Qwen3.5-27Bのローカル環境構築:vLLMとllama.cppの比較

Qwen3.5-27Bの性能と能力
Qwen3.5-27Bモデルは、ソースによると様々なベンチマークで強力な性能を示しています:MMLU-Pro: 85.3、MMLU-Redux: 93.3、C-Eval: 90.2、総合知能スコア: 42.1(比較モデルの91%を上回る)、コーディング指数: 34.9(コーディング能力で88%をトップ)。このモデルは、ネイティブ262kコンテキストで1M+トークンまで拡張可能な密なアーキテクチャを特徴としています。
バックエンド比較:llama.cpp vs vLLM
ソースでは、ローカルデプロイメントの2つの主要なアプローチを比較しています:
オプション1:llama.cpp
- 利点:フットプリントが小さい、セットアップが簡単、合理的なVRAM使用量のためのq4 KVキャッシュをサポート
- 欠点:KVキャッシュがランダムに消去される重大な問題があり、セッション中に完全なプロンプトの再処理を強制される。MTPによる推測デコードは機能しない。確固たる修正策のない既知のバグ。
オプション2:vLLM
- 利点:安定したセッション、KV消去なし、より高速な生成のためのMTPによる推測デコードをサポート
- 欠点:q4 KVサポートがないため、256kコンテキストでVRAMが急増する。v0.17.1ではQwen3.5のツールコール解析がバグっており、修正はGitHubのオープンプルリクエストにあるがまだマージされていない。これにより、不正なJSON出力でエージェント型コーディングフローが壊れる。
推奨されるvLLM設定
ソースでは、HFのモデルosoleve/Qwen3.5-27B-Text-NVFP4-MTPを使用した安定した高速実行のための具体的な設定推奨事項を提供しています:
- 最適化されたパフォーマンスのためにflashinfer cutlassバックエンドを使用
- コンテキストウィンドウを128kに設定(VRAMと使いやすさのバランス;ハードウェアがあれば256kに引き上げ)
- OOMクラッシュを避けるためにGPU使用率を0.82に制限
- max-num-seqを2に設定(過剰コミットせずに単一セッションを適切に処理)
- 速度向上のためにMTP推測デコードを有効化
- オープンプルリクエストからQwenツールコール解析修正でvLLMにパッチを適用
- Claudeコードcliを使用 - オープンコードにはパッチ適用後もツールコール解析の問題が残るが、Claudeコードでは発生しない
性能結果
ソースによると、性能はハードウェアによって異なります:
- RTX 5090(32GB VRAM)上:約50 TPS
- RTX Pro 6000(96GB VRAM)上:完全な256kコンテキストで70 TPS
📖 完全なソースを読む: r/LocalLLaMA
👀 See Also

AWSでClaude Codeを使って月額0.01ドルでサーバーレスAIエージェントプラットフォームを構築
ある開発者が、Claude Codeを29時間かけて使用し、NAT Gateway(32ドル/月)やALB(18ドル/月)などの高価なコンポーネントを排除し、約0.01ドル/月でAIエージェントを実行する完全なAWSサーバーレスプラットフォームを構築しました。このプロジェクトには233の単体テストと35のE2Eテストが含まれており、単一のcdk deployコマンドでデプロイできます。

Claude Code Workflow Visualは、メモリ階層とスキルシステムを説明するものです。
Redditユーザーが、Claude Codeのワークフロー構造を示すビジュアル図を共有しました。この図には、CLAUDE.mdファイルによるメモリ階層化や、.claude/skills/ディレクトリで定義された再利用可能なスキルが含まれています。ワークフローループでは、Planモードの使用、機能の記述、自動承認、頻繁なコミットが提案されています。

Claude Code オーケストレーターが有用であるための4つの要素
Claude Codeでオーケストレーターエージェントを構築した開発者からの実践的アドバイス:ミッションドキュメント、ハートビート、エージェント間通信、監査可能な制御。

サードパーティ製ハーネスの非推奨化に伴うOpenClawエージェントのClaude Codeへの移行
Anthropicがサードパーティ製ハーネスのサポートを終了したため、ユーザーはOpenClawエージェントをClaude Codeに移行する必要がありました。ある開発者は、Maxサブスクリプションで稼働していた17のエージェント(10のプラットフォームプロモーションエージェントと7のコンテンツパイプラインcron)を約4時間で移行することに成功しました。