RTX 5080 16GB:Qwen3.6 35B MoE、128kコンテキストで56トークン/秒、そしてMTPが役立たない理由

メインラインllama.cppのコミットb9190でMTP(マルチトークン予測)がマージされました。RTX 5080 16GB上でQwen3.6 35B MoEを128kコンテキストでベンチマークした結果、明確な発見がありました:モデルがGPUに完全に収まらない場合、MTPはパフォーマンスを低下させる。
最適設定(MTP無し)
Qwen3.6-35B-A3B Q4_K_XL --fit-target 1536で131kコンテキストの場合:
- 生成速度56 tok/s
- 128kコンテキストでのプロンプト処理速度1,584 tok/s
MTPフラグは不要です。
16GBでMTPが35B MoEを遅くする理由
コーディングエージェントのコンテキスト長でテストした3つの設定:
- 27B IQ3+MTP:12.45 GB、GPUに完全収容 — 平均73 tok/s(MTPは有効)
- 35B Q4_K_XL+MTP:約22 GB、部分オフロード — 平均74 tok/s(MTPは有害)
- 35B Q8_0+MTP:約36 GB、大量オフロード — 平均46 tok/s
MTP無しの場合、35B Q4_K_XLは--fit-target 0(15,815 MiB VRAM)で97 tok/s、--fit-target 1536(14,269 MiB)で86 tok/sを達成。MTPを有効にして--fit-target 1536にすると、速度は74 tok/s(14,623 MiB)に低下 — 23%の減速です。
根本原因:MTPの計算用バッファが約1.5 GBを確保(--fit-target 1536)し、さらに約3つのMoEエキスパート層をGPUからCPUに押し出します。MoE推論はCPU上のエキスパート層がボトルネックとなるため、MTPの79%トークン受理率ではステップ速度の低下を補えません。
27Bモデル(GPUに完全収容)の場合、--fit-target 0はMTPの有無にかかわらず機能するためVRAMペナルティはなく、MTPによって速度が約56から73 tok/sに向上します。
経験則
MTPはモデルがGPUに収まる場合に有効です。MTPの計算用バッファがより多くの層をCPUに押し出す場合には有害です。16GBカードで35B MoEを使用する場合、MTPはスキップしましょう。
テストシステム:RTX 5080 16GB、Ryzen 9 9950X、128GB RAM、llama.cpp b9204(メインライン)。一般的なMTPフラグ:-np 1 --fit on -fa on -t 20 --no-mmap --jinja -ctk q8_0 -ctv q8_0 --spec-type draft-mtp --spec-draft-n-max 2。
📖 出典全文: r/LocalLLaMA
👀 See Also

Claude Opus 4.7 システムプロンプトの変更点:プラットフォーム名変更、ツール統合、および動作更新
Anthropicは、Claude Opusのシステムプロンプトをバージョン4.6(2026年2月5日)から4.7(2026年4月16日)に更新し、「開発者プラットフォーム」を「Claude Platform」に改名、ツールリストにClaude in Powerpointを追加、児童安全に関する指示を拡充、ツール使用と応答の簡潔さに関する新しい行動指針を導入しました。

RTX 5000 PRO 48GB、Qwen3.6-27Bに対し4400トークン/秒の高精度キャッシングを実現
初めてPCを自作したユーザーが、Qwen3.6-27B-FP8フルプレシジョンKVキャッシュを搭載した単一のRTX 5000 Pro 48GBで、4400 tok/sのプロンプト処理と80 tok/sの生成を達成したと報告。vLLMとClaude Codeを使用。

Claudeデザインの請求バグ:追加利用購入が適用されず、サポートボットが有料ユーザーを閉じ込める
Claude Designユーザーがアプリ内課金で20ドルを支払ったが、クレジットがClaude Designの別個の利用制限に適用されない。サポートボットのFinが問題を誤解し、無関係な応答を繰り返し、新規チケットをブロックし、人間へのエスカレーションがない。

スーパーマイクロ共同創業者を含む3名、AI技術輸出事件で起訴される
スーパーマイクロコンピュータの共同創業者チャールズ・リアンを含む3名が、米国当局により、AI技術を中国へ違法に輸出する計画を企てたとして起訴されました。この事件は、輸出管理法違反の疑いが含まれています。