RTX 5080 16GB:Qwen3.6 35B MoE、128kコンテキストで56トークン/秒、そしてMTPが役立たない理由

✍️ OpenClawRadar📅 公開日: May 20, 2026🔗 Source
RTX 5080 16GB:Qwen3.6 35B MoE、128kコンテキストで56トークン/秒、そしてMTPが役立たない理由
Ad

メインラインllama.cppのコミットb9190でMTP(マルチトークン予測)がマージされました。RTX 5080 16GB上でQwen3.6 35B MoEを128kコンテキストでベンチマークした結果、明確な発見がありました:モデルがGPUに完全に収まらない場合、MTPはパフォーマンスを低下させる。

最適設定(MTP無し)

Qwen3.6-35B-A3B Q4_K_XL --fit-target 1536で131kコンテキストの場合:

  • 生成速度56 tok/s
  • 128kコンテキストでのプロンプト処理速度1,584 tok/s

MTPフラグは不要です。

16GBでMTPが35B MoEを遅くする理由

コーディングエージェントのコンテキスト長でテストした3つの設定:

  • 27B IQ3+MTP:12.45 GB、GPUに完全収容 — 平均73 tok/s(MTPは有効)
  • 35B Q4_K_XL+MTP:約22 GB、部分オフロード — 平均74 tok/s(MTPは有害)
  • 35B Q8_0+MTP:約36 GB、大量オフロード — 平均46 tok/s

MTP無しの場合、35B Q4_K_XLは--fit-target 0(15,815 MiB VRAM)で97 tok/s、--fit-target 1536(14,269 MiB)で86 tok/sを達成。MTPを有効にして--fit-target 1536にすると、速度は74 tok/s(14,623 MiB)に低下 — 23%の減速です。

根本原因:MTPの計算用バッファが約1.5 GBを確保(--fit-target 1536)し、さらに約3つのMoEエキスパート層をGPUからCPUに押し出します。MoE推論はCPU上のエキスパート層がボトルネックとなるため、MTPの79%トークン受理率ではステップ速度の低下を補えません。

27Bモデル(GPUに完全収容)の場合、--fit-target 0はMTPの有無にかかわらず機能するためVRAMペナルティはなく、MTPによって速度が約56から73 tok/sに向上します。

Ad

経験則

MTPはモデルがGPUに収まる場合に有効です。MTPの計算用バッファがより多くの層をCPUに押し出す場合には有害です。16GBカードで35B MoEを使用する場合、MTPはスキップしましょう。

テストシステム:RTX 5080 16GB、Ryzen 9 9950X、128GB RAM、llama.cpp b9204(メインライン)。一般的なMTPフラグ:-np 1 --fit on -fa on -t 20 --no-mmap --jinja -ctk q8_0 -ctv q8_0 --spec-type draft-mtp --spec-draft-n-max 2。

📖 出典全文: r/LocalLLaMA

Ad

👀 See Also

Claude Opus 4.7 システムプロンプトの変更点:プラットフォーム名変更、ツール統合、および動作更新
News

Claude Opus 4.7 システムプロンプトの変更点:プラットフォーム名変更、ツール統合、および動作更新

Anthropicは、Claude Opusのシステムプロンプトをバージョン4.6(2026年2月5日)から4.7(2026年4月16日)に更新し、「開発者プラットフォーム」を「Claude Platform」に改名、ツールリストにClaude in Powerpointを追加、児童安全に関する指示を拡充、ツール使用と応答の簡潔さに関する新しい行動指針を導入しました。

OpenClawRadar
RTX 5000 PRO 48GB、Qwen3.6-27Bに対し4400トークン/秒の高精度キャッシングを実現
News

RTX 5000 PRO 48GB、Qwen3.6-27Bに対し4400トークン/秒の高精度キャッシングを実現

初めてPCを自作したユーザーが、Qwen3.6-27B-FP8フルプレシジョンKVキャッシュを搭載した単一のRTX 5000 Pro 48GBで、4400 tok/sのプロンプト処理と80 tok/sの生成を達成したと報告。vLLMとClaude Codeを使用。

OpenClawRadar
Claudeデザインの請求バグ:追加利用購入が適用されず、サポートボットが有料ユーザーを閉じ込める
News

Claudeデザインの請求バグ:追加利用購入が適用されず、サポートボットが有料ユーザーを閉じ込める

Claude Designユーザーがアプリ内課金で20ドルを支払ったが、クレジットがClaude Designの別個の利用制限に適用されない。サポートボットのFinが問題を誤解し、無関係な応答を繰り返し、新規チケットをブロックし、人間へのエスカレーションがない。

OpenClawRadar
スーパーマイクロ共同創業者を含む3名、AI技術輸出事件で起訴される
News

スーパーマイクロ共同創業者を含む3名、AI技術輸出事件で起訴される

スーパーマイクロコンピュータの共同創業者チャールズ・リアンを含む3名が、米国当局により、AI技術を中国へ違法に輸出する計画を企てたとして起訴されました。この事件は、輸出管理法違反の疑いが含まれています。

OpenClawRadar