MTP + ユニファイドメモリがRTX 5090でllama.cpp推論を30%高速化

✍️ OpenClawRadar📅 公開日: May 12, 2026🔗 Source
Ad

llama.cpp で GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 とマルチトークン予測 (MTP) 推測を組み合わせると、スループットが約 30% 向上します。Qwen3.6-27B Q8_0 モデルで 49 tok/sec から 64 tok/sec になります。ベンチマークは、RTX 5090 に 128GB DDR5 5600 CL36 と Ryzen 9 9950X3D を組み合わせた環境で実行されました。

コマンドと設定

CUDA_VISIBLE_DEVICES=0 GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 /home/marcin/llama-server \
    -m /home/marcin/Pobrane/Qwen3.6-27B-Q8_0.gguf \
    --threads 16 \
    -c 262144 -fa on -np 1 \
    --spec-type mtp --spec-draft-n-max 3 \
    --webui-mcp-proxy \
    --chat-template-kwargs '{"preserve_thinking": true}' \
    --host 0.0.0.0 \
    --port 8090 \
    --jinja

主要なフラグ:

  • GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 — GPU がホストメモリに直接アクセスできるようにし、大きなコンテキストでの CUDA malloc を回避します。
  • --spec-type mtp --spec-draft-n-max 3 — ドラフト深さ 3 のマルチトークン予測推測を有効にします。
  • Qwen3.6-27B-Q8_0.gguf — Q8_0 に量子化された 27B パラメータの Qwen3.6 モデルで、Unsloth の MTP サポートで準備されています。
  • -c 262144 — 256K コンテキストウィンドウ; -fa on でフラッシュアテンションを有効化。
Ad

結果

  • MTP なし (統一メモリのみ): 49 tok/sec
  • MTP + 統一メモリ: 64 tok/sec
  • 向上率: 30% のスループット向上

draft-n-max が 3 の場合、モデルは最大 3 トークン先を推測し、逐次デコードのオーバーヘッドを削減します。統一メモリと組み合わせることで、CPU と GPU RAM 間の高コストな PCIe 転送を回避します。

対象ユーザー

大容量コンテキストのローカル推論を高性能コンシューマー GPU (RTX 5090) と十分なシステム RAM (128GB 以上) で実行する開発者。チャットボット、コードアシスタント、または投機的サンプリングがサポートされるレイテンシ重視の LLM ワークロードに適しています。

📖 ソース全文: r/LocalLLaMA

Ad

👀 See Also

OpenClaw A2Aプラグイン: リモートエージェントへの作業委任と継続状態の再現
Tools

OpenClaw A2Aプラグイン: リモートエージェントへの作業委任と継続状態の再現

新しいオープンソースプラグインがOpenClawに`remote_agent`ツールを追加し、A2Aプロトコルと継続状態のリプレイをサポートするエージェント間委任を可能にします。

OpenClawRadar
Unsloth Studioは、ローカルAIのファインチューニングにおいて、2倍の学習速度と70%のVRAM削減を実現します。
Tools

Unsloth Studioは、ローカルAIのファインチューニングにおいて、2倍の学習速度と70%のVRAM削減を実現します。

Unsloth Studioは、ローカルハードウェア上で言語モデルのトレーニングとファインチューニングを2倍の速度と70%のVRAM削減で実現するツールを提供します。GGUF形式へのモデルエクスポートをサポートし、RTX 4090などの24GBハードウェア上で完全なローカルAIコーディングワークフローを可能にします。

OpenClawRadar
pre-commitを使用してAI生成コードの品質とセキュリティを向上させる
Tools

pre-commitを使用してAI生成コードの品質とセキュリティを向上させる

開発者が、GoとJavaプロジェクト向けのpre-commit設定を共有しています。golangci-lint、govulncheck、checkovなどのツールを使用して、AI生成コードのコミット前に脆弱性や品質問題を検出します。

OpenClawRadar
ピンチベンチ結果:初のOpenClaw専用AIコーディングエージェントベンチマーク
Tools

ピンチベンチ結果:初のOpenClaw専用AIコーディングエージェントベンチマーク

OpenClaw専用の最初のベンチマークであるPinchBenchは、成功率、コスト、速度で32のAIモデルをランク付けしており、GoogleのGemini-3-Flash-Previewが95.1%の成功率で0.72ドルと首位を獲得しています。

OpenClawRadar