MTP + ユニファイドメモリがRTX 5090でllama.cpp推論を30%高速化
llama.cpp で GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 とマルチトークン予測 (MTP) 推測を組み合わせると、スループットが約 30% 向上します。Qwen3.6-27B Q8_0 モデルで 49 tok/sec から 64 tok/sec になります。ベンチマークは、RTX 5090 に 128GB DDR5 5600 CL36 と Ryzen 9 9950X3D を組み合わせた環境で実行されました。
コマンドと設定
CUDA_VISIBLE_DEVICES=0 GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 /home/marcin/llama-server \
-m /home/marcin/Pobrane/Qwen3.6-27B-Q8_0.gguf \
--threads 16 \
-c 262144 -fa on -np 1 \
--spec-type mtp --spec-draft-n-max 3 \
--webui-mcp-proxy \
--chat-template-kwargs '{"preserve_thinking": true}' \
--host 0.0.0.0 \
--port 8090 \
--jinja
主要なフラグ:
GGML_CUDA_ENABLE_UNIFIED_MEMORY=1— GPU がホストメモリに直接アクセスできるようにし、大きなコンテキストでの CUDA malloc を回避します。--spec-type mtp --spec-draft-n-max 3— ドラフト深さ 3 のマルチトークン予測推測を有効にします。Qwen3.6-27B-Q8_0.gguf— Q8_0 に量子化された 27B パラメータの Qwen3.6 モデルで、Unsloth の MTP サポートで準備されています。-c 262144— 256K コンテキストウィンドウ;-fa onでフラッシュアテンションを有効化。
結果
- MTP なし (統一メモリのみ): 49 tok/sec
- MTP + 統一メモリ: 64 tok/sec
- 向上率: 30% のスループット向上
draft-n-max が 3 の場合、モデルは最大 3 トークン先を推測し、逐次デコードのオーバーヘッドを削減します。統一メモリと組み合わせることで、CPU と GPU RAM 間の高コストな PCIe 転送を回避します。
対象ユーザー
大容量コンテキストのローカル推論を高性能コンシューマー GPU (RTX 5090) と十分なシステム RAM (128GB 以上) で実行する開発者。チャットボット、コードアシスタント、または投機的サンプリングがサポートされるレイテンシ重視の LLM ワークロードに適しています。
📖 ソース全文: r/LocalLLaMA
👀 See Also

OpenClaw A2Aプラグイン: リモートエージェントへの作業委任と継続状態の再現
新しいオープンソースプラグインがOpenClawに`remote_agent`ツールを追加し、A2Aプロトコルと継続状態のリプレイをサポートするエージェント間委任を可能にします。

Unsloth Studioは、ローカルAIのファインチューニングにおいて、2倍の学習速度と70%のVRAM削減を実現します。
Unsloth Studioは、ローカルハードウェア上で言語モデルのトレーニングとファインチューニングを2倍の速度と70%のVRAM削減で実現するツールを提供します。GGUF形式へのモデルエクスポートをサポートし、RTX 4090などの24GBハードウェア上で完全なローカルAIコーディングワークフローを可能にします。

pre-commitを使用してAI生成コードの品質とセキュリティを向上させる
開発者が、GoとJavaプロジェクト向けのpre-commit設定を共有しています。golangci-lint、govulncheck、checkovなどのツールを使用して、AI生成コードのコミット前に脆弱性や品質問題を検出します。

ピンチベンチ結果:初のOpenClaw専用AIコーディングエージェントベンチマーク
OpenClaw専用の最初のベンチマークであるPinchBenchは、成功率、コスト、速度で32のAIモデルをランク付けしており、GoogleのGemini-3-Flash-Previewが95.1%の成功率で0.72ドルと首位を獲得しています。