MTP + ユニファイドメモリがRTX 5090でllama.cpp推論を30%高速化
llama.cpp で GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 とマルチトークン予測 (MTP) 推測を組み合わせると、スループットが約 30% 向上します。Qwen3.6-27B Q8_0 モデルで 49 tok/sec から 64 tok/sec になります。ベンチマークは、RTX 5090 に 128GB DDR5 5600 CL36 と Ryzen 9 9950X3D を組み合わせた環境で実行されました。
コマンドと設定
CUDA_VISIBLE_DEVICES=0 GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 /home/marcin/llama-server \
-m /home/marcin/Pobrane/Qwen3.6-27B-Q8_0.gguf \
--threads 16 \
-c 262144 -fa on -np 1 \
--spec-type mtp --spec-draft-n-max 3 \
--webui-mcp-proxy \
--chat-template-kwargs '{"preserve_thinking": true}' \
--host 0.0.0.0 \
--port 8090 \
--jinja
主要なフラグ:
GGML_CUDA_ENABLE_UNIFIED_MEMORY=1— GPU がホストメモリに直接アクセスできるようにし、大きなコンテキストでの CUDA malloc を回避します。--spec-type mtp --spec-draft-n-max 3— ドラフト深さ 3 のマルチトークン予測推測を有効にします。Qwen3.6-27B-Q8_0.gguf— Q8_0 に量子化された 27B パラメータの Qwen3.6 モデルで、Unsloth の MTP サポートで準備されています。-c 262144— 256K コンテキストウィンドウ;-fa onでフラッシュアテンションを有効化。
結果
- MTP なし (統一メモリのみ): 49 tok/sec
- MTP + 統一メモリ: 64 tok/sec
- 向上率: 30% のスループット向上
draft-n-max が 3 の場合、モデルは最大 3 トークン先を推測し、逐次デコードのオーバーヘッドを削減します。統一メモリと組み合わせることで、CPU と GPU RAM 間の高コストな PCIe 転送を回避します。
対象ユーザー
大容量コンテキストのローカル推論を高性能コンシューマー GPU (RTX 5090) と十分なシステム RAM (128GB 以上) で実行する開発者。チャットボット、コードアシスタント、または投機的サンプリングがサポートされるレイテンシ重視の LLM ワークロードに適しています。
📖 ソース全文: r/LocalLLaMA
👀 See Also

監視塔:Claude Code APIトラフィックを監視するローカルプロキシ
Watchtowerは、Claude Code(またはCodex CLI)とそのAPI間のすべてのAPIトラフィックを傍受・表示するローカルHTTPプロキシ兼リアルタイムWebダッシュボードの無料オープンソースツールです。リクエスト、SSEストリーム、ツール定義、システムプロンプト、トークン使用量、レート制限を表示します。

Pali v0.1: 再現可能なベンチマークを備えたLLM向けオープンソースメモリ基盤
Paliは、Goで構築されたシングルバイナリのオープンソースLLMメモリ基盤で、マルチテナントAPI、ハイブリッド検索、プラグアンドプレイ拡張機能を備えています。v0.1リリースには、異なる構成でのパフォーマンス指標を示す再現可能な結果を含むベンチマークスイートが含まれています。

Reseed CLI: あらゆるサイトからClaude CodeやCursor向けにデザインシステムを抽出
Reseedは、任意のWebサイトからデザイントークン(色、スペーシング、タイプスケール、角丸)を抽出し、Claude CodeやCursorで使用できるtailwind.config.ts、design-system.md、およびリファレンスHTMLを生成するCLIツールです。

クロード・コードが構築したTreelo:無料の動画文字起こしツール
ある動画編集者が、Claude Codeを使用してTreeloという実用的な文字起こしツールを構築した経験を共有しました。この開発者は、きれいなSRTファイルを取得するために4つの異なるツールを行き来していましたが、各ステップでClaude Codeに問題を平易な英語で説明しました。