Qwen3.6 27B FP8、RTX 5000 PRO 48GB上で200kトークンBF16 KVキャッシュを80 TPSで実行

r/LocalLLaMAのRedditユーザーが、1枚のRTX 5000 PRO 48GB GPU上でQwen3.6-27B-FP8をBF16 KVキャッシュ200kトークンで実行し、60~90 TPSを達成したと報告。このセットアップはvLLM 0.20.1、CUDA 12.9、Qwen公式のFP8量子化を使用し、マルチモダリティとMTP投機的復号を維持しています。
セットアップの詳細
環境はFlashInfer FP8 MoE、FP8 Marlin、非同期スケジューリングを採用。主要な環境変数と起動コマンド:
export VLLM_USE_FLASHINFER_MOE_FP8=1
export VLLM_TEST_FORCE_FP8_MARLIN=1
export VLLM_SLEEP_WHEN_IDLE=1
export VLLM_MEMORY_PROFILER_ESTIMATE_CUDAGRAPHS=1
export VLLM_LOG_STATS_INTERVAL=2
export VLLM_WORKER_MULTIPROC_METHOD=spawn
export SAFETENSORS_FAST_GPU=1
export CUDA_DEVICE_ORDER=PCI_BUS_ID
export TORCH_FLOAT32_MATMUL_PRECISION=high
export PYTORCH_ALLOC_CONF=expandable_segments:True
vllm serve Qwen/Qwen3.6-27B-FP8
--host 0.0.0.0 --port 8080
--performance-mode interactivity
--trust-remote-code
--enable-auto-tool-choice
--tool-call-parser qwen3_coder
--reasoning-parser qwen3
--mm-encoder-tp-mode data
--mm-processor-cache-type shm
--gpu-memory-utilization 0.975
--speculative-config '{"method":"mtp","num_speculative_tokens":2}'
--compilation-config '{"cudagraph_mode": "FULL_AND_PIECEWISE", "max_cudagraph_capture_size": 16, "mode": "VLLM_COMPILE"}'
--async-scheduling
--attention-backend flashinfer
--max-model-len 196608
--kv-cache-dtype bfloat16
--enable-prefix-caching
パフォーマンスの観測
MTP=2の投機的復号により、コード生成中に60~90 TPSを達成。BF16 KVキャッシュは量子化KVで見られる圧縮問題を回避し、長いコーディングセッションの信頼性を向上。ユーザーは、このセットアップが1枚のRTX 5000 PRO 48GB、64GBのシステムRAM、適切なCPUで動作し、ローカルLLM開発向けの$10kワークステーションの有力な候補であると述べています。
対象ユーザー
量子化アーティファクトを最小限に抑え、長いコンテキストウィンドウを必要とする、ローカルで低圧縮のエージェント型コーディング環境を求める開発者向け。
📖 ソース全文: r/LocalLLaMA
👀 See Also

Claude Code v2.1.116:パフォーマンスの改善、ターミナルの修正、セキュリティアップデート
Claude Code v2.1.116は、40MB以上のセッションでの/resumeコマンドが最大67%高速化、ターミナルスクロールの滑らかさ向上、MCP起動の高速化など、大幅なパフォーマンス改善を提供します。このリリースでは、ターミナル描画の問題の修正、危険なパス操作に対するセキュリティ保護の追加、スラッシュコマンドやプラグイン管理に影響する複数のバグの解決も行われています。

OpenClaw 2026.3.2 リリース:プロダクションの秘訣、PDFツール、そしてより安全なデフォルト設定
OpenClaw 2026.3.2では、フェイルファースト動作を備えた本番環境対応のシークレットシステム、AnthropicおよびGoogleモデルをサポートするネイティブPDFツール、新規インストール時のツールアクセスを制限するより安全なデフォルト設定が導入されました。

Claude 4.6 Opusは最小限の入力からLinuxのlist.hを再現できる
ユーザーが、Claude 4.6 Opusに最初の43行を入力し温度を0に設定すると、Linuxのlist.hヘッダーファイルとほぼ同一のコピーを生成できることを実証し、オープンソースコードで学習したAIモデルのGPLライセンスへの影響について疑問を提起しました。

TinfoilのModelwrap技術によるモデル同一性の証明
TinfoilのModelwrapは、セキュアエンクレーブによる暗号学的コミットメントの検証を通じて、推論プロバイダーが主張する正確なモデル重みを提供することを保証します。