RTX 5000 PRO 48GB、Qwen3.6-27Bに対し4400トークン/秒の高精度キャッシングを実現

✍️ OpenClawRadar📅 公開日: May 14, 2026🔗 Source
RTX 5000 PRO 48GB、Qwen3.6-27Bに対し4400トークン/秒の高精度キャッシングを実現
Ad

ある開発者は、Mac Studioに対してRTX 5000 Pro 48GB(税込み4300ドル)に賭けた——その数字はその賭けを正当化する:Qwen3.6-27B-FP8とフルプレシジョンBF16 KVキャッシュを使用した場合、プロンプト処理(PP)で最大4400トークン/秒、テキスト生成(TG)で50~80トークン/秒を達成。

ハードウェアとコストの内訳

  • GPUコスト:4300ドル(税込み)
  • 総構築費:5600ドル(64GB RAM搭載)
  • コンテキスト制限:フルプレシジョン(BF16 KVキャッシュ)で200Kトークン

パフォーマンスベンチマーク

  • プロンプト処理:4400トークン/秒
  • テキスト生成:非常に大きなプロンプトで50~60トークン/秒、小さいものでは最大80トークン/秒
  • モデル:フルプレシジョンキャッシュのQwen3.6-27B-FP8
  • 消費電力:デュアルRTX 5090セットアップの約半分

主な所見

このユーザーは、未経験からPCを自作し、Claude Code(週間Claude Code Max制限の50%をvLLM/Linuxセットアップに消費)に依存した。Qwen3.6-27B-FP8とBF16キャッシュの正確なvLLM設定を詳細に記したRedditの投稿が主な参考資料となった。著者は、2台のRTX 5090の方が性能は優れるが、コスト、騒音、消費電力が大幅に高くなると指摘している。

📖 全文ソース: r/LocalLLaMA

Ad

👀 See Also

Claude Security 公開ベータ版:コードベースをスキャン、自身の調査結果を検証、パッチを提案
News

Claude Security 公開ベータ版:コードベースをスキャン、自身の調査結果を検証、パッチを提案

Anthropicは、エンタープライズ顧客向けにClaude Securityをパブリックベータ版としてリリースしました。セキュリティ研究者のようにコードを推論し、敵対的自己検証を通じて自身の結果に挑戦し、具体的なパッチを提案します。

OpenClawRadar
ThermoQA:エンジニアリング熱力学のためのオープンベンチマーク、293の計算問題でLLMをテスト
News

ThermoQA:エンジニアリング熱力学のためのオープンベンチマーク、293の計算問題でLLMをテスト

ThermoQAは、3つの階層にわたる293の工学熱力学問題からなるオープンベンチマークで、LLMの正確な数値計算能力をテストします。Claude Opus 4.6が94.1%の総合スコアで首位を走り、DeepSeek-R1は±2.5%で実行間のばらつきが最も大きくなっています。

OpenClawRadar
微調整されたQwen3 Smallモデルは、特定のタスクにおいてフロンティアLLMを凌駕し、低コストで優れた性能を発揮します
News

微調整されたQwen3 Smallモデルは、特定のタスクにおいてフロンティアLLMを凌駕し、低コストで優れた性能を発揮します

蒸留されたQwen3モデル(0.6Bから8Bパラメータ)は、関数呼び出しやText2SQLを含む9つのタスクのうち6つで、GPT-5、Gemini、Claudeなどの最先端APIモデルに匹敵するか上回る性能を示し、同等の性能に対して100万リクエストあたりのコストはわずか3ドル(比較対象は378ドル)でした。

OpenClawRadar
r/ClaudeAIサブレディットの週間訪問者数が50万人から190万人に急増
News

r/ClaudeAIサブレディットの週間訪問者数が50万人から190万人に急増

r/ClaudeAIサブレディットは、2025年11月の週間訪問者数約25万人から、2026年3月には190万人に成長しましたが、登録者数は約8万5千人のまま推移しています。

OpenClawRadar