Blackwell LLMツールキット:RTX Pro 6000上でのTensorRT-LLM用NVFP4構成、ホイール、ベンチマーク

✍️ OpenClawRadar📅 公開日: May 12, 2026🔗 Source
Blackwell LLMツールキット:RTX Pro 6000上でのTensorRT-LLM用NVFP4構成、ホイール、ベンチマーク
Ad

GitHub上の新しいリポジトリblackwell-llm-toolkitは、Nvidia Blackwell GPU(RTX Pro 6000、5090、5080、5070 Ti)上でLLMを実行するためのTensorRT-LLM設定、プリビルドホイール、ベンチマーク結果をまとめたものです。焦点はNVFP4量子化とプラットフォーム固有の障害の克服です。

主な機能

  • TensorRT-LLM設定: Blackwell上でMambaハイブリッドモデルを実行するために必要な、分かりにくい起動フラグを含むYAMLファイル(configs/trtllm/nemotron-omni-v3-sm120.yaml)を提供。
  • LMCacheホイール: PyPIのホイールはsm_120 cubinが欠落しているためBlackwellでクラッシュしていました。本リポジトリは再ビルドしたホイールとビルドスクリプトを提供し、Optane SSDを使用したKVキャッシュオフロードでテスト済み。
  • 研究ドキュメント: AI生成による、Nemotron Omni V3、Qwen 3.5/3.6、Gemma 4のアーキテクチャの違いに関する詳細な解説。特に、Qwen 3.5/3.6は単なるQwen3-VLの名称変更ではなく、完全に異なるアーキテクチャを持ちます。
  • ベンチマークハーネス: rapid_bench.pyは41プロンプトの品質評価(インテリジェンス、ツール使用、キャリブレーション、オーケストレーション、クリエイティブライティング)を実行。bench_harness.pyは持続的なデコード、TTFT、プリフィル、同時実行性を測定し、長いコンテキスト向けの--prompt-tokens Nモードも備えています。
Ad

ベンチマークハイライト(RTX Pro 6000 96GB 1台、TPなし)

  • Nemotron-3-Nano-Omni V3(マルチモーダル、NVFP4、8Kコンテキスト): 270 tok/s。テストした中で最速のモデルで、画像・動画・音声+テキストを処理。TRT-LLM v1.3.0rc13が必要。
  • Nemotron-3-Nano(テキストのみ、NVFP4、8Kコンテキスト): 249 tok/s。ツール呼び出しエージェントに最適(ツールスコア10/10)。
  • DeepSeek-V4-Flash(IQ2_XXS-XL GGUF、65Kコンテキスト): 31 tok/s。複雑な推論に最適(インテリジェンス9/10、ツール10/10、キャリブレーション13/13)。
  • MiniMax-M2.7-REAP-172B(Q3_K_S GGUF、196Kコンテキスト): 117 tok/s。長い会話に適しています。
  • MiniMax-M2.7 W4A16(Optane SSD上のLMCache使用、154Kコンテキスト): 20-22 tok/s。長いコンテキストでのW4A16品質。
  • MiniMax-M2.7 W4A16(短いコンテキスト、LMCacheなし、64Kコンテキスト): 22-25 tok/s。最高品質の短い回答(インテリジェンス10/10)。

完全な結果(TTFT、プリフィル速度、同時実行性、評価スコア)はbench/results.mdにあります。

対象読者

Blackwell GPU上でLLM推論を実行する開発者や研究者で、最適化されたTensorRT-LLM設定、長いコンテキストオフロードのためのプリビルドLMCache、またはモデル選択のための実際のベンチマークデータを必要とする方。

📖 全文を読む: r/LocalLLaMA

Ad

👀 See Also

Claude Codeによる.xcstringsの自動ローカライゼーション
Tools

Claude Codeによる.xcstringsの自動ローカライゼーション

新しいClaude Codeスキルが、Xcodeの.xcstringsファイルのローカライゼーションを5つのパイプラインステージ(ドメインスキャン、コメント生成、CLDR複数形を含む翻訳、文法チェック、複数形修正変換)で自動化します。

OpenClawRadar
T9OS:Claude Codeで完全に構築されたAIオーケストレーションシステム
Tools

T9OS:Claude Codeで完全に構築されたAIオーケストレーションシステム

経済学の学生が、Claude Codeを唯一のプログラミングツールとして使用して、完全なAIオーケストレーション層であるT9OSを構築しました。このシステムには、18の本番パイプライン、12状態のライフサイクルエンジン、およびすべての出力をレビューする7つのAI「ガーディアン」が含まれています。

OpenClawRadar
BotCost.dev:免费分析工具,查看AI机器人对您网站的成本影响
Tools

BotCost.dev:免费分析工具,查看AI机器人对您网站的成本影响

BotCost.devは、サーバーログを18種類の既知のAIボット(GPTBot、ClaudeBot、Perplexityなど)のフィンガープリントと照合し、月間の帯域幅コストを推定する無料ツールです。アップロード不要で、ブラウザ内で動作します。

OpenClawRadar
devopsiphai: オープンソースのClaude Codeスキルが、6つのフェーズにわたって運用の健全性を監査します。
Tools

devopsiphai: オープンソースのClaude Codeスキルが、6つのフェーズにわたって運用の健全性を監査します。

devopsiphaiは、6段階のプロセスとARCフレームワークを使用して本番プロジェクトの運用性を監査し、レターグレードと工数見積もり付きの構造化されたTODO.mdを出力するオープンソースのClaude Codeスキルです。

OpenClawRadar