llama.cpp ブランチ経由のV100 32GB上のQwen 3.6 27B MTP:54 t/s

✍️ OpenClawRadar📅 公開日: May 6, 2026🔗 Source
llama.cpp ブランチ経由のV100 32GB上のQwen 3.6 27B MTP:54 t/s
Ad

r/LocalLLaMAのユーザーが、PCIeアダプタを使用したV100 32GB SXMモジュール上で、マルチトークン予測(MTP)を用いてQwen 3.6 27Bを実行した印象的な結果を報告している。このセットアップはam17anのMTPブランチのllama.cppと対応するMTP GGUF量子化を使用している。主な仕様:Q8_0 KVキャッシュ、200kキャッシュ制限、llama-server経由でVS Code Copilotバックエンドとして実行。

パフォーマンス数値

  • MTPなし:29-30トークン/秒
  • MTPあり:54-55トークン/秒(150W電力制限時)
  • 50kトークンコンテキスト後:40-45 t/sに低下

ブランチ:am17anのMTPフォーク。ビルドと実行は簡単で、「一発でプルしてビルド」でき、llama-serverは問題なく動作した。このセットアップはツールコールやサブエージェントをうまく処理し、VRAMの制限(32GB)にもかかわらず「非常に洞察に富んだコードレビューとリファクタリング」を提供した。

これは特にV100のような古いデータセンターハードウェアでLLMを実行する開発者にとって重要である。MTPはこのモデルのスループットを実質的に2倍にし、コーディングアシスタントワークロードに実用的な利点を示している。

📖 全文を読む: r/LocalLLaMA

Ad

👀 See Also

log-context-mcp: MCPツールはClaudeデバッグ時のログトークン使用量を96%削減します
Tools

log-context-mcp: MCPツールはClaudeデバッグ時のログトークン使用量を96%削減します

log-context-mcpは、デバッグセッション中に冗長なログファイルでClaude Codeがトークンを消費する問題に対処するために構築されたMCP(Model Context Protocol)ツールです。ログファイルがClaudeのコンテキストに到達する前に前処理を行い、重複行の排除、スタックトレースのグループ化、ノイズの除去を行ってトークン使用量を削減します。2000行のApacheログでのテストでは、96.5%の削減率を示しながら、根本原因を正しく特定しました。

OpenClawRadar
自己進化スキルパターンの検証:5ラウンド実験結果
Tools

自己進化スキルパターンの検証:5ラウンド実験結果

開発者は、MySQLデータベース(29テーブル、590MBのスマートビル管理データ)で5ラウンドの実験を行い、Claude Code向けの自己進化型スキル設計パターンを検証しました。主な結果は、63.6%のファイブゲート拒否率、段階的収束、誤った知識が一切残らない100%の精度でした。

OpenClawRadar
QuellプロキシによるWindowsでのClaudeコードスクロールジャンプの修正
Tools

QuellプロキシによるWindowsでのClaudeコードスクロールジャンプの修正

Quellは、端末とClaude Codeの間に位置するRust製プロキシで、長い応答中にスクロール位置のリセットを引き起こす画面クリアシーケンスを除去します。また、Shift+Enterでの改行、セキュリティフィルタリング、完全なUnicodeサポートも追加します。

OpenClawRadar
ローカル35B MoEモデル、Agent OSコード障害率を0%に低減
Tools

ローカル35B MoEモデル、Agent OSコード障害率を0%に低減

ある開発者の報告によると、マルチエージェントシステムのランタイムをQwen 3.6 35B A3B(MoE、アクティブパラメータ3B)に切り替えたところ、コードの不具合が解消され、5層の検証ゲートを通じて100%の成功率を達成したとのことです。

OpenClawRadar