llama.cpp ブランチ経由のV100 32GB上のQwen 3.6 27B MTP:54 t/s

r/LocalLLaMAのユーザーが、PCIeアダプタを使用したV100 32GB SXMモジュール上で、マルチトークン予測(MTP)を用いてQwen 3.6 27Bを実行した印象的な結果を報告している。このセットアップはam17anのMTPブランチのllama.cppと対応するMTP GGUF量子化を使用している。主な仕様:Q8_0 KVキャッシュ、200kキャッシュ制限、llama-server経由でVS Code Copilotバックエンドとして実行。
パフォーマンス数値
- MTPなし:29-30トークン/秒
- MTPあり:54-55トークン/秒(150W電力制限時)
- 50kトークンコンテキスト後:40-45 t/sに低下
ブランチ:am17anのMTPフォーク。ビルドと実行は簡単で、「一発でプルしてビルド」でき、llama-serverは問題なく動作した。このセットアップはツールコールやサブエージェントをうまく処理し、VRAMの制限(32GB)にもかかわらず「非常に洞察に富んだコードレビューとリファクタリング」を提供した。
これは特にV100のような古いデータセンターハードウェアでLLMを実行する開発者にとって重要である。MTPはこのモデルのスループットを実質的に2倍にし、コーディングアシスタントワークロードに実用的な利点を示している。
📖 全文を読む: r/LocalLLaMA
👀 See Also

Oh-My-Mermaid: アーキテクチャ図を自動生成するClaudeコードスキル
Oh-My-Mermaidは、コードベースを分析し、自動的にMermaidアーキテクチャ図とドキュメントを生成するClaude Codeスキルです。npm経由でインストールされ、Claude Code内で/omm-scanコマンドを使用します。

P2PCLAW: AIエージェントが形式的に検証された科学を公開するためのピア・ツー・ピア・ネットワーク
P2PCLAWは、Lean 4における形式的数学的証明を通じて検証された科学的成果を、AIエージェントと人間の研究者が公開できるピアツーピアネットワークです。このシステムはGUN.jsとIPFSを使用し、安全な参加のための耐量子暗号とプライバシー機能を備えています。

CKサーチ:MCPサーチバー統合を備えたローカルセマンティック検索ツール
CK Searchは、組み込みMCPサーバーを備えたローカルセマンティック検索ツールで、クラウド依存なしで任意のテキストディレクトリをインデックス化します。このツールはAIエージェントがMCP経由で利用でき、ソースではセットアップ、長所、grepとの比較による制限事項をカバーした実践的なチュートリアルを提供しています。

Claude Codeによるプログラミング言語構築:カツレツ実験
アンクール・セティは、4週間かけてClaude Codeを使用して「Cutlet」という完全なプログラミング言語を構築しました。AIがすべてのコード行を生成する一方で、彼はガードレールとテストに集中しました。この言語は動的型付け、ベクトル化操作、REPLを特徴とし、macOSとLinuxで動作します。