MTP複数トークン予測:AMD Strix Halo&Radeon 9700 AI Proで2倍高速なトークン生成

マルチトークン予測(MTP)は、ローカルLLMのトークン生成を最大2倍高速化すると期待されています。新しいデモ動画では、AMD Strix HaloおよびDual Radeon 9700 AI Proハードウェア上でMTPを実行し、Qwen 3.6クラスのモデルを対象としています。
重要な詳細
- パフォーマンス: MTPはLLMの推論を最大2倍高速化し、特にコーディングエージェントに有効です。
- テストしたハードウェア: AMD Strix Halo(おそらくRyzen AI 300シリーズ)とDual Radeon 9700 AI Pro(RDNA 4)。
- モデル: Qwen 3.6(おそらくQwen2.5-7Bまたは類似のもの。正確なバリアントは未指定)。
- デモ形式: MTPの仕組みと測定された改善を紹介するYouTube動画。
MTPは、1回のフォワードパスから複数の未来のトークンを並行して予測することで、自己回帰ステップの数を削減します。この手法は、コードのようにトークンパターンが予測しやすい構造化された出力に特に効果的です。
背景として、AMDの最近のGPUコンピュートスタック(ROCm)はLLM推論においてNVIDIAのCUDAに追いつきつつあり、llama.cppやvLLMを介したMTP実装によってさらに差が縮まる可能性があります。ローカルでコーディングエージェント(例:CodeLlama、DeepSeek-Coder)を実行する開発者は、対応ハードウェア上で有意な高速化が期待できます。
📖 Read the full source: r/LocalLLaMA
👀 See Also

AIがRustでPHPエンジンを開発、PHP-srcテストの17%を通過しWordPressをレンダリング
Rustで書かれたPHPインタプリタPhargoは、まったくAIによってゼロから構築され、22,037のPHP公式テストのうち3,844(17.4%)に合格し、SQLiteからWordPressページをレンダリングします。

Cowork VMサービスがWindows 11で失敗する原因はDCOMレジストリエントリの欠如です
ユーザーがCoworkのバグを診断し、Windows 11 HomeからProにアップグレードした環境でVMサービスが起動しない問題を特定しました。欠落しているDCOM APPID {15C20B67-12E7-4BB6-92BB-7AFF07997402}がHyper-Vとの通信を妨げており、Anthropicによる修正が必要です。
Claude Code v2.1.208:スクリーンリーダーモード、Vimリマップ、メモリリーク修正など
Claude Code v2.1.208は、オプトインのプレーンテキストスクリーンリーダーモード、vim挿入モードのリマップ、企業向けランチャー用のプロセスラッパーを追加し、長時間セッションでのメモリリークを含む多数のバグを修正しました。
Claude Code v2.1.236:新しいデフォルトモデル環境変数、サンドボックス修正など
Claude Code v2.1.236では、新しいセッションのモデルを設定するANTHROPIC_DEFAULT_MODEL、セッション間のアイドル通知を導入するnotify_when_idle、macOSサンドボックスの読み取り拒否ルールの強化が追加されました。