MTPLX: Apple Silicon上でネイティブMTPヘッドを使用しトークン処理が2.24倍高速化

MTPLXはApple Silicon向けの推論エンジンで、モデルに内蔵されたMulti-Token Prediction(MTP)ヘッドを投機的ドラフターとして活用します。主な結果:MacBook Pro M5 Max上で、Qwen 3.6 27B 4ビットMLXが温度0.6、top_p 0.95、top_k 20の設定で28 tok/sから63 tok/s(2.24倍高速化)に向上。これらはQwenがコーディングに推奨する正確な設定です。
仕組み
DFlashやDDTree(外部ドラフターモデルが必要で、貪欲法のみ)とは異なり、MTPLXはモデル自身のMTPヘッドを使用します。各MTPヘッドが順次ドラフトを生成し、トークンごとの確率分布を出力します。これにより、温度と残差補正を用いた正確な棄却サンプリングが可能になります。外部ドラフターがないため、追加メモリ使用もありません。
Qwen 3.6 27B(深さ5までのMTPヘッド搭載)では、D2~D5をスイープした結果、最適な深さはD3と判明。より深い深さ(D4/D5)は初期の受容率は良好でしたが、深い位置での検証時間が節約できるトークン数を上回りました。
DFlash / DDTreeとの比較
DFlash MLXは生の速度では優れていますが、貪欲法(温度0)サンプリングのみに制限されており、実用的な使用が大きく制限されます。DDTreeも同様の制限を継承しています。両方とも外部ドラフターが必要です。MTPLXは、MTPヘッドを保持し、完全な温度サンプリング推論をサポートする任意のモデルで動作します。
インストールと使用方法
MTPLXは以下のコマンドを備えた完全なCLIとして提供されます:
mtplx start wizard— ガイド付きセットアップ- 4段階のMTP互換性検出によるモデルダウンロードと検査
- 設定可能な深さ2~7以上
- OpenAI/Anthropic互換APIサーバー、ブラウザチャットUI、ターミナルチャット
- ベンチマークスイート、ヘルス診断、クラッシュセーフなファン制御(アイドル認識による自動復元)
- 562のテストスイート付属
エンジンは、カスタムMetalカーネル、コンパイル済み検証グラフ、イノベーションテープGDNロールバック、およびドラフト専用の再量子化LMヘッドを備えた、パッチ適用済みMLXフォーク上に構築されています。
対象ユーザー
Apple Silicon上でローカルLLMを実行し、コーディングやクリエイティブライティングのために出力品質を犠牲にせずに高スループットで温度サンプリング推論を必要とする開発者向け。
📖 全文ソース: r/LocalLLaMA
👀 See Also

二つの無料Claudeコードスキル:チュートリアル生成とプロンプト修正
2つの新しい無料Claude Codeスキル: create-tutorialは実際のプロジェクトファイルからコード読解チュートリアルを生成し、prompterは誤字だらけのプロンプトを実行可能な指示に書き換えます。両方ともMITライセンスで、GitHubからインストール可能です。

OpenClawをQwen2.5 Coderに接続する:実現可能性と考慮事項
OpenClawを70億パラメータを持つQwen2.5 Coderモデルのローカルインスタンスに接続する可能性を探り、API Gemini 3のレート制限に対処します。

ClamBot: セキュリティのためWASMサンドボックスでLLM生成コードを実行するAIエージェント
ClamBotは、QuickJSをWasmtime上で使用してWebAssemblyサンドボックス内で全てのLLM生成コードを実行するAIエージェントフレームワークであり、exec()やサブプロセス呼び出しを不要にします。ツール呼び出しの承認ゲート、'clams'としての永続的なスクリプトキャッシュ、複数のLLMプロバイダーサポートを含みます。

llmLibrarian:ファイルベースAI検索のためのMCP統合ローカルRAGエンジン
llmLibrarianは、MCPを介して検索機能を公開するローカルRAGエンジンで、ClaudeなどのAIエージェントがインデックス化されたファイルをクエリできるようにします。整理にはChromaDBコレクションを、合成にはOllamaを使用し、すべてをオンデバイスで実行します。