Apple Silicon macOS VM:Metal機能シムでLLM推論が11〜16倍高速化
Lume macOS仮想化スタックを開発するCuaチームは、macOS VM内のMetalケーパビリティクエリをパッチし、新しいGPUカーネルを解放する研究プロジェクトをリリースしました。その結果、llama.cppはApple Silicon上のmacOS VMで11〜16倍高速に動作し、ベアメタル性能にほぼ匹敵します。
仕組み
AppleのVirtualization.frameworkは、macOSゲストに準仮想化GPUを提供します。ゲストのMetalドライバは控えめなケーパビリティプロファイルを報告します。標準のTahoe VMでは、Apple 5世代GPUファミリー、制限されたスレッドグループメモリ、SIMDグループ行列サポートなしを報告します。llama.cppはこれらの制限を認識し、物理GPUがより多くの処理ができるにもかかわらず、遅いカーネルを選択します。
Cuaのシムは、単一のゲストプロセス内のMetalケーパビリティクエリを傍受し、アップグレードされた値を返します。これにより、ゲストOSやハイパーバイザーを変更せずに、llama.cppが新しいMetalカーネルを選択できるようになります。
ベンチマーク
- TinyLlama 1.1B(M1 Ultra):プロンプト処理が標準VM比11.08倍、トークン生成が16.36倍高速。プロンプト処理はベアメタルの98%に達しました。
- Gemma 4 12B QAT Q4_0(6.98 GB):プロンプトが7.20倍、生成が14.54倍高速。ベアメタルのプロンプト速度の99.59%、生成速度の94.82%に到達。
- Muse Glimmer 30B Q4_K-M GGUF(64 GiBゲスト、llama.cpp b10359):512トークンプロンプトでプロンプト処理が7.55倍、生成が8.87倍高速。
重要性
これはVFIOの意味でのGPUパススルーではありません。ホストが依然としてGPUを所有しています。しかし、保守的なカーネル選択を強制していたケーパビリティの誤報告を修正しています。Tartユーザーは、macOSゲストのグラフィックスとLLMパフォーマンスについて同様の問題を報告しています。
このシムはプロセススコープであるため、対象アプリにのみ影響します。すべてはLumeおよびCuaと同じ寛容なライセンスでリリースされており、ソース、ビルドスクリプト、ベンチマークログが含まれています。
対象読者
Apple Silicon上のmacOS VM内でllama.cppやその他のMetalベースの推論を実行している開発者、特にローカルAIツールを構築したり、VMイメージに対してテストしている開発者向けです。
📖 全文ソース: HN LLM Tools
👀 See Also

ローカルAIのVS Code拡張機能は、保存時の安全でないコード生成をブロックします。
ある開発者が、VS Code拡張機能を作成しました。この拡張機能は、llama3.1:8b-instruct-q4をローカルで実行し、CWE-117(ログインジェクション)のような脆弱性を含む、AIによって生成された安全でないコードの保存を物理的にブロックします。このツールは、Claudeが教科書的なCWE-117の脆弱性を持つFlaskルートを生成した後に構築されました。

タイトル:Agent Smith:Claude Code向けMCPサーバー、スキル、チケットからPRまでのパイプラインを構築する1つのコマンド
Agent Smithはリポジトリをスキャンし、使用されているスタック(Go/Echo、React/Zustand、golang-jwt、pgxなど)を正確に検出し、それに合わせたMCPサーバー、フック、スキルを設定し、自律的なチケットからPRへのパイプラインを提供します。

API経由でMiniMax M2.7をテスト:3つの実際のMLおよびコーディングワークフロー
開発者がMiniMax M2.7とClaude Opus 4.7を3つの実タスク(PyTorchプロジェクトのリファクタリング、Obsidianノートの作成など)で比較。主要な結果とセットアップ方法を紹介。

Grape Root Toolは、リポジトリコンテキストをキャッシュすることでClaudeコードのトークン使用量を削減します
Grape Rootという無料の実験的ツールは、Claude Codeにおける冗長なトークン消費に対処します。以前に探索されたリポジトリファイルに関する軽量な状態を維持することで、フォローアッププロンプト時の変更されていないファイルの不要な再読み込みを防ぎます。