Apple Silicon macOS VM:Metal機能シムでLLM推論が11〜16倍高速化
Lume macOS仮想化スタックを開発するCuaチームは、macOS VM内のMetalケーパビリティクエリをパッチし、新しいGPUカーネルを解放する研究プロジェクトをリリースしました。その結果、llama.cppはApple Silicon上のmacOS VMで11〜16倍高速に動作し、ベアメタル性能にほぼ匹敵します。
仕組み
AppleのVirtualization.frameworkは、macOSゲストに準仮想化GPUを提供します。ゲストのMetalドライバは控えめなケーパビリティプロファイルを報告します。標準のTahoe VMでは、Apple 5世代GPUファミリー、制限されたスレッドグループメモリ、SIMDグループ行列サポートなしを報告します。llama.cppはこれらの制限を認識し、物理GPUがより多くの処理ができるにもかかわらず、遅いカーネルを選択します。
Cuaのシムは、単一のゲストプロセス内のMetalケーパビリティクエリを傍受し、アップグレードされた値を返します。これにより、ゲストOSやハイパーバイザーを変更せずに、llama.cppが新しいMetalカーネルを選択できるようになります。
ベンチマーク
- TinyLlama 1.1B(M1 Ultra):プロンプト処理が標準VM比11.08倍、トークン生成が16.36倍高速。プロンプト処理はベアメタルの98%に達しました。
- Gemma 4 12B QAT Q4_0(6.98 GB):プロンプトが7.20倍、生成が14.54倍高速。ベアメタルのプロンプト速度の99.59%、生成速度の94.82%に到達。
- Muse Glimmer 30B Q4_K-M GGUF(64 GiBゲスト、llama.cpp b10359):512トークンプロンプトでプロンプト処理が7.55倍、生成が8.87倍高速。
重要性
これはVFIOの意味でのGPUパススルーではありません。ホストが依然としてGPUを所有しています。しかし、保守的なカーネル選択を強制していたケーパビリティの誤報告を修正しています。Tartユーザーは、macOSゲストのグラフィックスとLLMパフォーマンスについて同様の問題を報告しています。
このシムはプロセススコープであるため、対象アプリにのみ影響します。すべてはLumeおよびCuaと同じ寛容なライセンスでリリースされており、ソース、ビルドスクリプト、ベンチマークログが含まれています。
対象読者
Apple Silicon上のmacOS VM内でllama.cppやその他のMetalベースの推論を実行している開発者、特にローカルAIツールを構築したり、VMイメージに対してテストしている開発者向けです。
📖 全文ソース: HN LLM Tools
👀 See Also

OpenUtter: OpenClaw経由でGoogle Meetの文字起こしをライブでクエリ
OpenUtterは、ヘッドレスブラウザを介してGoogle Meetにゲストとして参加し、ライブ字幕をキャプチャしてOpenClawイベントバスにストリーミングするスキルです。通話中にTelegram、WhatsApp、Slack、またはDiscordを介してライブ文字起こしをクエリできます。

エージェント・ウェイクスキル for OpenClaw: タスク完了時にDiscordに通知
開発者がagent-wake.pyというPythonスクリプトを作成しました。これはClaude Codeがタスク終了後に呼び出すもので、Discordに通知を送信し、ゲートウェイHTTP APIを通じてウェイクイベントを発火させ、エージェントが自動的に要約を投稿するように促します。
チャットから直接LinkedIn投稿にClaudeを活用:完全なワークフロー
Redditユーザーが、Contentdrips MCPコネクタを使用してClaude AIから直接LinkedInに投稿を作成、デザイン、公開するワークフローを共有しています。

アナムネーゼ:MCP経由でClaudeとChatGPTに接続するポータブルメモリレイヤー
Anamneseは、ClaudeとChatGPT間で記憶、タスク、目標、メモを保存する無料のMCPサーバーで、関連するコンテキストのみを会話に取り込みながら、ユーザーがデータを閲覧、編集、エクスポートできるツールです。