Apple Silicon macOS VM:Metal機能シムでLLM推論が11〜16倍高速化

✍️ OpenClawRadar📅 公開日: August 12, 2026🔗 Source
Ad

Lume macOS仮想化スタックを開発するCuaチームは、macOS VM内のMetalケーパビリティクエリをパッチし、新しいGPUカーネルを解放する研究プロジェクトをリリースしました。その結果、llama.cppはApple Silicon上のmacOS VMで11〜16倍高速に動作し、ベアメタル性能にほぼ匹敵します。

仕組み

AppleのVirtualization.frameworkは、macOSゲストに準仮想化GPUを提供します。ゲストのMetalドライバは控えめなケーパビリティプロファイルを報告します。標準のTahoe VMでは、Apple 5世代GPUファミリー、制限されたスレッドグループメモリ、SIMDグループ行列サポートなしを報告します。llama.cppはこれらの制限を認識し、物理GPUがより多くの処理ができるにもかかわらず、遅いカーネルを選択します。

Cuaのシムは、単一のゲストプロセス内のMetalケーパビリティクエリを傍受し、アップグレードされた値を返します。これにより、ゲストOSやハイパーバイザーを変更せずに、llama.cppが新しいMetalカーネルを選択できるようになります。

ベンチマーク

  • TinyLlama 1.1B(M1 Ultra):プロンプト処理が標準VM比11.08倍、トークン生成が16.36倍高速。プロンプト処理はベアメタルの98%に達しました。
  • Gemma 4 12B QAT Q4_0(6.98 GB):プロンプトが7.20倍、生成が14.54倍高速。ベアメタルのプロンプト速度の99.59%、生成速度の94.82%に到達。
  • Muse Glimmer 30B Q4_K-M GGUF(64 GiBゲスト、llama.cpp b10359):512トークンプロンプトでプロンプト処理が7.55倍、生成が8.87倍高速。
Ad

重要性

これはVFIOの意味でのGPUパススルーではありません。ホストが依然としてGPUを所有しています。しかし、保守的なカーネル選択を強制していたケーパビリティの誤報告を修正しています。Tartユーザーは、macOSゲストのグラフィックスとLLMパフォーマンスについて同様の問題を報告しています。

このシムはプロセススコープであるため、対象アプリにのみ影響します。すべてはLumeおよびCuaと同じ寛容なライセンスでリリースされており、ソース、ビルドスクリプト、ベンチマークログが含まれています。

対象読者

Apple Silicon上のmacOS VM内でllama.cppやその他のMetalベースの推論を実行している開発者、特にローカルAIツールを構築したり、VMイメージに対してテストしている開発者向けです。

📖 全文ソース: HN LLM Tools

Ad

👀 See Also

OpenUtter: OpenClaw経由でGoogle Meetの文字起こしをライブでクエリ
Tools

OpenUtter: OpenClaw経由でGoogle Meetの文字起こしをライブでクエリ

OpenUtterは、ヘッドレスブラウザを介してGoogle Meetにゲストとして参加し、ライブ字幕をキャプチャしてOpenClawイベントバスにストリーミングするスキルです。通話中にTelegram、WhatsApp、Slack、またはDiscordを介してライブ文字起こしをクエリできます。

OpenClawRadar
エージェント・ウェイクスキル for OpenClaw: タスク完了時にDiscordに通知
Tools

エージェント・ウェイクスキル for OpenClaw: タスク完了時にDiscordに通知

開発者がagent-wake.pyというPythonスクリプトを作成しました。これはClaude Codeがタスク終了後に呼び出すもので、Discordに通知を送信し、ゲートウェイHTTP APIを通じてウェイクイベントを発火させ、エージェントが自動的に要約を投稿するように促します。

OpenClawRadar
🦀
Tools

チャットから直接LinkedIn投稿にClaudeを活用:完全なワークフロー

Redditユーザーが、Contentdrips MCPコネクタを使用してClaude AIから直接LinkedInに投稿を作成、デザイン、公開するワークフローを共有しています。

OpenClawRadar
アナムネーゼ:MCP経由でClaudeとChatGPTに接続するポータブルメモリレイヤー
Tools

アナムネーゼ:MCP経由でClaudeとChatGPTに接続するポータブルメモリレイヤー

Anamneseは、ClaudeとChatGPT間で記憶、タスク、目標、メモを保存する無料のMCPサーバーで、関連するコンテキストのみを会話に取り込みながら、ユーザーがデータを閲覧、編集、エクスポートできるツールです。

OpenClawRadar