Apple Silicon macOS 虚拟机:通过 Metal 能力垫片实现 11–16 倍更快的 LLM 推理

✍️ OpenClawRadar📅 Опубликовано: 12 августа 2026 г.🔗 Source
Ad

Cua — команда, стоящая за стеком виртуализации Lume для macOS, — выпустила исследовательский проект, который исправляет запросы возможностей Metal внутри macOS VM, открывая доступ к новым GPU-ядрам. Результат: llama.cpp выполняется в 11–16 раз быстрее в macOS VM на Apple Silicon, почти достигая производительности bare-metal.

Как это работает

Virtualization.framework от Apple предоставляет macOS-гостям паравиртуализированный GPU. Драйвер Metal в гостевой системе сообщает консервативный профиль возможностей — в стандартных Tahoe VM он сообщает о GPU семейства Apple 5, ограниченной памяти threadgroup и отсутствии поддержки матриц SIMD-group. llama.cpp видит эти ограничения и выбирает более медленные ядра, хотя физический GPU способен на большее.

Шим Cua перехватывает запросы возможностей Metal в одном гостевом процессе и возвращает улучшенные значения. Это позволяет llama.cpp выбирать более новые ядра Metal без изменения гостевой ОС или гипервизора.

Бенчмарки

  • TinyLlama 1.1B (M1 Ultra): обработка промпта в 11.08× быстрее, генерация токенов в 16.36× быстрее по сравнению со стандартной VM. Скорость обработки промпта достигла 98% от bare-metal.
  • Gemma 4 12B QAT Q4_0 (6.98 GB): промпты в 7.20× быстрее, генерация в 14.54× быстрее. Достигнуто 99.59% скорости промпта bare-metal и 94.82% генерации.
  • Muse Glimmer 30B Q4_K-M GGUF (64 GiB гостевая, llama.cpp b10359): обработка промпта в 7.55× быстрее, генерация в 8.87× быстрее на промпте из 512 токенов.
Ad

Почему это важно

Это не GPU passthrough в смысле VFIO — хост по-прежнему владеет GPU. Но это исправляет неверную информацию о возможностях, которая вынуждала выбирать консервативные ядра. Пользователи Tart сообщали о похожей проблеме с графикой и производительностью LLM в macOS-гостях.

Шим действует в рамках процесса, поэтому затрагивает только целевое приложение. Все выпущено под той же разрешительной лицензией, что и Lume и Cua, с включением исходников, скриптов сборки и журналов бенчмарков.

Для кого это предназначено

Для разработчиков, запускающих llama.cpp или другие инференсы на основе Metal внутри macOS VM на Apple Silicon — особенно для тех, кто создает локальные AI-инструменты или тестирует образы VM.

📖 Читать полный источник: HN LLM Tools

Ad

👀 Смотрите также

Клод Сыщик: 56-шаговая рабочая процедура для расследований с помощью Claude AI
Инструменты

Клод Сыщик: 56-шаговая рабочая процедура для расследований с помощью Claude AI

Claude Sleuth — это структурированный рабочий процесс для расследований в Claude AI, состоящий из 6 этапов и 56 задач. Он включает постоянное хранение состояния через Cloudflare D1 и стандартизированные соглашения о выводе данных, такие как временные метки ISO 8601, записи сущностей по схеме POLE и вероятностный язык ICD 203.

OpenClawRadar
Разработчик создает генератор шаблонов .NET SaaS с помощью Claude Code и делится инсайтами о рабочем процессе
Инструменты

Разработчик создает генератор шаблонов .NET SaaS с помощью Claude Code и делится инсайтами о рабочем процессе

Разработчик открыл исходный код NETrock, стартового шаблона SaaS на .NET 10 с аутентификацией, ORM и фоновыми задачами, а затем создал для него клиентский генератор с помощью Claude Code. Генератор позволяет пользователям выбирать функции и загружать рабочий .zip-проект, который остается в их браузере.

OpenClawRadar
Best-Backup: Бесплатный инструмент для резервного копирования сервера OpenClaw и контейнеров Docker
Инструменты

Best-Backup: Бесплатный инструмент для резервного копирования сервера OpenClaw и контейнеров Docker

Бесплатный инструмент best-backup предоставляет надёжные возможности резервного копирования для серверов OpenClaw, включая полное резервное копирование серверов, копирование определённых папок и резервное копирование контейнеров Docker, с такими функциями, как сжатие, шифрование с использованием существующих SSH-ключей и интеграция с Google Drive.

OpenClawRadar
Сторожевая башня: Локальный прокси для мониторинга трафика Claude Code API
Инструменты

Сторожевая башня: Локальный прокси для мониторинга трафика Claude Code API

Watchtower — это бесплатный инструмент с открытым исходным кодом, который работает как локальный HTTP-прокси и веб-панель в реальном времени для перехвата и отображения всего API-трафика между Claude Code (или Codex CLI) и их API. Он показывает запросы, SSE-потоки, определения инструментов, системные промпты, использование токенов и лимиты запросов.

OpenClawRadar