Apple Silicon macOS 虚拟机:通过 Metal 能力垫片实现 11–16 倍更快的 LLM 推理
Cua — команда, стоящая за стеком виртуализации Lume для macOS, — выпустила исследовательский проект, который исправляет запросы возможностей Metal внутри macOS VM, открывая доступ к новым GPU-ядрам. Результат: llama.cpp выполняется в 11–16 раз быстрее в macOS VM на Apple Silicon, почти достигая производительности bare-metal.
Как это работает
Virtualization.framework от Apple предоставляет macOS-гостям паравиртуализированный GPU. Драйвер Metal в гостевой системе сообщает консервативный профиль возможностей — в стандартных Tahoe VM он сообщает о GPU семейства Apple 5, ограниченной памяти threadgroup и отсутствии поддержки матриц SIMD-group. llama.cpp видит эти ограничения и выбирает более медленные ядра, хотя физический GPU способен на большее.
Шим Cua перехватывает запросы возможностей Metal в одном гостевом процессе и возвращает улучшенные значения. Это позволяет llama.cpp выбирать более новые ядра Metal без изменения гостевой ОС или гипервизора.
Бенчмарки
- TinyLlama 1.1B (M1 Ultra): обработка промпта в 11.08× быстрее, генерация токенов в 16.36× быстрее по сравнению со стандартной VM. Скорость обработки промпта достигла 98% от bare-metal.
- Gemma 4 12B QAT Q4_0 (6.98 GB): промпты в 7.20× быстрее, генерация в 14.54× быстрее. Достигнуто 99.59% скорости промпта bare-metal и 94.82% генерации.
- Muse Glimmer 30B Q4_K-M GGUF (64 GiB гостевая, llama.cpp b10359): обработка промпта в 7.55× быстрее, генерация в 8.87× быстрее на промпте из 512 токенов.
Почему это важно
Это не GPU passthrough в смысле VFIO — хост по-прежнему владеет GPU. Но это исправляет неверную информацию о возможностях, которая вынуждала выбирать консервативные ядра. Пользователи Tart сообщали о похожей проблеме с графикой и производительностью LLM в macOS-гостях.
Шим действует в рамках процесса, поэтому затрагивает только целевое приложение. Все выпущено под той же разрешительной лицензией, что и Lume и Cua, с включением исходников, скриптов сборки и журналов бенчмарков.
Для кого это предназначено
Для разработчиков, запускающих llama.cpp или другие инференсы на основе Metal внутри macOS VM на Apple Silicon — особенно для тех, кто создает локальные AI-инструменты или тестирует образы VM.
📖 Читать полный источник: HN LLM Tools
👀 Смотрите также

Библиотекарь: отслеживайте чтение и получайте рекомендации без спойлеров
Навык OpenClaw, который отслеживает вашу читательскую жизнь, рекомендует сначала из ваших собственных книг и со временем узнает, как меняются ваши вкусы.

Либретто: Детерминированная генерация автоматизации браузера для ИИ-агентов программирования
Libretto — это набор инструментов Skill+CLI, который позволяет AI-агентам для написания кода генерировать детерминированные скрипты автоматизации браузера в виде реального кода, уходя от использования AI-агентов во время выполнения. Он сочетает автоматизацию пользовательского интерфейса Playwright с прямыми сетевыми/API-запросами для надёжности и включает пошаговую отладку и режимы только для чтения.

OpenClaw Nerve WebUI добавляет голосовое управление и панель управления командой.
Nerve — это веб-интерфейс для OpenClaw, предоставляющий универсальную панель управления для мониторинга и управления ИИ-агентами, с голосовым управлением через двойное нажатие Shift для интеграции с Whisper и возможностями создания команд под-агентов.

Использование вложений Harrier для локального семантического поиска в памяти агентов OpenClaw
Запустите локальный сервер эмбеддингов с моделью Harrier от Microsoft, откройте API, совместимое с Ollama, и настройте memorySearch в OpenClaw для локального поиска семантической памяти без внешних сервисов.