Apple Silicon macOS 虚拟机:通过 Metal 能力垫片实现 11–16 倍更快的 LLM 推理

✍️ OpenClawRadar📅 Опубликовано: 12 августа 2026 г.🔗 Source
Ad

Cua — команда, стоящая за стеком виртуализации Lume для macOS, — выпустила исследовательский проект, который исправляет запросы возможностей Metal внутри macOS VM, открывая доступ к новым GPU-ядрам. Результат: llama.cpp выполняется в 11–16 раз быстрее в macOS VM на Apple Silicon, почти достигая производительности bare-metal.

Как это работает

Virtualization.framework от Apple предоставляет macOS-гостям паравиртуализированный GPU. Драйвер Metal в гостевой системе сообщает консервативный профиль возможностей — в стандартных Tahoe VM он сообщает о GPU семейства Apple 5, ограниченной памяти threadgroup и отсутствии поддержки матриц SIMD-group. llama.cpp видит эти ограничения и выбирает более медленные ядра, хотя физический GPU способен на большее.

Шим Cua перехватывает запросы возможностей Metal в одном гостевом процессе и возвращает улучшенные значения. Это позволяет llama.cpp выбирать более новые ядра Metal без изменения гостевой ОС или гипервизора.

Бенчмарки

  • TinyLlama 1.1B (M1 Ultra): обработка промпта в 11.08× быстрее, генерация токенов в 16.36× быстрее по сравнению со стандартной VM. Скорость обработки промпта достигла 98% от bare-metal.
  • Gemma 4 12B QAT Q4_0 (6.98 GB): промпты в 7.20× быстрее, генерация в 14.54× быстрее. Достигнуто 99.59% скорости промпта bare-metal и 94.82% генерации.
  • Muse Glimmer 30B Q4_K-M GGUF (64 GiB гостевая, llama.cpp b10359): обработка промпта в 7.55× быстрее, генерация в 8.87× быстрее на промпте из 512 токенов.
Ad

Почему это важно

Это не GPU passthrough в смысле VFIO — хост по-прежнему владеет GPU. Но это исправляет неверную информацию о возможностях, которая вынуждала выбирать консервативные ядра. Пользователи Tart сообщали о похожей проблеме с графикой и производительностью LLM в macOS-гостях.

Шим действует в рамках процесса, поэтому затрагивает только целевое приложение. Все выпущено под той же разрешительной лицензией, что и Lume и Cua, с включением исходников, скриптов сборки и журналов бенчмарков.

Для кого это предназначено

Для разработчиков, запускающих llama.cpp или другие инференсы на основе Metal внутри macOS VM на Apple Silicon — особенно для тех, кто создает локальные AI-инструменты или тестирует образы VM.

📖 Читать полный источник: HN LLM Tools

Ad

👀 Смотрите также

Библиотекарь: отслеживайте чтение и получайте рекомендации без спойлеров
Инструменты

Библиотекарь: отслеживайте чтение и получайте рекомендации без спойлеров

Навык OpenClaw, который отслеживает вашу читательскую жизнь, рекомендует сначала из ваших собственных книг и со временем узнает, как меняются ваши вкусы.

OpenClawRadar
Либретто: Детерминированная генерация автоматизации браузера для ИИ-агентов программирования
Инструменты

Либретто: Детерминированная генерация автоматизации браузера для ИИ-агентов программирования

Libretto — это набор инструментов Skill+CLI, который позволяет AI-агентам для написания кода генерировать детерминированные скрипты автоматизации браузера в виде реального кода, уходя от использования AI-агентов во время выполнения. Он сочетает автоматизацию пользовательского интерфейса Playwright с прямыми сетевыми/API-запросами для надёжности и включает пошаговую отладку и режимы только для чтения.

OpenClawRadar
OpenClaw Nerve WebUI добавляет голосовое управление и панель управления командой.
Инструменты

OpenClaw Nerve WebUI добавляет голосовое управление и панель управления командой.

Nerve — это веб-интерфейс для OpenClaw, предоставляющий универсальную панель управления для мониторинга и управления ИИ-агентами, с голосовым управлением через двойное нажатие Shift для интеграции с Whisper и возможностями создания команд под-агентов.

OpenClawRadar
Использование вложений Harrier для локального семантического поиска в памяти агентов OpenClaw
Инструменты

Использование вложений Harrier для локального семантического поиска в памяти агентов OpenClaw

Запустите локальный сервер эмбеддингов с моделью Harrier от Microsoft, откройте API, совместимое с Ollama, и настройте memorySearch в OpenClaw для локального поиска семантической памяти без внешних сервисов.

OpenClawRadar