Движок вывода Bodega: Оптимизация вывода LLM для унифицированной памяти Apple Silicon

Bodega — это механизм вывода, разработанный специально для единой архитектуры памяти Apple Silicon, создававшийся более 2,5 лет с оптимизациями, близкими к уровню Metal на MLX. Он решает фундаментальные ограничения пропускной способности, с которыми сталкиваются разработчики при запуске LLM на оборудовании Mac.
Почему Apple Silicon требует другой оптимизации
Apple Silicon использует единую память, где CPU, GPU и нейронный процессор совместно используют один физический пул через единую внутрикристальную шину. Это принципиально отличается от дискретных GPU, таких как NVIDIA, у которых есть отдельные пулы видеопамяти и оперативной памяти, соединённые через PCIe. Пропускная способность памяти варьируется от ~400 ГБ/с на M1 Max до ~800 ГБ/с на M3 Ultra (с учётом штрафа за межкристальное соединение, фактическая пропускная способность снижается до 1,6–1,8x от производительности одного кристалла).
Ключевые архитектурные следствия:
- Декодирование ограничено пропускной способностью памяти — каждый токен требует загрузки весов модели из общей шины
- Предварительное заполнение ограничено вычислительной мощностью — доминируют TFLOPS GPU для матрично-матричного умножения
- Шина памяти используется совместно для всего — кэш KV, веса модели, ОС и приложения конкурируют за одну и ту же полосу пропускания 400–800 ГБ/с
Эта архитектура делает прямые порты реализаций пакетирования из vLLM или llama.cpp неэффективными на MLX, так как они были разработаны для других архитектур памяти.
Что создаёт Bodega
Разработчик изучил внутреннее устройство vLLM, включая непрерывное пакетирование, спекулятивное декодирование, чанковое предварительное заполнение и кэширование префиксов, а затем перестроил каждый компонент для MLX и единой модели памяти Apple.
Ключевое понимание для непрерывного пакетирования: генерация одного токена для одной последовательности загружает все веса модели для матрично-векторного умножения, что неэффективно на оборудовании с пропускной способностью 400+ ГБ/с. Решение — одновременное выполнение нескольких последовательностей с использованием весов × матрицы векторов вместо весов × одного вектора.
Управление кэшем KV было перепроектировано для единой памяти, где вытеснение блоков кэша имеет другие последствия по стоимости по сравнению с системами с изолированной видеопамятью.
Практические следствия
Разработчик сообщает о тестировании на нескольких конфигурациях Apple Silicon, включая два M3 Ultra (256 ГБ и 512 ГБ), M4 Max 128 ГБ и M1 Max 64 ГБ. Общий выявленный предел — пропускная способность для одного пользователя с одним запросом за раз и GPU, который в основном простаивает.
Репозиторий включает тесты производительности, которые можно проверить с помощью простого скрипта curl для настройки.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Джентик Мини: Самостоятельно размещаемый API и уровень выполнения действий для OpenClaw
Jentic Mini — это самодостаточный API и уровень выполнения действий, который располагается между AI-агентами и внешними API, хранит учетные данные в зашифрованном хранилище и предоставляет ограниченные наборы инструментов с индивидуально отзываемыми ключами. Он автоматически импортирует более 10 000 спецификаций OpenAPI и источников рабочих процессов Arazzo при добавлении учетных данных.

Встроенный визуализатор: локальные модели ИИ теперь могут отображать интерактивные HTML-визуализации
Inline Visualizer — это плагин с лицензией BSD-3 для Open WebUI, который позволяет любой локальной AI-модели с поддержкой вызова инструментов отображать интерактивные HTML/SVG-визуализации прямо в чате, используя JavaScript-мост, позволяющий элементам отправлять сообщения обратно к AI.

mentioned.to vs инструменты широкого мониторинга: сравнение рабочих процессов, ориентированных на Reddit
mentioned.to — это инструмент мониторинга, специально разработанный для рабочих процессов на Reddit, который фокусируется на отслеживании релевантных постов, выявлении возможностей для ответов, анализе успешного контента и составлении ответов, а не на широком мониторинге бренда по множеству каналов.

ForgeAI: Визуальная рабочая платформа для инженерии моделей
ForgeAI предоставляет визуальный интерфейс для инспекции, объединения и обучения моделей, предлагая такие функции, как проверка архитектуры 3D моделей и M-DNA Forge для визуального объединения слоев.