Движок вывода Bodega: Оптимизация вывода LLM для унифицированной памяти Apple Silicon

Bodega — это механизм вывода, разработанный специально для единой архитектуры памяти Apple Silicon, создававшийся более 2,5 лет с оптимизациями, близкими к уровню Metal на MLX. Он решает фундаментальные ограничения пропускной способности, с которыми сталкиваются разработчики при запуске LLM на оборудовании Mac.
Почему Apple Silicon требует другой оптимизации
Apple Silicon использует единую память, где CPU, GPU и нейронный процессор совместно используют один физический пул через единую внутрикристальную шину. Это принципиально отличается от дискретных GPU, таких как NVIDIA, у которых есть отдельные пулы видеопамяти и оперативной памяти, соединённые через PCIe. Пропускная способность памяти варьируется от ~400 ГБ/с на M1 Max до ~800 ГБ/с на M3 Ultra (с учётом штрафа за межкристальное соединение, фактическая пропускная способность снижается до 1,6–1,8x от производительности одного кристалла).
Ключевые архитектурные следствия:
- Декодирование ограничено пропускной способностью памяти — каждый токен требует загрузки весов модели из общей шины
- Предварительное заполнение ограничено вычислительной мощностью — доминируют TFLOPS GPU для матрично-матричного умножения
- Шина памяти используется совместно для всего — кэш KV, веса модели, ОС и приложения конкурируют за одну и ту же полосу пропускания 400–800 ГБ/с
Эта архитектура делает прямые порты реализаций пакетирования из vLLM или llama.cpp неэффективными на MLX, так как они были разработаны для других архитектур памяти.
Что создаёт Bodega
Разработчик изучил внутреннее устройство vLLM, включая непрерывное пакетирование, спекулятивное декодирование, чанковое предварительное заполнение и кэширование префиксов, а затем перестроил каждый компонент для MLX и единой модели памяти Apple.
Ключевое понимание для непрерывного пакетирования: генерация одного токена для одной последовательности загружает все веса модели для матрично-векторного умножения, что неэффективно на оборудовании с пропускной способностью 400+ ГБ/с. Решение — одновременное выполнение нескольких последовательностей с использованием весов × матрицы векторов вместо весов × одного вектора.
Управление кэшем KV было перепроектировано для единой памяти, где вытеснение блоков кэша имеет другие последствия по стоимости по сравнению с системами с изолированной видеопамятью.
Практические следствия
Разработчик сообщает о тестировании на нескольких конфигурациях Apple Silicon, включая два M3 Ultra (256 ГБ и 512 ГБ), M4 Max 128 ГБ и M1 Max 64 ГБ. Общий выявленный предел — пропускная способность для одного пользователя с одним запросом за раз и GPU, который в основном простаивает.
Репозиторий включает тесты производительности, которые можно проверить с помощью простого скрипта curl для настройки.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

GLM-5-Turbo демонстрирует низкий уровень ошибок при вызове инструментов в пользовательском тестировании.
Модель z-ai/glm-5-turbo демонстрирует среднюю частоту ошибок при вызове инструментов в 0,57% в тестах, что значительно ниже показателя GLM-5 в ~3%. Пользователь сообщил об успешном использовании модели с CLI-инструментом для написания фэнтези-романа объёмом 97 000 слов с минимальными проблемами.

TranscriptionSuite v1.1.2 добавляет модели WhisperX, NeMo и VibeVoice.
TranscriptionSuite v1.1.2 теперь предлагает три конвейера транскрипции: WhisperX с диаризацией PyAnnote, модели NeMo (Parakeet и Canary) с диаризацией PyAnnote и модели VibeVoice со встроенной диаризацией. Обновление включает менеджер моделей, параллельную обработку, управление горячими клавишами и конвейер записи 24 кГц для VibeVoice.

Hollow AgentOS сокращает использование токенов кода Claude на 68,5% благодаря JSON-ориентированной операционной системе для ИИ-агентов.
Hollow AgentOS — это JSON-ориентированная операционная система для ИИ-агентов, которая сокращает использование токенов в Claude Code на 68,5%, устраняя избыточные накладные расходы на выполнение shell-команд. Она интегрируется в Claude Code через MCP, запускает локальные вычисления через Ollama и распространяется под лицензией MIT.

Бит-Чат: ИИ-агенты могут отправлять биткоины через Lightning через мессенджеры
Система под названием Bit-Chat позволяет ИИ-агентам отправлять платежи в биткоинах через сеть Lightning по электронной почте, WhatsApp, Telegram или Signal. Агенты могут генерировать выделенные адреса, такие как [email protected], и платежи работают, даже если получатель не зарегистрирован.