MTPLX: в 2,24 раза быстрее генерация токенов на Apple Silicon с использованием нативных MTP-головок

MTPLX — это движок инференса для Apple Silicon, использующий встроенные головы Multi-Token Prediction (MTP) модели в качестве спекулятивных драфтеров. Ключевой результат: Qwen 3.6 27B 4-bit MLX переходит с 28 ток/с на 63 ток/с (в 2,24 раза быстрее) на MacBook Pro M5 Max при температуре 0.6, top_p 0.95, top_k 20 — именно те настройки, которые Qwen рекомендует для программирования.
Как это работает
В отличие от DFlash или DDTree (которые требуют внешнюю модель-драфтер и работают только в жадном режиме), MTPLX использует собственные головы MTP модели. Каждая голова MTP генерирует последовательно, выдавая распределения вероятностей для каждого токена. Это позволяет выполнять точную выборку с отклонением с учетом температуры и остаточной коррекцией. Отсутствие внешнего драфтера означает отсутствие дополнительного расхода памяти.
Для Qwen 3.6 27B (который поставляется с головами MTP глубиной до 5) оптимальная глубина оказалась D3 после тестирования D2–D5. Более глубокие уровни (D4/D5) хорошо принимали ранние токены, но на поздних позициях затраты на верификацию превышали сэкономленные токены.
Статус по сравнению с DFlash / DDTree
DFlash MLX достигает более высокой сырой скорости, но ограничен только жадной выборкой (температура 0), что сильно ограничивает его применение в реальных условиях. DDTree наследует те же ограничения. Оба требуют внешнего драфтера. MTPLX работает с любой моделью, сохранившей свои головы MTP, и поддерживает полный инференс с температурной выборкой.
Установка и использование
MTPLX поставляется как полноценный CLI со следующими командами:
mtplx start wizard— настройка с помощью мастера- Загрузка и проверка модели с четырехуровневым обнаружением совместимости MTP
- Настраиваемая глубина от 2 до 7+
- API-сервер, совместимый с OpenAI/Anthropic, браузерный чат, терминальный чат
- Набор бенчмарков, диагностика здоровья, управление вентилятором с защитой от сбоев и автоматическим восстановлением в режиме ожидания
- Включает 562 теста
Движок построен на форке MLX с патчами, пользовательскими ядрами Metal, скомпилированными графами верификации, инновационной лентой отката GDN и переквантованной головой LM только для драфта.
Для кого это
Разработчики, запускающие локальные LLM на Apple Silicon, которым нужен высокопроизводительный инференс с температурной выборкой для программирования или творческого письма без потери качества вывода.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Контекст Lean: Плагин Claude Code преобразует многословную документацию в файлы, оптимизированные для агентов.
Бесплатный плагин с открытым исходным кодом для Claude Code под названием Lean Context анализирует документацию проекта и удаляет контент, который AI-агенты могут обнаружить через поиск (grepping), оставляя только важные неочевидные команды, подводные камни и особенности окружения. В тесте с .NET e-commerce проектом он сократил 8 документов общим объёмом в 1 263 строки до всего 23 строк.

Claude-voice: Локальный TTS с выделением слов для Claude Code
Claude-voice — это инструмент на Python, который добавляет локальное преобразование текста в речь с подсветкой слов в реальном времени к голосовому режиму Claude Code. Он использует Kokoro TTS (82 миллиона параметров), работающую полностью локально без API-ключей.

cstat: Нативный статус-бар на Rust для Claude Code с производительностью 2 мс
cstat — это нативный бинарный файл на Rust, который заменяет строку состояния claude-hud с 62 мс на реализацию за 2 мс, исключая 24 запуска подпроцессов за вызов. Он отображает информацию о модели, ограничения скорости, статус git, использование контекстного окна, активные инструменты, под-агентов и прогресс задач.

Когтевой Компактор: 14-ступенчатый движок сжатия токенов для конвейеров LLM
Claw Compactor — это движок сжатия токенов LLM с открытым исходным кодом, использующий 14-ступенчатый Fusion Pipeline для достижения среднего сжатия 54% без затрат на вывод LLM. Включает специализированные компрессоры для кода, JSON, логов, диффов и результатов поиска с возможностью обратимого сжатия.