MTPLX: в 2,24 раза быстрее генерация токенов на Apple Silicon с использованием нативных MTP-головок

✍️ OpenClawRadar📅 Опубликовано: 5 мая 2026 г.🔗 Source
MTPLX: в 2,24 раза быстрее генерация токенов на Apple Silicon с использованием нативных MTP-головок
Ad

MTPLX — это движок инференса для Apple Silicon, использующий встроенные головы Multi-Token Prediction (MTP) модели в качестве спекулятивных драфтеров. Ключевой результат: Qwen 3.6 27B 4-bit MLX переходит с 28 ток/с на 63 ток/с (в 2,24 раза быстрее) на MacBook Pro M5 Max при температуре 0.6, top_p 0.95, top_k 20 — именно те настройки, которые Qwen рекомендует для программирования.

Как это работает

В отличие от DFlash или DDTree (которые требуют внешнюю модель-драфтер и работают только в жадном режиме), MTPLX использует собственные головы MTP модели. Каждая голова MTP генерирует последовательно, выдавая распределения вероятностей для каждого токена. Это позволяет выполнять точную выборку с отклонением с учетом температуры и остаточной коррекцией. Отсутствие внешнего драфтера означает отсутствие дополнительного расхода памяти.

Для Qwen 3.6 27B (который поставляется с головами MTP глубиной до 5) оптимальная глубина оказалась D3 после тестирования D2–D5. Более глубокие уровни (D4/D5) хорошо принимали ранние токены, но на поздних позициях затраты на верификацию превышали сэкономленные токены.

Статус по сравнению с DFlash / DDTree

DFlash MLX достигает более высокой сырой скорости, но ограничен только жадной выборкой (температура 0), что сильно ограничивает его применение в реальных условиях. DDTree наследует те же ограничения. Оба требуют внешнего драфтера. MTPLX работает с любой моделью, сохранившей свои головы MTP, и поддерживает полный инференс с температурной выборкой.

Ad

Установка и использование

MTPLX поставляется как полноценный CLI со следующими командами:

  • mtplx start wizard — настройка с помощью мастера
  • Загрузка и проверка модели с четырехуровневым обнаружением совместимости MTP
  • Настраиваемая глубина от 2 до 7+
  • API-сервер, совместимый с OpenAI/Anthropic, браузерный чат, терминальный чат
  • Набор бенчмарков, диагностика здоровья, управление вентилятором с защитой от сбоев и автоматическим восстановлением в режиме ожидания
  • Включает 562 теста

Движок построен на форке MLX с патчами, пользовательскими ядрами Metal, скомпилированными графами верификации, инновационной лентой отката GDN и переквантованной головой LM только для драфта.

Для кого это

Разработчики, запускающие локальные LLM на Apple Silicon, которым нужен высокопроизводительный инференс с температурной выборкой для программирования или творческого письма без потери качества вывода.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Локальный инструмент RAG, созданный с использованием Nemotron Nano 9B v2 и вызова инструментов vLLM
Инструменты

Локальный инструмент RAG, созданный с использованием Nemotron Nano 9B v2 и вызова инструментов vLLM

Разработчик создал локальный инструмент для исследований RAG, который полностью работает на одном GPU, используя Nemotron Nano 9B v2 Japanese на vLLM с пользовательскими плагинами-парсерами для вызова инструментов. Система включает двухэтапный процесс извлечения-выполнения с двуязычным извлечением ключевых слов и параллельным поиском FTS5/DuckDuckGo.

OpenClawRadar
Результаты A/B-тестирования: хуки oh-my-claudecode демонстрируют минимальное влияние на производительность Claude Code.
Инструменты

Результаты A/B-тестирования: хуки oh-my-claudecode демонстрируют минимальное влияние на производительность Claude Code.

Разработчик потратил 7% своих еженедельных Max20 токенов на тестирование хуков oh-my-claudecode с Claude Sonnet 4.6, не обнаружив значительного улучшения качества кода или снижения затрат для задачи кодирования в рамках одной сессии.

OpenClawRadar
Изучение LiveDocs: Нотация анализа данных на базе ИИ
Инструменты

Изучение LiveDocs: Нотация анализа данных на базе ИИ

LiveDocs предлагает реактивную среду для работы с документами, позволяя командам данных выполнять многопроцессные анализы и поддерживать полный цикл анализа с помощью AI-агента.

OpenClawRadar
Локальная система мониторинга поведения с конвейером MCP и кодом Claude
Инструменты

Локальная система мониторинга поведения с конвейером MCP и кодом Claude

Разработчик создал локальную систему мониторинга поведения под названием BRAIN, которая отслеживает переключения между приложениями, операции с файлами и сессии разработки, передавая данные через пользовательский MCP-сервер в Claude Code. Система работает на 100% локально без какой-либо зависимости от облачных сервисов.

OpenClawRadar