MTP уровень принятия: 50% порог определяет выгоду спекулятивного декодирования

Пользователь Reddit протестировал MTP (Многотокеновое предсказание) с помощью mlx-vlm на Gemma-4 (26B, 4-битная) и обнаружил, что производительность полностью зависит от уровня принятия черновиков токенов. Измерения на M4 Max Studio показывают конкретные пороговые значения.
Результаты нагрузки
- Генерация кода: 75 ток/с → 114,8 ток/с (в 1,53 раза быстрее) — уровень принятия: 66% слотов
- Длинная проза: 75 ток/с → 71,1 ток/с (0,95×, практически без изменений) — уровень принятия: 31% слотов
- Вывод JSON: 51,3 ток/с → 25,6 ток/с (в 0,50 раза медленнее) — уровень принятия: 8% слотов
Порог, по-видимому, составляет ~50% принятия. Ниже этого накладные расходы спекулятивного декодирования перевешивают выгоду.
Детали теста: код — "написать несколько функций Python для X"; длинная проза — "написать эссе на 800 слов о бумажных деньгах в династии Тан"; вывод JSON — группировка элементов по схожести в структурированный вывод.
Бонусный совет: пользователь отмечает, что Gemma неплохо следует инструкциям по структуре JSON, но включение структурированного вывода (json_schema) добавляет ~20% накладных расходов. Он рекомендует допускать слегка неровный JSON и исправлять его во время выполнения. mlx-vlm всё равно не поддерживает json_schema для спекулятивного декодирования.
Итог: MTP отлично подходит для локального кодирования, но может ухудшить производительность для структурированных или прозаических задач с низким уровнем принятия.
📖 Источник: r/LocalLLaMA
👀 Смотрите также

Исправление скорости обработки промптов в Llama.cpp с использованием параметра --ubatch-size
Пользователь обнаружил, что установка параметра --ubatch-size в соответствии с размером кэша L3 GPU (64 МБ для Radeon 9070XT) значительно повысила скорость обработки промптов для больших моделей, таких как Qwen 27B в Llama.cpp, сделав вызов кода Claude пригодным для использования.

OpenClaw WhatsApp Автоответчик может пропускать понимание медиа в версии 2026.4.2.
Пользователь сообщает, что в OpenClaw 2026.4.2 поток автоматического ответа WhatsApp может пропустить конвейер обработки медиа, что препятствует транскрипции голосовых сообщений при использовании внешних STT-сервисов, таких как Groq. Исправление заключается в явном вызове обработки медиа перед отправкой агенту.

Перехват поэзии циклов сна OpenClaw для отслеживания оперативных слепых зон
Пользователь изменяет запрос цикла сна OpenClaw в 3 часа ночи, превращая поэтический дневник в запрашиваемую базу данных, которая отслеживает слепые зоны и траекторию инфраструктуры.

Утечка бюджета в OpenClaw API: Настройки, которые нужно изменить немедленно
Функция Heartbeat по умолчанию в OpenClaw может истощать бюджет API, проверяя задачи каждые 30 минут и загружая полные контекстные файлы, память и историю чата каждый раз. Источник рекомендует изменить активные часы, использовать более дешёвые базовые модели, вручную переключаться на премиум-модели только при необходимости и использовать команду /new для сброса сессий.