MTP уровень принятия: 50% порог определяет выгоду спекулятивного декодирования

✍️ OpenClawRadar📅 Опубликовано: 9 мая 2026 г.🔗 Source
MTP уровень принятия: 50% порог определяет выгоду спекулятивного декодирования
Ad

Пользователь Reddit протестировал MTP (Многотокеновое предсказание) с помощью mlx-vlm на Gemma-4 (26B, 4-битная) и обнаружил, что производительность полностью зависит от уровня принятия черновиков токенов. Измерения на M4 Max Studio показывают конкретные пороговые значения.

Ad

Результаты нагрузки

  • Генерация кода: 75 ток/с → 114,8 ток/с (в 1,53 раза быстрее) — уровень принятия: 66% слотов
  • Длинная проза: 75 ток/с → 71,1 ток/с (0,95×, практически без изменений) — уровень принятия: 31% слотов
  • Вывод JSON: 51,3 ток/с → 25,6 ток/с (в 0,50 раза медленнее) — уровень принятия: 8% слотов

Порог, по-видимому, составляет ~50% принятия. Ниже этого накладные расходы спекулятивного декодирования перевешивают выгоду.

Детали теста: код — "написать несколько функций Python для X"; длинная проза — "написать эссе на 800 слов о бумажных деньгах в династии Тан"; вывод JSON — группировка элементов по схожести в структурированный вывод.

Бонусный совет: пользователь отмечает, что Gemma неплохо следует инструкциям по структуре JSON, но включение структурированного вывода (json_schema) добавляет ~20% накладных расходов. Он рекомендует допускать слегка неровный JSON и исправлять его во время выполнения. mlx-vlm всё равно не поддерживает json_schema для спекулятивного декодирования.

Итог: MTP отлично подходит для локального кодирования, но может ухудшить производительность для структурированных или прозаических задач с низким уровнем принятия.

📖 Источник: r/LocalLLaMA

Ad

👀 Смотрите также

Исправление скорости обработки промптов в Llama.cpp с использованием параметра --ubatch-size
Советы

Исправление скорости обработки промптов в Llama.cpp с использованием параметра --ubatch-size

Пользователь обнаружил, что установка параметра --ubatch-size в соответствии с размером кэша L3 GPU (64 МБ для Radeon 9070XT) значительно повысила скорость обработки промптов для больших моделей, таких как Qwen 27B в Llama.cpp, сделав вызов кода Claude пригодным для использования.

OpenClawRadar
OpenClaw WhatsApp Автоответчик может пропускать понимание медиа в версии 2026.4.2.
Советы

OpenClaw WhatsApp Автоответчик может пропускать понимание медиа в версии 2026.4.2.

Пользователь сообщает, что в OpenClaw 2026.4.2 поток автоматического ответа WhatsApp может пропустить конвейер обработки медиа, что препятствует транскрипции голосовых сообщений при использовании внешних STT-сервисов, таких как Groq. Исправление заключается в явном вызове обработки медиа перед отправкой агенту.

OpenClawRadar
Перехват поэзии циклов сна OpenClaw для отслеживания оперативных слепых зон
Советы

Перехват поэзии циклов сна OpenClaw для отслеживания оперативных слепых зон

Пользователь изменяет запрос цикла сна OpenClaw в 3 часа ночи, превращая поэтический дневник в запрашиваемую базу данных, которая отслеживает слепые зоны и траекторию инфраструктуры.

OpenClawRadar
Утечка бюджета в OpenClaw API: Настройки, которые нужно изменить немедленно
Советы

Утечка бюджета в OpenClaw API: Настройки, которые нужно изменить немедленно

Функция Heartbeat по умолчанию в OpenClaw может истощать бюджет API, проверяя задачи каждые 30 минут и загружая полные контекстные файлы, память и историю чата каждый раз. Источник рекомендует изменить активные часы, использовать более дешёвые базовые модели, вручную переключаться на премиум-модели только при необходимости и использовать команду /new для сброса сессий.

OpenClawRadar