MTP уровень принятия: 50% порог определяет выгоду спекулятивного декодирования

Пользователь Reddit протестировал MTP (Многотокеновое предсказание) с помощью mlx-vlm на Gemma-4 (26B, 4-битная) и обнаружил, что производительность полностью зависит от уровня принятия черновиков токенов. Измерения на M4 Max Studio показывают конкретные пороговые значения.
Результаты нагрузки
- Генерация кода: 75 ток/с → 114,8 ток/с (в 1,53 раза быстрее) — уровень принятия: 66% слотов
- Длинная проза: 75 ток/с → 71,1 ток/с (0,95×, практически без изменений) — уровень принятия: 31% слотов
- Вывод JSON: 51,3 ток/с → 25,6 ток/с (в 0,50 раза медленнее) — уровень принятия: 8% слотов
Порог, по-видимому, составляет ~50% принятия. Ниже этого накладные расходы спекулятивного декодирования перевешивают выгоду.
Детали теста: код — "написать несколько функций Python для X"; длинная проза — "написать эссе на 800 слов о бумажных деньгах в династии Тан"; вывод JSON — группировка элементов по схожести в структурированный вывод.
Бонусный совет: пользователь отмечает, что Gemma неплохо следует инструкциям по структуре JSON, но включение структурированного вывода (json_schema) добавляет ~20% накладных расходов. Он рекомендует допускать слегка неровный JSON и исправлять его во время выполнения. mlx-vlm всё равно не поддерживает json_schema для спекулятивного декодирования.
Итог: MTP отлично подходит для локального кодирования, но может ухудшить производительность для структурированных или прозаических задач с низким уровнем принятия.
📖 Источник: r/LocalLLaMA
👀 Смотрите также
OpenClaw достиг лимита контекста в 33K: Как это исправить
Пользователи OpenClaw сообщают о жестком ограничении в 33K токенов, несмотря на настройку контекстного окна в 262K. Проблема, по-видимому, связана с контекстом по умолчанию в Ollama.

Как я взаимодействую с ИИ-моделями в 2026 году по сравнению с прошлым годом: 3 ключевых изменения
Разработчик делится тремя конкретными изменениями: перейти от шаблонов промптов к переиспользуемым навыкам, писать цели вместо пошаговых инструкций и использовать команды /loop для долгих проектов в Claude Code и Codex.

Предварительная рутина кодирования с Claude Code: 5 MCP-серверов до написания строки кода
Разработчик делится 60–90-секундным ритуалом с использованием 5 MCP-серверов (Memory, Codebase Graph, Tavily Search, Context7 Docs) и хуков безопасности, чтобы резко сократить галлюцинации и бесполезные правки.

Исправление расхода токенов Claude Code: отключение заголовка атрибуции для улучшения кэширования.
Установка CLAUDE_CODE_ATTRIBUTION_HEADER=false в конфигурации вашей оболочки может повысить процент попаданий в кэш промптов Claude Code между сессиями с 48% до 99,98%, снижая затраты на обработку системных промптов в 7 раз за сессию.