MTP уровень принятия: 50% порог определяет выгоду спекулятивного декодирования

✍️ OpenClawRadar📅 Опубликовано: 9 мая 2026 г.🔗 Source
MTP уровень принятия: 50% порог определяет выгоду спекулятивного декодирования
Ad

Пользователь Reddit протестировал MTP (Многотокеновое предсказание) с помощью mlx-vlm на Gemma-4 (26B, 4-битная) и обнаружил, что производительность полностью зависит от уровня принятия черновиков токенов. Измерения на M4 Max Studio показывают конкретные пороговые значения.

Ad

Результаты нагрузки

  • Генерация кода: 75 ток/с → 114,8 ток/с (в 1,53 раза быстрее) — уровень принятия: 66% слотов
  • Длинная проза: 75 ток/с → 71,1 ток/с (0,95×, практически без изменений) — уровень принятия: 31% слотов
  • Вывод JSON: 51,3 ток/с → 25,6 ток/с (в 0,50 раза медленнее) — уровень принятия: 8% слотов

Порог, по-видимому, составляет ~50% принятия. Ниже этого накладные расходы спекулятивного декодирования перевешивают выгоду.

Детали теста: код — "написать несколько функций Python для X"; длинная проза — "написать эссе на 800 слов о бумажных деньгах в династии Тан"; вывод JSON — группировка элементов по схожести в структурированный вывод.

Бонусный совет: пользователь отмечает, что Gemma неплохо следует инструкциям по структуре JSON, но включение структурированного вывода (json_schema) добавляет ~20% накладных расходов. Он рекомендует допускать слегка неровный JSON и исправлять его во время выполнения. mlx-vlm всё равно не поддерживает json_schema для спекулятивного декодирования.

Итог: MTP отлично подходит для локального кодирования, но может ухудшить производительность для структурированных или прозаических задач с низким уровнем принятия.

📖 Источник: r/LocalLLaMA

Ad

👀 Смотрите также

🦀
Советы

OpenClaw достиг лимита контекста в 33K: Как это исправить

Пользователи OpenClaw сообщают о жестком ограничении в 33K токенов, несмотря на настройку контекстного окна в 262K. Проблема, по-видимому, связана с контекстом по умолчанию в Ollama.

OpenClawRadar
Как я взаимодействую с ИИ-моделями в 2026 году по сравнению с прошлым годом: 3 ключевых изменения
Советы

Как я взаимодействую с ИИ-моделями в 2026 году по сравнению с прошлым годом: 3 ключевых изменения

Разработчик делится тремя конкретными изменениями: перейти от шаблонов промптов к переиспользуемым навыкам, писать цели вместо пошаговых инструкций и использовать команды /loop для долгих проектов в Claude Code и Codex.

OpenClawRadar
Предварительная рутина кодирования с Claude Code: 5 MCP-серверов до написания строки кода
Советы

Предварительная рутина кодирования с Claude Code: 5 MCP-серверов до написания строки кода

Разработчик делится 60–90-секундным ритуалом с использованием 5 MCP-серверов (Memory, Codebase Graph, Tavily Search, Context7 Docs) и хуков безопасности, чтобы резко сократить галлюцинации и бесполезные правки.

OpenClawRadar
Исправление расхода токенов Claude Code: отключение заголовка атрибуции для улучшения кэширования.
Советы

Исправление расхода токенов Claude Code: отключение заголовка атрибуции для улучшения кэширования.

Установка CLAUDE_CODE_ATTRIBUTION_HEADER=false в конфигурации вашей оболочки может повысить процент попаданий в кэш промптов Claude Code между сессиями с 48% до 99,98%, снижая затраты на обработку системных промптов в 7 раз за сессию.

OpenClawRadar