MTP Multi-Token Prediction: генерация токенов в 2 раза быстрее на AMD Strix Halo и Radeon 9700 AI Pro

✍️ OpenClawRadar📅 Опубликовано: 19 мая 2026 г.🔗 Source
MTP Multi-Token Prediction: генерация токенов в 2 раза быстрее на AMD Strix Halo и Radeon 9700 AI Pro
Ad

Мультитокенное предсказание (MTP) обещает до 2-кратного ускорения генерации токенов для локальных LLM. Новое демо-видео показывает MTP на оборудовании AMD Strix Halo и Dual Radeon 9700 AI Pro, ориентированном на модели класса Qwen 3.6.

Ad

Ключевые детали

  • Производительность: MTP ускоряет вывод LLM до 2 раз, что особенно полезно для кодирующих агентов.
  • Протестированное оборудование: AMD Strix Halo (вероятно, серия Ryzen AI 300) и Dual Radeon 9700 AI Pro (RDNA 4).
  • Модель: Qwen 3.6 (предположительно Qwen2.5-7B или аналогичная, точный вариант не указан).
  • Формат демо: видео на YouTube, объясняющее принцип работы MTP и измеренные улучшения.

MTP работает за счет параллельного предсказания нескольких будущих токенов за один прямой проход, что сокращает количество авторегрессионных шагов. Этот метод особенно эффективен для структурированных выходных данных, таких как код, где паттерны токенов более предсказуемы.

Для контекста: недавний стек GPU-вычислений AMD (ROCm) догоняет NVIDIA CUDA для вывода LLM, и реализации MTP через llama.cpp или vLLM могут еще больше сократить разрыв. Разработчикам, использующим локальные кодирующие агенты (например, CodeLlama, DeepSeek-Coder), следует ожидать значительного ускорения на поддерживаемом оборудовании.

📖 Источник: r/LocalLLaMA

Ad

👀 Смотрите также

Anthropic переносит фоновую автоматизацию Claude Code в отдельный кредитный пакет SDK, нарушая работу агентов
Новости

Anthropic переносит фоновую автоматизацию Claude Code в отдельный кредитный пакет SDK, нарушая работу агентов

Начиная с 15 июня, claude -p, использование Agent SDK, Claude Code GitHub Actions и сторонние приложения Agent SDK больше не будут учитываться в интерактивных квотах Pro/Max. Применяется новый отдельный кредитный пул Agent SDK: $100 в месяц для планов Max 5x. Фоновые стеки агентов (например, тикеты → агенты → хуки → исполнитель → claude -p) быстро исчерпают этот лимит.

OpenClawRadar
Slurm Coding: Искусственный интеллект в разработке, где время исчезает
Новости

Slurm Coding: Искусственный интеллект в разработке, где время исчезает

Разработчик описывает 'сламовое кодирование' как интенсивный паттерн разработки, который стал возможен благодаря инструментам ИИ-кодирования, когда небольшие идеи быстро превращаются в полноценные системы через цикл быстрой реализации и выброса дофамина.

OpenClawRadar
Nvidia RTX Spark: 1-петафлопный суперчип приносит локальные ИИ-агенты на ПК с Windows
Новости

Nvidia RTX Spark: 1-петафлопный суперчип приносит локальные ИИ-агенты на ПК с Windows

Nvidia представляет RTX Spark — 1-петафлопсный суперчип для ПК на Windows, обеспечивающий работу локальных ИИ-агентов с поддержкой до 128 ГБ унифицированной памяти и полным стеком CUDA/RTX. Поставки начнутся осенью 2026 года в ноутбуках и десктопах от ASUS, Dell, HP, Lenovo, Microsoft Surface и MSI.

OpenClawRadar
AlphaEvolve: агент на базе Gemini от DeepMind оптимизирует алгоритмы в геномике, энергосетях и цепях TPC
Новости

AlphaEvolve: агент на базе Gemini от DeepMind оптимизирует алгоритмы в геномике, энергосетях и цепях TPC

AlphaEvolve, кодирующий агент на базе Gemini от Google DeepMind, снизил ошибки обнаружения вариантов DeepConsensus на 30%, повысил осуществимость AC Optimal Power Flow GNN с 14% до 88% и уменьшил ошибку квантовой схемы в 10 раз.

OpenClawRadar