MTP Multi-Token Prediction: генерация токенов в 2 раза быстрее на AMD Strix Halo и Radeon 9700 AI Pro

✍️ OpenClawRadar📅 Опубликовано: 19 мая 2026 г.🔗 Source
MTP Multi-Token Prediction: генерация токенов в 2 раза быстрее на AMD Strix Halo и Radeon 9700 AI Pro
Ad

Мультитокенное предсказание (MTP) обещает до 2-кратного ускорения генерации токенов для локальных LLM. Новое демо-видео показывает MTP на оборудовании AMD Strix Halo и Dual Radeon 9700 AI Pro, ориентированном на модели класса Qwen 3.6.

Ad

Ключевые детали

  • Производительность: MTP ускоряет вывод LLM до 2 раз, что особенно полезно для кодирующих агентов.
  • Протестированное оборудование: AMD Strix Halo (вероятно, серия Ryzen AI 300) и Dual Radeon 9700 AI Pro (RDNA 4).
  • Модель: Qwen 3.6 (предположительно Qwen2.5-7B или аналогичная, точный вариант не указан).
  • Формат демо: видео на YouTube, объясняющее принцип работы MTP и измеренные улучшения.

MTP работает за счет параллельного предсказания нескольких будущих токенов за один прямой проход, что сокращает количество авторегрессионных шагов. Этот метод особенно эффективен для структурированных выходных данных, таких как код, где паттерны токенов более предсказуемы.

Для контекста: недавний стек GPU-вычислений AMD (ROCm) догоняет NVIDIA CUDA для вывода LLM, и реализации MTP через llama.cpp или vLLM могут еще больше сократить разрыв. Разработчикам, использующим локальные кодирующие агенты (например, CodeLlama, DeepSeek-Coder), следует ожидать значительного ускорения на поддерживаемом оборудовании.

📖 Источник: r/LocalLLaMA

Ad

👀 Смотрите также

Активность Anthropic в DNS раскрывает новый сервис STT, API RC2 и туннельную инфраструктуру
Новости

Активность Anthropic в DNS раскрывает новый сервис STT, API RC2 и туннельную инфраструктуру

Мониторинг DNS поддоменов Anthropic выявил новые записи для сервиса преобразования речи в текст на платформе 'Titanium', кандидата на выпуск API версии 2, туннельной инфраструктуры и MCP-прокси в стадии тестирования.

OpenClawRadar
Агенты ИИ предпочитают структурированные запросы вместо естественного языка в тесте сервера Cala MCP.
Новости

Агенты ИИ предпочитают структурированные запросы вместо естественного языка в тесте сервера Cala MCP.

Команда Cala создала MCP-сервер с тремя способами доступа к графу знаний: запросы на естественном языке, структурированный язык запросов и прямое обход сущностей/связей. Агенты отказались от естественного языка в течение нескольких минут, выбрав структурированные запросы и обход графа без подсказок.

OpenClawRadar
Дебиторская задолженность AI-гиперскейлеров выросла на 974% до $225 млрд в 2026 году, скрытый долг достиг $1,65 трлн
Новости

Дебиторская задолженность AI-гиперскейлеров выросла на 974% до $225 млрд в 2026 году, скрытый долг достиг $1,65 трлн

Эмиссия облигаций гиперскейлерами выросла на 974% до $225 млрд в первом полугодии 2026 года, скрытый долг достиг $1,65 трлн. S&P отмечает усталость инвесторов на фоне роста премий.

OpenClawRadar
Анализ Клода дебатов о минимаксе и рыночной нише Anthropic
Новости

Анализ Клода дебатов о минимаксе и рыночной нише Anthropic

Клод утверждает, что MiniMax легально получила обучающие данные, заплатив за миллионы API-вызовов, и указывает на пробел в продуктовой линейке Anthropic — отсутствие дешёвого постоянного оркестратора.

OpenClawRadar