NVIDIA Groq 3 LPX достигает 3 431 токена в секунду в тестах на длинный контекст
Ускоритель NVIDIA Groq 3 LPX, предназначенный для интерактивного вывода на платформе Vera Rubin, показал первый сторонний бенчмарк: 3431 выходных токенов в секунду в тесте Artificial Analysis с контекстом 100K на модели Gemma 4 31B. Этот результат нацелен на уровень обслуживания «высокой интерактивности» — такой отклик необходим для многоходовых агентных сессий, где контекст разрастается до сотен тысяч токенов.
Почему длинный контекст и интерактивность — это сложно
Агентные нагрузки многоходовые: каждый ход добавляет выходные данные в контекст, и последующие ходы должны повторно обработать все предыдущие. При входном контексте более 100K токенов, обслуживание со скоростью более 3000 токенов в секунду на пользователя при управлении большим KV-кэшем — это системная задача. Стандартный прием — тензорный параллелизм (TP) — распределяет вычисления между чипами, но при очень малых размерах батча, необходимых для интерактивной задержки, фиксированные затраты на координацию (коллективные операции) могут съесть ускорение.
Узкое место — задержка первого бита, а не пропускная способность. Как сказано в статье, при малых тензорах время передачи определяется задержкой (A), а не количеством данных (N), деленным на пропускную способность (B).
Подход Groq 3 LPX
Groq 3 LPX решает эту проблему с помощью детерминированного планирования рабочей нагрузки на уровне компилятора. Компилятор заранее планирует, когда каждый тензор отправляется и прибывает, перекрывая вычисления и связь с мелкой гранулярностью. Заранее спланированные межчиповые соединения минимизируют задержку первого бита, делая TP эффективным даже при размере батча 1.
На тесте SPEED-Bench, который измеряет агентные и кодинговые задачи, Groq 3 LPX достиг медианы 4767 выходных токенов в секунду. Система также поддерживает несколько конфигураций развертывания с Vera Rubin NVL72:
- Разделение предварительного заполнения и декодирования
- Разделение внимания и FFN
- Спекулятивное декодирование с внешним драфтером
Это может масштабироваться до моделей с триллионами параметров, сочетая интерактивность Groq 3 LPX с пропускной способностью Vera Rubin для крупномасштабных ИИ-фабрик.
Для кого это предназначено
Разработчикам, создающим агентные системы, требующие высокой интерактивности с длинным контекстом — особенно тем, кто запускает мультиагентные рабочие процессы на моделях с более чем 2 триллионами параметров — этот бенчмарк будет полезен для планирования инфраструктуры.
📖 Читайте полный источник: HN AI Agents
👀 Смотрите также

Три критических пробела в OpenClaw для производственных ИИ-агентов
Разработчик выявил три недостающие возможности в OpenClaw, которые мешают ИИ-агентам функционировать как настоящие сотрудники: аудируемость, детальный контроль действий и разрешение инструкций.
OpenAI закупила более 10 000 Mac для обучения агентов: Apple как ИИ-инфраструктура
Сообщается, что OpenAI купил десятки тысяч Mac mini и Mac Studio для обучения агентов, работающих с компьютером. Архитектура Apple с унифицированной памятью подходит для агентного ИИ, что увеличило выручку от Mac на 29%.

Посмертный анализ Claude Code: три ошибки привели к ухудшению качества, теперь исправлены
Anthropic объяснил три отдельные проблемы, вызвавшие жалобы на качество Claude Code: пониженный уровень рассуждений по умолчанию, ошибка кэширования, приводящая к потере памяти сессии, и подсказка о краткости, ухудшившая качество кода. Все исправлено по состоянию на 20 апреля (v2.1.116).

Клод Код Сабагенты Не Загружают Навыки в Мультиагентных Системах
Разработчик сообщает, что суб-агенты в Claude Code v2.1.91 не могут получить доступ к навыкам, определённым в директории .claude/skills/, несмотря на то, что навыки идеально работают в основной сессии. Несколько подходов, включая указание навыков во фронтмете агента, инструмент Skill, флаги CLI и команды агентов, не дают результата.