NVIDIA Groq 3 LPX достигает 3 431 токена в секунду в тестах на длинный контекст

✍️ OpenClawRadar📅 Опубликовано: 25 августа 2026 г.🔗 Source
Ad

Ускоритель NVIDIA Groq 3 LPX, предназначенный для интерактивного вывода на платформе Vera Rubin, показал первый сторонний бенчмарк: 3431 выходных токенов в секунду в тесте Artificial Analysis с контекстом 100K на модели Gemma 4 31B. Этот результат нацелен на уровень обслуживания «высокой интерактивности» — такой отклик необходим для многоходовых агентных сессий, где контекст разрастается до сотен тысяч токенов.

Почему длинный контекст и интерактивность — это сложно

Агентные нагрузки многоходовые: каждый ход добавляет выходные данные в контекст, и последующие ходы должны повторно обработать все предыдущие. При входном контексте более 100K токенов, обслуживание со скоростью более 3000 токенов в секунду на пользователя при управлении большим KV-кэшем — это системная задача. Стандартный прием — тензорный параллелизм (TP) — распределяет вычисления между чипами, но при очень малых размерах батча, необходимых для интерактивной задержки, фиксированные затраты на координацию (коллективные операции) могут съесть ускорение.

Узкое место — задержка первого бита, а не пропускная способность. Как сказано в статье, при малых тензорах время передачи определяется задержкой (A), а не количеством данных (N), деленным на пропускную способность (B).

Ad

Подход Groq 3 LPX

Groq 3 LPX решает эту проблему с помощью детерминированного планирования рабочей нагрузки на уровне компилятора. Компилятор заранее планирует, когда каждый тензор отправляется и прибывает, перекрывая вычисления и связь с мелкой гранулярностью. Заранее спланированные межчиповые соединения минимизируют задержку первого бита, делая TP эффективным даже при размере батча 1.

На тесте SPEED-Bench, который измеряет агентные и кодинговые задачи, Groq 3 LPX достиг медианы 4767 выходных токенов в секунду. Система также поддерживает несколько конфигураций развертывания с Vera Rubin NVL72:

  • Разделение предварительного заполнения и декодирования
  • Разделение внимания и FFN
  • Спекулятивное декодирование с внешним драфтером

Это может масштабироваться до моделей с триллионами параметров, сочетая интерактивность Groq 3 LPX с пропускной способностью Vera Rubin для крупномасштабных ИИ-фабрик.

Для кого это предназначено

Разработчикам, создающим агентные системы, требующие высокой интерактивности с длинным контекстом — особенно тем, кто запускает мультиагентные рабочие процессы на моделях с более чем 2 триллионами параметров — этот бенчмарк будет полезен для планирования инфраструктуры.

📖 Читайте полный источник: HN AI Agents

Ad

👀 Смотрите также

Три критических пробела в OpenClaw для производственных ИИ-агентов
Новости

Три критических пробела в OpenClaw для производственных ИИ-агентов

Разработчик выявил три недостающие возможности в OpenClaw, которые мешают ИИ-агентам функционировать как настоящие сотрудники: аудируемость, детальный контроль действий и разрешение инструкций.

OpenClawRadar
🦀
Новости

OpenAI закупила более 10 000 Mac для обучения агентов: Apple как ИИ-инфраструктура

Сообщается, что OpenAI купил десятки тысяч Mac mini и Mac Studio для обучения агентов, работающих с компьютером. Архитектура Apple с унифицированной памятью подходит для агентного ИИ, что увеличило выручку от Mac на 29%.

OpenClawRadar
Посмертный анализ Claude Code: три ошибки привели к ухудшению качества, теперь исправлены
Новости

Посмертный анализ Claude Code: три ошибки привели к ухудшению качества, теперь исправлены

Anthropic объяснил три отдельные проблемы, вызвавшие жалобы на качество Claude Code: пониженный уровень рассуждений по умолчанию, ошибка кэширования, приводящая к потере памяти сессии, и подсказка о краткости, ухудшившая качество кода. Все исправлено по состоянию на 20 апреля (v2.1.116).

OpenClawRadar
Клод Код Сабагенты Не Загружают Навыки в Мультиагентных Системах
Новости

Клод Код Сабагенты Не Загружают Навыки в Мультиагентных Системах

Разработчик сообщает, что суб-агенты в Claude Code v2.1.91 не могут получить доступ к навыкам, определённым в директории .claude/skills/, несмотря на то, что навыки идеально работают в основной сессии. Несколько подходов, включая указание навыков во фронтмете агента, инструмент Skill, флаги CLI и команды агентов, не дают результата.

OpenClawRadar