NVIDIA Groq 3 LPX atinge 3.431 tokens/seg em benchmarks de contexto longo
O Groq 3 LPX da NVIDIA, o acelerador de inferência interativa para a plataforma Vera Rubin, publicou seu primeiro benchmark de terceiros: 3.431 tokens de saída por segundo no benchmark de contexto de 100K da Artificial Analysis usando o modelo Gemma 4 31B. Esse resultado visa o nível de serviço de "alta interatividade" — o tipo de capacidade de resposta necessária para sessões agênticas multi-turno, onde o contexto cresce para centenas de milhares de tokens.
Por Que Contexto Longo + Interatividade é Difícil
Cargas de trabalho agênticas são multi-turno: cada turno adiciona saída ao contexto, e turnos posteriores devem reprocessar tudo o que veio antes. Com 100 mil tokens de entrada ou mais, servir a mais de 3.000 tokens por segundo por usuário enquanto gerencia um grande cache KV é um desafio de sistemas. O truque padrão — paralelismo de tensor (TP) — divide a computação entre chips, mas em tamanhos de lote muito pequenos exigidos pela latência interativa, o custo fixo de coordenação (operações coletivas) pode consumir o ganho de velocidade.
O gargalo é a latência do primeiro bit, não a largura de banda. Como o artigo afirma, com tensores pequenos, o tempo de transferência é dominado pela latência (A) em vez da quantidade de dados (N) dividida pela largura de banda (B).
Abordagem do Groq 3 LPX
O Groq 3 LPX resolve isso com planejamento determinístico e agendado por compilador. O compilador pré-agenda quando cada tensor sai e chega, sobrepondo computação e comunicação em granularidade fina. A rede chip-a-chip pré-planejada minimiza a latência do primeiro bit, tornando o TP eficaz mesmo com tamanho de lote 1.
No SPEED-Bench, que mede tarefas agênticas e específicas de código, o Groq 3 LPX atingiu uma mediana de 4.767 tokens de saída por segundo. O sistema também suporta múltiplas configurações de implantação com Vera Rubin NVL72:
- Disagregação prefill-decode
- Disagregação atenção-FFN
- Decodificação especulativa com rascunho externo
Elas podem escalar para modelos com múltiplos trilhões de parâmetros, combinando a interatividade do Groq 3 LPX com o throughput da Vera Rubin para fábricas de IA em grande escala.
Para Quem é Isso
Desenvolvedores que constroem sistemas agênticos que exigem alta interatividade com contexto longo — especialmente aqueles que executam fluxos de trabalho multiagentes em modelos com mais de 2T parâmetros — acharão este benchmark relevante para o planejamento de infraestrutura.
📖 Leia a fonte completa: HN AI Agents
👀 See Also

Snowflake demite equipe de documentação após treinar IA substituta
A Snowflake confirmou 'reduções direcionadas de força de trabalho' nas equipes de redação técnica e documentação, com fontes relatando aproximadamente 400 pessoas afetadas. A empresa vinha gravando as sessões de documentação por 8 meses para construir conjuntos de dados de treinamento a partir dos fluxos de trabalho dos redatores seniores.

Claude Code v2.1.196: Modelos Padrão da Organização, Correção de Segurança, Recuperação de Tarefas em Segundo Plano
Claude Code v2.1.196 adiciona modelos padrão da organização, corrige um problema de segurança com a inicialização de servidores MCP, melhora a confiabilidade de sessões em segundo plano e reduz o uso de tokens no /code-review em 25%.

NVIDIA Lança Nemotron-3-Ultra-550B: 55B Parâmetros Ativos, 1M de Contexto, Híbrido LatentMoE
A NVIDIA lançou o Nemotron-3-Ultra-550B-A55B-BF16, um modelo de 550B parâmetros com 55B ativos, contexto de 1M tokens, arquitetura híbrida LatentMoE (Mamba-2 + MoE + Attention + MTP) e raciocínio configurável.

O OpenRouter confirma que os modelos Alfa Hunter/Healer são variantes do MiMo V2
Os modelos anteriormente sigilosos Hunter Alpha e Healer Alpha do OpenRouter foram confirmados como variantes do MiMo V2. O Hunter Alpha é o modelo de raciocínio apenas em texto MiMo V2 Pro com janela de contexto de 1M, enquanto o Healer Alpha é o modelo de raciocínio texto+imagem MiMo V2 Omni com janela de contexto de 262K.