NVIDIA Groq 3 LPX atteint 3 431 tokens/seconde sur les benchmarks de contexte long
Le Groq 3 LPX de NVIDIA, l'accélérateur d'inférence interactive pour la plateforme Vera Rubin, a publié son premier benchmark tiers : 3 431 jetons de sortie par seconde sur le benchmark de contexte 100K d'Artificial Analysis avec le modèle Gemma 4 31B. Ce résultat vise le niveau de service "haute interactivité" - le type de réactivité nécessaire pour les sessions agentiques multi-tours où le contexte atteint des centaines de milliers de jetons.
Pourquoi Contexte Long + Interactivité est Difficile
Les charges de travail agentiques sont multi-tours : chaque tour ajoute la sortie au contexte, et les tours suivants doivent retraiter tout ce qui précède. Avec plus de 100K jetons en entrée, servir plus de 3 000 jetons par seconde par utilisateur tout en gérant un grand cache KV est un défi système. L'astuce standard - le parallélisme tensoriel (TP) - divise le calcul entre les puces, mais avec les très petites tailles de lot requises pour une latence interactive, le coût fixe de coordination (opérations collectives) peut manger le gain de vitesse.
Le goulot d'étranglement est la latence du premier bit, pas la bande passante. Comme le dit l'article, avec de petits tenseurs, le temps de transfert est dominé par la latence (A) plutôt que par la quantité de données (N) divisée par la bande passante (B).
L'approche du Groq 3 LPX
Le Groq 3 LPX résout cela avec une planification déterministe et planifiée par compilateur. Le compilateur pré-planifie quand chaque tenseur part et arrive, chevauchant le calcul et la communication à granularité fine. La mise en réseau inter-puces pré-planifiée minimise la latence du premier bit, rendant le TP efficace même à une taille de lot de 1.
Sur le SPEED-Bench, qui mesure les tâches agentiques et spécifiques au codage, le Groq 3 LPX a atteint une médiane de 4 767 jetons de sortie par seconde. Le système prend également en charge plusieurs configurations de déploiement avec Vera Rubin NVL72 :
- Désagrégation pré-remplissage/décodage
- Désagrégation attention-FFN
- Décodage spéculatif avec draft externe
Celles-ci peuvent passer à l'échelle pour des modèles de plusieurs billions de paramètres, associant l'interactivité du Groq 3 LPX au débit de Vera Rubin pour les usines d'IA à grande échelle.
À qui cela s'adresse
Les développeurs qui construisent des systèmes agentiques exigeant une haute interactivité avec un contexte long - en particulier ceux qui exécutent des workflows multi-agents sur des modèles de 2T+ paramètres - trouveront ce benchmark pertinent pour la planification des infrastructures.
📖 Lire la source complète : HN AI Agents
👀 See Also

Psychiatre à Melbourne refuse de nouveaux patients qui ne consentent pas à la prise de notes par IA
Un psychiatre de Melbourne exige désormais que les nouveaux patients acceptent la transcription par IA des séances, sous peine d'être redirigés ailleurs, soulevant des problèmes de sécurité des données et de précision.

Glomz Octagon : Révisions de code multi-agents – 179 agents, 1 333 révisions et l'effet de réseau
Glomz.com a mené une expérience où 179 agents IA se sont inscrits, ont soumis 433 soumissions de code et généré 1 333 révisions dans une arène « Octagon ». L'effet de réseau « cascade de révisions » est réel — les soumissions avec 3 à 5 révisions initiales ont attiré plus d'agents, la meilleure soumission recevant 21 révisions.

Le NIST sollicite l'avis du public sur les normes de sécurité des agents d'IA.
Le National Institute of Standards and Technology a publié une demande d'information sur les considérations de sécurité pour les agents d'intelligence artificielle, avec une date limite de commentaires fixée au 9 mars 2026. La demande d'information est ouverte aux commentaires du public via le Federal Register.

Sam Altman, Trump et Bernie Sanders unis pour la propriété publique de l'infrastructure IA
Sam Altman, Donald Trump et Bernie Sanders sont rarement d'accord : les infrastructures d'IA devraient être publiques. L'AP relate ce consensus bipartisan inédit sur un modèle de propriété publique.