NVIDIA Groq 3 LPX alcanza 3.431 tokens/segundo en pruebas de contexto largo
El acelerador Groq 3 LPX de NVIDIA, diseñado para inferencia interactiva en la plataforma Vera Rubin, ha publicado su primer benchmark de terceros: 3,431 tokens de salida por segundo en el benchmark de contexto de 100K de Artificial Analysis, utilizando el modelo Gemma 4 31B. Este resultado apunta a la capa de servicio de "alta interactividad", la capacidad de respuesta necesaria para sesiones agénticas de múltiples turnos donde el contexto crece hasta cientos de miles de tokens.
Por Qué Contexto Largo + Interactividad es Difícil
Las cargas de trabajo agénticas son de múltiples turnos: cada turno añade salida al contexto, y los turnos posteriores deben reprocesar todo lo anterior. Con más de 100K tokens de entrada, servir a más de 3,000 tokens por segundo por usuario mientras se gestiona una gran caché KV es un desafío de sistemas. El truco estándar, el paralelismo tensorial (TP), divide el cálculo entre chips, pero en los tamaños de lote muy pequeños requeridos para la latencia interactiva, el costo fijo de coordinación (operaciones colectivas) puede consumir la aceleración.
El cuello de botella es la latencia del primer bit, no el ancho de banda. Como se afirma en el artículo, con tensores pequeños el tiempo de transferencia está dominado por la latencia (A) en lugar de la cantidad de datos (N) dividida por el ancho de banda (B).
Enfoque de Groq 3 LPX
Groq 3 LPX resuelve esto con una planificación de carga de trabajo determinista y programada por compilador. El compilador preprograma cuándo cada tensor sale y llega, superponiendo computación y comunicación a una granularidad fina. La red entre chips preplanificada minimiza la latencia del primer bit, haciendo que TP sea efectivo incluso con tamaño de lote 1.
En SPEED-Bench, que mide tareas agénticas y específicas de codificación, Groq 3 LPX alcanzó una mediana de 4,767 tokens de salida por segundo. El sistema también admite múltiples configuraciones de despliegue con Vera Rubin NVL72:
- Desagregación de prefill-decode
- Desagregación de atención-FFN
- Decodificación especulativa con redactor externo
Estas pueden escalar a modelos de billones de parámetros, combinando la interactividad de Groq 3 LPX con el rendimiento de Vera Rubin para fábricas de IA a gran escala.
Para Quién Es Esto
Los desarrolladores que construyen sistemas agénticos que requieren alta interactividad con contexto largo—especialmente aquellos que ejecutan flujos de trabajo multiagente en modelos de más de 2T parámetros—encontrarán este benchmark relevante para la planificación de infraestructura.
📖 Lee la fuente completa: HN AI Agents
👀 Ver también

Crítica del Límite de Abstracción y del Enfoque de Integración de Servicios del MCP
Una discusión en Reddit critica al MCP por agrupar el acceso a la API, herramientas eficientes y conocimiento del dominio en una sola capa, argumentando que esto crea interfaces limitadas en comparación con las API subyacentes. La publicación utiliza Lattice como ejemplo, donde su API pública solo cubre flujos de trabajo de administración de recursos humanos a pesar de tener una API GraphQL completa.

Actualización de estado de Claude: Tasas de error elevadas para Opus 4.6 y Sonnet 4.6
Una actualización oficial del estado del sistema Claude reporta tasas de error elevadas para los modelos Opus 4.6 y Sonnet 4.6, con un incidente registrado el 2026-03-31T21:10:28.000Z. La publicación automática dirige a los usuarios a verificar el estado de resolución y los informes de rendimiento de la comunidad.

La Necesidad de Gobernanza Relacional en Sistemas Multiagente
Los marcos de gobernanza actuales se centran en la identidad, los permisos y los interruptores de emergencia, pero no abordan la coordinación entre agentes. Las investigaciones muestran que las interacciones entre agentes requieren soluciones específicas más allá de las conversaciones entre humanos y agentes ampliadas.

Reseña de OpenClaw: Problemas de Fiabilidad en su Estado Actual, Valor como Herramienta de Aprendizaje
Un desarrollador con amplia experiencia en plataformas de IA informa que OpenClaw tiene dificultades con la confiabilidad en tareas básicas de múltiples pasos, lo que hace cuestionables las aplicaciones empresariales autónomas, pero encuentra valor en aprender la estructura y orquestación de agentes.