GRPO Agente: Primera IA en vencer a todos los humanos en una competencia de programación

✍️ OpenClawRadar📅 Publicado: 24 de mayo de 2026🔗 Source
GRPO Agente: Primera IA en vencer a todos los humanos en una competencia de programación
Ad

Un equipo ha desarrollado Agentic GRPO, un algoritmo de aprendizaje por refuerzo que permitió a un sistema de IA superar consistentemente a todos los participantes humanos en concursos de programación competitiva en vivo, siendo la primera IA en lograrlo. El mejor anterior, Gemini 3 Deep Think de Google, solo alcanzó el octavo lugar.

Por qué el RL estándar falla para agentes de codificación

El RL tradicional para LLMs trata una respuesta como una trayectoria: prompt → razonamiento → respuesta final → recompensa. Pero los sistemas agentivos llaman herramientas, generan hipótesis, ejecutan pruebas, depuran código, resumen contexto, revisan planes y repiten muchas veces antes de tener éxito. Esto crea problemas difíciles: las recompensas llegan muy tarde, las trayectorias son muy largas y la política cambia mientras los rollouts aún se ejecutan (derivación fuera de política). Agentic GRPO estabiliza el aprendizaje en este entorno.

¿Qué es GRPO?

GRPO significa Group Relative Policy Optimization. Similar a PPO, muestrea múltiples salidas, las compara entre sí, recompensa las relativamente mejores y actualiza el modelo hacia mejores trayectorias. En lugar de requerir una calificación escalar perfecta, utiliza ranking/normalización relativa dentro de un grupo de muestras.

Ad

Intuición central de Agentic GRPO

Para un agente de codificación de IA resolviendo un problema de programación difícil, el flujo de trabajo podría ser: proponer hipótesis → generar algoritmo → escribir código → generar pruebas → ejecutar pruebas → depurar fallos → reintentar → finalmente pasar. En RL estándar, el modelo solo obtendría recompensa al final, haciendo el entrenamiento lento e inestable.

Agentic GRPO introduce:

  • Recompensas inmediatas — actualizar tan pronto como aparezca retroalimentación intermedia
  • Corrección retardada — arreglar retroactivamente actualizaciones anteriores una vez conocido el resultado final

Así, en lugar de esperar hasta que todo el rollout termine (etapa1 → etapa2 → etapa3 → recompensa final), el sistema hace: recompensa etapa1 → actualizar ahora; recompensa etapa2 → actualizar ahora; recompensa etapa3 → actualizar ahora; luego: llega recompensa final, corregir retroactivamente actualizaciones anteriores.

Analogía

RL tradicional: esperar hasta que todo el proyecto se entregue, luego decir "buen trabajo" o "mal trabajo". Agentic GRPO: dar retroalimentación continua ("esa hipótesis fue útil", "esa prueba detectó un error", "esta optimización ayudó") pero después revisar la evaluación ("en realidad, la decisión de diseño temprana causó problemas"). El aprendizaje se vuelve más rápido, denso y estable.

Esto resuelve RL específicamente para agentes LLM de horizonte largo, agentes de codificación y flujos de trabajo autónomos.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

Claude AI presenta actualizaciones del complemento Cowork con personalización empresarial y nuevos conectores.
Noticias

Claude AI presenta actualizaciones del complemento Cowork con personalización empresarial y nuevos conectores.

Claude AI ha lanzado actualizaciones del complemento Cowork que permiten a los administradores empresariales crear mercados privados de complementos y agregar conectores para Google Workspace, Docusign, Apollo y otras herramientas. Una nueva vista previa de investigación permite a Claude trabajar en Excel y PowerPoint para análisis integrales y creación de presentaciones.

OpenClawRadar
🦀
Noticias

Claude Code v2.1.208: Modo de Lector de Pantalla, Remapeos de Vim, Correcciones de Pérdida de Memoria y Más

Claude Code v2.1.208 añade modo de lector de pantalla en texto plano (opt-in), remapeos de secuencias en modo inserción de Vim, un envoltorio de procesos para lanzadores corporativos y corrige docenas de errores, incluyendo fugas de memoria en sesiones largas.

OpenClawRadar
Claude Code v2.1.145: Listado de Agentes JSON, Correcciones de Span OTEL, Parche de Seguridad y Más
Noticias

Claude Code v2.1.145: Listado de Agentes JSON, Correcciones de Span OTEL, Parche de Seguridad y Más

Claude Code v2.1.145 añade `claude agents --json` para scripting, corrige una omisión de permisos, mejora los spans OTEL y más.

OpenClawRadar
El desarrollador cambia a Minimax 2.7 tras la prohibición de Claude y los problemas de crédito de MiMo.
Noticias

El desarrollador cambia a Minimax 2.7 tras la prohibición de Claude y los problemas de crédito de MiMo.

Un desarrollador probó múltiples modelos de IA para OpenClaw después de que Claude fuera prohibido, encontrando que GLM 5.1 y 5 Turbo eran ineficaces para tareas de agente, el sistema de créditos de MiMo V2 Pro ineficiente, y finalmente optó por Minimax 2.7 por su generosa cuota y capacidad para manejar tareas de automatización.

OpenClawRadar