Análisis de 413,000 Ejecuciones de Agentes de IA Revela lo que los Hace Tener Éxito

✍️ OpenClawRadar📅 Publicado: 12 de marzo de 2026🔗 Source
Análisis de 413,000 Ejecuciones de Agentes de IA Revela lo que los Hace Tener Éxito
Ad

Un nuevo análisis de 413.278 ejecuciones de agentes de ingeniería de software de IA del conjunto de datos CoderForge-Preview revela lo que separa las ejecuciones exitosas de las fallidas. El estudio examinó 17 mil millones de tokens de datos de comportamiento, comparando ejecuciones aprobadas versus fallidas en problemas idénticos.

Hallazgos clave de los datos

El análisis muestra que las prácticas comunes de ingeniería de software humanas pueden reducir realmente el rendimiento de los agentes de IA. Estos son los patrones específicos que surgieron:

  • Deja de decirles a los agentes que "exploren primero": Forzar a los agentes a buscar o ver archivos antes de editar reduce su efectividad. A diferencia de los humanos con memoria de trabajo limitada, los agentes ya tienen la base de código en su ventana de contexto. Los primeros turnos dedicados a buscar y explorar indican que el agente está dando palos de ciego en lugar de aprender.
  • Los enfoques basados en pruebas son obligatorios: El mayor predictor de ejecuciones exitosas es la fracción de comandos bash iniciales dedicados exclusivamente a ejecutar pruebas. Los agentes no deben editar a ciegas—los mensajes del sistema deben exigir ejecutar la suite de pruebas inmediatamente.
  • Mantén a los agentes con una correa corta: Si un agente intenta editar 3 o más archivos en el primer 30% de su ejecución, las tasas de éxito caen significativamente. Dispersar ediciones en múltiples archivos indica confusión. Obliga a los agentes a arreglar una cosa a la vez.
  • La perseverancia es una ilusión: Si un agente ejecuta exactamente el mismo comando bash dos veces al principio de la ejecución, está atrapado en un bucle en lugar de "pensar intensamente" o "intentar de nuevo". Rompe el bucle o reinicia la ejecución.
Ad

Cambios prácticos de implementación

El análisis recomienda cambios específicos en el scaffolding de los agentes:

  • Deja de usar mensajes como: "Explora la base de código, lee los archivos relevantes y descubre el error."
  • En su lugar, usa: "Ejecuta la suite de pruebas inmediatamente para verificar la línea base. Haz cambios específicos en un máximo de 1 o 2 archivos. Vuelve a ejecutar las pruebas."

La idea clave es dejar de proyectar las limitaciones humanas en los LLM. Déjalos usar sus enormes ventanas de contexto y oblígalos a demostrar su trabajo con pruebas.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

LLM Local Batalla con el Solitario de Unreal Engine: Qwen 3.6-27B Quema 687k Tokens en una Carta
Noticias

LLM Local Batalla con el Solitario de Unreal Engine: Qwen 3.6-27B Quema 687k Tokens en una Carta

El intento de un desarrollador de crear un juego de Solitario en Unreal Engine usando Qwen 3.6-27B consumió 687k tokens para una sola carta, requiriendo intervención manual para descargar PNGs, crear mallas y realizar muchas indicaciones.

OpenClawRadar
Anthropic Lanza Claude Code Channels para Integración de Mensajería
Noticias

Anthropic Lanza Claude Code Channels para Integración de Mensajería

Anthropic ha lanzado Claude Code Channels, permitiendo a los desarrolladores enviar mensajes directos a sesiones de Claude Code desde Telegram o Discord con acceso completo a herramientas, incluyendo edición de archivos, ejecución de pruebas y operaciones de git. La función requiere un plan de pago de Anthropic y admite dos plataformas en comparación con las 20+ de OpenClaw.

OpenClawRadar
OpenClaw: ¿Experiencia decepcionante o error de configuración?
Noticias

OpenClaw: ¿Experiencia decepcionante o error de configuración?

Los usuarios informan problemas con OpenClaw que no logra realizar más allá de interacciones simples de chatbot a pesar de una configuración correcta siguiendo las pautas oficiales.

OpenClawRadar
La Corte Suprema se niega a escuchar el caso de derechos de autor de IA, dejando intacta la decisión del tribunal inferior.
Noticias

La Corte Suprema se niega a escuchar el caso de derechos de autor de IA, dejando intacta la decisión del tribunal inferior.

La Corte Suprema de EE. UU. se negó a escuchar una disputa sobre derechos de autor de material generado por IA, dejando vigente un fallo de un tribunal inferior que denegó la protección de derechos de autor para obras creadas sin autoría humana.

OpenClawRadar