Método de Evolución de Código Triplica el Rendimiento de LLM en el Benchmark ARC-AGI-2

✍️ OpenClawRadar📅 Publicado: 28 de febrero de 2026🔗 Source
Método de Evolución de Código Triplica el Rendimiento de LLM en el Benchmark ARC-AGI-2
Ad

La evolución de código mejora el razonamiento de LLM en ARC-AGI-2

Investigadores de Imbue han publicado resultados que muestran cómo la evolución de código puede mejorar significativamente el rendimiento de los LLM en el benchmark ARC-AGI-2. Su método combina muestreo basado en aptitud y mutación de código impulsada por un LLM base, logrando ganancias sustanciales en diferentes tipos de modelos.

Resultados de rendimiento

El método de evolución produce diferentes mejoras dependiendo del modelo base:

  • Kimi K2.5 (pesos abiertos): Ganancia de rendimiento de 2.8x, del 12.1% al 34.0% de precisión en el conjunto de evaluación público, a $2.67 por tarea. Esta representa la solución de código abierto/pesos abiertos de mayor rendimiento para ARC-AGI-2 actualmente disponible.
  • Gemini 3 Flash: Ganancia de rendimiento de 1.8x, del 34.0% al 61.4% de precisión, a $2.42 por tarea.
  • Gemini 3.1 Pro: Mejoró del 88.1% al 95.1% de precisión, a $8.71 por tarea. Este resultado es competitivo con el estado del arte actual (97.9% a $11.77/tarea por Confluence Lab).

Todas las ejecuciones utilizaron el mismo marco de evolución y prompts. Los investigadores señalan que las puntuaciones en el conjunto de evaluación público utilizado para estos resultados no son directamente comparables con el conjunto de datos semi-privado utilizado para la tabla de clasificación oficial de ARC-AGI-2.

Ad

Cómo funciona la evolución de código

El método mejora iterativamente una solución inicial utilizando muestreo basado en aptitud y mutación de código. El paso de mutación es impulsado por un LLM base subyacente, pero es agnóstico al modelo específico elegido. Este enfoque puede aplicarse a una amplia gama de tareas de razonamiento y optimización más allá de ARC-AGI-2.

Para contexto, ARC-AGI (Corpus de Abstracción y Razonamiento) fue propuesto por François Chollet en 2019 como una forma de medir la "inteligencia fluida general": la capacidad de un sistema para aprender eficientemente soluciones a problemas novedosos. Cada tarea presenta 2-5 ejemplos de entrada/salida (cuadrículas rectangulares con valores de color) y requiere deducir reglas de transformación para predecir salidas para entradas de desafío.

📖 Leer la fuente completa: HN LLM Tools

Ad

👀 Ver también

NarrateAI MCP Server Demo Muestra a Claude Agregando Voz en Off a Videos
Herramientas

NarrateAI MCP Server Demo Muestra a Claude Agregando Voz en Off a Videos

Una demostración en vivo muestra a Claude usando el servidor MCP de NarrateAI para narrar automáticamente videos desde una URL, manejando sondeo asíncrono y generando narración analizando grabaciones de pantalla silenciosas.

OpenClawRadar
Markdown como Protocolo para Interfaz de Usuario Agéntica con Ejecución en Flujo
Herramientas

Markdown como Protocolo para Interfaz de Usuario Agéntica con Ejecución en Flujo

Un prototipo utiliza Markdown como protocolo unificado para que los agentes de IA transmitan texto, código ejecutable y datos en una sola respuesta. Cuenta con ejecución en streaming donde el código se ejecuta declaración por declaración a medida que llega y una primitiva mount() para crear interfaces de usuario React con flujo de datos entre cliente, servidor y LLM.

OpenClawRadar
Lumyr: Generación de Dashboard mediante Claude con Automatización en Python y Streamlit
Herramientas

Lumyr: Generación de Dashboard mediante Claude con Automatización en Python y Streamlit

Lumyr es una herramienta que genera paneles de control en vivo y compartibles a partir de descripciones en inglés sencillo, utilizando Claude para la generación de paneles y automatizando la capa de Python y Streamlit. Los usuarios no necesitan escribir Python, abrir Streamlit, desplegar, configurar alojamiento ni gestionar infraestructura.

OpenClawRadar
🦀
Herramientas

Agente IA OpenClaw con 6 Roles, Memoria y Diseño Consciente del TDAH: Desglose de Operaciones Diarias

Un fundador solitario con TDAH construyó un agente de IA de código abierto con 6 roles (planificador de acciones, coordinador de informes, redactor, legal, investigador, CRM) que comparten memoria, generando automáticamente seguimientos y borradores a partir de transcripciones.

OpenClawRadar