Método de Evolución de Código Triplica el Rendimiento de LLM en el Benchmark ARC-AGI-2

✍️ OpenClawRadar📅 Publicado: 28 de febrero de 2026🔗 Source
Método de Evolución de Código Triplica el Rendimiento de LLM en el Benchmark ARC-AGI-2
Ad

La evolución de código mejora el razonamiento de LLM en ARC-AGI-2

Investigadores de Imbue han publicado resultados que muestran cómo la evolución de código puede mejorar significativamente el rendimiento de los LLM en el benchmark ARC-AGI-2. Su método combina muestreo basado en aptitud y mutación de código impulsada por un LLM base, logrando ganancias sustanciales en diferentes tipos de modelos.

Resultados de rendimiento

El método de evolución produce diferentes mejoras dependiendo del modelo base:

  • Kimi K2.5 (pesos abiertos): Ganancia de rendimiento de 2.8x, del 12.1% al 34.0% de precisión en el conjunto de evaluación público, a $2.67 por tarea. Esta representa la solución de código abierto/pesos abiertos de mayor rendimiento para ARC-AGI-2 actualmente disponible.
  • Gemini 3 Flash: Ganancia de rendimiento de 1.8x, del 34.0% al 61.4% de precisión, a $2.42 por tarea.
  • Gemini 3.1 Pro: Mejoró del 88.1% al 95.1% de precisión, a $8.71 por tarea. Este resultado es competitivo con el estado del arte actual (97.9% a $11.77/tarea por Confluence Lab).

Todas las ejecuciones utilizaron el mismo marco de evolución y prompts. Los investigadores señalan que las puntuaciones en el conjunto de evaluación público utilizado para estos resultados no son directamente comparables con el conjunto de datos semi-privado utilizado para la tabla de clasificación oficial de ARC-AGI-2.

Ad

Cómo funciona la evolución de código

El método mejora iterativamente una solución inicial utilizando muestreo basado en aptitud y mutación de código. El paso de mutación es impulsado por un LLM base subyacente, pero es agnóstico al modelo específico elegido. Este enfoque puede aplicarse a una amplia gama de tareas de razonamiento y optimización más allá de ARC-AGI-2.

Para contexto, ARC-AGI (Corpus de Abstracción y Razonamiento) fue propuesto por François Chollet en 2019 como una forma de medir la "inteligencia fluida general": la capacidad de un sistema para aprender eficientemente soluciones a problemas novedosos. Cada tarea presenta 2-5 ejemplos de entrada/salida (cuadrículas rectangulares con valores de color) y requiere deducir reglas de transformación para predecir salidas para entradas de desafío.

📖 Leer la fuente completa: HN LLM Tools

Ad

👀 Ver también

Análisis de Precios de Modelos de OpenRouter e Inteligencia por Dólar
Herramientas

Análisis de Precios de Modelos de OpenRouter e Inteligencia por Dólar

Un usuario de Reddit recopiló los precios de la API de OpenRouter para 16 modelos de IA y calculó los valores de inteligencia por dólar, identificando a MiMo-V2-Flash como la mejor opción en cuanto a valor a $0.09/M de tokens y a GPT-5.4 como el más inteligente a $2.50/M de tokens.

OpenClawRadar
Elodin lanza su arnés de carreras de IA de código abierto con simulación en tiempo real de Betaflight para los participantes del AI Grand Prix
Herramientas

Elodin lanza su arnés de carreras de IA de código abierto con simulación en tiempo real de Betaflight para los participantes del AI Grand Prix

Elodin ha publicado un simulador open-source para la clasificación virtual del AI Grand Prix, que cumple con las restricciones de la competición y funciona con Betaflight real. La herramienta basada en Rust/Bevy genera muestras de sensores de cámara directamente en el bucle, evitando la sobrecarga de motores de juego pesados.

OpenClawRadar
Rutinas de Claude Code: Programa tareas del agente como Cron con razonamiento
Herramientas

Rutinas de Claude Code: Programa tareas del agente como Cron con razonamiento

Claude Code Routines te permite ejecutar tareas de agente en un horario programado sin mantener una sesión abierta. Un usuario de Reddit comparte ejemplos reales: revisión nocturna de commits, verificación semanal de dependencias, análisis diario de registros de errores, con razonamiento de IA en lugar de resultados de scripts sin procesar.

OpenClawRadar
SIDJUA v0.9.7: Inteligencia Artificial Multiagente de Código Abierto con Aplicación de Gobernanza Pre-Acción
Herramientas

SIDJUA v0.9.7: Inteligencia Artificial Multiagente de Código Abierto con Aplicación de Gobernanza Pre-Acción

SIDJUA v0.9.7 es un marco de IA multiagente de código abierto y autoalojado que aplica reglas de gobernanza antes de que los agentes actúen, bloqueando acciones no autorizadas como exceder presupuestos o violar alcances. Es compatible con múltiples proveedores de LLM, funciona con 4 GB de RAM e incluye una interfaz gráfica de escritorio construida con Tauri v2.

OpenClawRadar