Método de Evolución de Código Triplica el Rendimiento de LLM en el Benchmark ARC-AGI-2

La evolución de código mejora el razonamiento de LLM en ARC-AGI-2
Investigadores de Imbue han publicado resultados que muestran cómo la evolución de código puede mejorar significativamente el rendimiento de los LLM en el benchmark ARC-AGI-2. Su método combina muestreo basado en aptitud y mutación de código impulsada por un LLM base, logrando ganancias sustanciales en diferentes tipos de modelos.
Resultados de rendimiento
El método de evolución produce diferentes mejoras dependiendo del modelo base:
- Kimi K2.5 (pesos abiertos): Ganancia de rendimiento de 2.8x, del 12.1% al 34.0% de precisión en el conjunto de evaluación público, a $2.67 por tarea. Esta representa la solución de código abierto/pesos abiertos de mayor rendimiento para ARC-AGI-2 actualmente disponible.
- Gemini 3 Flash: Ganancia de rendimiento de 1.8x, del 34.0% al 61.4% de precisión, a $2.42 por tarea.
- Gemini 3.1 Pro: Mejoró del 88.1% al 95.1% de precisión, a $8.71 por tarea. Este resultado es competitivo con el estado del arte actual (97.9% a $11.77/tarea por Confluence Lab).
Todas las ejecuciones utilizaron el mismo marco de evolución y prompts. Los investigadores señalan que las puntuaciones en el conjunto de evaluación público utilizado para estos resultados no son directamente comparables con el conjunto de datos semi-privado utilizado para la tabla de clasificación oficial de ARC-AGI-2.
Cómo funciona la evolución de código
El método mejora iterativamente una solución inicial utilizando muestreo basado en aptitud y mutación de código. El paso de mutación es impulsado por un LLM base subyacente, pero es agnóstico al modelo específico elegido. Este enfoque puede aplicarse a una amplia gama de tareas de razonamiento y optimización más allá de ARC-AGI-2.
Para contexto, ARC-AGI (Corpus de Abstracción y Razonamiento) fue propuesto por François Chollet en 2019 como una forma de medir la "inteligencia fluida general": la capacidad de un sistema para aprender eficientemente soluciones a problemas novedosos. Cada tarea presenta 2-5 ejemplos de entrada/salida (cuadrículas rectangulares con valores de color) y requiere deducir reglas de transformación para predecir salidas para entradas de desafío.
📖 Leer la fuente completa: HN LLM Tools
👀 Ver también

Análisis de Precios de Modelos de OpenRouter e Inteligencia por Dólar
Un usuario de Reddit recopiló los precios de la API de OpenRouter para 16 modelos de IA y calculó los valores de inteligencia por dólar, identificando a MiMo-V2-Flash como la mejor opción en cuanto a valor a $0.09/M de tokens y a GPT-5.4 como el más inteligente a $2.50/M de tokens.

Elodin lanza su arnés de carreras de IA de código abierto con simulación en tiempo real de Betaflight para los participantes del AI Grand Prix
Elodin ha publicado un simulador open-source para la clasificación virtual del AI Grand Prix, que cumple con las restricciones de la competición y funciona con Betaflight real. La herramienta basada en Rust/Bevy genera muestras de sensores de cámara directamente en el bucle, evitando la sobrecarga de motores de juego pesados.

Rutinas de Claude Code: Programa tareas del agente como Cron con razonamiento
Claude Code Routines te permite ejecutar tareas de agente en un horario programado sin mantener una sesión abierta. Un usuario de Reddit comparte ejemplos reales: revisión nocturna de commits, verificación semanal de dependencias, análisis diario de registros de errores, con razonamiento de IA en lugar de resultados de scripts sin procesar.

SIDJUA v0.9.7: Inteligencia Artificial Multiagente de Código Abierto con Aplicación de Gobernanza Pre-Acción
SIDJUA v0.9.7 es un marco de IA multiagente de código abierto y autoalojado que aplica reglas de gobernanza antes de que los agentes actúen, bloqueando acciones no autorizadas como exceder presupuestos o violar alcances. Es compatible con múltiples proveedores de LLM, funciona con 4 GB de RAM e incluye una interfaz gráfica de escritorio construida con Tauri v2.