Método de Evolução de Código Triplica o Desempenho do LLM no Benchmark ARC-AGI-2

✍️ OpenClawRadar📅 Publicado: February 28, 2026🔗 Source
Método de Evolução de Código Triplica o Desempenho do LLM no Benchmark ARC-AGI-2
Ad

Evolução de Código Impulsiona o Raciocínio de LLMs no ARC-AGI-2

Pesquisadores da Imbue publicaram resultados mostrando como a evolução de código pode melhorar significativamente o desempenho de LLMs no benchmark ARC-AGI-2. Seu método combina amostragem baseada em aptidão e mutação de código conduzida por um LLM base, alcançando ganhos substanciais em diferentes tipos de modelos.

Resultados de Desempenho

O método de evolução produz diferentes melhorias dependendo do modelo base:

  • Kimi K2.5 (pesos abertos): Ganho de desempenho de 2,8x, de 12,1% para 34,0% de precisão no conjunto de avaliação público, a US$ 2,67 por tarefa. Esta é a solução de código aberto/pesos abertos de maior desempenho para o ARC-AGI-2 atualmente disponível.
  • Gemini 3 Flash: Ganho de desempenho de 1,8x, de 34,0% para 61,4% de precisão, a US$ 2,42 por tarefa.
  • Gemini 3.1 Pro: Melhorou de 88,1% para 95,1% de precisão, a US$ 8,71 por tarefa. Este resultado é competitivo com o estado da arte atual (97,9% a US$ 11,77/tarefa da Confluence Lab).

Todas as execuções usaram exatamente o mesmo framework de evolução e prompts. Os pesquisadores observam que as pontuações no conjunto de avaliação público usado para esses resultados não são diretamente comparáveis ao conjunto de dados semi-privado usado para o ranking oficial do ARC-AGI-2.

Ad

Como Funciona a Evolução de Código

O método melhora iterativamente uma solução inicial usando amostragem baseada em aptidão e mutação de código. A etapa de mutação é conduzida por um LLM base subjacente, mas é agnóstica ao modelo específico escolhido. Esta abordagem pode ser aplicada a uma ampla gama de tarefas de raciocínio e otimização além do ARC-AGI-2.

Para contexto, o ARC-AGI (Corpus de Abstração e Raciocínio) foi proposto por François Chollet em 2019 como uma forma de medir "inteligência fluida geral" - a capacidade de um sistema de aprender soluções para problemas novos de forma eficiente. Cada tarefa apresenta 2-5 exemplos de entrada/saída (grades retangulares com valores de cor) e requer deduzir regras de transformação para prever saídas para entradas de desafio.

📖 Leia a fonte completa: HN LLM Tools

Ad

👀 See Also

Skynet: Rede de Colaboração Multiagente para Agentes de Código Claude
Tools

Skynet: Rede de Colaboração Multiagente para Agentes de Código Claude

Skynet é uma rede de código aberto que permite colaboração baseada em funções entre múltiplos agentes Claude Code e humanos. É instalado como uma habilidade usando npx e gerenciado através de comandos em linguagem natural.

OpenClawRadar
Hollow AgentOS: Execute agentes similares ao Claude localmente na RTX 5070 usando Qwen 3.5 9B
Tools

Hollow AgentOS: Execute agentes similares ao Claude localmente na RTX 5070 usando Qwen 3.5 9B

Um sistema de agentes auto-modificáveis executando o Qwen 3.5 9B em hardware local reduz os custos da API Claude em 50%. Usa um ciclo iterativo de teste e autoaperfeiçoamento para desenvolver software sem intervenção humana.

OpenClawRadar
Pacote de Habilidades OpenClaw: Um Conjunto de Mais de 2.500 Comandos para Operações Autônomas Reais no Ubuntu
Tools

Pacote de Habilidades OpenClaw: Um Conjunto de Mais de 2.500 Comandos para Operações Autônomas Reais no Ubuntu

Um novo pacote de habilidades para agentes de IA OpenClaw introduz mais de 2.500 habilidades de execução para operações DevOps, como gerenciamento Docker, configuração de rede, resposta a CVEs e automação de sistemas em ambientes Ubuntu.

OpenClawRadar
Usando o Modo de Código MCP para Pesquisa Eficiente de Palavras-chave no Claude
Tools

Usando o Modo de Código MCP para Pesquisa Eficiente de Palavras-chave no Claude

Um desenvolvedor criou um servidor MCP que permite ao Claude realizar pesquisas de palavras-chave autônomas usando um padrão de Modo de Código, reduzindo os tokens de definição de ferramentas de milhares para aproximadamente 1.000 com apenas duas ferramentas: pesquisa e execução.

OpenClawRadar