Estudo da ETH Zurich Questiona o Valor de Arquivos AGENTS.md para Agentes de IA de Codificação

✍️ OpenClawRadar📅 Publicado: March 8, 2026🔗 Source
Estudo da ETH Zurich Questiona o Valor de Arquivos AGENTS.md para Agentes de IA de Codificação
Ad

Resultados da Pesquisa sobre Arquivos AGENTS.md

Um novo artigo de pesquisadores da ETH Zurich questiona a prática amplamente difundida na indústria de usar arquivos AGENTS.md com agentes de codificação de IA. O estudo, conduzido por Thibaud Gloaguen, Niels Mündler, Mark Müller, Veselin Raychev e Martin Vechev, fornece evidências empíricas de que esses arquivos de contexto frequentemente atrapalham em vez de ajudar os agentes de IA.

Metodologia e Testes

A equipe criou o AGENTbench, um novo conjunto de dados com 138 tarefas reais em Python obtidas de repositórios de nicho para evitar viés de benchmarks populares como o SWE-bench que os modelos de IA podem ter memorizado. Eles testaram quatro agentes: Claude 3.5 Sonnet, Codex GPT-5.2, GPT-5.1 mini e Qwen Code em três cenários:

  • Sem arquivo de contexto
  • Arquivo AGENTS.md gerado por LLM
  • Arquivo AGENTS.md escrito por humanos

O desempenho foi medido usando três indicadores proxy: taxas de sucesso das tarefas (determinadas por testes unitários do repositório), número de etapas do agente e custos gerais de inferência.

Principais Resultados

Os arquivos de contexto gerados por LLM degradaram o desempenho, reduzindo as taxas de sucesso das tarefas em média 3% em comparação com não fornecer nenhum arquivo de contexto. Esses arquivos aumentaram consistentemente o número de etapas que os agentes realizaram, elevando os custos de inferência em mais de 20%.

Os arquivos escritos por humanos mostraram ganhos marginais com um aumento médio de 4% na taxa de sucesso das tarefas no AGENTbench, mas isso veio com um aumento paralelo nas etapas, elevando os custos em até 19%.

Incluir visões gerais da arquitetura ou explicações da estrutura do repositório nos arquivos AGENTS.md não reduziu o tempo que os modelos gastaram localizando arquivos relevantes para as tarefas.

Ad

Análise de Comportamento

A análise de rastreamento revelou que os agentes geralmente seguiram as instruções nos arquivos AGENTS.md, levando-os a executar mais testes, ler mais arquivos, realizar mais buscas grep e fazer mais verificações de qualidade de código. Embora minucioso, esse comportamento frequentemente era desnecessário para resolver tarefas específicas, forçando os modelos de raciocínio a "pensar" mais sem produzir patches finais melhores.

Recomendações Práticas

Os pesquisadores recomendam omitir completamente os arquivos de contexto gerados por LLM e limitar as instruções escritas por humanos a detalhes não inferíveis, como ferramentas altamente específicas ou comandos de construção personalizados. Eles observam que, embora 60.000 repositórios de código aberto atualmente contenham arquivos de contexto como AGENTS.md, e muitas estruturas de agentes apresentem comandos integrados para gerá-los automaticamente, esses arquivos têm apenas efeitos marginais no comportamento do agente.

📖 Leia a fonte completa: HN AI Agents

Ad

👀 See Also

Reunião do Departamento de Defesa da Anthropic e Laboratórios de IA Chineses Destilando Claude
News

Reunião do Departamento de Defesa da Anthropic e Laboratórios de IA Chineses Destilando Claude

O CEO da Anthropic se reúne com o Secretário de Defesa dos EUA em uma situação que oficiais descrevem como 'melhore ou saia', enquanto a empresa relata ter flagrado três laboratórios chineses de IA realizando destilação em massa dos recursos do Claude.

OpenClawRadar
Custos da API OpenClaw Chegam a US$ 275 em 5,5 Horas, Projetando Mais de US$ 200K Anuais
News

Custos da API OpenClaw Chegam a US$ 275 em 5,5 Horas, Projetando Mais de US$ 200K Anuais

Um desenvolvedor testando o OpenClaw com a API GPT-5.4 da OpenAI gastou US$ 275 entre 11h e 16h30, o que, anualizado, representa mais de US$ 200.000 por ano nessa taxa de uso.

OpenClawRadar
Claude Opus 4.1 marca 17,75% no conjunto de dados privado do SWE-Bench Pro, destacando a lacuna entre memorização e raciocínio.
News

Claude Opus 4.1 marca 17,75% no conjunto de dados privado do SWE-Bench Pro, destacando a lacuna entre memorização e raciocínio.

Claude Opus 4.1 obteve 80% no SWE-Bench Verified, mas caiu para 17,75% no conjunto de dados privado do SWE-Bench Pro, com 276 tarefas de 18 bases de código proprietárias de startups. A análise da Scale AI descobriu que os modelos estavam navegando por memória em vez de raciocinar em repositórios familiares.

OpenClawRadar
Sakana AI Lança o Laboratório RSI: Autoaperfeiçoamento Recursivo com Modelos de Base
News

Sakana AI Lança o Laboratório RSI: Autoaperfeiçoamento Recursivo com Modelos de Base

A Sakana AI lança oficialmente seu Laboratório de Melhoria Recursiva, baseando-se em pesquisas publicadas como LLM-Squared, Darwin Gödel Machine e The AI Scientist para criar sistemas de IA autônomos e auto-aprimoráveis.

OpenClawRadar