Estudo da ETH Zurich Questiona o Valor de Arquivos AGENTS.md para Agentes de IA de Codificação

Resultados da Pesquisa sobre Arquivos AGENTS.md
Um novo artigo de pesquisadores da ETH Zurich questiona a prática amplamente difundida na indústria de usar arquivos AGENTS.md com agentes de codificação de IA. O estudo, conduzido por Thibaud Gloaguen, Niels Mündler, Mark Müller, Veselin Raychev e Martin Vechev, fornece evidências empíricas de que esses arquivos de contexto frequentemente atrapalham em vez de ajudar os agentes de IA.
Metodologia e Testes
A equipe criou o AGENTbench, um novo conjunto de dados com 138 tarefas reais em Python obtidas de repositórios de nicho para evitar viés de benchmarks populares como o SWE-bench que os modelos de IA podem ter memorizado. Eles testaram quatro agentes: Claude 3.5 Sonnet, Codex GPT-5.2, GPT-5.1 mini e Qwen Code em três cenários:
- Sem arquivo de contexto
- Arquivo AGENTS.md gerado por LLM
- Arquivo AGENTS.md escrito por humanos
O desempenho foi medido usando três indicadores proxy: taxas de sucesso das tarefas (determinadas por testes unitários do repositório), número de etapas do agente e custos gerais de inferência.
Principais Resultados
Os arquivos de contexto gerados por LLM degradaram o desempenho, reduzindo as taxas de sucesso das tarefas em média 3% em comparação com não fornecer nenhum arquivo de contexto. Esses arquivos aumentaram consistentemente o número de etapas que os agentes realizaram, elevando os custos de inferência em mais de 20%.
Os arquivos escritos por humanos mostraram ganhos marginais com um aumento médio de 4% na taxa de sucesso das tarefas no AGENTbench, mas isso veio com um aumento paralelo nas etapas, elevando os custos em até 19%.
Incluir visões gerais da arquitetura ou explicações da estrutura do repositório nos arquivos AGENTS.md não reduziu o tempo que os modelos gastaram localizando arquivos relevantes para as tarefas.
Análise de Comportamento
A análise de rastreamento revelou que os agentes geralmente seguiram as instruções nos arquivos AGENTS.md, levando-os a executar mais testes, ler mais arquivos, realizar mais buscas grep e fazer mais verificações de qualidade de código. Embora minucioso, esse comportamento frequentemente era desnecessário para resolver tarefas específicas, forçando os modelos de raciocínio a "pensar" mais sem produzir patches finais melhores.
Recomendações Práticas
Os pesquisadores recomendam omitir completamente os arquivos de contexto gerados por LLM e limitar as instruções escritas por humanos a detalhes não inferíveis, como ferramentas altamente específicas ou comandos de construção personalizados. Eles observam que, embora 60.000 repositórios de código aberto atualmente contenham arquivos de contexto como AGENTS.md, e muitas estruturas de agentes apresentem comandos integrados para gerá-los automaticamente, esses arquivos têm apenas efeitos marginais no comportamento do agente.
📖 Leia a fonte completa: HN AI Agents
👀 See Also

Reunião do Departamento de Defesa da Anthropic e Laboratórios de IA Chineses Destilando Claude
O CEO da Anthropic se reúne com o Secretário de Defesa dos EUA em uma situação que oficiais descrevem como 'melhore ou saia', enquanto a empresa relata ter flagrado três laboratórios chineses de IA realizando destilação em massa dos recursos do Claude.

Custos da API OpenClaw Chegam a US$ 275 em 5,5 Horas, Projetando Mais de US$ 200K Anuais
Um desenvolvedor testando o OpenClaw com a API GPT-5.4 da OpenAI gastou US$ 275 entre 11h e 16h30, o que, anualizado, representa mais de US$ 200.000 por ano nessa taxa de uso.

Claude Opus 4.1 marca 17,75% no conjunto de dados privado do SWE-Bench Pro, destacando a lacuna entre memorização e raciocínio.
Claude Opus 4.1 obteve 80% no SWE-Bench Verified, mas caiu para 17,75% no conjunto de dados privado do SWE-Bench Pro, com 276 tarefas de 18 bases de código proprietárias de startups. A análise da Scale AI descobriu que os modelos estavam navegando por memória em vez de raciocinar em repositórios familiares.

Sakana AI Lança o Laboratório RSI: Autoaperfeiçoamento Recursivo com Modelos de Base
A Sakana AI lança oficialmente seu Laboratório de Melhoria Recursiva, baseando-se em pesquisas publicadas como LLM-Squared, Darwin Gödel Machine e The AI Scientist para criar sistemas de IA autônomos e auto-aprimoráveis.