Исследование ETH Zurich ставит под сомнение ценность файлов AGENTS.md для ИИ-агентов в программировании

Результаты исследования файлов AGENTS.md
Новая статья исследователей из ETH Zurich ставит под сомнение широко распространенную в отрасли практику использования файлов AGENTS.md с ИИ-агентами для программирования. Исследование, проведенное Тибодом Глоагеном, Нильсом Мюндлером, Марком Мюллером, Веселином Райчевым и Мартином Вечевым, предоставляет эмпирические доказательства того, что эти контекстные файлы часто скорее мешают, чем помогают ИИ-агентам.
Методология и тестирование
Команда создала AGENTbench — новый набор данных из 138 реальных задач на Python, взятых из нишевых репозиториев, чтобы избежать смещения из-за популярных бенчмарков, таких как SWE-bench, которые ИИ-модели могли запомнить. Они протестировали четырех агентов: Claude 3.5 Sonnet, Codex GPT-5.2, GPT-5.1 mini и Qwen Code в трех сценариях:
- Без контекстного файла
- LLM-сгенерированный файл AGENTS.md
- Файл AGENTS.md, написанный человеком
Производительность измерялась с помощью трех косвенных показателей: процент успешного выполнения задач (определяемый модульными тестами репозитория), количество шагов агента и общие затраты на вывод.
Ключевые результаты
Контекстные файлы, сгенерированные LLM, ухудшали производительность, снижая процент успешного выполнения задач в среднем на 3% по сравнению с отсутствием контекстного файла. Эти файлы постоянно увеличивали количество шагов, которые предпринимали агенты, что приводило к росту затрат на вывод более чем на 20%.
Файлы, написанные человеком, показали незначительное улучшение со средним увеличением процента успешного выполнения задач на AGENTbench на 4%, но это сопровождалось аналогичным увеличением количества шагов, что повышало затраты до 19%.
Включение обзоров архитектуры или объяснений структуры репозитория в файлы AGENTS.md не сокращало время, которое модели тратили на поиск соответствующих файлов для задач.
Анализ поведения
Анализ трассировок показал, что агенты, как правило, следовали инструкциям в файлах AGENTS.md, что заставляло их запускать больше тестов, читать больше файлов, выполнять больше поисков с помощью grep и проводить больше проверок качества кода. Хотя такое поведение было тщательным, оно часто было излишним для решения конкретных задач, заставляя модели рассуждений «думать» усерднее, не приводя к лучшим итоговым исправлениям.
Практические рекомендации
Исследователи рекомендуют полностью отказаться от контекстных файлов, сгенерированных LLM, и ограничить инструкции, написанные человеком, невыводимыми деталями, такими как высокоспециализированные инструменты или пользовательские команды сборки. Они отмечают, что хотя 60 000 репозиториев с открытым исходным кодом в настоящее время содержат контекстные файлы, такие как AGENTS.md, и многие фреймворки для агентов имеют встроенные команды для их автоматической генерации, эти файлы оказывают лишь незначительное влияние на поведение агентов.
📖 Read the full source: HN AI Agents
👀 Смотрите также

Открытые LLM превосходят Claude Opus 4.6 в генерации торговых стратегий при более низкой стоимости.
Пользователь Reddit протестировал 10 языковых моделей на генерацию торговых стратегий и обнаружил, что модели с открытым исходным кодом превзошли Claude Opus 4.6, несмотря на то, что они в 10 раз дешевле. Minimax 2.5 и Gemini 3.1 возглавили рейтинг.

Клод Код удалил производственную базу данных после ошибки в файле состояния Terraform
Разработчик использовал Claude Code для управления инфраструктурой AWS с помощью Terraform, но отсутствие файла состояния привело к созданию дублирующих ресурсов и последующей операции 'destroy', которая уничтожила 2,5 года записей, включая снимки базы данных.

Угроза блокировки Internet Archive ставит под угрозу сохранение истории веб-пространства.
Крупные издатели, включая The New York Times, блокируют краулеры Internet Archive с помощью технических мер, выходящих за рамки robots.txt, что грозит потерей исторических веб-записей. Wayback Machine Архива содержит более одного триллиона сохранённых страниц, а Wikipedia ссылается на 2,6 миллиона сохранённых новостных статей на 249 языках.

Википедия запрещает контент, созданный искусственным интеллектом, и разрешает ограниченное использование ИИ с проверкой человеком
Википедия официально запретила своим 260 000 редакторам использовать ИИ, такой как ChatGPT, для написания статей, ссылаясь на проблемы с точностью и надежностью. Редакторы по-прежнему могут использовать ИИ для перевода и корректуры с одобрения человека.