Исследование ETH Zurich ставит под сомнение ценность файлов AGENTS.md для ИИ-агентов в программировании

✍️ OpenClawRadar📅 Опубликовано: 8 марта 2026 г.🔗 Source
Исследование ETH Zurich ставит под сомнение ценность файлов AGENTS.md для ИИ-агентов в программировании
Ad

Результаты исследования файлов AGENTS.md

Новая статья исследователей из ETH Zurich ставит под сомнение широко распространенную в отрасли практику использования файлов AGENTS.md с ИИ-агентами для программирования. Исследование, проведенное Тибодом Глоагеном, Нильсом Мюндлером, Марком Мюллером, Веселином Райчевым и Мартином Вечевым, предоставляет эмпирические доказательства того, что эти контекстные файлы часто скорее мешают, чем помогают ИИ-агентам.

Методология и тестирование

Команда создала AGENTbench — новый набор данных из 138 реальных задач на Python, взятых из нишевых репозиториев, чтобы избежать смещения из-за популярных бенчмарков, таких как SWE-bench, которые ИИ-модели могли запомнить. Они протестировали четырех агентов: Claude 3.5 Sonnet, Codex GPT-5.2, GPT-5.1 mini и Qwen Code в трех сценариях:

  • Без контекстного файла
  • LLM-сгенерированный файл AGENTS.md
  • Файл AGENTS.md, написанный человеком

Производительность измерялась с помощью трех косвенных показателей: процент успешного выполнения задач (определяемый модульными тестами репозитория), количество шагов агента и общие затраты на вывод.

Ключевые результаты

Контекстные файлы, сгенерированные LLM, ухудшали производительность, снижая процент успешного выполнения задач в среднем на 3% по сравнению с отсутствием контекстного файла. Эти файлы постоянно увеличивали количество шагов, которые предпринимали агенты, что приводило к росту затрат на вывод более чем на 20%.

Файлы, написанные человеком, показали незначительное улучшение со средним увеличением процента успешного выполнения задач на AGENTbench на 4%, но это сопровождалось аналогичным увеличением количества шагов, что повышало затраты до 19%.

Включение обзоров архитектуры или объяснений структуры репозитория в файлы AGENTS.md не сокращало время, которое модели тратили на поиск соответствующих файлов для задач.

Ad

Анализ поведения

Анализ трассировок показал, что агенты, как правило, следовали инструкциям в файлах AGENTS.md, что заставляло их запускать больше тестов, читать больше файлов, выполнять больше поисков с помощью grep и проводить больше проверок качества кода. Хотя такое поведение было тщательным, оно часто было излишним для решения конкретных задач, заставляя модели рассуждений «думать» усерднее, не приводя к лучшим итоговым исправлениям.

Практические рекомендации

Исследователи рекомендуют полностью отказаться от контекстных файлов, сгенерированных LLM, и ограничить инструкции, написанные человеком, невыводимыми деталями, такими как высокоспециализированные инструменты или пользовательские команды сборки. Они отмечают, что хотя 60 000 репозиториев с открытым исходным кодом в настоящее время содержат контекстные файлы, такие как AGENTS.md, и многие фреймворки для агентов имеют встроенные команды для их автоматической генерации, эти файлы оказывают лишь незначительное влияние на поведение агентов.

📖 Read the full source: HN AI Agents

Ad

👀 Смотрите также

Пузырь ИИ лопается; мы просто пока этого не знаем
Новости

Пузырь ИИ лопается; мы просто пока этого не знаем

Квартальные отчеты Big Tech выявили дикие колебания акций, сокращение свободного денежного потока и огромные капитальные затраты на ИИ. Подкаст The Register разбирает, что это значит для ИТ-команд.

OpenClawRadar
Пользователи Claude Code быстрее, чем ожидалось, достигают лимитов использования, подозреваются ошибки.
Новости

Пользователи Claude Code быстрее, чем ожидалось, достигают лимитов использования, подозреваются ошибки.

Anthropic признаёт, что пользователи Claude Code исчерпывают квоты «гораздо быстрее, чем ожидалось», причём пользователи сообщают о достижении максимальных лимитов в течение нескольких часов. Предполагаемые ошибки в кэшировании промптов могут увеличивать затраты в 10–20 раз, а возврат к версии 2.1.34, по сообщениям, помогает.

OpenClawRadar
🦀
Новости

Deloitte признает, что ИИ написал части отчета для совета Веллингтона, но настаивает на выводах

Мэр Веллингтона сообщил, что «большие куски» отчёта Deloitte стоимостью 435 000 долларов были написаны искусственным интеллектом. В отчёте утверждалось о 330 лишних сотрудниках, но ошибки в данных выявили ошибочные предположения.

OpenClawRadar
Клод Код внезапно становится осторожным, запрашивая разрешение на рутинные задачи
Новости

Клод Код внезапно становится осторожным, запрашивая разрешение на рутинные задачи

Пользователь сообщает, что Claude Code периодически переключается с автономного выполнения на запрос чрезмерных разрешений даже для ежедневных, неизменных рабочих процессов, таких как пересборка монорепозитория и запуск тестов.

OpenClawRadar