ETH 취리히 연구, AI 코딩 에이전트를 위한 AGENTS.md 파일의 가치에 의문 제기

AGENTS.md 파일에 관한 연구 결과
ETH 취리히 연구진의 새로운 논문은 AI 코딩 에이전트와 함께 AGENTS.md 파일을 사용하는 산업계의 보편적 관행에 의문을 제기합니다. Thibaud Gloaguen, Niels Mündler, Mark Müller, Veselin Raychev, Martin Vechev가 수행한 이 연구는 이러한 컨텍스트 파일이 AI 에이전트를 돕기보다는 오히려 방해하는 경우가 많다는 경험적 증거를 제공합니다.
방법론 및 테스트
연구팀은 AI 모델이 암기했을 수 있는 SWE-bench와 같은 인기 벤치마크의 편향을 피하기 위해 틈새 저장소에서 가져온 138개의 실제 Python 작업으로 구성된 새로운 데이터셋인 AGENTbench를 구축했습니다. 그들은 세 가지 시나리오에서 네 가지 에이전트를 테스트했습니다:
- 컨텍스트 파일 없음
- LLM 생성 AGENTS.md 파일
- 인간 작성 AGENTS.md 파일
성능은 세 가지 대리 지표를 사용하여 측정되었습니다: 작업 성공률(저장소 단위 테스트로 결정), 에이전트 단계 수, 전체 추론 비용.
주요 결과
LLM 생성 컨텍스트 파일은 성능을 저하시켜, 컨텍스트 파일을 제공하지 않은 경우에 비해 작업 성공률을 평균 3% 감소시켰습니다. 이러한 파일은 에이전트가 수행하는 단계 수를 지속적으로 증가시켜 추론 비용을 20% 이상 상승시켰습니다.
인간 작성 파일은 AGENTbench에서 작업 성공률이 평균 4% 증가하는 미미한 향상을 보였지만, 이는 단계 수의 병행 증가와 함께 비용을 최대 19%까지 증가시켰습니다.
AGENTS.md 파일에 아키텍처 개요나 저장소 구조 설명을 포함하는 것은 모델이 작업에 필요한 관련 파일을 찾는 데 소요되는 시간을 줄이지 못했습니다.
행동 분석
추적 분석에 따르면, 에이전트는 일반적으로 AGENTS.md 파일의 지시를 따르며, 더 많은 테스트를 실행하고, 더 많은 파일을 읽고, 더 많은 grep 검색을 수행하며, 더 많은 코드 품질 검사를 수행했습니다. 이 행동은 철저했지만, 특정 작업을 해결하는 데 종종 불필요했으며, 추론 모델이 더 나은 최종 패치를 산출하지 못한 채 더 열심히 "생각"하도록 강요했습니다.
실용적 권장사항
연구진은 LLM 생성 컨텍스트 파일을 완전히 생략하고, 인간 작성 지시사항을 매우 구체적인 도구나 맞춤형 빌드 명령과 같이 추론할 수 없는 세부사항으로 제한할 것을 권장합니다. 그들은 현재 60,000개의 오픈소스 저장소가 AGENTS.md와 같은 컨텍스트 파일을 포함하고 있으며, 많은 에이전트 프레임워크가 이를 자동 생성하는 내장 명령어를 특징으로 하지만, 이러한 파일이 에이전트 행동에 미치는 영향은 미미하다고 지적합니다.
📖 전체 출처 읽기: HN AI Agents
👀 See Also

유지보수 비용을 줄이지 못하는 AI 에이전트가 팀을 망칠 것입니다
James Shore는 AI 코딩 속도를 두 배로 높여도 유지보수 비용이 절반으로 줄지 않으면 몇 달 안에 순 생산성이 손실된다고 주장합니다. 모델은 코드 출력이 2배이고 라인당 유지보수 비용이 2배일 때 생산성이 약 5개월 후에 시작점보다 나빠진다는 것을 보여줍니다.

OpenClaw 에이전트의 지출 패턴과 지출 한도 부재
한 개발자가 두 달 동안 OpenClaw 에이전트 지출을 추적한 결과, 대부분의 에이전트가 제한 없이 방치될 경우 API 및 서비스 요금으로 월 평균 40~80달러를 소비하며, 주말과 야간에 급증하는 패턴을 발견했습니다. 기본 동작은 무제한이며, 내장된 지출 한도는 없습니다.

클로드 소넷 4.6 공개: 향상된 코딩 및 컴퓨터 사용 능력
클로드 소넷 4.6은 100만 토큰 컨텍스트 창을 도입하고 코딩 및 컴퓨터 사용 능력을 향상시켜, 더 넓은 범위의 작업에 대해 오푸스급 모델에 대한 강력한 대안이 되었습니다.

Anthropic, 모델 버전 고정 기능을 제거해 클라이언트 애플리케이션에 차질
Anthropic은 claude-sonnet-4-5-20250929 모델을 지원 중단하고 사용자들을 claude-sonnet-4-6으로 강제 이전시키고 있습니다. 이 모델은 항상 최신 버전을 참조하며 특정 버전을 고정할 수 있는 방법이 없습니다. 이는 모델 버전이 변경될 때 클라이언트 애플리케이션이 예측 불가능하게 중단될 수 있음을 의미합니다.