취리히 연방공과대학교 연구: 과도한 컨텍스트가 AI 코딩 에이전트 성능을 저하시킨다

ETH 취리히의 최근 연구는 AI 코딩 에이전트에게 더 많은 컨텍스트가 반드시 더 나은 성능을 의미하지는 않는다는 구체적인 증거를 제시합니다. 이 연구는 138개의 실제 GitHub 작업에 대해 4개의 코딩 에이전트를 테스트하여 명확한 정량적 결과를 도출했습니다.
주요 발견
연구에 따르면 LLM이 생성한 컨텍스트 파일은 실제로 작업 성공률을 2-3% 감소시키면서 추론 비용을 20% 증가시켰습니다. 심지어 인간이 작성한 컨텍스트 파일도 성공률을 약 4%만 향상시켰지만 여전히 비용을 상당히 증가시켰습니다.
핵심 문제
연구자들은 에이전트들이 컨텍스트 파일의 모든 지시사항을 반드시 실행해야 하는 것으로 처리한다는 사실을 발견했습니다. 한 실험에서 생성된 컨텍스트 파일만으로 저장소를 축소했을 때 성능이 다시 향상되었습니다. 이는 에이전트들이 필수적인 지시사항과 관련 없는 역사적 정보를 구분하는 데 어려움을 겪고 있음을 나타냅니다.
실용적 권장사항
연구는 에이전트가 스스로 발견할 수 없는 정보만 포함하고 컨텍스트를 최소한으로 유지할 것을 권장합니다. 이는 이메일 스레드와 같은 커뮤니케이션 데이터에 특히 관련이 있는데, 이러한 데이터는 컨텍스트처럼 보일 수 있지만 실제로는 역사적 잡음일 때 종종 지시사항으로 해석됩니다.
컨텍스트 API 솔루션
이 문제를 해결하기 위해 연구자들은 이메일 처리에 초점을 맞춘 컨텍스트 API(iGPT)를 개발했습니다. 이 API는:
- 컨텍스트가 모델에 도달하기 전에 이메일 스레드를 대화 그래프로 재구성합니다
- 인용된 텍스트를 중복 제거합니다
- 누가 언제 무엇을 말했는지 감지합니다
- 원시 텍스트 대신 구조화된 JSON을 반환합니다
이 접근 방식은 에이전트가 전체 대화 기록 대신 필터링된 컨텍스트를 받도록 보장하여 관련 정보에 집중하는 능력을 향상시킵니다.
📖 전체 출처 읽기: r/LocalLLaMA
👀 See Also

ClawCast 에피소드 3: 온보딩 개편, 데모 취소, 장기 워크플로우를 위한 OpenClaw vs Codex
ClawCast 3화에서는 OpenClaw의 온보딩 개편, 데모 취소 이유, Hermes 자기 개선 시스템의 교훈, 그리고 장기 자율 워크플로에서 OpenClaw와 Codex의 비교를 다룹니다.

합성 사회: 몰트북에서 가상의 삶을 구축하는 AI 에이전트들
없음

클로드 소넷 4.5, 오류 급증 중 — 상태 업데이트
Claude Sonnet 4.5가 2026-04-28T13:29:56.000Z 기준으로 현재 오류 증가를 겪고 있습니다. 업데이트를 위해 상태 페이지와 Reddit megathread를 확인하세요.

클로드 관리 에이전트, 드리밍·결과물·멀티에이전트 오케스트레이션·웹훅 추가
Dreaming은 예정된 메모리 큐레이션 프로세스로, Harvey 테스트에서 작업 완료율을 약 6배 향상시켰습니다. Outcomes, 멀티에이전트 오케스트레이션, 웹훅이 이제 Claude Platform에서 퍼블릭 베타로 제공됩니다.