벤치마크 결과, 컨텍스트 엔진이 SWE-bench에서 AI 코딩 에이전트 비용을 3배 절감하는 것으로 나타났습니다.

한 개발자가 동일한 Claude Opus 4.5 모델을 사용하여 SWE-bench Verified에서 네 가지 AI 코딩 에이전트를 벤치마킹했으며, 컨텍스트 관리가 유일한 변수였습니다. 결과는 유사한 성능 수준에 대해 상당한 비용 차이를 보여줍니다.
벤치마크 설정
테스트는 SWE-bench Verified의 100개 작업으로 구성된 계층화된 하위 집합을 사용했으며, 모든 12개의 저장소가 비례적으로 표현되었습니다. 모든 에이전트는 동일한 작업당 $3 예산과 250턴 제한으로 Claude Opus 4.5를 실행했습니다. 유일한 차이는 모델 앞에 있는 컨텍스트 계층이었습니다.
결과
- 컨텍스트 엔진 + Claude Code: 73.0% Pass@1, 작업당 $0.67
- Live-SWE-Agent: 72.0% Pass@1, 작업당 $0.86
- OpenHands: 70.0% Pass@1, 작업당 $1.77
- Sonar Foundation: 70.0% Pass@1, 작업당 $1.98
가장 비싼 설정은 더 낮은 해결율에 대해 작업당 3배 더 많은 비용이 듭니다. 8개의 작업은 컨텍스트 계층이 있는 설정에서만 해결되었습니다 - 모델이 올바른 코드를 보지 않고는 수정할 수 없는 버그들입니다.
제한 사항
matplotlib(렌더링이 많고 시각적 출력 코드)에서는 컨텍스트 엔진이 43%의 점수를 기록한 반면, Sonar Foundation은 86%를 달성했습니다. 그래프 기반 컨텍스트는 관련 코드가 종속성 체인을 따르지 않을 때 효과적이지 않습니다.
컨텍스트 계층 작동 방식
Claude가 전체 파일을 읽도록 하는 대신, tree-sitter + SQLite(30개 언어 지원)를 사용하여 코드베이스를 종속성 그래프로 사전 인덱싱하고 순위가 매겨진 컨텍스트 캡슐을 반환합니다: 중요한 함수에 대한 전체 소스, 그들과 연결된 모든 것에 대한 스켈레톤화된 시그니처. 에이전트는 모든 작업을 시작할 때 이미 관련된 내용을 알고 있습니다.
MCP를 통해 세션 간에 지속되는 세션 메모리를 포함합니다. 코드가 변경되면 이전 관찰이 자동으로 오래된 것으로 표시되어 에이전트가 동일한 내용을 다시 탐색하지 않습니다.
이 시스템은 클라우드, 계정, 코드가 사용자의 기기를 떠나는 것 없이 100% 로컬로 작동합니다. Claude Code 및 MCP를 통한 11개의 다른 에이전트와 함께 작동합니다.
오픈 소스 가용성
벤치마크 하네스, 모든 평가 로그, 인스턴스별 결과 및 비교 스크립트는 GitHub의 github.com/Vexp-ai/vexp-swe-bench에서 사용할 수 있습니다. 도구 자체는 vexp.dev에서 무료 티어, VS Code 확장 또는 CLI로 사용할 수 있습니다. 차트가 포함된 전체 벤치마크 결과는 vexp.dev/benchmark에서 확인할 수 있습니다.
📖 Read the full source: r/ClaudeAI
👀 See Also

Claude Code v2.1.139, 비동기 장기 실행 작업을 위한 /goal 명령어 추가
Claude Code v2.1.139에 /goal 명령어가 도입되어 완료 조건이 충족될 때까지 실행되는 파이어 앤 포겟 세션과 활성 세션을 모니터링할 수 있는 새로운 에이전트 보기가 추가되었습니다.

OpenClaw Outlook 애드인은 로컬 에이전트를 이메일 사이드바에 연결합니다.
한 개발자가 WebSocket을 통해 로컬 OpenClaw Gateway에 연결하는 Outlook 애드인을 구축했습니다. 이 도구는 선택된 이메일을 컨텍스트로 읽고, 이메일별 채팅 세션을 유지하며, Outlook 데스크톱 및 웹에서 작동합니다.

소스 제어 PR 리뷰를 위한 AI 검사 구현
Continue는 마크다운 파일을 소스 제어된 체크로 사용하여 GitHub 상태 체크를 통해 확인 가능하게 함으로써 AI 체크를 풀 리퀘스트 워크플로우에 직접 통합합니다.

agent-data: 오픈클로우 에이전트를 위한 구조화된 웹 데이터, 브라우저 자동화보다 70% 저렴
agent-data는 X, Reddit, 항공편, 구인 목록을 위한 순수 Python API 엔드포인트를 제공하며, OpenClaw와 같은 AI 에이전트를 위해 설계되었습니다. 브라우저 자동화가 필요 없으며, 벤치마크에서 상당한 비용 절감과 신뢰성 향상을 보여줍니다.