벤치마크 결과, 컨텍스트 엔진이 SWE-bench에서 AI 코딩 에이전트 비용을 3배 절감하는 것으로 나타났습니다.

✍️ OpenClawRadar📅 게시일: March 23, 2026🔗 Source
벤치마크 결과, 컨텍스트 엔진이 SWE-bench에서 AI 코딩 에이전트 비용을 3배 절감하는 것으로 나타났습니다.
Ad

한 개발자가 동일한 Claude Opus 4.5 모델을 사용하여 SWE-bench Verified에서 네 가지 AI 코딩 에이전트를 벤치마킹했으며, 컨텍스트 관리가 유일한 변수였습니다. 결과는 유사한 성능 수준에 대해 상당한 비용 차이를 보여줍니다.

벤치마크 설정

테스트는 SWE-bench Verified의 100개 작업으로 구성된 계층화된 하위 집합을 사용했으며, 모든 12개의 저장소가 비례적으로 표현되었습니다. 모든 에이전트는 동일한 작업당 $3 예산과 250턴 제한으로 Claude Opus 4.5를 실행했습니다. 유일한 차이는 모델 앞에 있는 컨텍스트 계층이었습니다.

결과

  • 컨텍스트 엔진 + Claude Code: 73.0% Pass@1, 작업당 $0.67
  • Live-SWE-Agent: 72.0% Pass@1, 작업당 $0.86
  • OpenHands: 70.0% Pass@1, 작업당 $1.77
  • Sonar Foundation: 70.0% Pass@1, 작업당 $1.98

가장 비싼 설정은 더 낮은 해결율에 대해 작업당 3배 더 많은 비용이 듭니다. 8개의 작업은 컨텍스트 계층이 있는 설정에서만 해결되었습니다 - 모델이 올바른 코드를 보지 않고는 수정할 수 없는 버그들입니다.

제한 사항

matplotlib(렌더링이 많고 시각적 출력 코드)에서는 컨텍스트 엔진이 43%의 점수를 기록한 반면, Sonar Foundation은 86%를 달성했습니다. 그래프 기반 컨텍스트는 관련 코드가 종속성 체인을 따르지 않을 때 효과적이지 않습니다.

Ad

컨텍스트 계층 작동 방식

Claude가 전체 파일을 읽도록 하는 대신, tree-sitter + SQLite(30개 언어 지원)를 사용하여 코드베이스를 종속성 그래프로 사전 인덱싱하고 순위가 매겨진 컨텍스트 캡슐을 반환합니다: 중요한 함수에 대한 전체 소스, 그들과 연결된 모든 것에 대한 스켈레톤화된 시그니처. 에이전트는 모든 작업을 시작할 때 이미 관련된 내용을 알고 있습니다.

MCP를 통해 세션 간에 지속되는 세션 메모리를 포함합니다. 코드가 변경되면 이전 관찰이 자동으로 오래된 것으로 표시되어 에이전트가 동일한 내용을 다시 탐색하지 않습니다.

이 시스템은 클라우드, 계정, 코드가 사용자의 기기를 떠나는 것 없이 100% 로컬로 작동합니다. Claude Code 및 MCP를 통한 11개의 다른 에이전트와 함께 작동합니다.

오픈 소스 가용성

벤치마크 하네스, 모든 평가 로그, 인스턴스별 결과 및 비교 스크립트는 GitHub의 github.com/Vexp-ai/vexp-swe-bench에서 사용할 수 있습니다. 도구 자체는 vexp.dev에서 무료 티어, VS Code 확장 또는 CLI로 사용할 수 있습니다. 차트가 포함된 전체 벤치마크 결과는 vexp.dev/benchmark에서 확인할 수 있습니다.

📖 Read the full source: r/ClaudeAI

Ad

👀 See Also

Claude Code v2.1.139, 비동기 장기 실행 작업을 위한 /goal 명령어 추가
Tools

Claude Code v2.1.139, 비동기 장기 실행 작업을 위한 /goal 명령어 추가

Claude Code v2.1.139에 /goal 명령어가 도입되어 완료 조건이 충족될 때까지 실행되는 파이어 앤 포겟 세션과 활성 세션을 모니터링할 수 있는 새로운 에이전트 보기가 추가되었습니다.

OpenClawRadar
OpenClaw Outlook 애드인은 로컬 에이전트를 이메일 사이드바에 연결합니다.
Tools

OpenClaw Outlook 애드인은 로컬 에이전트를 이메일 사이드바에 연결합니다.

한 개발자가 WebSocket을 통해 로컬 OpenClaw Gateway에 연결하는 Outlook 애드인을 구축했습니다. 이 도구는 선택된 이메일을 컨텍스트로 읽고, 이메일별 채팅 세션을 유지하며, Outlook 데스크톱 및 웹에서 작동합니다.

OpenClawRadar
소스 제어 PR 리뷰를 위한 AI 검사 구현
Tools

소스 제어 PR 리뷰를 위한 AI 검사 구현

Continue는 마크다운 파일을 소스 제어된 체크로 사용하여 GitHub 상태 체크를 통해 확인 가능하게 함으로써 AI 체크를 풀 리퀘스트 워크플로우에 직접 통합합니다.

OpenClawRadar
agent-data: 오픈클로우 에이전트를 위한 구조화된 웹 데이터, 브라우저 자동화보다 70% 저렴
Tools

agent-data: 오픈클로우 에이전트를 위한 구조화된 웹 데이터, 브라우저 자동화보다 70% 저렴

agent-data는 X, Reddit, 항공편, 구인 목록을 위한 순수 Python API 엔드포인트를 제공하며, OpenClaw와 같은 AI 에이전트를 위해 설계되었습니다. 브라우저 자동화가 필요 없으며, 벤치마크에서 상당한 비용 절감과 신뢰성 향상을 보여줍니다.

OpenClawRadar