클로드 오퍼스 4.1은 SWE-Bench Pro 비공개 데이터셋에서 17.75%의 점수를 기록하며, 암기 능력과 추론 능력 간의 격차를 부각시켰습니다.

✍️ OpenClawRadar📅 게시일: March 9, 2026🔗 Source
클로드 오퍼스 4.1은 SWE-Bench Pro 비공개 데이터셋에서 17.75%의 점수를 기록하며, 암기 능력과 추론 능력 간의 격차를 부각시켰습니다.
Ad

벤치마크 결과가 상당한 성능 격차를 보여줍니다

클로드 오퍼스 4.1은 SWE-Bench Verified에서 80% 이상을 달성했지만, SWE-Bench Pro의 비공개 데이터셋에서는 단 17.75%만 기록했습니다. 이 데이터셋은 GitHub에 한 번도 올라간 적 없는 18개의 독점 스타트업 코드베이스에서 가져온 276개의 작업으로 구성되어 있으며, GPL 라이선스 공개 저장소를 통한 데이터 오염을 제거하기 위해 특별히 설계되었습니다.

동일한 비공개 데이터셋에서 다른 모델들의 결과: GPT-5.2는 23.81%(리더보드 1위), 제미니 3 프로는 17.95%를 기록했습니다.

궤적 분석이 암기 행동을 드러냅니다

스케일 AI의 분석에 따르면 테스트 중에 모델들이 익숙한 저장소에서 문제 설명을 완전히 읽기 전에 수정할 올바른 파일 경로를 식별할 수 있었습니다. 이는 모델들이 문제를 추론하기보다는 기억을 통해 탐색하고 있었음을 나타냅니다.

SWE-Bench Verified에서의 80% 점수는 실제였지만, 대부분의 사람들이 가정했던 것과는 다른 능력을 측정한 것입니다. 즉, 새로운 코드에 대한 추론보다는 주로 훈련 데이터의 기억을 측정한 것입니다.

AI 코딩 도구 배치에 대한 실질적인 함의

개발자들이 워크플로우에서 AI 코딩 도구를 어디에 배치할지 결정할 때, 기억과 추론 사이의 구분은 헤드라인 벤치마크 수치보다 더 중요합니다. 오염된 벤치마크에서 잘 수행하는 모델들은 훈련 중에 보지 못한 진정으로 새로운 코드베이스에서 어려움을 겪을 수 있습니다.

SWE-Bench Pro는 GitHub나 훈련 데이터셋에 한 번도 공개된 적 없는 코드를 사용함으로써 이 오염 문제를 해결하기 위해 특별히 만들어졌습니다.

📖 전체 출처 읽기: r/ClaudeAI

Ad

👀 See Also

OpenClaw 사용자가 OpenRouter를 통해 940달러로 1억 4300만 토큰을 처리했다고 보고합니다
News

OpenClaw 사용자가 OpenRouter를 통해 940달러로 1억 4300만 토큰을 처리했다고 보고합니다

OpenClaw 멀티 에이전트 파이프라인을 실행한 Reddit 사용자가 1억 4,300만 토큰을 $94.16에 처리하여 OpenRouter를 통해 라우팅하고 특정 구성 최적화를 구현함으로써 약 $0.66/백만 토큰의 비용을 달성했습니다.

OpenClawRadar
클로드 코드 v2.1.77 릴리스: 토큰 제한, 샌드박스 제어 및 버그 수정
News

클로드 코드 v2.1.77 릴리스: 토큰 제한, 샌드박스 제어 및 버그 수정

Claude Code v2.1.77는 Claude Opus 4.6의 기본 최대 출력 토큰 한도를 64k 토큰으로 증가시키고, allowRead 샌드박스 파일 시스템 설정을 추가했습니다. 이번 릴리스에는 메모리 관리부터 터미널 UI 동작에 이르기까지 30개 이상의 문제 수정이 포함되었습니다.

OpenClawRadar
OpenAI의 국방부 계약 조건은 잠재적 감시를 포함한 '합법적인 모든 사용'을 허용합니다
News

OpenAI의 국방부 계약 조건은 잠재적 감시를 포함한 '합법적인 모든 사용'을 허용합니다

오픈AI는 '합법적 사용'이라는 문구를 포함한 국방부와의 새로운 조건을 협상했으며, 관계자들에 따르면 이는 군이 기술적으로 합법적인 경우 오픈AI의 기술을 대규모 감시 프로그램에 사용할 수 있도록 허용합니다. 앤트로픽은 두 가지 빨간 선, 즉 미국인에 대한 대규모 감시와 치명적 자율 무기 사용을 거부하며 양보하지 않아 블랙리스트에 올랐습니다.

OpenClawRadar
AI 에이전트는 Cala MCP 서버 테스트에서 자연어보다 구조화된 쿼리를 선호합니다
News

AI 에이전트는 Cala MCP 서버 테스트에서 자연어보다 구조화된 쿼리를 선호합니다

Cala 팀은 자연어 질의, 구조화된 질의 언어, 직접적인 개체/관계 탐색이라는 세 가지 지식 그래프 접근 방법을 갖춘 MCP 서버를 구축했습니다. 에이전트들은 몇 분 안에 자연어를 포기하고, 아무런 프롬프트 없이 구조화된 질의와 그래프 탐색을 선택했습니다.

OpenClawRadar