SWE-rebench 리더보드 업데이트: 2026년 2월 결과, 치열한 경쟁 양상 보여

SWE-rebench 2026년 2월 결과
SWE-rebench 리더보드가 2026년 2월 실행 결과로 업데이트되었으며, 57개의 새로운 GitHub PR 작업을 대상으로 진행되었습니다. 설정은 표준 SWE-bench 방법론을 따릅니다: 모델은 실제 PR 이슈를 읽고, 코드를 수정하며, 테스트를 실행하고, 전체 테스트 스위트를 통과시켜야 합니다. 작업은 이전 달에 생성된 PR로 제한됩니다.
주요 결과
- Claude Opus 4.6이 65.3% 해결률로 여전히 정상을 유지하며, 강력한 pass@5(~70%)로 기준을 제시하고 있습니다
- 상위 계층은 매우 치열합니다: gpt-5.2-medium (64.4%), GLM-5 (62.8%), gpt-5.4-medium (62.8%) 모두 선두와 몇 포인트 차이 내에 있습니다
- Gemini 3.1 Pro Preview (62.3%)와 DeepSeek-V3.2 (60.9%)가 밀집된 상위 6위를 완성합니다
- 오픈 웨이트/하이브리드 모델은 계속 향상되고 있습니다: Qwen3.5-397B (59.9%), Step-3.5-Flash (59.6%), Qwen3-Coder-Next (54.4%)는 개선된 장문 컨텍스트 활용과 확장성으로 격차를 좁히고 있습니다
- MiniMax M2.5 (54.6%)는 경쟁력 있는 성능과 비용 효율적인 옵션으로 계속 두각을 나타내고 있습니다
전반적으로, 2월 결과는 여러 모델이 선두와 몇 포인트 차이 내에 있는 매우 경쟁적인 최전선을 보여줍니다.
📖 Read the full source: r/LocalLLaMA
👀 See Also

OpenClaw: 실망스러운 경험인가, 설정 오류인가?
사용자들은 공식 지침에 따라 올바르게 설정했음에도 OpenClaw가 단순한 챗봇 상호작용 이상의 성능을 발휘하지 못하는 문제를 보고하고 있습니다.

GitHub, 개발자들의 반발로 인해 Copilot이 풀 리퀘스트에 광고를 삽입하는 기능을 비활성화했습니다.
GitHub이 개발자들이 Raycast와 같은 도구에 대한 광고를 추가하고 있다는 사실을 발견한 후, Copilot이 풀 리퀘스트에 홍보성 '팁'을 삽입하는 기능을 제거했습니다. 언급되었을 때 Copilot이 생성하지 않은 PR을 편집할 수 있도록 했던 이 기능은 커뮤니티 피드백에 따라 비활성화되었습니다.

MCP 대 스킬 논쟁: 역할 이해와 컨텍스트 부패의 실제 문제
레딧 게시물에 따르면 MCP는 AI 에이전트를 위한 도구, 인증, 컨텍스트 조정을 제공하는 반면, 스킬은 에이전트 행동을 정의하는 재사용 가능한 프롬프트입니다. 저자는 두 가지가 모두 필요하며, 에이전트가 지시를 잊어버리는 '컨텍스트 부패'가 중요한 문제라고 지적합니다.

PwC 2026 CEO 설문조사: 56% AI 투자 수익 없어, 12%만 성공
PwC가 95개국 4,454명의 CEO를 대상으로 설문 조사를 실시한 결과, 56%는 AI로 인한 재정적 영향이 전혀 없다고 보고했으며, 단 12%만이 AI를 성공적으로 활용해 비용을 절감하고 매출을 동시에 성장시켰습니다. 성공적인 '선도 기업'들은 AI를 제품과 서비스에 직접 적용할 가능성이 3배 더 높습니다.