SWE-rebench 리더보드 업데이트: 2026년 2월 결과, 치열한 경쟁 양상 보여

SWE-rebench 2026년 2월 결과
SWE-rebench 리더보드가 2026년 2월 실행 결과로 업데이트되었으며, 57개의 새로운 GitHub PR 작업을 대상으로 진행되었습니다. 설정은 표준 SWE-bench 방법론을 따릅니다: 모델은 실제 PR 이슈를 읽고, 코드를 수정하며, 테스트를 실행하고, 전체 테스트 스위트를 통과시켜야 합니다. 작업은 이전 달에 생성된 PR로 제한됩니다.
주요 결과
- Claude Opus 4.6이 65.3% 해결률로 여전히 정상을 유지하며, 강력한 pass@5(~70%)로 기준을 제시하고 있습니다
- 상위 계층은 매우 치열합니다: gpt-5.2-medium (64.4%), GLM-5 (62.8%), gpt-5.4-medium (62.8%) 모두 선두와 몇 포인트 차이 내에 있습니다
- Gemini 3.1 Pro Preview (62.3%)와 DeepSeek-V3.2 (60.9%)가 밀집된 상위 6위를 완성합니다
- 오픈 웨이트/하이브리드 모델은 계속 향상되고 있습니다: Qwen3.5-397B (59.9%), Step-3.5-Flash (59.6%), Qwen3-Coder-Next (54.4%)는 개선된 장문 컨텍스트 활용과 확장성으로 격차를 좁히고 있습니다
- MiniMax M2.5 (54.6%)는 경쟁력 있는 성능과 비용 효율적인 옵션으로 계속 두각을 나타내고 있습니다
전반적으로, 2월 결과는 여러 모델이 선두와 몇 포인트 차이 내에 있는 매우 경쟁적인 최전선을 보여줍니다.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Claude Code v2.1.195: 후크 매처 수정, 마우스 비활성화 환경 변수, 음성 받아쓰기 수정
Claude Code v2.1.195는 하이픈이 포함된 식별자를 정확히 일치하도록 후크 매처를 수정하고, CLAUDE_CODE_DISABLE_MOUSE_CLICKS 환경 변수를 추가하며, 음성 받아쓰기와 백그라운드 작업을 개선합니다.

클로드, 이제 어도비 크리에이티브 클라우드, 블렌더, 에이블톤 등에 연결
Anthropic이 Claude가 Adobe Creative Cloud, Affinity, Blender, Ableton, Splice, Autodesk와 통합될 수 있는 커넥터를 출시하여 자연어로 앱 제어 및 데이터 검색을 가능하게 했습니다.

Kimi K2.6, 공격적인 슬라이딩 전략으로 코딩 챌린지에서 Claude, GPT-5.5, Gemini 제쳐
AI 코딩 대회의 12일차 Word Gem Puzzle에서 Moonshot AI의 오픈 가중치 모델 Kimi K2.6이 22매치 포인트(7-1-0)를 기록하며 GPT-5.5(16), Claude Opus 4.7(12), Gemini Pro 3.1(9)을 앞질렀습니다. MiMo V2-Pro가 2위를 차지했습니다. Kimi는 공격적인 슬라이딩으로 승리했습니다.

바둑 기사들이 AI에 자발적으로 권한을 내주다: 부정 행위가 감지 불가능해진 방법
LessWrong 게시물은 AI가 바둑 대회에서 어떻게 부정 행위를 만연하게 만들고 처벌이 거의 불가능해졌는지 자세히 설명하며, Carlo Metta가 Leela 0.11과 Leela Zero를 사용하여 여러 시즌 동안 26경기 중 25승을 거두고 카메라 감시 아래에서만 한 번 패배한 사례를 사용합니다.