SWE-rebenchリーダーボード更新:2026年2月の結果は接戦を明らかに

Ad
SWE-rebench 2026年2月結果
SWE-rebenchリーダーボードが、57の新規GitHub PRタスクに対する2026年2月の実行結果で更新されました。設定は標準的なSWE-bench手法に従っています:モデルは実際のPR課題を読み、コードを編集し、テストを実行し、完全なテストスイートをパスする必要があります。タスクは前月に作成されたPRに限定されています。
主な結果
- Claude Opus 4.6は65.3%の解決率でトップを維持し、強力なpass@5(約70%)でペースをリードし続けています
- トップ層は非常に接戦です:gpt-5.2-medium(64.4%)、GLM-5(62.8%)、gpt-5.4-medium(62.8%)はすべてリーダーから数ポイント以内に収まっています
- Gemini 3.1 Pro Preview(62.3%)とDeepSeek-V3.2(60.9%)が、密集した上位6位を締めくくっています
- オープンウェイト/ハイブリッドモデルは改善を続けています:Qwen3.5-397B(59.9%)、Step-3.5-Flash(59.6%)、Qwen3-Coder-Next(54.4%)は、改善された長文脈の活用とスケーリングにより差を縮めています
- MiniMax M2.5(54.6%)は、競争力のある性能を持つコスト効率の良い選択肢として引き続き際立っています
全体として、2月は複数のモデルがリーダーから数ポイント以内に収まる、非常に競争の激しい最先端を示しています。
📖 Read the full source: r/LocalLLaMA
Ad
👀 See Also

News
Claude Code v2.1.186: MCP CLI認証、Bash自動応答、20以上の修正
Claude Code v2.1.186 では、CLI からの MCP 認証、bash コマンドへの自動応答、スリープ復帰やサブエージェント権限など 20 以上のバグ修正を実施。
OpenClawRadar
🦀
News
ニューオーリンズ、911通報トリアージにCarbyne AIを試験導入 — 緊急テクノロジーへの影響
ニューオーリンズは、同じ事件に関する繰り返しの電話を処理するためにCarbyneのAI緊急通報トリアージを試験導入し、ディスパッチャーの負担を軽減している。AIは発信者に既知の事件について電話しているか尋ね、はいならAIが情報を提供し、いいえなら人間に転送する。
OpenClawRadar

News
Zigプロジェクトが厳格な反LLM寄稿方針を採用する根拠
ZigはLLM支援によるコントリビューション(問題報告、PR、コメント)を全面的に禁止している。VPのLoris Cro氏は「コントリビューターポーカー」の哲学を説明する。PRのレビューはコードを取り込むためだけでなく、信頼できるコントリビューターを育成するための投資であると述べている。
OpenClawRadar

News
OpenAIのトレーニングコストは、年間でAnthropicの4〜5倍を超えると予測されています
ウォール・ストリート・ジャーナルが報じた機密財務資料によると、OpenAIは今後5年間、毎年Anthropicの4〜5倍のトレーニング費用を支出する見込みです。この支出規模は、驚異的と表現されています。
OpenClawRadar