SWE-rebenchリーダーボード更新:2026年2月の結果は接戦を明らかに

SWE-rebench 2026年2月結果
SWE-rebenchリーダーボードが、57の新規GitHub PRタスクに対する2026年2月の実行結果で更新されました。設定は標準的なSWE-bench手法に従っています:モデルは実際のPR課題を読み、コードを編集し、テストを実行し、完全なテストスイートをパスする必要があります。タスクは前月に作成されたPRに限定されています。
主な結果
- Claude Opus 4.6は65.3%の解決率でトップを維持し、強力なpass@5(約70%)でペースをリードし続けています
- トップ層は非常に接戦です:gpt-5.2-medium(64.4%)、GLM-5(62.8%)、gpt-5.4-medium(62.8%)はすべてリーダーから数ポイント以内に収まっています
- Gemini 3.1 Pro Preview(62.3%)とDeepSeek-V3.2(60.9%)が、密集した上位6位を締めくくっています
- オープンウェイト/ハイブリッドモデルは改善を続けています:Qwen3.5-397B(59.9%)、Step-3.5-Flash(59.6%)、Qwen3-Coder-Next(54.4%)は、改善された長文脈の活用とスケーリングにより差を縮めています
- MiniMax M2.5(54.6%)は、競争力のある性能を持つコスト効率の良い選択肢として引き続き際立っています
全体として、2月は複数のモデルがリーダーから数ポイント以内に収まる、非常に競争の激しい最先端を示しています。
📖 Read the full source: r/LocalLLaMA
👀 See Also

オープンクロー・ゲートウェイの信頼性問題:25日間の過酷な使用後のサイレント障害
OpenClawユーザーが18以上のcronジョブとTelegram統合で約25日間システムを毎日実行した詳細なレポートにより、ゲートウェイが「ゾンビ化」状態に入る重要なパターンが特定されました。この状態では、実行中と表示されるものの、すべての機能が停止します。ユーザーは、セッション書き込みロックが無期限に保持される、cronジョブが幽霊的な実行状態で固まる、無効な構成でサイレント障害が発生するなどの具体的な問題を文書化しています。

クロードコードのソースコードが流出したと報じられ、エージェントのアーキテクチャ詳細が明らかになったとのことです。
AnthropicのAIコーディングエージェント「Claude Code」のソースコードが流出した模様で、システムプロンプト、エージェントループの実装、ツール呼び出しインフラを含む完全なリポジトリが含まれているとのことです。

Kimi K2.6 対 Claude Opus 4.7:Minetest Mod + Google Sheets連携による実践的コーディング対決
開発者がKimi K2.6とClaude Opus 4.7を、TypeScriptバックエンドとGoogle Sheetsログ機能を持つMinetestのバウンティボードMOD構築でテスト。Opusは両方のタスクを達成、Kimiはローカルタスクは合格したが統合タスクは失敗。コスト:Opus約$3.59(ローカル)、$16.03(統合);Kimi $0.39(ローカル)、$5.03(失敗)。

クロードのミニマックス論争とアンソロピックの市場ギャップ分析
Claudeは、MiniMaxが数百万のAPIコールに対して支払いを行うことで合法的にトレーニングデータを取得したと主張し、Anthropicの製品ラインナップには安価で持続的なオーケストレーター向けのギャップがあると指摘しています。