Claude Opus 4.1は、SWE-Bench Proのプライベートデータセットにおいて17.75%のスコアを記録し、記憶力と推論力のギャップを浮き彫りにしました。

✍️ OpenClawRadar📅 公開日: March 9, 2026🔗 Source
Claude Opus 4.1は、SWE-Bench Proのプライベートデータセットにおいて17.75%のスコアを記録し、記憶力と推論力のギャップを浮き彫りにしました。
Ad

ベンチマーク結果が示す大きなパフォーマンスギャップ

Claude Opus 4.1はSWE-Bench Verifiedで80%以上を達成しましたが、SWE-Bench Proのプライベートデータセットではわずか17.75%のスコアでした。このデータセットには、GitHub上に一度も公開されたことのない18のプロプライエタリなスタートアップコードベースから抽出された276のタスクが含まれており、GPLライセンスの公開リポジトリを通じたデータ汚染を排除するために特別に設計されています。

同じプライベートデータセットにおける他のモデルの結果:GPT-5.2は23.81%(リーダーボードトップ)、Gemini 3 Proは17.95%を獲得しました。

軌跡分析が記憶依存の行動を明らかに

Scale AIの分析によると、テスト中にモデルは、馴染みのあるリポジトリでは問題の説明を完全に読む前に修正すべき正しいファイルパスを特定できていました。これは、問題を推論して解決するのではなく、記憶に基づいてナビゲートしていたことを示しています。

SWE-Bench Verifiedでの80%のスコアは実際のものでしたが、ほとんどの人が想定していた能力とは異なるものを測定していました。主に新しいコードについて推論するのではなく、トレーニングデータの記憶を測定していたのです。

AIコーディングツール導入における実用的な示唆

開発者がワークフローのどこにAIコーディングツールを導入するかを決定する際には、見出しのベンチマーク数値よりも、記憶と推論の区別の方が重要です。汚染されたベンチマークで良好なパフォーマンスを示すモデルでも、トレーニング中に見たことのない真に新しいコードベースでは苦戦する可能性があります。

SWE-Bench Proは、GitHubやトレーニングデータセットに一度も公開されたことのないコードを使用することで、この汚染問題に対処するために特別に作成されました。

📖 完全なソースを読む: r/ClaudeAI

Ad

👀 See Also

カイザー看護師、AI監視が患者ケアを低下させると主張、契約交渉を控え
News

カイザー看護師、AI監視が患者ケアを低下させると主張、契約交渉を控え

カイザー・パーマネンテの看護師らが、AIによる職場監視(通話時間追跡、生産性予測、共感スコアリング)により患者対応を急がされ、ケアの質が損なわれていると報告。自殺企図の患者との15分超の通話が管理職の批判を招いた事例も。

OpenClawRadar
深圳市龍崗区、AIエージェントスタートアップ向けにOpenClaw補助金を提案
News

深圳市龍崗区、AIエージェントスタートアップ向けにOpenClaw補助金を提案

深セン市龍崗区は、OpenClawエコシステムの開発と一人会社(OPC)スタートアップを対象とした補助金と支援を提供する政策文書の草案を発表し、AIエージェント起業の世界的ハブとなることを目指しています。

OpenClawRadar
Claudeのソースコード流出により、autoDreamメモリシステムとマルチエージェントパターンが明らかになりました
News

Claudeのソースコード流出により、autoDreamメモリシステムとマルチエージェントパターンが明らかになりました

Anthropicは、npmソースマップにClaude CodeのTypeScriptソースを誤って含めて公開してしまい、autoDreamメモリ統合、モジュラーシステムプロンプトアーキテクチャ、マルチエージェントコーディネータパターンを明らかにしました。

OpenClawRadar
NYTマガジン、小規模ビジネスでのOpenClaw実用事例を取材 — Redditから共有されたギフト記事
News

NYTマガジン、小規模ビジネスでのOpenClaw実用事例を取材 — Redditから共有されたギフト記事

New York Times Magazineの記事で、OpenClawのユーザーがビジネスでのAIエージェント活用について語っています。元々はRedditの投稿から始まりました。無料ギフトリンク付き。

OpenClawRadar