Opus 4.7 推論努力ベンチマーク: 実タスクでは中が高と最大を上回る

✍️ OpenClawRadar📅 公開日: May 13, 2026🔗 Source
Ad

Redditユーザーのktane氏は、オープンソースのGraphQL-go-toolsリポジトリから抽出した29の実タスクにおいて、Claude Code内のClaude Opus 4.7を5段階の推論努力(低、中、高、超高、最大)でテストしました。その結果、中程度の推論努力が、テスト合格率、人間作成パッチとの意味的同等性、コードレビュー合格率、および総合的なクラフト/規律スコアのすべてにおいて、より高い設定を一貫して上回りました。

Ad

主な結果

  • 全タスク合格率: 中28/29、最大27/29、高26/29、超高25/29、低23/29
  • 同等のパッチ: 中14/29、最大13/29、高12/29、超高11/29、低10/29
  • コードレビュー合格率: 中10/29、高7/29、最大8/29、超高4/29、低5/29
  • コードレビュールーブリック平均: 中2.716、高2.509、超高2.482、最大2.431、低2.426
  • フットプリントリスク(低いほど良い): 低0.155、中0.189、高0.206、最大0.227、超高0.238
  • タスクあたりのコスト: 低$2.50、中$3.15、高$5.01、超高$6.51、最大$8.84
  • タスクあたりの所要時間: 低383.8秒、中450.7秒、高716.4秒、超高803.8秒、最大996.9秒
  • 1ドルあたりの同等パス数: 低4.0、中4.4、高2.4、超高1.7、最大1.5

著者は、Opus 4.7が適応的思考(adaptive thinking)を採用しており、タスクごとに推論予算をすでに割り当てていると指摘します。そのため、努力ノブは生の知能を追加するのではなく、すでに適応的なポリシーにバイアスをかけています。注目すべきは、PR #1260において、高および超高の設定が、以前のPRからコミットハッシュを掘り起こすことに余分な推論を費やし「作業不要」と結論付けたのに対し、中と最大の設定は正しく制御フローを読み、修正を生成したことです。

これは、推論が増えるほど品質が向上する直感的な単調曲線を示したCodex内のGPT-5.5とは対照的です。タスクごとの詳細を含む完全なインタラクティブレポートは、stet.shでご覧いただけます。

📖 全文ソース: r/ClaudeAI

Ad

👀 See Also

Anthropicがサブスクリプション契約を変更、OpenClawユーザーのエージェント使用料は別途請求に
News

Anthropicがサブスクリプション契約を変更、OpenClawユーザーのエージェント使用料は別途請求に

AnthropicはClaude Maxサブスクリプションの適用範囲を、Claude.aiやClaude Codeなどの自社プラットフォームに限定し、すべてのサードパーティエージェントの利用をトークン単位で課金する「追加利用」として扱うようになりました。ユーザーには4つの選択肢があります:Maxプランを継続して追加料金を支払う、Anthropic APIに切り替える、他のプロバイダーに変更する、またはManifestを使用したインテリジェントなルーティングを利用する。

OpenClawRadar
15のマルチモーダルAIモデルの視覚的推論ベンチマーク結果
News

15のマルチモーダルAIモデルの視覚的推論ベンチマーク結果

AIMultipleは、2つのトラック(チャート理解と視覚的論理)にわたる200の視覚的推論問題で、主要な15のマルチモーダルAIモデルをベンチマークしました。Gemini-3.1-pro-previewとGemini-3-pro-previewが総合結果をリードし、続いてGPT-5.2、Kimi-K2.5、GPT-5.2-proが続きました。

OpenClawRadar
VibeThinker-3B:在AIME数学基准测试中与671B DeepSeek匹敌的3B参数模型
News

VibeThinker-3B:在AIME数学基准测试中与671B DeepSeek匹敌的3B参数模型

Sina Weiboの研究者が発表したVibeThinker-3Bは、3BパラメータでAIME 2026で94.3を記録し、DeepSeek V3.2(671B)に匹敵。論文は「パラメトリック圧縮・カバレッジ仮説」を提唱し、検証可能な推論が小規模モデルに圧縮可能だと主張。

OpenClawRadar
OpenClaw 4月アップデート: 破壊的変更と信頼低下の1ヶ月
News

OpenClaw 4月アップデート: 破壊的変更と信頼低下の1ヶ月

OpenClawの4月のアップデートは、新機能と修正が重大なバグと一緒にリリースされるパターンを示している。インストール後スクリプトによるファイル削除、セキュリティホール、壊れたスキルが信頼を損なっている。

OpenClawRadar