研究においてOpus 4.6は優れており、Gemini 3.1 Proは予測ベンチマークでより優れた判断力を持つ

✍️ OpenClawRadar📅 公開日: May 7, 2026🔗 Source
研究においてOpus 4.6は優れており、Gemini 3.1 Proは予測ベンチマークでより優れた判断力を持つ
Ad

あるRedditユーザーが、4つのフロンティアモデル(Claude Opus 4.6、GPT-5.4、Gemini 3.1 Pro、Grok 4.20)を2025年10月~12月の1,417の二値予測問題で比較したベンチマーク結果を投稿した。重要な革新点は、パフォーマンスを2つの評価条件に分解したことだ:エージェント的(各モデルがツールを使い自らウェブリサーチを行う)と固定証拠(全モデルがBosseら2026年の標準化手法で作成された約12,000文字のリサーチ資料を受け取る)。

主な発見

  • Opus 4.6はエージェント的条件で劇的に優れる:何を検索すべきか、どのページを読むべきか、関連詳細を抽出するかを見極める能力が高い。しかし、リサーチを除くとその優位性は消える。
  • Gemini 3.1 Proは固定証拠に対してより鋭い判断を示す——予測タスクでの情報の重み付けがより正確。標準化された資料を与えられると較正が実際に改善する一方、Opusの較正は急降下する。
  • GPT-5.4とGrok 4.20は条件間でほとんど変化せず、パフォーマンスが検索戦略にあまり依存しないことを示唆。
  • OpusとGeminiの順位が条件間で逆転したことは、投稿者によれば評価が壊れても偏ってもいないことを示す(偏った評価なら全モデルが同じ方向に動くはず)。

解釈

較正の非対称性——Opusの較正は検索を除くと低下し、Geminiの較正は向上する——は、Opusが検索トレースを確率割り当ての足場として利用している可能性を示唆する。言い換えれば、検索ループの実行自体が、それが表面化する情報とは別に、認識論的な仕事の一部を担っている。これは新しい発見であり、AIリサーチエージェントの評価と設計に影響を与える可能性がある。

Ad

制限とリソース

固定証拠の資料自体がLMによって生成されているため、このテストは抽象的な判断力ではなく、各モデルが特定の標準化された証拠のバージョンをどのように解釈するかを測定している可能性がある。投稿者はこれを制限として指摘するが、モデル間で振る舞いが異なることから懸念は薄れると主張する。

完全な較正スコア、洗練スコア、条件別分析は以下で入手可能:futuresearch.ai/opus-research-gemini-judgment。ベンチマークとリーダーボードは:evals.futuresearch.ai

投稿者の知る限り、これはフロンティアモデルのパフォーマンスをリサーチ段階と判断段階に分解した初めての直接評価である。他の分野での再現を呼びかけている。

📖 全文ソース: r/ClaudeAI

Ad

👀 See Also

GoogleアカウントがOpenClaw統合試行後に停止されました
News

GoogleアカウントがOpenClaw統合試行後に停止されました

開発者がOpenClaw統合のためにAPIアクセスを設定した後、わずか48時間で新規Googleアカウントが停止されました。手動で作成されたにもかかわらず、ボット活動としてフラグが立てられました。

OpenClawRadar
アンドレイ・カーパシー氏、Claudeを用いた再帰的自己改善推進のためAnthropicの事前学習チームに加入
News

アンドレイ・カーパシー氏、Claudeを用いた再帰的自己改善推進のためAnthropicの事前学習チームに加入

OpenAIの共同創業者だったAndrej Karpathyが、Anthropicの事前学習チームにNick Josefの下で参加し、Claudeを用いた事前学習研究を加速し、再帰的自己改善を実現する新チームを立ち上げる。

OpenClawRadar
🦀
News

AIスタートアップの研究発表減少:オープンソースと開発者への影響

トップAIスタートアップが研究発表を大幅に減らしており、分野の透明性と再現性に対する懸念が高まっている。

OpenClawRadar
DatabricksがAIコーディングコストを70%削減:モデルの柔軟性、オープンソース、効率の最前線
News

DatabricksがAIコーディングコストを70%削減:モデルの柔軟性、オープンソース、効率の最前線

Databricksは、効率的なオープンソースモデルの迅速な採用、内部ベンチマークの構築、モデル柔軟性の強制により、AIコーディング支出を70%削減した。主要なレバー:GLMの展開と、コスト回帰によるOpus 5.0の拒否。

OpenClawRadar