IDPリーダーボードのベンチマークによると、Claude Sonnet 4.6は文書AIタスクにおいてOpus 4.6と同等の性能を示しています

✍️ OpenClawRadar📅 公開日: March 11, 2026🔗 Source
IDPリーダーボードのベンチマークによると、Claude Sonnet 4.6は文書AIタスクにおいてOpus 4.6と同等の性能を示しています
Ad

ドキュメントAIのオープンベンチマークであるIDPリーダーボードが、ドキュメント処理タスクにおけるClaudeモデルの比較結果を公開しました。このベンチマークでは、9,000以上の実ドキュメントを使用して、複数のカテゴリーで16のモデルをテストしました。

ベンチマーク結果

IDPリーダーボードによるClaudeモデルのスコア:

  • Claude Sonnet 4.6: 総合80.8
  • Claude Opus 4.6: 総合80.3
  • Claude Haiku 4.5: 総合69.6

SonnetとOpusは、テキスト、表、数式、レイアウト分析を含む抽出タスクでほぼ同等の性能を示しました。ベンチマーク結果によると、両モデルのレーダーチャートは同一に見えるとのことです。

コスト比較

ソースでは、以下のような大きなコスト差が指摘されています:

  • Sonnet: 1,000ページあたり24ドル
  • Opus: 1,000ページあたり40ドル

ドキュメント処理ワークロードにおいては、同等の性能をより低コストで実現できるため、Opusを使用する理由はないとベンチマークは示唆しています。

重要な注意点

注目すべき発見として、Claudeモデルにはより厳格なコンテンツモデレーションがあり、特定のドキュメントタイプの性能に影響を与えました。古い新聞のスキャン、教科書のページ、歴史的文書などがコンテンツフィルターをトリガーすることがありました。この問題は、OlmOCRとOmniDocのベンチマークでのみ発生しました。

ベンチマークのすべての予測結果は、idp-leaderboard.orgのResults Explorerで確認でき、各Claudeモデルが各ドキュメントに対して出力した内容を正確に確認できます。

📖 Read the full source: r/ClaudeAI

Ad

👀 See Also

Coinbase x402 対 Google A2A: エージェント間決済における二つの相反する支払い順序
News

Coinbase x402 対 Google A2A: エージェント間決済における二つの相反する支払い順序

エージェント間決済の設計で、Coinbaseのx402は作業後に決済(検証→実行→決済)、GoogleのA2Aは作業前に決済(検証→決済→実行)するという根本的な違いがある。

OpenClawRadar
Anthropicのプラットフォーム戦略とOpenClawの対応
News

Anthropicのプラットフォーム戦略とOpenClawの対応

ある開発者がAnthropicが最近行った外部Claude連携への制限を分析し、価格や法的問題ではなく、典型的なプラットフォーム企業戦略として捉え、プロバイダーの好意に依存するのではなく、ポータブルなスタックを構築すべきだと主張しています。

OpenClawRadar
アップルのAI戦略と知性の商品化
News

アップルのAI戦略と知性の商品化

この記事は、知性が商品化される中で、Appleの保守的なAIへのアプローチが有利になる可能性があると論じています。例えば、Gemma4のようなモデルはスマートフォン上で動作しながらMMLU Proで85.2%を達成し、OpenAIのSoraは1日あたり210万ドルの収益に対して1500万ドルのコストがかかっています。

OpenClawRadar
オープンソースモデルは、ベンチマークでClaude Opus 4.6に匹敵するか、あるいは上回る性能を示しています。
News

オープンソースモデルは、ベンチマークでClaude Opus 4.6に匹敵するか、あるいは上回る性能を示しています。

DeepSeek V3.2、DeepSeek R1、Kimi K2.5、MiniMax M2.5は、MMLU-Pro、速度、ツール使用、推論を含む5つの主要ベンチマークのうち4つでClaude Opus 4.6を上回り、大幅に低コストです。

OpenClawRadar