IDPリーダーボードのベンチマークによると、Claude Sonnet 4.6は文書AIタスクにおいてOpus 4.6と同等の性能を示しています

ドキュメントAIのオープンベンチマークであるIDPリーダーボードが、ドキュメント処理タスクにおけるClaudeモデルの比較結果を公開しました。このベンチマークでは、9,000以上の実ドキュメントを使用して、複数のカテゴリーで16のモデルをテストしました。
ベンチマーク結果
IDPリーダーボードによるClaudeモデルのスコア:
- Claude Sonnet 4.6: 総合80.8
- Claude Opus 4.6: 総合80.3
- Claude Haiku 4.5: 総合69.6
SonnetとOpusは、テキスト、表、数式、レイアウト分析を含む抽出タスクでほぼ同等の性能を示しました。ベンチマーク結果によると、両モデルのレーダーチャートは同一に見えるとのことです。
コスト比較
ソースでは、以下のような大きなコスト差が指摘されています:
- Sonnet: 1,000ページあたり24ドル
- Opus: 1,000ページあたり40ドル
ドキュメント処理ワークロードにおいては、同等の性能をより低コストで実現できるため、Opusを使用する理由はないとベンチマークは示唆しています。
重要な注意点
注目すべき発見として、Claudeモデルにはより厳格なコンテンツモデレーションがあり、特定のドキュメントタイプの性能に影響を与えました。古い新聞のスキャン、教科書のページ、歴史的文書などがコンテンツフィルターをトリガーすることがありました。この問題は、OlmOCRとOmniDocのベンチマークでのみ発生しました。
ベンチマークのすべての予測結果は、idp-leaderboard.orgのResults Explorerで確認でき、各Claudeモデルが各ドキュメントに対して出力した内容を正確に確認できます。
📖 Read the full source: r/ClaudeAI
👀 See Also

ディストピアベンチ拡張版:6種のディストピアタイプで42モデルをテスト — Claude Opus 4.7が全モデルを凌駕
DystopiaBenchにハクスリー・モジュールとボードリヤール・モジュールが追加され、GPT-5.5、Gemini 3.1 Pro、Grok 4.3、GLM-5.1を含む42モデルがテストされました。Claude Opus 4.7は、すべてのシナリオでL4-L5の有害なリクエストを一貫して拒否しますが、他のモデルはL4またはL5にまで従うことがあります。

Claude Sonnet 4.5 でエラー増加中 — 状況アップデート
Claude Sonnet 4.5は、2026年4月28日13:29:56 UTC時点でエラー率が高くなっています。最新情報はステータスページとReddit megathreadをご確認ください。

AIの手頃さの危機:OpenAIとAnthropic、1ドル稼ぐのに8〜14ドルを燃焼
DSHRの分析によると、AIプラットフォームはトークンを40~70倍に補助している。OpenAIは2025年に130億ドルの収益に対し385億ドルの損失を計上し、売上・マーケティングに44%を費やしている。

OpenClaw 2026.3.2 リリース:プロダクションの秘訣、PDFツール、そしてより安全なデフォルト設定
OpenClaw 2026.3.2では、フェイルファースト動作を備えた本番環境対応のシークレットシステム、AnthropicおよびGoogleモデルをサポートするネイティブPDFツール、新規インストール時のツールアクセスを制限するより安全なデフォルト設定が導入されました。