Der IDP-Leaderboard-Benchmark zeigt, dass Claude Sonnet 4.6 bei Dokumenten-KI-Aufgaben mit Opus 4.6 gleichzieht.

Das IDP-Leaderboard, ein offener Benchmark für Dokumenten-KI, hat Ergebnisse veröffentlicht, die Claude-Modelle bei Dokumentenverarbeitungsaufgaben vergleichen. Der Benchmark testete 16 Modelle in mehreren Kategorien mit über 9.000 echten Dokumenten.
Benchmark-Ergebnisse
Die Punktzahlen der Claude-Modelle aus dem IDP-Leaderboard:
- Claude Sonnet 4.6: 80,8 insgesamt
- Claude Opus 4.6: 80,3 insgesamt
- Claude Haiku 4.5: 69,6 insgesamt
Sonnet und Opus schnitten bei Extraktionsaufgaben im Wesentlichen gleich gut ab, einschließlich Text, Tabellen, Formeln und Layoutanalyse. Die Radardiagramme beider Modelle sehen laut den Benchmark-Ergebnissen identisch aus.
Kostenvergleich
Die Quelle weist auf erhebliche Kostenunterschiede hin:
- Sonnet kostet 24 US-Dollar pro 1.000 Seiten
- Opus kostet 40 US-Dollar pro 1.000 Seiten
Für Dokumentenverarbeitungs-Workloads legt der Benchmark nahe, dass es keinen Grund gibt, Opus zu verwenden, angesichts der gleichwertigen Leistung bei niedrigeren Kosten.
Wichtiger Hinweis
Eine bemerkenswerte Erkenntnis: Die Claude-Modelle hatten strengere Inhaltsmoderation, die die Leistung bei bestimmten Dokumententypen beeinflusste. Alte Zeitungsscans, Lehrbuchseiten und historische Dokumente lösten manchmal Inhaltsfilter aus. Dieses Problem trat nur in den OlmOCR- und OmniDoc-Benchmarks auf.
Alle Vorhersagen aus dem Benchmark sind im Results Explorer unter idp-leaderboard.org sichtbar, wo Sie genau sehen können, was jedes Claude-Modell bei jedem Dokument ausgegeben hat.
📖 Read the full source: r/ClaudeAI
👀 Siehe auch
Claude verbessert Nullstellenschranke der Riemannschen Vermutung von 41,6 % auf 67,2 %
Eine unveröffentlichte Forschungsversion von Claude verbesserte die untere Schranke für Nullstellen auf der kritischen Linie von 41,6 % auf 67,2 % durch eine neuartige Kombination früherer Arbeiten.

Claude Code v2.1.146: /code-review-Befehl, Paginierungs-Korrektur, Windows-PowerShell-Korrektur
Claude Code v2.1.146 benennt /simplify in /code-review um, mit optionalem Aufwandslevel, behebt MCP-Paginierung und Windows PowerShell-Tool, verbessert die Zuverlässigkeit des Auto-Updaters und die Diff-Rendering-Leistung.

Claude-Code löscht Produktionsdatenbank nach Terraform-State-File-Fehler
Ein Entwickler nutzte Claude Code, um AWS-Infrastruktur mit Terraform zu verwalten, doch eine fehlende Statusdatei führte zu doppelten Ressourcen und einem anschließenden 'destroy'-Befehl, der 2,5 Jahre an Aufzeichnungen inklusive Datenbank-Snapshots löschte.

KI-Codierer laufen mit offenen Laptops herum, um Agenten am Laufen zu halten
Technikbegeisterte tragen Laptops im Clamshell-Modus, damit KI-Codierungsagenten wie Claude Code und OpenAI Codex nicht anhalten. Zu den Tipps gehört die Verwendung von 'caffeinate' auf dem Mac.