Der IDP-Leaderboard-Benchmark zeigt, dass Claude Sonnet 4.6 bei Dokumenten-KI-Aufgaben mit Opus 4.6 gleichzieht.

Das IDP-Leaderboard, ein offener Benchmark für Dokumenten-KI, hat Ergebnisse veröffentlicht, die Claude-Modelle bei Dokumentenverarbeitungsaufgaben vergleichen. Der Benchmark testete 16 Modelle in mehreren Kategorien mit über 9.000 echten Dokumenten.
Benchmark-Ergebnisse
Die Punktzahlen der Claude-Modelle aus dem IDP-Leaderboard:
- Claude Sonnet 4.6: 80,8 insgesamt
- Claude Opus 4.6: 80,3 insgesamt
- Claude Haiku 4.5: 69,6 insgesamt
Sonnet und Opus schnitten bei Extraktionsaufgaben im Wesentlichen gleich gut ab, einschließlich Text, Tabellen, Formeln und Layoutanalyse. Die Radardiagramme beider Modelle sehen laut den Benchmark-Ergebnissen identisch aus.
Kostenvergleich
Die Quelle weist auf erhebliche Kostenunterschiede hin:
- Sonnet kostet 24 US-Dollar pro 1.000 Seiten
- Opus kostet 40 US-Dollar pro 1.000 Seiten
Für Dokumentenverarbeitungs-Workloads legt der Benchmark nahe, dass es keinen Grund gibt, Opus zu verwenden, angesichts der gleichwertigen Leistung bei niedrigeren Kosten.
Wichtiger Hinweis
Eine bemerkenswerte Erkenntnis: Die Claude-Modelle hatten strengere Inhaltsmoderation, die die Leistung bei bestimmten Dokumententypen beeinflusste. Alte Zeitungsscans, Lehrbuchseiten und historische Dokumente lösten manchmal Inhaltsfilter aus. Dieses Problem trat nur in den OlmOCR- und OmniDoc-Benchmarks auf.
Alle Vorhersagen aus dem Benchmark sind im Results Explorer unter idp-leaderboard.org sichtbar, wo Sie genau sehen können, was jedes Claude-Modell bei jedem Dokument ausgegeben hat.
📖 Read the full source: r/ClaudeAI
👀 Siehe auch

AWS Lambda MicroVMs: VM-Isolierung für Benutzer- und KI-generierten Code mit Suspend/Resume bis zu 8 Stunden
AWS startet Lambda MicroVMs, eine serverlose Compute-Primitive auf Basis von Firecracker, die pro Benutzer VM-Isolation, nahezu sofortigen Start und bis zu 8 Stunden Zustandsspeicherung für die Ausführung von benutzer- oder KI-generiertem Code bietet.

Absolventen buhen KI-Ermunterungen bei Abschlussfeiern aus: Ein Zeichen der Entwicklerstimmung
Hochschulabsolventen buhten Redner aus, die bei Abschlussfeiern für KI-Begeisterung warben. Dies spiegelt die verbreitete Besorgnis über die Auswirkungen von KI auf Arbeitsplätze und die Gesellschaft wider.

Claude übertrifft Gemini, ChatGPT und Grok bei einer Echtzeit-Python-Codierherausforderung
Ein Entwickler testete Claude, Gemini, ChatGPT und Grok in einem Echtzeit-Python-Codierungsturnier, bei dem KI-generierte Bots um Wörter auf einem 15×15-Buchstabenraster kämpften. Claude gewann überlegen.

Claude Skills vs. MCP: Eine praktische Grenzfrage für Entwickler
Ein Entwickler stellt die Frage, wo der Mehrwert von MCP entscheidend wird gegenüber Claude Skills, nachdem die Skills-Veröffentlichung die Integration von Werkzeugen erschwert hat, und merkt an, dass gut strukturierte Anweisungen oft ausreichen, ohne Protokollgrenzen zu benötigen.