Der IDP-Leaderboard-Benchmark zeigt, dass Claude Sonnet 4.6 bei Dokumenten-KI-Aufgaben mit Opus 4.6 gleichzieht.

✍️ OpenClawRadar📅 Veröffentlicht: 11. März 2026🔗 Source
Der IDP-Leaderboard-Benchmark zeigt, dass Claude Sonnet 4.6 bei Dokumenten-KI-Aufgaben mit Opus 4.6 gleichzieht.
Ad

Das IDP-Leaderboard, ein offener Benchmark für Dokumenten-KI, hat Ergebnisse veröffentlicht, die Claude-Modelle bei Dokumentenverarbeitungsaufgaben vergleichen. Der Benchmark testete 16 Modelle in mehreren Kategorien mit über 9.000 echten Dokumenten.

Benchmark-Ergebnisse

Die Punktzahlen der Claude-Modelle aus dem IDP-Leaderboard:

  • Claude Sonnet 4.6: 80,8 insgesamt
  • Claude Opus 4.6: 80,3 insgesamt
  • Claude Haiku 4.5: 69,6 insgesamt

Sonnet und Opus schnitten bei Extraktionsaufgaben im Wesentlichen gleich gut ab, einschließlich Text, Tabellen, Formeln und Layoutanalyse. Die Radardiagramme beider Modelle sehen laut den Benchmark-Ergebnissen identisch aus.

Kostenvergleich

Die Quelle weist auf erhebliche Kostenunterschiede hin:

  • Sonnet kostet 24 US-Dollar pro 1.000 Seiten
  • Opus kostet 40 US-Dollar pro 1.000 Seiten

Für Dokumentenverarbeitungs-Workloads legt der Benchmark nahe, dass es keinen Grund gibt, Opus zu verwenden, angesichts der gleichwertigen Leistung bei niedrigeren Kosten.

Ad

Wichtiger Hinweis

Eine bemerkenswerte Erkenntnis: Die Claude-Modelle hatten strengere Inhaltsmoderation, die die Leistung bei bestimmten Dokumententypen beeinflusste. Alte Zeitungsscans, Lehrbuchseiten und historische Dokumente lösten manchmal Inhaltsfilter aus. Dieses Problem trat nur in den OlmOCR- und OmniDoc-Benchmarks auf.

Alle Vorhersagen aus dem Benchmark sind im Results Explorer unter idp-leaderboard.org sichtbar, wo Sie genau sehen können, was jedes Claude-Modell bei jedem Dokument ausgegeben hat.

📖 Read the full source: r/ClaudeAI

Ad

👀 Siehe auch

AWS Lambda MicroVMs: VM-Isolierung für Benutzer- und KI-generierten Code mit Suspend/Resume bis zu 8 Stunden
Nachrichten

AWS Lambda MicroVMs: VM-Isolierung für Benutzer- und KI-generierten Code mit Suspend/Resume bis zu 8 Stunden

AWS startet Lambda MicroVMs, eine serverlose Compute-Primitive auf Basis von Firecracker, die pro Benutzer VM-Isolation, nahezu sofortigen Start und bis zu 8 Stunden Zustandsspeicherung für die Ausführung von benutzer- oder KI-generiertem Code bietet.

OpenClawRadar
Absolventen buhen KI-Ermunterungen bei Abschlussfeiern aus: Ein Zeichen der Entwicklerstimmung
Nachrichten

Absolventen buhen KI-Ermunterungen bei Abschlussfeiern aus: Ein Zeichen der Entwicklerstimmung

Hochschulabsolventen buhten Redner aus, die bei Abschlussfeiern für KI-Begeisterung warben. Dies spiegelt die verbreitete Besorgnis über die Auswirkungen von KI auf Arbeitsplätze und die Gesellschaft wider.

OpenClawRadar
Claude übertrifft Gemini, ChatGPT und Grok bei einer Echtzeit-Python-Codierherausforderung
Nachrichten

Claude übertrifft Gemini, ChatGPT und Grok bei einer Echtzeit-Python-Codierherausforderung

Ein Entwickler testete Claude, Gemini, ChatGPT und Grok in einem Echtzeit-Python-Codierungsturnier, bei dem KI-generierte Bots um Wörter auf einem 15×15-Buchstabenraster kämpften. Claude gewann überlegen.

OpenClawRadar
Claude Skills vs. MCP: Eine praktische Grenzfrage für Entwickler
Nachrichten

Claude Skills vs. MCP: Eine praktische Grenzfrage für Entwickler

Ein Entwickler stellt die Frage, wo der Mehrwert von MCP entscheidend wird gegenüber Claude Skills, nachdem die Skills-Veröffentlichung die Integration von Werkzeugen erschwert hat, und merkt an, dass gut strukturierte Anweisungen oft ausreichen, ohne Protokollgrenzen zu benötigen.

OpenClawRadar