Le benchmark IDP Leaderboard montre que Claude Sonnet 4.6 égale Opus 4.6 pour les tâches d'IA documentaire.

✍️ OpenClawRadar📅 Publié: March 11, 2026🔗 Source
Le benchmark IDP Leaderboard montre que Claude Sonnet 4.6 égale Opus 4.6 pour les tâches d'IA documentaire.
Ad

Le classement IDP, un benchmark ouvert pour l'IA documentaire, a publié des résultats comparant les modèles Claude sur des tâches de traitement de documents. Le benchmark a testé 16 modèles dans plusieurs catégories en utilisant plus de 9 000 documents réels.

Résultats du benchmark

Les scores des modèles Claude du classement IDP :

  • Claude Sonnet 4.6 : 80,8 global
  • Claude Opus 4.6 : 80,3 global
  • Claude Haiku 4.5 : 69,6 global

Sonnet et Opus ont performé essentiellement de manière équivalente sur les tâches d'extraction incluant le texte, les tableaux, les formules et l'analyse de mise en page. Les graphiques radar des deux modèles sont identiques selon les résultats du benchmark.

Comparaison des coûts

La source note des différences de coût significatives :

  • Sonnet coûte 24 $ pour 1 000 pages
  • Opus coûte 40 $ pour 1 000 pages

Pour les charges de travail de traitement de documents, le benchmark suggère qu'il n'y a aucune raison d'utiliser Opus étant donné la performance équivalente à un coût inférieur.

Ad

Mise en garde importante

Une découverte notable : les modèles Claude avaient une modération de contenu plus stricte qui a affecté la performance sur certains types de documents. Les scans de vieux journaux, les pages de manuels scolaires et les documents historiques ont parfois déclenché des filtres de contenu. Ce problème n'est apparu que dans les benchmarks OlmOCR et OmniDoc.

Toutes les prédictions du benchmark sont visibles dans l'explorateur de résultats à idp-leaderboard.org, où vous pouvez voir exactement ce que chaque modèle Claude a produit sur chaque document.

📖 Read the full source: r/ClaudeAI

Ad

👀 See Also

Exploration de Step 3.5 Flash : Modèle Open-Source pour un Raisonnement Profond Rapide
News

Exploration de Step 3.5 Flash : Modèle Open-Source pour un Raisonnement Profond Rapide

Step 3.5 Flash est un modèle de base open-source conçu pour un raisonnement profond rapide et efficace, utilisant une architecture éparse de Mélange d'Experts.

OpenClawRadar
Les utilisateurs d'OpenClaw signalent des coûts d'API élevés dus à des requêtes vagues, le développeur conseille des flux de travail structurés.
News

Les utilisateurs d'OpenClaw signalent des coûts d'API élevés dus à des requêtes vagues, le développeur conseille des flux de travail structurés.

Un utilisateur de Reddit signale une facture de 300 $ d'Anthropic due à OpenClaw suite à des instructions vagues, la communauté soulignant que l'orchestrateur fonctionne mieux avec des intentions claires et des flux de travail structurés plutôt qu'en tant que 'génie' pour des souhaits irréalistes.

OpenClawRadar
Devenir ingénieur IA à plein temps : ne plus toucher au code
News

Devenir ingénieur IA à plein temps : ne plus toucher au code

Max Heyer décrit un workflow où les agents écrivent tout le code, lui se contente de lire les diffs, rédiger les spécifications et faire la relecture. La compétence qui compte est le goût — évaluer le code est plus difficile que le produire.

OpenClawRadar
Les utilisateurs de Claude Code atteignent les limites d'utilisation plus vite que prévu, des bogues sont soupçonnés.
News

Les utilisateurs de Claude Code atteignent les limites d'utilisation plus vite que prévu, des bogues sont soupçonnés.

Anthropic reconnaît que les utilisateurs de Claude Code épuisent leurs quotas 'bien plus rapidement que prévu', avec des utilisateurs signalant des limites atteintes en quelques heures. Des bogues présumés dans la mise en cache des invites pourraient gonfler les coûts de 10 à 20 fois, et le rétrogradage vers la version 2.1.34 semblerait aider.

OpenClawRadar