Le benchmark IDP Leaderboard montre que Claude Sonnet 4.6 égale Opus 4.6 pour les tâches d'IA documentaire.

Le classement IDP, un benchmark ouvert pour l'IA documentaire, a publié des résultats comparant les modèles Claude sur des tâches de traitement de documents. Le benchmark a testé 16 modèles dans plusieurs catégories en utilisant plus de 9 000 documents réels.
Résultats du benchmark
Les scores des modèles Claude du classement IDP :
- Claude Sonnet 4.6 : 80,8 global
- Claude Opus 4.6 : 80,3 global
- Claude Haiku 4.5 : 69,6 global
Sonnet et Opus ont performé essentiellement de manière équivalente sur les tâches d'extraction incluant le texte, les tableaux, les formules et l'analyse de mise en page. Les graphiques radar des deux modèles sont identiques selon les résultats du benchmark.
Comparaison des coûts
La source note des différences de coût significatives :
- Sonnet coûte 24 $ pour 1 000 pages
- Opus coûte 40 $ pour 1 000 pages
Pour les charges de travail de traitement de documents, le benchmark suggère qu'il n'y a aucune raison d'utiliser Opus étant donné la performance équivalente à un coût inférieur.
Mise en garde importante
Une découverte notable : les modèles Claude avaient une modération de contenu plus stricte qui a affecté la performance sur certains types de documents. Les scans de vieux journaux, les pages de manuels scolaires et les documents historiques ont parfois déclenché des filtres de contenu. Ce problème n'est apparu que dans les benchmarks OlmOCR et OmniDoc.
Toutes les prédictions du benchmark sont visibles dans l'explorateur de résultats à idp-leaderboard.org, où vous pouvez voir exactement ce que chaque modèle Claude a produit sur chaque document.
📖 Read the full source: r/ClaudeAI
👀 See Also

Meta publie le modèle d'IA BOxCrete pour la conception de mélanges de béton
Meta a lancé Bayesian Optimization for Concrete (BOxCrete), un modèle d'IA open source pour concevoir des mélanges de béton durables utilisant des matériaux produits aux États-Unis. Le modèle améliore les versions précédentes avec une meilleure robustesse au bruit et des capacités de prédiction d'affaissement.
Claude Code v2.1.207 : Mode automatique généralement disponible, correction du gel du terminal et renforcement de la sécurité
Le mode automatique est désormais stable sans inscription sur Bedrock/Vertex/Foundry. Correction du gel du terminal lors de longs affichages, d'injections shell dans les plugins, etc.
Claude Code 2.1.233 : prise en charge des MR GitLab, limites de mémoire et correctifs de sécurité
Claude Code v2.1.233 ajoute la prise en charge des URL de merge request GitLab, des limites de mémoire optionnelles pour Bash, et corrige une fuite d'identifiants NTLM et une utilisation CPU excessive.
Débat chez Debian sur la politique de contribution à l'IA/LLM : ce que les développeurs doivent savoir
Debian a commencé à voter sur l'avenir des contributions IA/LLM. Le résultat déterminera comment le code généré par IA sera traité dans les paquets Debian.