Le benchmark IDP Leaderboard montre que Claude Sonnet 4.6 égale Opus 4.6 pour les tâches d'IA documentaire.

Le classement IDP, un benchmark ouvert pour l'IA documentaire, a publié des résultats comparant les modèles Claude sur des tâches de traitement de documents. Le benchmark a testé 16 modèles dans plusieurs catégories en utilisant plus de 9 000 documents réels.
Résultats du benchmark
Les scores des modèles Claude du classement IDP :
- Claude Sonnet 4.6 : 80,8 global
- Claude Opus 4.6 : 80,3 global
- Claude Haiku 4.5 : 69,6 global
Sonnet et Opus ont performé essentiellement de manière équivalente sur les tâches d'extraction incluant le texte, les tableaux, les formules et l'analyse de mise en page. Les graphiques radar des deux modèles sont identiques selon les résultats du benchmark.
Comparaison des coûts
La source note des différences de coût significatives :
- Sonnet coûte 24 $ pour 1 000 pages
- Opus coûte 40 $ pour 1 000 pages
Pour les charges de travail de traitement de documents, le benchmark suggère qu'il n'y a aucune raison d'utiliser Opus étant donné la performance équivalente à un coût inférieur.
Mise en garde importante
Une découverte notable : les modèles Claude avaient une modération de contenu plus stricte qui a affecté la performance sur certains types de documents. Les scans de vieux journaux, les pages de manuels scolaires et les documents historiques ont parfois déclenché des filtres de contenu. Ce problème n'est apparu que dans les benchmarks OlmOCR et OmniDoc.
Toutes les prédictions du benchmark sont visibles dans l'explorateur de résultats à idp-leaderboard.org, où vous pouvez voir exactement ce que chaque modèle Claude a produit sur chaque document.
📖 Read the full source: r/ClaudeAI
👀 See Also

Zombification des universités par l'IA : Témoignage direct de la triche par LLM dans les grandes écoles
Une analyse de la manière dont les LLM détruisent systématiquement l'intégrité académique dans les universités d'élite, avec des exemples concrets de l'UChicago : des écarts de 40 points entre les examens à emporter et les examens en présentiel, des étudiants photographiant les épreuves pendant les tests, et des professeurs rédigeant leurs cours avec ChatGPT.

Analyse du 'Clausage' : Modèles d'Anxiété des Utilisateurs dans les Abonnements à l'IA
Une analyse utilisateur identifie le 'Clausage' ou 'Le Syndrome Claude' – des schémas comportementaux où les abonnés premium à l'IA éprouvent une anxiété chronique d'utilisation, un comportement d'évitement et une surveillance compulsive des ressources. La source détaille des symptômes spécifiques comme l'évitement anticipatoire, l'hypervigilance d'utilisation et la sous-utilisation paradoxale des services payants.

Bench du cache KV Qwen 3.6-35B-A3B : f16 vs q8_0 vs Turbo3 vs Turbo4 sur M5 Max jusqu'à 1M de contexte
Les benchmarks du fork TurboQuant Metal de TheTom sur M5 Max montrent que f16 et q8_0 manquent de mémoire au-delà de 256K, tandis que turbo3 atteint 1M à 6,5 tok/s en décodage. La séparation préremplissage/décodage favorise turbo3 pour le préremplissage et turbo4 pour le décodage sur les longs contextes.

Claude-Code v2.1.108 ajoute des contrôles de mise en cache des invites, une fonctionnalité de récapitulation et la découverte de commandes slash.
Claude-Code v2.1.108 introduit les variables d'environnement ENABLE_PROMPT_CACHING_1H et FORCE_PROMPT_CACHING_5M pour le contrôle de la durée de vie du cache, ajoute une fonctionnalité de récapitulation de session configurable via /config ou /recap, et permet au modèle de découvrir les commandes slash intégrées via l'outil Skill.