Benchmark d'effort de raisonnement Opus 4.7 : Le niveau moyen bat les niveaux élevé et maximal sur des tâches réelles
L'utilisateur de Reddit ktane a testé Claude Opus 4.7 dans Claude Code sur cinq niveaux d'effort de raisonnement (low, medium, high, xhigh, max) sur 29 tâches réelles du dépôt open-source GraphQL-go-tools. Le résultat : l'effort de raisonnement moyen a systématiquement surpassé les réglages plus élevés en termes de taux de réussite des tests, d'équivalence sémantique avec les correctifs humains, de taux de réussite de relecture de code, et de scores agrégés de qualité/discipline.
Résultats clés
- Taux de réussite toutes tâches : Medium 28/29, Max 27/29, High 26/29, Xhigh 25/29, Low 23/29
- Correctifs équivalents : Medium 14/29, Max 13/29, High 12/29, Xhigh 11/29, Low 10/29
- Taux de réussite relecture de code : Medium 10/29, High 7/29, Max 8/29, Xhigh 4/29, Low 5/29
- Moyenne de la grille de relecture de code : Medium 2.716, High 2.509, Xhigh 2.482, Max 2.431, Low 2.426
- Risque d'empreinte (plus bas = mieux) : Low 0.155, Medium 0.189, High 0.206, Max 0.227, Xhigh 0.238
- Coût par tâche : Low 2,50 $, Medium 3,15 $, High 5,01 $, Xhigh 6,51 $, Max 8,84 $
- Durée par tâche : Low 383,8 s, Medium 450,7 s, High 716,4 s, Xhigh 803,8 s, Max 996,9 s
- Réussites équivalentes par dollar : Low 4,0, Medium 4,4, High 2,4, Xhigh 1,7, Max 1,5
L'auteur note qu'Opus 4.7 utilise la pensée adaptative — il alloue déjà un budget de raisonnement par tâche. Le paramètre d'effort biaise donc une politique déjà adaptative plutôt que d'ajouter de l'intelligence brute. Notamment, dans un PR (#1260), les réglages high et xhigh ont gaspillé du raisonnement supplémentaire à rechercher des hashs de commit de PR antérieurs et ont conclu « aucun travail nécessaire », tandis que medium et max ont correctement lu le flux de contrôle et produit un correctif.
Cela contraste avec GPT-5.5 dans Codex, qui montrait une courbe monotone intuitive où plus de raisonnement améliorait la qualité. Le rapport interactif complet avec des analyses détaillées par tâche est disponible sur stet.sh.
📖 Lire la source complète : r/ClaudeAI
👀 See Also
Les utilisateurs de Claude Plan obtiennent des crédits mensuels SDK Agent à partir du 15 juin 2026
Les abonnés aux formules Claude Pro, Max, Team et Enterprise peuvent bénéficier d'un crédit mensuel pour l'utilisation du SDK Agent, couvrant claude -p, l'intégration GitHub Actions et les applications tierces. Les crédits sont renouvelés chaque mois, attribués par utilisateur et ne peuvent pas être mutualisés.

Développeurs d'émulateur PS3 demandent l'arrêt des PR générées par IA
Les mainteneurs de RPCS3 ont publiquement demandé aux utilisateurs d'arrêter de soumettre des pull requests générées par des agents d'IA, citant une faible qualité et une charge de maintenance élevée.

Utilisation de l'eau par les centres de données d'IA en Californie : estimations issues de la physique et des modèles d'IA
Une analyse de California WaterBlog utilisant la physique et quatre modèles d'IA estime que la consommation d'eau des centres de données d'IA en Californie se situe entre 2 300 et 400 000 acres-pieds par an, avec une fourchette réaliste de 32 000 à 290 000 acres-pieds par an — modeste par rapport à l'agriculture.

L'UE oblige Google à partager les données de recherche et à ouvrir Android aux IA tierces
Les nouvelles mesures de spécification du DMA exigent que Google partage ses données de recherche avec ses concurrents et ouvre Android aux assistants IA tiers avec une intégration système complète d'ici mi-2027.