Benchmark d'effort de raisonnement Opus 4.7 : Le niveau moyen bat les niveaux élevé et maximal sur des tâches réelles
L'utilisateur de Reddit ktane a testé Claude Opus 4.7 dans Claude Code sur cinq niveaux d'effort de raisonnement (low, medium, high, xhigh, max) sur 29 tâches réelles du dépôt open-source GraphQL-go-tools. Le résultat : l'effort de raisonnement moyen a systématiquement surpassé les réglages plus élevés en termes de taux de réussite des tests, d'équivalence sémantique avec les correctifs humains, de taux de réussite de relecture de code, et de scores agrégés de qualité/discipline.
Résultats clés
- Taux de réussite toutes tâches : Medium 28/29, Max 27/29, High 26/29, Xhigh 25/29, Low 23/29
- Correctifs équivalents : Medium 14/29, Max 13/29, High 12/29, Xhigh 11/29, Low 10/29
- Taux de réussite relecture de code : Medium 10/29, High 7/29, Max 8/29, Xhigh 4/29, Low 5/29
- Moyenne de la grille de relecture de code : Medium 2.716, High 2.509, Xhigh 2.482, Max 2.431, Low 2.426
- Risque d'empreinte (plus bas = mieux) : Low 0.155, Medium 0.189, High 0.206, Max 0.227, Xhigh 0.238
- Coût par tâche : Low 2,50 $, Medium 3,15 $, High 5,01 $, Xhigh 6,51 $, Max 8,84 $
- Durée par tâche : Low 383,8 s, Medium 450,7 s, High 716,4 s, Xhigh 803,8 s, Max 996,9 s
- Réussites équivalentes par dollar : Low 4,0, Medium 4,4, High 2,4, Xhigh 1,7, Max 1,5
L'auteur note qu'Opus 4.7 utilise la pensée adaptative — il alloue déjà un budget de raisonnement par tâche. Le paramètre d'effort biaise donc une politique déjà adaptative plutôt que d'ajouter de l'intelligence brute. Notamment, dans un PR (#1260), les réglages high et xhigh ont gaspillé du raisonnement supplémentaire à rechercher des hashs de commit de PR antérieurs et ont conclu « aucun travail nécessaire », tandis que medium et max ont correctement lu le flux de contrôle et produit un correctif.
Cela contraste avec GPT-5.5 dans Codex, qui montrait une courbe monotone intuitive où plus de raisonnement améliorait la qualité. Le rapport interactif complet avec des analyses détaillées par tâche est disponible sur stet.sh.
📖 Lire la source complète : r/ClaudeAI
👀 See Also

Les coûts de l'API OpenClaw atteignent 275 $ en 5,5 heures, soit une projection annuelle de plus de 200 000 $
Un développeur testant OpenClaw avec l'API GPT-5.4 d'OpenAI a dépensé 275 $ entre 11h et 16h30, ce qui équivaut à plus de 200 000 $ par an à ce rythme d'utilisation.

Atlassian active la collecte de données par défaut pour l'entraînement de l'IA
Atlassian a activé la collecte de données par défaut dans ses produits pour entraîner des modèles d'IA, selon une source publiée sur Hacker News avec 312 points et 75 commentaires.

Recherche sur la cohérence des agents IA : Principaux résultats et enseignements pratiques
Une étude de 3 000 expériences sur Claude, GPT-4o et Llama révèle que les agents cohérents atteignent une précision de 80 à 92 %, tandis que les incohérents chutent à 25–60 %, 69 % des divergences survenant dès le premier appel d'outil.

ClawCast Ép.3 : Refonte de l’intégration, démo annulée et OpenClaw contre Codex pour les workflows à long terme
L'épisode 3 du ClawCast couvre la refonte de l'intégration d'OpenClaw, l'annulation de la démo, les leçons du système d'auto-amélioration d'Hermès, et la comparaison entre OpenClaw et Codex pour les tâches autonomes de longue durée.