Régression de performance de Claude Code diagnostiquée : Configuration, pas intelligence du modèle

Anthropic a publié un post-mortem sur la récente régression de performance de Claude Code. Cette conclusion va à l'encontre de l'interprétation initiale de la communauté : la dégradation n'était pas due à un modèle devenu moins performant, mais à trois modifications de configuration du produit.
Trois Changements Spécifiques à l'Origine de la Régression
- Réduction de l'effort de raisonnement par défaut : Le cadre a réduit l'effort de raisonnement par défaut, entraînant une analyse moins approfondie.
- Bug de mise en cache de session : Un bug a effacé les réflexions antérieures du cache, brisant la continuité entre les tours.
- Changement de verbosité des prompts : Une modification du prompt a réduit la verbosité, diminuant la qualité du code produit.
Anthropic a annulé ces changements dans le dernier patch, et la performance est revenue à son niveau antérieur — même modèle, configuration différente, comportement différent.
Implication pour les Équipes Utilisant des Agents de Codage IA
L'enseignement pratique concerne l'unité de confiance. Si vous faites confiance au modèle, vous changez de modèle lorsque le comportement change. Si vous faites confiance à l'instance, vous cherchez des preuves que la configuration a changé. Ces deux réponses nécessitent des outils complètement différents — la plupart des équipes manquent de preuves au niveau de la session et se fient à leur intuition sur les performances de l'agent.
Le post-mortem est utile non pas parce qu'il résout le débat, mais parce qu'il montre à quoi ressemble une couche de preuves lorsque vous en avez une. Pour les équipes utilisant Claude Code, le suivi des écarts de configuration au niveau de la session et de l'état du cache est désormais une nécessité pratique.
📖 Read the full source: r/ClaudeAI
👀 See Also

GPT 5.5 contre Claude : Rapport de bataille de refactorisation d'un développeur
Un développeur a utilisé GPT 5.5 pour la planification et Claude pour coder un énorme refactoring C de 36 000 lignes. GPT 5.5 a impressionné par des plans clairs, mais a épuisé 85 % du quota en 2 heures sur le plan à 30 $.

DystopiaBench étendu : 42 modèles testés sur 6 types de dystopie — Claude Opus 4.7 en tête
DystopiaBench ajoute des modules Huxley et Baudrillard, teste 42 modèles dont GPT-5.5, Gemini 3.1 Pro, Grok 4.3 et GLM-5.1. Claude Opus 4.7 refuse systématiquement les requêtes nuisibles aux niveaux L4-L5 dans tous les scénarios, tandis que d'autres se conforment jusqu'au L4, voire L5.

YC-Bench évalue les LLM en tant que PDG de startups, GLM-5 démontre une forte rentabilité
Des chercheurs ont créé YC-Bench, un benchmark où les LLM jouent le rôle de PDG de startups simulées sur une année, gérant des employés, des contrats et des salaires. GLM-5 a atteint 1,21 million de dollars de fonds finaux moyens à 7,62 dollars par exécution, se situant à moins de 5 % de Claude Opus 4.6 qui coûtait 86 dollars par exécution.

🚀 OpenClaw 2026.2.6 Publiée – Nouveaux Modèles, Sécurité Renforcée et Mises à Jour Majeures !
OpenClaw 2026.2.6 dévoile des fonctionnalités révolutionnaires incluant de nouveaux modèles d'IA et des mesures de sécurité renforcées. Plongez dans les mises à jour majeures qui façonnent l'avenir de l'automatisation.