Test A/B de Claude Code réduit silencieusement l'effort « Élevé » au niveau « Faible » précédent
Les développeurs utilisant Claude Code ont peut-être remarqué une baisse soudaine des performances cette semaine. Selon un rapport de l'utilisateur X @argofowl, Anthropic mène un test A/B côté serveur qui réduit silencieusement le niveau d'effort effectif pour certaines sessions. Le changement affecte Claude Code version 2.1.236 et ultérieures, où le modèle interprète désormais l'effort "élevé" comme 10 sur 100 — la valeur exacte que "faible" utilisait auparavant. Les versions plus anciennes et Opus 5 ne sont pas affectées, et le journal des modifications n'en fait pas mention.
Détails clés
- Version concernée : Claude Code 2.1.236+ (notamment après 2.1.237)
- Changement : L'échelle d'effort est réduite côté serveur ; "élevé" correspond désormais à 10/100 au lieu de sa valeur supérieure précédente.
- Portée : Uniquement les sessions concernées — c'est un test A/B, donc tout le monde ne le voit pas.
- Détection : Si "élevé" vous semble équivalent à "faible", vous faites partie du groupe de test.
- Aucune entrée dans le journal des modifications : Le changement a été effectué sans aucune documentation publique.
Le rapporteur, @argofowl, a passé un après-midi convaincu que ses propres outils étaient cassés avant de découvrir le problème. Il a exprimé sa frustration face aux pratiques de test opaques d'Anthropic : "holy fuck anthropic, vous êtes parfois insupportables."
Analyse
Ce n'est pas un correctif côté client — c'est une configuration côté serveur qui affecte la façon dont le modèle interprète les paramètres d'effort. Si vous utilisez la version 2.1.236 ou ultérieure et que vous remarquez une baisse de qualité de sortie lorsque vous réglez l'effort sur "élevé", vous faites peut-être partie de cette expérience. Pour éviter le test, vous pouvez épingler une version plus ancienne (par exemple 2.1.235 ou antérieure) ou attendre qu'Anthropic déploie ou annule ce changement. Comme il s'agit d'un test A/B, votre expérience peut varier.
Pour les développeurs qui comptent sur un comportement cohérent de l'agent de codage IA, ce type de changement silencieux est préoccupant. Aucune déclaration officielle d'Anthropic n'a encore été faite, et le changement n'est mentionné dans aucun journal public des modifications. Si vous êtes concerné, vérifiez votre version de Claude Code et envisagez éventuellement une rétrogradation pour assurer des performances stables.
📖 Lire la source complète : HN AI Agents
👀 See Also
Comment fonctionne le filigrane de texte de Claude
Le filigrane à venir de Claude utilise une clé et les mots précédents pour modifier les choix aléatoires sans affecter la qualité de la sortie. Il est conçu pour se conformer à la loi européenne sur l'IA.

Stratégie des poids ouverts de Mistral : valorisation à 14 milliards de dollars sur la souveraineté, pas sur les benchmarks
Mistral a bâti un empire de l'IA de 14 milliards de dollars en proposant des modèles open-weight aux gouvernements et aux entreprises cherchant une indépendance vis-à-vis des technologies américaines et chinoises. Le chiffre d'affaires a atteint 200 millions de dollars en 2025, avec un objectif de 80 millions de dollars par mois d'ici décembre 2026.

Comptage des glucides par IA échoue à la reproductibilité : 27 000 requêtes montrent un écart de 429 g sur une seule photo
Une étude portant sur 26 904 requêtes IA à travers 4 modèles a révélé que Gemini 2.5 Pro faisait varier ses estimations de glucides pour une seule photo de paella de 55g à 484g — un écart potentiel de 42,9 unités d'insuline. Claude présentait seulement 2,4 % de variation médiane.

Pourquoi je ne lirai pas de fiction écrite par des LLM : profils statistiques et le problème de la médiane en écriture
Chris McCormick explique pourquoi il évite les fictions écrites par des LLM, arguant que leur profil statistique est trop proche de la médiane, poussant l'esprit des lecteurs vers le statistiquement normal plutôt que vers l'unique créativité.