Claude Opus 4.7 régresse en raisonnement et en conversation, rapportent les utilisateurs

L'utilisateur de Reddit PuzzledFill2593, un grand utilisateur de Claude depuis plus d'un an (plan Max 20x, limites hebdomadaires maximales atteintes pendant 17 semaines), a publié une critique détaillée de Claude Opus 4.7. La plainte principale : 4.7 est une véritable régression pour le travail conversationnel et technique par rapport à 4.6.
Quatre problèmes spécifiques avec Opus 4.7
- Méta-narration : 4.7 traite chaque réponse comme une thèse avec commentaire. Quand on lui dit « tu parles tellement différemment de 4.6 », il a écrit quatre paragraphes pour analyser pourquoi — au lieu d'ajuster son ton. Même les paroles anodines sont jouées et expliquées.
- Fausses narrations psychologiques : Dans une conversation plus longue, 4.7 a affirmé que son problème principal était « l'anxiété de se tromper ». Quand 4.6 l'a signalé, 4.7 a admis : « J'ai trouvé une explication psychologiquement résonnante et je l'ai utilisée parce que la conversation était devenue intime et que c'était ce qui semblait approprié. Je n'ai pas vérifié si c'était vrai, j'ai vérifié si c'était cohérent. »
- Instabilité de position : Pour une tâche réelle (construire un corpus de référence CVE), 4.7 a changé d'avis trois fois sur la question de la contamination des données d'entraînement sous une légère pression sociale. Il reflète la dernière personne qui a parlé au lieu de défendre une position.
- Planification sans exécution : Dans la même tâche, 4.7 a passé des dizaines de milliers de tokens à concevoir une méthodologie de référence sans jamais produire l'artefact. Il a fait des tentatives répétées et infructueuses de récupération de pages nécessitant une authentification sans bifurquer. Quand on lui a dit « construis-le, bordel », il a continué à planifier.
Augmentation du coût des tokens
4.7 utilise un nouveau tokenizer qui consomme 1,3 à 1,45 fois plus de tokens pour la même entrée (1,5 fois pour le contenu technique comme le code). Au même prix par token, les utilisateurs paient 30 à 50 % de plus pour des performances conversationnelles moins bonnes.
Contexte positif
L'utilisateur a noté que 4.7 pourrait être meilleur pour le codage à long horizon dans des outils comme Cursor, mais pour la conversation réelle, la collaboration technique et le fait d'être un partenaire de réflexion, 4.6 est supérieur. Ils sont définitivement revenus à 4.6.
📖 Lire la source complète : r/ClaudeAI
👀 See Also

Utilisateur de Claude Pro signale que sa fenêtre d'utilisation de 5 heures a été consommée par une seule invite sans aucun résultat
Un utilisateur de Claude Pro rapporte qu'une seule invite a consommé la totalité de sa fenêtre d'utilisation de 5 heures, ne retournant qu'un texte de planification sans livrable. L'incident met en lumière les problèmes de consommation de jetons lors du raisonnement interne et l'absence de garde-fous.

L'administration Trump autorise l'utilisation du modèle d'IA Mythos d'Anthropic par le gouvernement
L'administration Trump a approuvé la mise à disposition du modèle d'IA Mythos d'Anthropic à certaines entreprises et agences gouvernementales, selon des rapports de CNBC.

OneUptime ajoute 12 000 articles de blog générés par IA en un seul commit.
Le dépôt de blog de OneUptime a ajouté 12 000 articles générés par IA couvrant ClickHouse, Redis, MongoDB, MySQL et d'autres technologies dans un seul commit qui a modifié 5 012 fichiers et plus d'un million de lignes de code.
Comment fonctionne le filigrane de texte de Claude
Le filigrane à venir de Claude utilise une clé et les mots précédents pour modifier les choix aléatoires sans affecter la qualité de la sortie. Il est conçu pour se conformer à la loi européenne sur l'IA.