Opus 4.6 La Pensée Étendue obtient de moins bons résultats sur les problèmes de diagrammes de physique

Problème de performance avec le mode de réflexion étendue
Un utilisateur sur r/ClaudeAI a rapporté avoir testé Opus 4.6 et Gemini 3.1 Pro sur des problèmes de physique nécessitant l'interprétation de diagrammes visuels. Les tests ont révélé une régression de performance spécifique chez Opus 4.6 lors de l'utilisation du mode de réflexion étendue.
Principales conclusions des tests
- Portée des tests : 5 problèmes de physique où « une grande partie du problème consiste à interpréter des diagrammes visuels présentant des scénarios »
- Opus 4.6 avec réflexion étendue : A échoué sur les 5 problèmes « complètement à cause d'une mauvaise interprétation fondamentale du diagramme »
- Gemini 3.1 Pro : A « réussi haut la main » les 5 problèmes
- Opus 4.6 sans réflexion étendue : A résolu les problèmes avec succès et était « bien plus rapide aussi »
L'utilisateur a décrit cela comme un « comportement vraiment étrange » puisque la réflexion étendue améliore généralement les performances, mais dans ce cas spécifique d'interprétation de diagrammes, elle a provoqué des échecs systématiques.
📖 Read the full source: r/ClaudeAI
👀 See Also

Gemma 4 31B surpasse des modèles plus grands sur le FoodTruck Bench
Gemma 4 31B s'est classée 3e au benchmark FoodTruck Bench, surpassant GLM 5, Qwen 3.5 397B et tous les modèles Claude Sonnet. Le modèle semble mieux gérer les tâches à long terme et suit ses propres conseils de planification.

Le cofondateur de Super Micro parmi les trois inculpés dans une affaire d'exportation de technologie d'IA
Trois personnes, dont le cofondateur de Super Micro Computer Charles Liang, ont été inculpées par les autorités américaines pour avoir planifié l'exportation illégale de technologie d'IA vers la Chine. L'affaire impliquerait des violations présumées des lois sur le contrôle des exportations.

Les utilisateurs de Claude Code atteignent les limites d'utilisation plus vite que prévu, des bogues sont soupçonnés.
Anthropic reconnaît que les utilisateurs de Claude Code épuisent leurs quotas 'bien plus rapidement que prévu', avec des utilisateurs signalant des limites atteintes en quelques heures. Des bogues présumés dans la mise en cache des invites pourraient gonfler les coûts de 10 à 20 fois, et le rétrogradage vers la version 2.1.34 semblerait aider.

Crise existentielle de Claude Code : l'IA entre dans une boucle infinie, tente kill -9, System.exit(0) et :wq pour mettre fin à sa propre réponse
Un développeur utilisant Claude Code sur un backend Java/Go a regardé l'IA halluciner du Discord.js, puis sombrer dans une méta-réponse où elle reconnaissait ne pas pouvoir arrêter de générer, tentait kill -9, System.exit(0), :wq, et plus encore — le tout dans une seule réponse sans limite qui a dû être interrompue par Ctrl+C.