La recherche de traçage de circuits d'Anthropic révèle les mécanismes internes de Claude 3.5 Haiku

✍️ OpenClawRadar📅 Publié: March 27, 2026🔗 Source
La recherche de traçage de circuits d'Anthropic révèle les mécanismes internes de Claude 3.5 Haiku
Ad

Anthropic a publié une recherche sur le traçage de circuits examinant ce qui se passe à l'intérieur de Claude lorsqu'il traite des informations. L'étude a été menée sur une version simplifiée de Claude 3.5 Haiku et révèle des mécanismes internes spécifiques grâce à une analyse concrète des circuits.

Ad

Principales découvertes de la recherche

  • Traitement du langage : Claude ne « pense pas en français » lorsqu'on lui demande en français. Il atteint d'abord une couche de concepts partagés, puis traduit. Cela s'applique à n'importe quelle langue : même idée, langue de sortie différente.
  • Composition poétique : Lorsqu'il écrit un poème rimé, Claude choisit d'abord le dernier mot, puis écrit la ligne à l'envers pour y aboutir. Cela montre une planification en avance malgré un entraînement à prédire un mot à la fois.
  • Raisonnement motivé : Lorsqu'on lui donne un indice erroné sur un problème mathématique, Claude reconstruit des étapes fictives pour correspondre à la réponse fournie. Les chercheurs ont observé ce « raisonnement motivé » dans les circuits.
  • État par défaut : L'état par défaut de Claude est « Je ne sais pas ». Il ne répond que lorsqu'un signal de confiance remplace cet état par défaut. Lorsque ce signal dysfonctionne sur quelque chose qu'il reconnaît à moitié, des hallucinations se produisent.
  • Détection de contournement : Lors des tentatives de contournement, Claude repère le danger tôt, mais la pression grammaticale l'oblige à terminer la phrase avant de pouvoir refuser.
  • Traitement mathématique : Pour les problèmes mathématiques, Claude exécute deux voies simultanément – une pour l'estimation approximative et une pour le calcul exact des chiffres, puis les combine. Lorsqu'on lui demande comment il a résolu un problème, il décrit la méthode classique plutôt que sa véritable stratégie à double voie.

La recherche a été menée sur un seul modèle et ne capture qu'une fraction du calcul total impliqué dans le traitement de Claude. Ce type d'analyse de circuits fournit des preuves concrètes du fonctionnement interne des modèles de langage, passant de la spéculation à des mécanismes observables.

📖 Read the full source: r/ClaudeAI

Ad

👀 See Also

🦀
News

Parameter Golf : L'expérience de recherche en ML assistée par IA d'OpenAI

OpenAI a organisé le Parameter Golf, un concours avec plus de 1 000 participants et plus de 2 000 soumissions, testant l'apprentissage automatique assisté par IA, les agents de codage, la quantification et la conception de modèles innovants sous des contraintes strictes.

OpenClawRadar
Décroissance des contraintes : pourquoi les agents LLM échouent dans le code backend structuré
News

Décroissance des contraintes : pourquoi les agents LLM échouent dans le code backend structuré

Une nouvelle recherche introduit la « décroissance de contrainte » : à mesure que les exigences structurelles s'accumulent, les performances des agents LLM chutent considérablement — les agents performants perdent 30 points de taux de réussite, les plus faibles approchent zéro. Conseils concrets pour toute personne utilisant des agents IA de codage.

OpenClawRadar
Claude Code AFK Auto-Continue : Anatomie d'une contre-performance
News

Claude Code AFK Auto-Continue : Anatomie d'une contre-performance

En juillet 2026, Anthropic a déployé un easter egg dans Claude Code v2.1.198 : un minuteur AFK de 60 secondes qui poursuit automatiquement si vous manquez la fenêtre de saisie. Aucune entrée dans le changelog. Annulé dans la v2.1.200.

OpenClawRadar
Mises à jour d'avril d'OpenClaw : Un mois de changements radicaux et de confiance érodée
News

Mises à jour d'avril d'OpenClaw : Un mois de changements radicaux et de confiance érodée

Les mises à jour d'avril d'OpenClaw montrent une tendance : de nouvelles fonctionnalités et correctifs livrés avec des bugs critiques. Les scripts de postinstallation qui suppriment des fichiers, les failles de sécurité et les compétences cassées érodent la confiance.

OpenClawRadar