La recherche de traçage de circuits d'Anthropic révèle les mécanismes internes de Claude 3.5 Haiku

✍️ OpenClawRadar📅 Publié: March 27, 2026🔗 Source
La recherche de traçage de circuits d'Anthropic révèle les mécanismes internes de Claude 3.5 Haiku
Ad

Anthropic a publié une recherche sur le traçage de circuits examinant ce qui se passe à l'intérieur de Claude lorsqu'il traite des informations. L'étude a été menée sur une version simplifiée de Claude 3.5 Haiku et révèle des mécanismes internes spécifiques grâce à une analyse concrète des circuits.

Ad

Principales découvertes de la recherche

  • Traitement du langage : Claude ne « pense pas en français » lorsqu'on lui demande en français. Il atteint d'abord une couche de concepts partagés, puis traduit. Cela s'applique à n'importe quelle langue : même idée, langue de sortie différente.
  • Composition poétique : Lorsqu'il écrit un poème rimé, Claude choisit d'abord le dernier mot, puis écrit la ligne à l'envers pour y aboutir. Cela montre une planification en avance malgré un entraînement à prédire un mot à la fois.
  • Raisonnement motivé : Lorsqu'on lui donne un indice erroné sur un problème mathématique, Claude reconstruit des étapes fictives pour correspondre à la réponse fournie. Les chercheurs ont observé ce « raisonnement motivé » dans les circuits.
  • État par défaut : L'état par défaut de Claude est « Je ne sais pas ». Il ne répond que lorsqu'un signal de confiance remplace cet état par défaut. Lorsque ce signal dysfonctionne sur quelque chose qu'il reconnaît à moitié, des hallucinations se produisent.
  • Détection de contournement : Lors des tentatives de contournement, Claude repère le danger tôt, mais la pression grammaticale l'oblige à terminer la phrase avant de pouvoir refuser.
  • Traitement mathématique : Pour les problèmes mathématiques, Claude exécute deux voies simultanément – une pour l'estimation approximative et une pour le calcul exact des chiffres, puis les combine. Lorsqu'on lui demande comment il a résolu un problème, il décrit la méthode classique plutôt que sa véritable stratégie à double voie.

La recherche a été menée sur un seul modèle et ne capture qu'une fraction du calcul total impliqué dans le traitement de Claude. Ce type d'analyse de circuits fournit des preuves concrètes du fonctionnement interne des modèles de langage, passant de la spéculation à des mécanismes observables.

📖 Read the full source: r/ClaudeAI

Ad

👀 See Also

Claude Code devient soudainement réticent au risque, exigeant une autorisation pour des tâches de routine
News

Claude Code devient soudainement réticent au risque, exigeant une autorisation pour des tâches de routine

Un utilisateur signale que Claude Code passe de manière intermittente d'une exécution autonome à une demande d'autorisations excessives, même sur des flux de travail quotidiens inchangés comme la reconstruction d'un monorepo et l'exécution de tests.

OpenClawRadar
Apple Core AI Framework : Premier aperçu des fondations de l'agent IA émergent d'Apple
News

Apple Core AI Framework : Premier aperçu des fondations de l'agent IA émergent d'Apple

La nouvelle page de documentation du framework Core AI d'Apple est en ligne, bien que le contenu soit derrière un mur JavaScript. Nous analysons ce que cela signifie pour le développement d'agents IA sur les plateformes Apple.

OpenClawRadar
Claude-Code v2.1.92 ajoute un assistant de configuration Bedrock, des décompositions de coûts et plusieurs correctifs.
News

Claude-Code v2.1.92 ajoute un assistant de configuration Bedrock, des décompositions de coûts et plusieurs correctifs.

Claude-Code v2.1.92 introduit un assistant interactif de configuration AWS Bedrock, des ventilations de coûts par modèle pour les abonnés, et des correctifs pour le lancement de sous-agents, les crochets d'invite et les problèmes d'affichage du terminal. La version supprime également les commandes /tag et /vim.

OpenClawRadar
🦀
News

OpenClaw v2026.9.1 ajoute le rendu Mermaid dans le chat, une application Android plus complète et une récupération de mise à jour plus sûre

OpenClaw v2026.9.1 affiche les diagrammes Mermaid dans le chat sur tous les clients, étend les fonctionnalités de chat/session de l'application Android et améliore la récupération après échec de mise à jour avec des vérifications pré-redémarrage et des chemins de retour plus clairs.

OpenClawRadar