Recherche sur la cohérence des agents IA : Principaux résultats et enseignements pratiques

Résultats de la recherche sur la cohérence des agents
Une recherche partagée sur r/ClaudeAI examine un problème critique dans le développement des agents IA : l'auto-contradiction où les agents donnent des réponses différentes à des tâches identiques. L'étude a porté sur 3 000 expériences avec des invites et des entrées cohérentes sur trois modèles majeurs.
Métriques de performance clés
- Les agents cohérents ont atteint une précision de 80 à 92 %
- Les agents incohérents sont tombés à 25–60 % de précision
- Soit un écart de performance de 32 à 55 points
Modèles de divergence
La recherche a identifié des modèles spécifiques dans l'incohérence des agents :
- 69 % des divergences se produisent dès le tout premier appel d'outil
- Les requêtes de recherche initiales sont le point de défaillance critique
- Les appels initiaux corrects conduisent à une convergence en aval
- Les appels initiaux incorrects font diverger les exécutions
Signaux de diagnostic pratiques
La longueur du chemin sert de signal de diagnostic économique : les agents qui prennent 8 étapes pour une tâche de 3 étapes sont généralement perdus plutôt que minutieux.
Recommandation de test immédiat
La conclusion pratique est simple : exécutez votre agent 3 à 5 fois en parallèle. Si les trajectoires concordent, vous pouvez faire confiance au résultat. Si elles divergent, ne déployez pas cette implémentation.
Ressources de recherche
L'article complet est disponible à https://arxiv.org/abs/2602.11619 avec un compte-rendu détaillé sur https://amcortex.substack.com/p/run-your-agent-10-times-you-wont.
📖 Lire la source complète : r/ClaudeAI
👀 See Also

La recherche de traçage de circuits d'Anthropic révèle les mécanismes internes de Claude 3.5 Haiku
Anthropic a publié une recherche sur le traçage de circuits d'une version simplifiée de Claude 3.5 Haiku, révélant six comportements spécifiques, notamment son état par défaut « Je ne sais pas », l'écriture de poèmes à l'envers et le traitement mathématique à double voie.

Claude a réglé une vraie alarme sur Android via le système d'intents — sans piratage, mais des problèmes de transparence persistent
Claude AI a utilisé le système d'intentions standard d'Android pour créer une alarme native dans l'application Samsung Clock. L'utilisateur a d'abord craint une brèche, mais il s'agit d'une communication standard entre applications. L'absence de divulgation préalable des actions au niveau de l'appareil soulève des préoccupations de transparence.

OpenClaw 2026.3.22-beta.1 : Principaux changements de flux de travail pour les auteurs d'extensions et l'automatisation du navigateur
OpenClaw 2026.3.22-beta.1 modifie l'installation des plugins pour privilégier ClawHub plutôt que npm, supprime le relais de l'extension Chrome, consolide la génération d'images et introduit des changements cassants dans le Plugin SDK.

Meta suspend un programme interne de formation en IA après une fuite de données de frappe d'un employé
Meta suspend son programme MCI de suivi des frappes clavier après qu'une fuite de niveau SEV 2 a exposé des conversations privées, des données de performance et des transcriptions à l'échelle de l'entreprise.