Agent-Xray : Outil open-source pour déboguer les défaillances des agents IA à partir des journaux de traces

Agent-Xray est un outil open-source pour déboguer les agents IA en analysant leurs journaux de traces. Il a été créé pour résoudre le problème des agents qui échouent à des tâches sans erreurs claires - des situations où le code s'exécute correctement mais l'agent prend de mauvaises décisions, comme appeler à plusieurs reprises le mauvais outil malgré des messages d'erreur suggérant le bon.
Fonctionnalités principales
L'outil lit les journaux de traces et fournit une évaluation structurelle et une classification des causes profondes des échecs des agents. Il reconstruit ce que l'agent voyait à chaque étape pour aider à comprendre pourquoi de mauvaises décisions ont été prises.
Catégories d'échec
- spin
- tool_bug
- early_abort
Mode d'application
La fonctionnalité la plus importante selon le créateur est le mode d'application. Après avoir corrigé un bogue d'agent, ce mode exécute des défis adverses contre vos correctifs pour vérifier qu'ils sont légitimes. Il vérifie :
- Les retours codés en dur
- Les assertions affaiblies
Cela résout le problème où les correctifs pourraient fonctionner sur des tâches de test spécifiques mais sont en réalité fragiles, ou où les agents apprennent à contourner le test.
Intégration au flux de travail
L'outil s'exécute en tant qu'outils MCP, permettant à Claude Code de l'utiliser directement. Un flux de travail typique décrit dans la source :
- Demander à Claude Code de trier les traces des agents
- Il trouve l'échec le plus grave
- Rejoue ce que l'agent a vu
- Suggère un correctif
- Le mode d'application vérifie que le correctif est légitime
Le créateur décrit cela comme "des agents qui déboguent des agents".
Détails techniques
- Installation :
pip install agent-xray - Démarrage rapide :
agent-xray quickstart(inclut des traces d'exemple pour tester sans vos propres données) - Licence : MIT
- Zéro dépendance
- Fonctionne hors ligne
- Fonctionne avec OpenAI, Anthropic, LangChain, CrewAI, traces OpenTelemetry
- Âge du projet : Environ 9 jours au moment de la publication
Cas d'utilisation
Cet outil est destiné aux développeurs travaillant avec des agents IA qui doivent déboguer des échecs qui ne produisent pas d'erreurs ou de traces d'appel traditionnelles - des situations où les agents prennent des décisions incorrectes malgré l'accès aux bons outils et informations.
📖 Read the full source: r/ClaudeAI
👀 See Also

Pali v0.1 : Infrastructure de mémoire open source pour LLM avec des benchmarks reproductibles
Pali est une infrastructure de mémoire open source pour les LLM, construite en Go sous forme d'un binaire unique avec des API multi-locataires, une récupération hybride et des extensions plug-and-play. La version v0.1 inclut une suite de benchmarks avec des résultats reproductibles montrant les métriques de performance pour différentes configurations.

Graph Compose : Flux de travail temporels hébergés avec constructeur visuel et IA
Graph Compose est une plateforme hébergée pour orchestrer des flux de travail d'API sur Temporal, vous permettant de définir des workflows sous forme de graphes JSON avec trois méthodes de construction : un constructeur visuel React Flow, un SDK TypeScript et un assistant IA qui convertit l'anglais simple en graphes.

TEMM1E v3.0.0 introduit l'Intelligence en Essaim pour la Coordination des Agents IA
TEMM1E v3.0.0 ajoute 'Many Tems', une intelligence en essaim qui coordonne les travailleurs agents IA via des signaux de stigmergie au lieu d'appels LLM, obtenant des performances 5,86 fois plus rapides et un coût 3,4 fois inférieur sur des tâches complexes avec zéro jeton de coordination.

Manifest Ajoute des Plans de Jetons MiniMax avec Prise en Charge du Modèle M2.7
Manifest, une couche de routage open source pour OpenClaw, prend désormais en charge les forfaits de tokens MiniMax à partir de 10 $/mois. Le nouveau modèle MiniMax M2.7 est spécialement conçu pour les flux de travail OpenClaw et obtient 62,7 sur MM-ClawBench et 56,2 sur SWE-Bench Pro.