Agent-Xray : Outil open-source pour déboguer les défaillances des agents IA à partir des journaux de traces

Agent-Xray est un outil open-source pour déboguer les agents IA en analysant leurs journaux de traces. Il a été créé pour résoudre le problème des agents qui échouent à des tâches sans erreurs claires - des situations où le code s'exécute correctement mais l'agent prend de mauvaises décisions, comme appeler à plusieurs reprises le mauvais outil malgré des messages d'erreur suggérant le bon.
Fonctionnalités principales
L'outil lit les journaux de traces et fournit une évaluation structurelle et une classification des causes profondes des échecs des agents. Il reconstruit ce que l'agent voyait à chaque étape pour aider à comprendre pourquoi de mauvaises décisions ont été prises.
Catégories d'échec
- spin
- tool_bug
- early_abort
Mode d'application
La fonctionnalité la plus importante selon le créateur est le mode d'application. Après avoir corrigé un bogue d'agent, ce mode exécute des défis adverses contre vos correctifs pour vérifier qu'ils sont légitimes. Il vérifie :
- Les retours codés en dur
- Les assertions affaiblies
Cela résout le problème où les correctifs pourraient fonctionner sur des tâches de test spécifiques mais sont en réalité fragiles, ou où les agents apprennent à contourner le test.
Intégration au flux de travail
L'outil s'exécute en tant qu'outils MCP, permettant à Claude Code de l'utiliser directement. Un flux de travail typique décrit dans la source :
- Demander à Claude Code de trier les traces des agents
- Il trouve l'échec le plus grave
- Rejoue ce que l'agent a vu
- Suggère un correctif
- Le mode d'application vérifie que le correctif est légitime
Le créateur décrit cela comme "des agents qui déboguent des agents".
Détails techniques
- Installation :
pip install agent-xray - Démarrage rapide :
agent-xray quickstart(inclut des traces d'exemple pour tester sans vos propres données) - Licence : MIT
- Zéro dépendance
- Fonctionne hors ligne
- Fonctionne avec OpenAI, Anthropic, LangChain, CrewAI, traces OpenTelemetry
- Âge du projet : Environ 9 jours au moment de la publication
Cas d'utilisation
Cet outil est destiné aux développeurs travaillant avec des agents IA qui doivent déboguer des échecs qui ne produisent pas d'erreurs ou de traces d'appel traditionnelles - des situations où les agents prennent des décisions incorrectes malgré l'accès aux bons outils et informations.
📖 Read the full source: r/ClaudeAI
👀 See Also

Plateforme ELBO : Formation Assistée par l'IA pour les Compétences en Pensée Critique et en Communication
ELBO est une plateforme de formation en direct construite avec Claude Code qui utilise l'IA pour aider les utilisateurs à pratiquer la pensée critique, la persuasion, la négociation et les compétences en prise de parole en public à travers des scénarios et des débats simulés.
Fork d'OpenClaw avec un LLM personnalisé : Guide de configuration locale uniquement
Un utilisateur de Reddit a fork OpenClaw pour le faire fonctionner entièrement avec des modèles locaux, créant un 'JARVIS' entièrement personnalisé sans dépendance au cloud. Le processus a pris des minutes, pas des heures, et exécute deux versions côte à côte sur un M2 Ultra.

llm-idle-timeout se déclenche à 2 minutes sur N100/WSL2 malgré le paramètre timeoutSeconds
Un utilisateur rapporte que le watchdog d'inactivité dans OpenClaw se déclenche après 2 minutes sur du matériel N100/WSL2, ignorant le paramètre timeoutSeconds=300, en raison d'un démarrage lent de la passerelle (45+ secondes) et de l'absence d'un noOutputTimeoutMs configurable.

TradesMCP : Serveur MCP Open Source pour la Vérification des Licences de Contractants et les Données de Construction
TradesMCP est un serveur Model Context Protocol open source qui fournit à Claude un accès à des données réelles de licences d'entrepreneurs, de permis de construire, de prix des matériaux et de taux de main-d'œuvre. L'outil a correctement vérifié une licence d'entrepreneur active en Californie, là où ChatGPT a renvoyé des informations incorrectes.