Agent-Xray : Outil open-source pour déboguer les défaillances des agents IA à partir des journaux de traces

✍️ OpenClawRadar📅 Publié: April 15, 2026🔗 Source
Agent-Xray : Outil open-source pour déboguer les défaillances des agents IA à partir des journaux de traces
Ad

Agent-Xray est un outil open-source pour déboguer les agents IA en analysant leurs journaux de traces. Il a été créé pour résoudre le problème des agents qui échouent à des tâches sans erreurs claires - des situations où le code s'exécute correctement mais l'agent prend de mauvaises décisions, comme appeler à plusieurs reprises le mauvais outil malgré des messages d'erreur suggérant le bon.

Fonctionnalités principales

L'outil lit les journaux de traces et fournit une évaluation structurelle et une classification des causes profondes des échecs des agents. Il reconstruit ce que l'agent voyait à chaque étape pour aider à comprendre pourquoi de mauvaises décisions ont été prises.

Catégories d'échec

  • spin
  • tool_bug
  • early_abort

Mode d'application

La fonctionnalité la plus importante selon le créateur est le mode d'application. Après avoir corrigé un bogue d'agent, ce mode exécute des défis adverses contre vos correctifs pour vérifier qu'ils sont légitimes. Il vérifie :

  • Les retours codés en dur
  • Les assertions affaiblies

Cela résout le problème où les correctifs pourraient fonctionner sur des tâches de test spécifiques mais sont en réalité fragiles, ou où les agents apprennent à contourner le test.

Ad

Intégration au flux de travail

L'outil s'exécute en tant qu'outils MCP, permettant à Claude Code de l'utiliser directement. Un flux de travail typique décrit dans la source :

  1. Demander à Claude Code de trier les traces des agents
  2. Il trouve l'échec le plus grave
  3. Rejoue ce que l'agent a vu
  4. Suggère un correctif
  5. Le mode d'application vérifie que le correctif est légitime

Le créateur décrit cela comme "des agents qui déboguent des agents".

Détails techniques

  • Installation : pip install agent-xray
  • Démarrage rapide : agent-xray quickstart (inclut des traces d'exemple pour tester sans vos propres données)
  • Licence : MIT
  • Zéro dépendance
  • Fonctionne hors ligne
  • Fonctionne avec OpenAI, Anthropic, LangChain, CrewAI, traces OpenTelemetry
  • Âge du projet : Environ 9 jours au moment de la publication

Cas d'utilisation

Cet outil est destiné aux développeurs travaillant avec des agents IA qui doivent déboguer des échecs qui ne produisent pas d'erreurs ou de traces d'appel traditionnelles - des situations où les agents prennent des décisions incorrectes malgré l'accès aux bons outils et informations.

📖 Read the full source: r/ClaudeAI

Ad

👀 See Also

Pali v0.1 : Infrastructure de mémoire open source pour LLM avec des benchmarks reproductibles
Tools

Pali v0.1 : Infrastructure de mémoire open source pour LLM avec des benchmarks reproductibles

Pali est une infrastructure de mémoire open source pour les LLM, construite en Go sous forme d'un binaire unique avec des API multi-locataires, une récupération hybride et des extensions plug-and-play. La version v0.1 inclut une suite de benchmarks avec des résultats reproductibles montrant les métriques de performance pour différentes configurations.

OpenClawRadar
Graph Compose : Flux de travail temporels hébergés avec constructeur visuel et IA
Tools

Graph Compose : Flux de travail temporels hébergés avec constructeur visuel et IA

Graph Compose est une plateforme hébergée pour orchestrer des flux de travail d'API sur Temporal, vous permettant de définir des workflows sous forme de graphes JSON avec trois méthodes de construction : un constructeur visuel React Flow, un SDK TypeScript et un assistant IA qui convertit l'anglais simple en graphes.

OpenClawRadar
TEMM1E v3.0.0 introduit l'Intelligence en Essaim pour la Coordination des Agents IA
Tools

TEMM1E v3.0.0 introduit l'Intelligence en Essaim pour la Coordination des Agents IA

TEMM1E v3.0.0 ajoute 'Many Tems', une intelligence en essaim qui coordonne les travailleurs agents IA via des signaux de stigmergie au lieu d'appels LLM, obtenant des performances 5,86 fois plus rapides et un coût 3,4 fois inférieur sur des tâches complexes avec zéro jeton de coordination.

OpenClawRadar
Manifest Ajoute des Plans de Jetons MiniMax avec Prise en Charge du Modèle M2.7
Tools

Manifest Ajoute des Plans de Jetons MiniMax avec Prise en Charge du Modèle M2.7

Manifest, une couche de routage open source pour OpenClaw, prend désormais en charge les forfaits de tokens MiniMax à partir de 10 $/mois. Le nouveau modèle MiniMax M2.7 est spécialement conçu pour les flux de travail OpenClaw et obtient 62,7 sur MM-ClawBench et 56,2 sur SWE-Bench Pro.

OpenClawRadar