エージェントX線: トレースログからAIエージェントの障害をデバッグするためのオープンソースツール

Agent-Xrayは、AIエージェントのトレースログを分析してデバッグするためのオープンソースツールです。このツールは、明確なエラーがなくエージェントがタスクに失敗する問題を解決するために作成されました。例えば、コードは正常に実行されるものの、エージェントが誤った判断を下す状況、エラーメッセージが正しいツールを示唆しているにもかかわらず間違ったツールを繰り返し呼び出すような場合です。
主な機能
このツールはトレースログを読み取り、エージェントの失敗に対して構造的な評価と根本原因の分類を提供します。エージェントが各ステップで何を見ていたかを再構築し、なぜ誤った判断が下されたのかを理解するのに役立ちます。
失敗のカテゴリ
- spin
- tool_bug
- early_abort
強制実行モード
作成者によると、最も重要な機能は強制実行モードです。エージェントのバグを修正した後、このモードは敵対的チャレンジを実行して修正が正当であることを検証します。以下をチェックします:
- ハードコードされた戻り値
- 弱められたアサーション
これは、修正が特定のテストタスクでは機能するものの実際には脆弱である場合や、エージェントがテストを攻略することを学習する問題に対処します。
ワークフロー統合
このツールはMCPツールとして実行され、Claude Codeが直接使用できるようにします。ソースで説明されている典型的なワークフロー:
- Claude Codeにエージェントトレースのトリアージを指示する
- 最悪の失敗を見つける
- エージェントが見ていたものを再生する
- 修正を提案する
- 強制実行モードで修正が正当であることを検証する
作成者はこれを「エージェントがエージェントをデバッグする」と表現しています。
技術的詳細
- インストール:
pip install agent-xray - クイックスタート:
agent-xray quickstart(独自のデータなしでテストするためのサンプルトレースを含む) - ライセンス:MIT
- 依存関係なし
- オフラインで実行可能
- OpenAI、Anthropic、LangChain、CrewAI、OpenTelemetryトレースと連携
- プロジェクトの経過日数:投稿時点で約9日
ユースケース
このツールは、従来のエラーやスタックトレースを生成しない失敗をデバッグする必要があるAIエージェントを扱う開発者向けです。エージェントが正しいツールと情報にアクセスできるにもかかわらず誤った判断を下す状況です。
📖 Read the full source: r/ClaudeAI
👀 See Also

Forge: ClaudeベースのIDE、自動検証とプロジェクトDNAを搭載
Forgeは、コードを表示する前に自動的に型チェック、テスト、カバレッジチェック、インポート検証を実行する、VS Code上に構築されたClaudeベースのIDEです。検証が失敗した場合の自己修復ループを含み、コードベースのパターンからプロジェクトDNAを構築します。

MCPによりClaudeがGoogle Search Consoleデータを自動分析
新しい無料MCPがClaudeをGoogle Search Consoleに直接接続し、クエリ、ページ、クリック数、CTRなどの検索パフォーマンスデータを、手動でのCSVエクスポートなしに自然言語でクエリできるようにします。
対立クロードチャットを活用し、キックオフの曖昧さをコスト発生前に発見する方法
ある開発者は、Claude Codeに送るキックオフ仕様を敵対的にレビューするための2つ目のClaudeチャットを追加し、プロジェクトフェーズ全体でClaude Codeのやり直しにかかるコストを推定150〜400ドル削減した。

開発者が現実的なリレーショナルデータベース生成ツールを構築
開発者が、外部キー関係とテーブル間の整合性が保たれたテストデータベースを作成する問題を解決する、現実的なデータを備えた完全なリレーショナルデータベースを生成するツールを構築しました。