Agente-Xray: Ferramenta de código aberto para depurar falhas de agentes de IA a partir de logs de rastreamento

Agent-Xray é uma ferramenta de código aberto para depurar agentes de IA analisando seus logs de rastreamento. Foi criada para resolver o problema de agentes que falham em tarefas sem erros claros — situações em que o código é executado normalmente, mas o agente toma decisões erradas, como chamar repetidamente a ferramenta errada apesar de mensagens de erro sugerirem a correta.
Principais Recursos
A ferramenta lê logs de rastreamento e fornece classificação estrutural e de causa raiz para falhas de agentes. Ela reconstrói o que o agente estava vendo em cada etapa para ajudar a entender por que decisões ruins foram tomadas.
Categorias de Falha
- spin
- tool_bug
- early_abort
Modo de Aplicação
O recurso mais significativo, segundo o criador, é o modo de aplicação. Após corrigir um bug do agente, esse modo executa desafios adversariais contra suas correções para verificar se são legítimas. Ele verifica:
- Retornos codificados
- Afirmações enfraquecidas
Isso aborda o problema em que as correções podem funcionar em tarefas de teste específicas, mas na verdade são frágeis, ou onde os agentes aprendem a manipular o teste.
Integração de Fluxo de Trabalho
A ferramenta é executada como ferramentas MCP, permitindo que o Claude Code a use diretamente. Um fluxo de trabalho típico descrito na fonte:
- Diga ao Claude Code para triar rastreamentos de agentes
- Ele encontra a pior falha
- Reproduz o que o agente viu
- Sugere uma correção
- O modo de aplicação verifica se a correção é legítima
O criador descreve isso como "agentes depurando agentes".
Detalhes Técnicos
- Instalação:
pip install agent-xray - Início rápido:
agent-xray quickstart(inclui rastreamentos de amostra para testar sem seus próprios dados) - Licença: MIT
- Zero dependências
- Executa offline
- Funciona com OpenAI, Anthropic, LangChain, CrewAI, rastreamentos OpenTelemetry
- Tempo do projeto: Cerca de 9 dias no momento da postagem
Caso de Uso
Esta ferramenta é para desenvolvedores que trabalham com agentes de IA e precisam depurar falhas que não produzem erros tradicionais ou rastreamentos de pilha — situações em que os agentes tomam decisões incorretas apesar de terem acesso a ferramentas e informações corretas.
📖 Read the full source: r/ClaudeAI
👀 See Also

agentcache: Biblioteca Python para Cache de Prefixo de LLM Multi-Agente
agentcache é uma biblioteca Python que permite que frameworks de LLM multiagente compartilhem prefixos de prompt em cache, alcançando até 76% de taxas de acerto no cache e reduzindo o tempo de inferência pela metade em testes com GPT-4o-mini.

Claude Command Center v5.0.0 Adiciona Suporte no Primeiro Dia para Fable 5 com Alternância no Meio da Sessão
Claude Command Center v5.0.0 adiciona suporte de primeira classe ao novo nível Fable 5 da Anthropic, incluindo troca de modelo no meio da sessão, um seletor de modelo reprojetado e uma correção para erros de CLI com aliases versionados.

Pacote de Fluxo de Trabalho de Revisão de Código MultiModel como Habilidade Reutilizável
Uma habilidade reutilizável que orquestra vários modelos de IA para revisões de código em PR e não-PR, testada com OpenClaw e modelos como GPT-5.5, DeepSeek V4 Pro, Kimi K2.6, Qwen 3.6 Plus e GLM-5.1.

Servidor MCP de Código Aberto Conecta Claude à API do Mailchimp
Um desenvolvedor criou um servidor MCP do Mailchimp usando Claude Code, fornecendo 53 ferramentas para campanhas, públicos, relatórios, automações e e-commerce com modos de segurança integrados e configuração somente leitura.