Verificador de alucinação estrutural de código aberto para pipelines de agentes de IA

✍️ OpenClawRadar📅 Publicado: March 11, 2026🔗 Source
Verificador de alucinação estrutural de código aberto para pipelines de agentes de IA
Ad

O que faz

Um verificador de alucinação estrutural projetado especificamente para pipelines de agentes de IA. Diferente da verificação de veracidade, esta ferramenta foca em capturar falhas estruturais que quebram ferramentas subsequentes.

Problema que resolve

A maioria dos problemas dos agentes não são erros factuais, mas problemas estruturais como:

  • O modelo inventar um campo em uma resposta de ferramenta JSON
  • Citar uma fonte que não estava no conjunto recuperado
  • Injeção de prompt escondida dentro do conteúdo recuperado
  • Afirmar que uma ferramenta retornou algo que não retornou

Quatro supressores

A ferramenta inclui quatro supressores construídos em Claude Code que rodam como um único passo antes que a saída do agente alcance os usuários:

  • grounding_enforcer - verifica se a saída do modelo é realmente suportada pelas fontes que você passou
  • prompt_suppressor - captura tentativas de injeção em conteúdo recuperado e resultados de ferramentas
  • json_suppressor - valida respostas estruturadas de ferramentas contra esquemas esperados
  • tool_response_suppressor - sinaliza quando a saída alegada de uma ferramenta não corresponde ao que ela retornou
Ad

Disponibilidade

A ferramenta está disponível em dois formatos:

  • Uma API REST
  • Um servidor MCP (funciona com Claude Desktop, Cursor, Windsurf, etc.)

O nível gratuito oferece 500 requisições/mês sem necessidade de cartão de crédito.

Source and documentation

Repositório GitHub: https://github.com/steveswain14/mcp-hallucination-suite

API e documentação: https://certifai.dev

📖 Read the full source: r/ClaudeAI

Ad

👀 See Also

SLayer: Uma Camada Semântica Open-Source para Agentes de IA que Aprende com Consultas
Tools

SLayer: Uma Camada Semântica Open-Source para Agentes de IA que Aprende com Consultas

SLayer é uma camada semântica leve e incorporável que permite que agentes de IA consultem bancos de dados, gerenciem modelos e aprendam com interações via MCP, REST, CLI ou Python.

OpenClawRadar
cc-lens: Painel Local para Análise de Sessões de Código Claude
Tools

cc-lens: Painel Local para Análise de Sessões de Código Claude

Um desenvolvedor criou o cc-lens, um painel local que lê arquivos de sessão do Claude Code de ~/.claude/ e fornece análises de uso, rastreamento de custos e reprodução de sessões. Ele roda completamente na sua máquina sem sincronização na nuvem, cadastros ou telemetria.

OpenClawRadar
Método de Evolução de Código Triplica o Desempenho do LLM no Benchmark ARC-AGI-2
Tools

Método de Evolução de Código Triplica o Desempenho do LLM no Benchmark ARC-AGI-2

Pesquisadores alcançaram uma melhoria de 2,8x no benchmark ARC-AGI-2 usando evolução de código com modelos de pesos abertos, atingindo 34% de precisão a US$ 2,67 por tarefa. O mesmo método elevou o Gemini 3.1 Pro para 95% de precisão a US$ 8,71 por tarefa.

OpenClawRadar
SkillMesh: Roteador Compatível com MCP para Grandes Catálogos de Ferramentas Reduz Tamanho do Contexto em 70%
Tools

SkillMesh: Roteador Compatível com MCP para Grandes Catálogos de Ferramentas Reduz Tamanho do Contexto em 70%

SkillMesh é um roteador compatível com MCP que recupera apenas os cartões de especialistas relevantes para consultas de agentes de IA, reduzindo o tamanho do contexto em 70% e melhorando a seleção de ferramentas. Ele suporta Claude via servidor MCP, pacotes de habilidades Codex e esquemas de função no estilo OpenAI.

OpenClawRadar