Verificador de alucinação estrutural de código aberto para pipelines de agentes de IA

O que faz
Um verificador de alucinação estrutural projetado especificamente para pipelines de agentes de IA. Diferente da verificação de veracidade, esta ferramenta foca em capturar falhas estruturais que quebram ferramentas subsequentes.
Problema que resolve
A maioria dos problemas dos agentes não são erros factuais, mas problemas estruturais como:
- O modelo inventar um campo em uma resposta de ferramenta JSON
- Citar uma fonte que não estava no conjunto recuperado
- Injeção de prompt escondida dentro do conteúdo recuperado
- Afirmar que uma ferramenta retornou algo que não retornou
Quatro supressores
A ferramenta inclui quatro supressores construídos em Claude Code que rodam como um único passo antes que a saída do agente alcance os usuários:
grounding_enforcer- verifica se a saída do modelo é realmente suportada pelas fontes que você passouprompt_suppressor- captura tentativas de injeção em conteúdo recuperado e resultados de ferramentasjson_suppressor- valida respostas estruturadas de ferramentas contra esquemas esperadostool_response_suppressor- sinaliza quando a saída alegada de uma ferramenta não corresponde ao que ela retornou
Disponibilidade
A ferramenta está disponível em dois formatos:
- Uma API REST
- Um servidor MCP (funciona com Claude Desktop, Cursor, Windsurf, etc.)
O nível gratuito oferece 500 requisições/mês sem necessidade de cartão de crédito.
Source and documentation
Repositório GitHub: https://github.com/steveswain14/mcp-hallucination-suite
API e documentação: https://certifai.dev
📖 Read the full source: r/ClaudeAI
👀 See Also

SLayer: Uma Camada Semântica Open-Source para Agentes de IA que Aprende com Consultas
SLayer é uma camada semântica leve e incorporável que permite que agentes de IA consultem bancos de dados, gerenciem modelos e aprendam com interações via MCP, REST, CLI ou Python.

cc-lens: Painel Local para Análise de Sessões de Código Claude
Um desenvolvedor criou o cc-lens, um painel local que lê arquivos de sessão do Claude Code de ~/.claude/ e fornece análises de uso, rastreamento de custos e reprodução de sessões. Ele roda completamente na sua máquina sem sincronização na nuvem, cadastros ou telemetria.

Método de Evolução de Código Triplica o Desempenho do LLM no Benchmark ARC-AGI-2
Pesquisadores alcançaram uma melhoria de 2,8x no benchmark ARC-AGI-2 usando evolução de código com modelos de pesos abertos, atingindo 34% de precisão a US$ 2,67 por tarefa. O mesmo método elevou o Gemini 3.1 Pro para 95% de precisão a US$ 8,71 por tarefa.

SkillMesh: Roteador Compatível com MCP para Grandes Catálogos de Ferramentas Reduz Tamanho do Contexto em 70%
SkillMesh é um roteador compatível com MCP que recupera apenas os cartões de especialistas relevantes para consultas de agentes de IA, reduzindo o tamanho do contexto em 70% e melhorando a seleção de ferramentas. Ele suporta Claude via servidor MCP, pacotes de habilidades Codex e esquemas de função no estilo OpenAI.