Vérificateur de hallucination structurelle open-source pour les pipelines d'agents IA

Ce qu'il fait
Un vérificateur d'hallucinations structurelles spécialement conçu pour les pipelines d'agents IA. Contrairement à la vérification de la véracité, cet outil se concentre sur la détection des défaillances structurelles qui perturbent les outils en aval.
Problème qu'il résout
La plupart des problèmes des agents ne sont pas des erreurs factuelles mais des problèmes structurels comme :
- Le modèle invente un champ dans une réponse d'outil JSON
- Citer une source qui ne faisait pas partie de l'ensemble récupéré
- Une injection de prompt cachée dans le contenu récupéré
- Prétendre qu'un outil a retourné quelque chose qu'il n'a pas retourné
Quatre suppresseurs
L'outil comprend quatre suppresseurs intégrés en Claude Code qui s'exécutent en une seule étape avant que la sortie de l'agent n'atteigne les utilisateurs :
grounding_enforcer- vérifie si la sortie du modèle est effectivement étayée par les sources que vous avez transmisesprompt_suppressor- détecte les tentatives d'injection dans le contenu récupéré et les résultats des outilsjson_suppressor- valide les réponses structurées des outils par rapport aux schémas attendustool_response_suppressor- signale quand la sortie revendiquée par un outil ne correspond pas à ce qu'il a réellement retourné
Disponibilité
L'outil est disponible en deux formats :
- Une API REST
- Un serveur MCP (fonctionne avec Claude Desktop, Cursor, Windsurf, etc.)
Le niveau gratuit offre 500 requêtes/mois sans carte de crédit requise.
Source et documentation
Dépôt GitHub : https://github.com/steveswain14/mcp-hallucination-suite
API et documentation : https://certifai.dev
📖 Read the full source: r/ClaudeAI
👀 See Also

LightMem : Système de mémoire léger pour agents LLM avec des gains de 10×+ et un coût 100× inférieur
LightMem est un système de mémoire modulaire pour les agents LLM qui permet d'améliorer la précision jusqu'à 10,9 % tout en réduisant les tokens jusqu'à 117 fois, les appels API jusqu'à 159 fois et le temps d'exécution de plus de 12 fois. Il est conçu pour un raisonnement à contexte long et évolutif dans les flux de travail des agents.

Mike : IA juridique open source avec auto-hébergement et support multi-modèles
Mike est une alternative open-source à Harvey et Legora, offrant un chat documentaire, une extraction tabulaire et des modèles de flux de travail — le tout auto-hébergeable avec vos propres clés API Claude ou Gemini.

Faire avancer les choses : Système de méta-prompting pour les agents d'IA de codage
Get Shit Done est un système de méta-invites, d'ingénierie de contexte et de développement piloté par spécifications qui fonctionne avec Claude Code, OpenCode, Gemini CLI, Codex, Copilot et Antigravity. Il traite la dégradation de contexte en fournissant des invites structurées et des flux de travail de vérification.

Claude Code + MCP génère des suites de tests à partir du code source
Claude Code analyse le code source pour générer des suites de tests hiérarchiques couvrant les modules, les fonctionnalités, les scénarios, les chemins heureux, les cas limites et la gestion des erreurs, puis les pousse vers les systèmes de gestion de tests via MCP.