Open-Source-Struktur-Halluzinationsprüfer für KI-Agenten-Pipelines

Was es tut
Ein struktureller Halluzinationsprüfer, der speziell für KI-Agenten-Pipelines entwickelt wurde. Im Gegensatz zur Wahrheitsprüfung konzentriert sich dieses Tool darauf, strukturelle Fehler zu erkennen, die nachgelagerte Tools beeinträchtigen.
Problem, das es löst
Die meisten Agentenprobleme sind keine faktischen Fehler, sondern strukturelle Probleme wie:
- Das Modell erfindet ein Feld in einer JSON-Tool-Antwort
- Zitieren einer Quelle, die nicht im abgerufenen Datensatz enthalten war
- Prompt-Injection, die in abgerufenen Inhalten versteckt ist
- Behaupten, ein Tool habe etwas zurückgegeben, was es nicht tat
Vier Unterdrücker
Das Tool enthält vier in Claude Code integrierte Unterdrücker, die als einzelner Schritt laufen, bevor die Agentenausgabe die Benutzer erreicht:
grounding_enforcer- prüft, ob die Modellausgabe tatsächlich durch die übergebenen Quellen unterstützt wirdprompt_suppressor- erkennt Injektionsversuche in abgerufenen Inhalten und Tool-Ergebnissenjson_suppressor- validiert strukturierte Tool-Antworten gegen erwartete Schematatool_response_suppressor- markiert, wenn die behauptete Ausgabe eines Tools nicht mit dem übereinstimmt, was es zurückgegeben hat
Verfügbarkeit
Das Tool ist in zwei Formaten verfügbar:
- Eine REST-API
- Ein MCP-Server (funktioniert mit Claude Desktop, Cursor, Windsurf usw.)
Der kostenlose Tarif bietet 500 Anfragen/Monat ohne Kreditkarte.
Source und Dokumentation
GitHub-Repository: https://github.com/steveswain14/mcp-hallucination-suite
API und Dokumentation: https://certifai.dev
📖 Read the full source: r/ClaudeAI
👀 Siehe auch

agentmemory V4 erreicht 96,2 % auf dem LongMemEval-Benchmark und übertrifft damit kommerzielle KI-Gedächtnissysteme.
agentmemory V4 erreichte 96,2 % auf LongMemEval und übertraf damit mehrere geförderte KI-Speicherunternehmen, darunter PwC Chronos (95,6 %), Mastra (94,87 %) und OMEGA (93,2 %). Das System wurde allein in 16 Tagen auf einem Mittelklasse-Gaming-PC mit einem Budget von 1.000 US-Dollar entwickelt.

Open-Sourced the-vibe-stack: Markdown-Regeln zur Aufrechterhaltung der Code-Konsistenz von Claude
Ein Entwickler hat 'the-vibe-stack' als Open-Source veröffentlicht – eine Reihe von Markdown-Regeln, die darauf ausgelegt sind, Claude Code während längerer Sitzungen auf Kurs zu halten, indem sie ein starres Schema vorgeben. Der Ansatz zielt darauf ab, Logikdrift und Token-Verschwendung zu reduzieren und gleichzeitig vorhersehbare Ergebnisse zu gewährleisten.

CodeVibe: Push-Benachrichtigungen für KI-Codierungsagenten bei blockierter Eingabe
CodeVibe sendet Push-Benachrichtigungen auf Ihr Telefon, wenn KI-Coding-Agenten wie Claude Code bei der Genehmigung von Bearbeitungsvorgängen feststecken. Sie können Dateiunterschiede prüfen und mit nummerierten Optionen antworten, um den Agenten in Bewegung zu halten.

Claude Skills Hub: Durchsuchbares Repository für 789+ Claude Code Skills und 10 autonome Agenten
Claude Skills Hub (clskills.in) bietet eine zentralisierte Suchoberfläche für 789+ Claude Code Skill-Dateien in 71 Kategorien sowie 10 autonome KI-Agenten, die mehrere Skills zu vollständigen Workflows verknüpfen. Das Open-Source-Projekt sammelt Skills aus mehreren Community-Sammlungen und ermöglicht Downloads mit einem Klick.