Open-Source-Struktur-Halluzinationsprüfer für KI-Agenten-Pipelines

✍️ OpenClawRadar📅 Veröffentlicht: 11. März 2026🔗 Source
Open-Source-Struktur-Halluzinationsprüfer für KI-Agenten-Pipelines
Ad

Was es tut

Ein struktureller Halluzinationsprüfer, der speziell für KI-Agenten-Pipelines entwickelt wurde. Im Gegensatz zur Wahrheitsprüfung konzentriert sich dieses Tool darauf, strukturelle Fehler zu erkennen, die nachgelagerte Tools beeinträchtigen.

Problem, das es löst

Die meisten Agentenprobleme sind keine faktischen Fehler, sondern strukturelle Probleme wie:

  • Das Modell erfindet ein Feld in einer JSON-Tool-Antwort
  • Zitieren einer Quelle, die nicht im abgerufenen Datensatz enthalten war
  • Prompt-Injection, die in abgerufenen Inhalten versteckt ist
  • Behaupten, ein Tool habe etwas zurückgegeben, was es nicht tat

Vier Unterdrücker

Das Tool enthält vier in Claude Code integrierte Unterdrücker, die als einzelner Schritt laufen, bevor die Agentenausgabe die Benutzer erreicht:

  • grounding_enforcer - prüft, ob die Modellausgabe tatsächlich durch die übergebenen Quellen unterstützt wird
  • prompt_suppressor - erkennt Injektionsversuche in abgerufenen Inhalten und Tool-Ergebnissen
  • json_suppressor - validiert strukturierte Tool-Antworten gegen erwartete Schemata
  • tool_response_suppressor - markiert, wenn die behauptete Ausgabe eines Tools nicht mit dem übereinstimmt, was es zurückgegeben hat
Ad

Verfügbarkeit

Das Tool ist in zwei Formaten verfügbar:

  • Eine REST-API
  • Ein MCP-Server (funktioniert mit Claude Desktop, Cursor, Windsurf usw.)

Der kostenlose Tarif bietet 500 Anfragen/Monat ohne Kreditkarte.

Source und Dokumentation

GitHub-Repository: https://github.com/steveswain14/mcp-hallucination-suite

API und Dokumentation: https://certifai.dev

📖 Read the full source: r/ClaudeAI

Ad

👀 Siehe auch

agentmemory V4 erreicht 96,2 % auf dem LongMemEval-Benchmark und übertrifft damit kommerzielle KI-Gedächtnissysteme.
Werkzeuge

agentmemory V4 erreicht 96,2 % auf dem LongMemEval-Benchmark und übertrifft damit kommerzielle KI-Gedächtnissysteme.

agentmemory V4 erreichte 96,2 % auf LongMemEval und übertraf damit mehrere geförderte KI-Speicherunternehmen, darunter PwC Chronos (95,6 %), Mastra (94,87 %) und OMEGA (93,2 %). Das System wurde allein in 16 Tagen auf einem Mittelklasse-Gaming-PC mit einem Budget von 1.000 US-Dollar entwickelt.

OpenClawRadar
Open-Sourced the-vibe-stack: Markdown-Regeln zur Aufrechterhaltung der Code-Konsistenz von Claude
Werkzeuge

Open-Sourced the-vibe-stack: Markdown-Regeln zur Aufrechterhaltung der Code-Konsistenz von Claude

Ein Entwickler hat 'the-vibe-stack' als Open-Source veröffentlicht – eine Reihe von Markdown-Regeln, die darauf ausgelegt sind, Claude Code während längerer Sitzungen auf Kurs zu halten, indem sie ein starres Schema vorgeben. Der Ansatz zielt darauf ab, Logikdrift und Token-Verschwendung zu reduzieren und gleichzeitig vorhersehbare Ergebnisse zu gewährleisten.

OpenClawRadar
CodeVibe: Push-Benachrichtigungen für KI-Codierungsagenten bei blockierter Eingabe
Werkzeuge

CodeVibe: Push-Benachrichtigungen für KI-Codierungsagenten bei blockierter Eingabe

CodeVibe sendet Push-Benachrichtigungen auf Ihr Telefon, wenn KI-Coding-Agenten wie Claude Code bei der Genehmigung von Bearbeitungsvorgängen feststecken. Sie können Dateiunterschiede prüfen und mit nummerierten Optionen antworten, um den Agenten in Bewegung zu halten.

OpenClawRadar
Claude Skills Hub: Durchsuchbares Repository für 789+ Claude Code Skills und 10 autonome Agenten
Werkzeuge

Claude Skills Hub: Durchsuchbares Repository für 789+ Claude Code Skills und 10 autonome Agenten

Claude Skills Hub (clskills.in) bietet eine zentralisierte Suchoberfläche für 789+ Claude Code Skill-Dateien in 71 Kategorien sowie 10 autonome KI-Agenten, die mehrere Skills zu vollständigen Workflows verknüpfen. Das Open-Source-Projekt sammelt Skills aus mehreren Community-Sammlungen und ermöglicht Downloads mit einem Klick.

OpenClawRadar