AIエージェントパイプライン向けオープンソース構造的幻覚チェッカー

✍️ OpenClawRadar📅 公開日: March 11, 2026🔗 Source
AIエージェントパイプライン向けオープンソース構造的幻覚チェッカー
Ad

機能概要

AIエージェントパイプライン向けに特別に設計された構造的ハルシネーションチェッカー。事実確認とは異なり、このツールは下流ツールを破壊する構造的失敗の検出に焦点を当てています。

解決する課題

エージェントの問題の多くは事実誤認ではなく、以下のような構造的問題です:

  • JSONツール応答でモデルがフィールドを捏造する
  • 取得セットに含まれていないソースを引用する
  • 取得コンテンツ内に隠されたプロンプトインジェクション
  • ツールが返していない内容を返したと主張する

4つの抑制機能

このツールには、Claude Codeで構築された4つの抑制機能が含まれており、エージェントの出力がユーザーに届く前に単一ステップとして実行されます:

  • grounding_enforcer - モデル出力が実際に渡されたソースでサポートされているか確認
  • prompt_suppressor - 取得コンテンツやツール結果におけるインジェクション試行を検出
  • json_suppressor - 構造化ツール応答を期待されるスキーマに対して検証
  • tool_response_suppressor - ツールが主張する出力と実際の返り値が一致しない場合にフラグを立てる

利用方法

このツールは2つの形式で利用可能です:

  • REST API
  • MCPサーバー(Claude Desktop、Cursor、Windsurfなどと連携)

無料枠ではクレジットカード不要で月500リクエストを提供します。

ソースとドキュメント

GitHubリポジトリ: https://github.com/steveswain14/mcp-hallucination-suite

APIとドキュメント: https://certifai.dev

📖 Read the full source: r/ClaudeAI

Ad

👀 See Also

スキルビル:AIコーディングスキルのためのマークダウンベースのガバナンスフレームワーク
Tools

スキルビル:AIコーディングスキルのためのマークダウンベースのガバナンスフレームワーク

開発者は、Kotlin、Android/KMP、PHP、Go向けに44のMarkdownベースのAIスキルからなるフレームワーク「Skill Bill」を構築しました。これは、命名のずれや重複ロジックなどのプロンプト管理の問題に対処します。また、10〜12のスキル呼び出しを連鎖させる「feature-implement」などのオーケストレータースキルを含み、Claude Code、Copilot、GLM、Codexと同期します。

OpenClawRadar
AIのために人員削減した企業は、そうしなかった企業に負けるだろう
Tools

AIのために人員削減した企業は、そうしなかった企業に負けるだろう

AIによる人員削減は、長期的な組織知を短期的なコスト削減と引き換えにします。チームを維持し、AIで能力を増幅させる戦略こそが勝利への道です。

OpenClawRadar
Supra-50M-Reasoning:チェーン・オブ・ソート思考を備えたオープンソースの小型モデル
Tools

Supra-50M-Reasoning:チェーン・オブ・ソート思考を備えたオープンソースの小型モデル

SupraLabsがSupra-50M-Reasoningを公開。50Mパラメータのモデルで、回答前に完全な思考連鎖を生成するようファインチューニング。手書き500サンプルのデータセット、完全オープンソース。

OpenClawRadar
エージェントメモリV4は、LongMemEvalベンチマークで96.2%を達成し、商用AIメモリシステムを上回りました。
Tools

エージェントメモリV4は、LongMemEvalベンチマークで96.2%を達成し、商用AIメモリシステムを上回りました。

agentmemory V4はLongMemEvalで96.2%のスコアを獲得し、PwC Chronos(95.6%)、Mastra(94.87%)、OMEGA(93.2%)など複数の資金調達済みAIメモリ企業を上回りました。このシステムは中程度のゲーミングPCを使用し、1,000ドルの予算で16日間で単独で構築されました。

OpenClawRadar