오픈소스 AI 에이전트 파이프라인용 구조적 환각 검사기

기능
AI 에이전트 파이프라인을 위해 특별히 설계된 구조적 환각 검사기입니다. 사실 확인과 달리, 이 도구는 다운스트림 도구를 중단시키는 구조적 실패를 포착하는 데 중점을 둡니다.
해결하는 문제
대부분의 에이전트 문제는 사실 오류가 아닌 다음과 같은 구조적 문제입니다:
- 모델이 JSON 도구 응답에 필드를 임의로 추가하는 경우
- 검색된 집합에 없던 소스를 인용하는 경우
- 검색된 콘텐츠 내에 숨겨진 프롬프트 주입
- 도구가 반환하지 않은 내용을 반환했다고 주장하는 경우
네 가지 억제기
이 도구에는 Claude Code로 구축된 네 가지 억제기가 포함되어 있으며, 에이전트 출력이 사용자에게 도달하기 전에 단일 단계로 실행됩니다:
grounding_enforcer- 모델 출력이 실제로 전달된 소스에 의해 지원되는지 확인prompt_suppressor- 검색된 콘텐츠 및 도구 결과에서 주입 시도를 포착json_suppressor- 구조화된 도구 응답을 예상 스키마에 대해 검증tool_response_suppressor- 도구의 주장된 출력이 실제 반환 내용과 일치하지 않을 때 표시
이용 가능성
이 도구는 두 가지 형식으로 이용 가능합니다:
- REST API
- MCP 서버 (Claude Desktop, Cursor, Windsurf 등과 호환)
무료 티어는 신용카드 없이 월 500회 요청을 제공합니다.
소스 및 문서
GitHub 저장소: https://github.com/steveswain14/mcp-hallucination-suite
API 및 문서: https://certifai.dev
📖 전체 소스 읽기: r/ClaudeAI
👀 See Also

오픈 소스 시스템이 클로드 코드 패턴을 진화하는 문서로 캡처합니다
개발자 Lee Fuhr는 Claude Code 작업에서 얻은 학습 내용을 체계적으로 포착하고 체계화한 세 가지 오픈소스 저장소를 공개했습니다. 이 시스템에는 14가지 원칙과 19가지 패턴을 담은 방법론 문서, 아키텍처 분류 프레임워크, 그리고 149가지 기능을 갖춘 메모리 시스템이 포함되어 있습니다.

Claude Code, 3주 견적 개발자를 6시간에 SaaS 온보딩 플로우 재구축, 활성화율 13% 향상
한 SaaS 창업자가 Claude Code를 사용하여 온보딩 플로우 전체(회원가입 → 프로필 → 첫 인보이스 → 대시보드 튜토리얼)를 6시간 만에 재구축했습니다. 개발자가 3주, $4,500을 견적했던 작업이었습니다. 활성화율이 35%에서 48%로 13% 포인트 상승했습니다.

ToolLoop: 모든 모델과 함께 사용할 수 있는 Claude 스타일 도구용 오픈소스 에이전트 프레임워크
ToolLoop는 LiteLLM을 통해 모든 LLM과 작동하는 파일 작업, 코드 검색, 셸 접근 및 하위 에이전트를 위한 11가지 도구를 갖춘 오픈소스 Python 프레임워크입니다. 2,700줄의 이 프레임워크는 공유 컨텍스트로 대화 중간에 모델을 전환할 수 있습니다.

AI Doomsday Toolbox v0.932는 Android 로컬 AI를 위한 벤치마킹, 데이터셋 생성, 에이전트 작업 공간을 추가합니다.
AI Doomsday Toolbox v0.932는 Android 기기에서 로컬 LLM 벤치마킹, 텍스트/PDF 파일을 Alpaca JSON 형식으로 변환하는 데이터셋 생성기, Termux 통합 AI 에이전트 작업 공간을 도입했습니다. 이 업데이트에는 Whisper를 이용한 자막 입히기와 내장 Ollama 관리 도구도 포함됩니다.