Claude와 평가 하네스를 사용하여 환각을 감지하는 Obsidian용 에이전틱 RAG 구축하기

r/ClaudeAI의 한 개발자가 Obsidian 볼트 위에 에이전틱 RAG 시스템을 구축하여 Claude가 엔지니어링 PDF의 질문에 답변할 때 주간 토큰 한도를 초과하지 않도록 했습니다. 워크플로우: 엔지니어링 PDF를 마크다운으로 변환하고, 이를 Obsidian 볼트에 넣은 후, 저렴한 에이전트(Kimi K2.5)를 사용하여 볼트에서 BM25 검색을 수행하고, Claude는 전체 책 대신 관련 청크만 보게 합니다. 이렇게 하여 질문당 토큰 비용이 약 50k에서 5k로 줄었습니다.
새로운 문제: 에이전트가 때때로 자신 있게 틀린 답변을 했습니다. 예를 들어, 정식 구절이 4권 5장에 있는데 "마르쿠스 아우렐리우스가 9권 3장에서 죽음에 대해 썼다"고 말하는 식입니다. 충분히 그럴듯해서 수동 검증이 필요했습니다. 그래서 개발자는 Claude Sonnet 4.6을 LLM 평가자로 사용하는 평가 하네스를 구축했는데, 의도적으로 Kimi 에이전트와 다른 모델 제품군을 선택하여 자신의 출력을 평가하지 않도록 했습니다.
초기 루브릭은 0.7 "얇지만 틀리지 않음"을 포함한 네 개의 버킷이 있었습니다. 수동 채점할 때, 인간 채점자(동일한 개발자, 블라인드, 다른 날짜)도 경계선에 있는 모든 것을 0.7로 처리했습니다. 일치율이 괜찮아 보였지만 실제로는 공유 편향을 측정한 것이었습니다. 네 번의 루브릭 반복 후, 작업 버전은 중간 버킷을 완전히 없애고 한 가지 특정 경우에 대해 0.9 버킷을 추가했습니다: "정답이지만 잘못된 청크". 이 경우 이전에는 거짓 양성(1.0이 검색 실패를 감춤) 또는 거짓 음성(0.4가 정답을 처벌)을 유발했습니다. 이 분할로 문제가 해결되었습니다.
새로운 루브릭에서 18개 행에 대한 평가자-인간 일치율이 7/18(39%)에서 17/18(94%)로 향상되었습니다. 주의사항: 18개 행은 작은 샘플이고, 단일 평가자(평가자 간 신뢰도 미확립)이며, BM25는 새롭지 않지만(질의/문서 어휘 중복이 높은 기술/문학 코퍼스에서 잘 작동), 한 코퍼스를 33pp 향상시킨 동일한 청킹 기법이 동일한 평가에서 다른 코퍼스를 17pp 퇴보시켰습니다. 하네스가 첫 번째 실행에서 이를 잡아냈습니다.
4회에 걸친 루브릭 개선 이야기, 보정 워크시트 및 부정적인 결과 메모가 포함된 전체 글은 Medium에 있습니다. 저자는 RAG/에이전트 설정에서 Claude Sonnet을 평가자로 사용하는 다른 사람들이 어떻게 하며, 어떤 루브릭을 최종 선택했고, 단일 인간 평가자로 평가자 간 신뢰도를 어떻게 처리하는지 궁금해합니다.
📖 전체 출처 읽기: r/ClaudeAI
👀 See Also

LLMSpend: Anthropic 및 OpenAI SDK용 오픈소스 비용 추적기
LLMSpend는 두 줄의 코드로 Anthropic 및 OpenAI SDK 호출에 비용 추적 기능을 추가하는 Python 라이브러리입니다. 외부로 데이터를 전송하지 않고 로컬 SQLite 저장소, CLI 보고서, 웹 대시보드를 제공합니다.

Composer: Claude Code 에이전트가 함께 편집하는 실시간 마크다운 에디터
Composer는 인간과 Claude Code 에이전트가 동시에 같은 문서를 편집할 수 있는 마크다운 에디터입니다. 에이전트는 MCP를 통해 연결되어 문서를 읽고, 댓글에 답하며, 제안을 남길 수 있습니다. 공개 문서는 무료이며 로그인이 필요 없습니다.

Vigil: 오픈클로 에이전트의 차단 방지를 위한 암호화 ID 시스템
OpenClaw 에이전트를 운영하는 개발자가 익명 에이전트 트래픽이 사이트들에 의해 점점 더 차단되고 있음을 확인했으며, Vigil이라는 로그인 시스템을 제안합니다. 이 시스템은 에이전트에 암호화된 ID를 부여하여 평판을 구축하고 무차별적인 차단을 피할 수 있도록 합니다.

내 오픈클로가 물리적 몸을 얻었어: 눈, 다리, 목소리를 가진 로봇 강아지
없음