Construindo um RAG Agentic para o Obsidian com Claude e uma Estrutura de Avaliação para Detectar Alucinações

Um desenvolvedor no r/ClaudeAI construiu um sistema RAG agêntico sobre seu cofre Obsidian para permitir que o Claude respondesse perguntas de PDFs de engenharia sem estourar o limite semanal de tokens. O fluxo de trabalho: converter PDFs de engenharia para markdown, colocá-los em um cofre Obsidian, usar um agente barato (Kimi K2.5) para recuperação BM25 sobre o cofre, e fazer o Claude ver apenas partes relevantes em vez de livros inteiros. Isso reduziu o custo de token por pergunta de ~50k para ~5k.
O novo problema: o agente às vezes estava confiantemente errado — por exemplo, dizendo "Marco Aurélio escreveu sobre a morte no Livro IX, seção 3" quando a passagem canônica estava no Livro IV, seção 5. Plausível o suficiente para exigir verificação manual. Então o desenvolvedor construiu um harness de avaliação usando o Claude Sonnet 4.6 como juiz LLM, deliberadamente uma família de modelos diferente do agente Kimi para evitar avaliar sua própria saída.
A rubrica inicial tinha quatro categorias, incluindo um 0.7 "raso, mas não errado". Na avaliação manual, o avaliador humano (o mesmo desenvolvedor, às cegas, em um dia diferente) também colocou tudo que era borderline em 0.7. O número de concordância parecia respeitável, mas na verdade media um viés compartilhado. Após quatro iterações da rubrica, a versão funcional eliminou a categoria intermediária e adicionou uma categoria 0.9 para um caso específico: "resposta certa, pedaço errado". Esse caso anteriormente causava um falso positivo (1.0 mascarando uma falha de recuperação) ou falso negativo (0.4 punindo uma resposta correta). A divisão corrigiu isso.
Sob a nova rubrica, a concordância do juiz com o humano em 18 linhas foi de 7/18 (39%) para 17/18 (94%). Ressalvas: 18 linhas é uma amostra pequena, avaliador único (confiabilidade entre avaliadores não estabelecida), BM25 não é novidade (mas funciona bem para corpora técnicos/literários onde a sobreposição de vocabulário consulta/documento é alta). Um resultado negativo: a mesma técnica de divisão de pedaços que elevou um corpus em 33 pontos percentuais fez outro regredir 17pp na mesma avaliação — o harness detectou isso na primeira execução.
O artigo completo com a história das quatro iterações da rubrica, planilha de calibração e nota de resultado negativo está no Medium. O autor está curioso sobre outros usando Claude Sonnet como juiz para seus sistemas RAG/agentes, qual rubrica eles adotaram e como lidam com a confiabilidade entre avaliadores com um único humano no loop.
📖 Leia a fonte completa: r/ClaudeAI
👀 See Also

Reformular o comando de barra para Claude Code aplica técnica de ciência cognitiva à resolução de problemas
Um desenvolvedor criou um comando de barra /reframe para o Claude Code que implementa uma técnica de ciência cognitiva chamada oscilação distância-engajamento. A abordagem foi testada em três LLMs de código aberto com 50 problemas e superou consistentemente outros métodos.

GrapeRoot MCP Tool Reduz o Uso de Tokens de Código do Claude em 50-70%
Um desenvolvedor criou o GrapeRoot, uma ferramenta MCP usando Claude Code, que rastreia arquivos explorados e evita reler conteúdo inalterado, reduzindo o uso de tokens em 50-70% e fazendo planos de $20 do Claude Code durarem 2-3× mais.

OpenHelm: Um Aplicativo macOS para Automatizar Tarefas de Código do Claude
OpenHelm é um aplicativo gratuito e local para macOS que automatiza tarefas repetitivas de codificação com o Claude, executando trabalhos em um cronograma, repetindo automaticamente falhas e dividindo o trabalho em partes para evitar limites de sessão. Ele usa sua assinatura existente do Claude para chamadas de LLM.

Fennara: Plugin Godot + MCP para Agentes de IA com Loop de Feedback Iterativo
Fennara é um plugin Godot e servidor MCP que fornece a agentes de IA diagnósticos de script, validação de cena, erros em tempo de execução, informações de nós, capturas de tela e resultados de pesquisa semântica após cada edição — possibilitando um ciclo de feedback mais apertado do que comandos únicos.