Construcción de un RAG agéntico para Obsidian con Claude y un arnés de evaluación para detectar alucinaciones

✍️ OpenClawRadar📅 Publicado: 16 de mayo de 2026🔗 Source
Construcción de un RAG agéntico para Obsidian con Claude y un arnés de evaluación para detectar alucinaciones
Ad

Un desarrollador en r/ClaudeAI construyó un sistema RAG agéntico sobre su bóveda de Obsidian para que Claude respondiera preguntas de PDFs de ingeniería sin agotar el límite semanal de tokens. El flujo de trabajo: convertir PDFs de ingeniería a markdown, colocarlos en una bóveda de Obsidian, usar un agente barato (Kimi K2.5) para la recuperación BM25 sobre la bóveda, y que Claude solo vea fragmentos relevantes en lugar de libros completos. Esto redujo el costo de tokens por pregunta de ~50k a ~5k.

El nuevo problema: el agente a veces se equivocaba con seguridad — por ejemplo, diciendo "Marco Aurelio escribió sobre la muerte en el Libro IX, sección 3" cuando el pasaje canónico estaba en el Libro IV, sección 5. Lo suficientemente plausible como para requerir verificación manual. Así que el desarrollador construyó un arnés de evaluación usando Claude Sonnet 4.6 como juez LLM, deliberadamente una familia de modelos diferente del agente Kimi para evitar calificar su propia salida.

La rúbrica inicial tenía cuatro categorías, incluyendo un 0.7 "débil pero no incorrecto". Al calificar manualmente, el evaluador humano (el mismo desarrollador, ciego, en un día diferente) también colapsó todo lo límite en 0.7. El número de concordancia parecía respetable, pero en realidad medía un sesgo compartido. Después de cuatro iteraciones de la rúbrica, la versión funcional eliminó por completo la categoría intermedia y añadió una categoría 0.9 para un caso específico: "respuesta correcta, fragmento incorrecto". Este caso antes causaba un falso positivo (1.0 encubriendo una falla de recuperación) o un falso negativo (0.4 castigando una respuesta correcta). La división lo solucionó.

Ad

Bajo la nueva rúbrica, la concordancia del juez con el humano en 18 filas pasó de 7/18 (39%) a 17/18 (94%). Salvedades: 18 filas son una muestra pequeña, un solo evaluador (confiabilidad entre evaluadores no establecida), BM25 no es novedoso (pero funciona bien para corpus técnicos/literarios donde la superposición de vocabulario entre consulta y documento es alta). Un resultado negativo: la misma técnica de fragmentación que elevó un corpus en 33pp hizo retroceder otro en 17pp en la misma evaluación — el arnés lo detectó en la primera ejecución.

El artículo completo con la historia de las cuatro iteraciones de la rúbrica, la hoja de trabajo de calibración y la nota sobre el resultado negativo está en Medium. El autor tiene curiosidad sobre otros que usen Claude Sonnet como juez para sus configuraciones RAG/agente, qué rúbrica adoptaron y cómo manejan la confiabilidad entre evaluadores con un solo humano en el ciclo.

📖 Read the full source: r/ClaudeAI

Ad

👀 Ver también

Cámara: Agente de IA para la Gestión de Infraestructura de GPU
Herramientas

Cámara: Agente de IA para la Gestión de Infraestructura de GPU

Chamber es un agente de IA que gestiona la infraestructura de GPU manejando tareas como el aprovisionamiento de clústeres, el diagnóstico de trabajos fallidos y la gestión de cargas de trabajo. Proporciona operaciones estructuradas con validación y reversión, no solo comandos de shell sin procesar.

OpenClawRadar
Herramienta de código abierto para feeds de Reddit curados por IA utilizando Cloudflare, Supabase y Vercel
Herramientas

Herramienta de código abierto para feeds de Reddit curados por IA utilizando Cloudflare, Supabase y Vercel

Un desarrollador ha liberado como código abierto una herramienta autoalojada que filtra Reddit para encontrar publicaciones de calidad sobre desarrollo asistido por IA, utilizando Cloudflare Workers para trabajos cron y proxies, Supabase para almacenamiento y Vercel para el frontend. La herramienta incluye puntuación de participación, resúmenes opcionales con LLM y cuesta $1-2/mes para el procesamiento de IA.

OpenClawRadar
Desarrollador comparte solución para que Claude AI ignore reglas más allá del umbral de 50 conteos
Herramientas

Desarrollador comparte solución para que Claude AI ignore reglas más allá del umbral de 50 conteos

Un desarrollador informa que Claude Code comenzó a ignorar reglas silenciosamente una vez que su conjunto de reglas compartidas superó aproximadamente 50 elementos, especialmente durante tareas intensivas en frontend. Crearon un hook que escanea los prompts y carga solo 2-3 reglas relevantes basándose en coincidencias de palabras clave.

OpenClawRadar
Tokenmeter: Aplicación gratuita de Windows para rastrear el uso de tokens de Claude Code sin conexión
Herramientas

Tokenmeter: Aplicación gratuita de Windows para rastrear el uso de tokens de Claude Code sin conexión

Tokenmeter es una aplicación gratuita de código abierto para Windows que lee archivos locales .jsonl de Claude Code para mostrar el uso de tokens, costos estimados, ahorros en caché y un mapa de calor de actividad de 90 días, todo sin conexión.

OpenClawRadar