Construcción de un RAG agéntico para Obsidian con Claude y un arnés de evaluación para detectar alucinaciones

✍️ OpenClawRadar📅 Publicado: 16 de mayo de 2026🔗 Source
Construcción de un RAG agéntico para Obsidian con Claude y un arnés de evaluación para detectar alucinaciones
Ad

Un desarrollador en r/ClaudeAI construyó un sistema RAG agéntico sobre su bóveda de Obsidian para que Claude respondiera preguntas de PDFs de ingeniería sin agotar el límite semanal de tokens. El flujo de trabajo: convertir PDFs de ingeniería a markdown, colocarlos en una bóveda de Obsidian, usar un agente barato (Kimi K2.5) para la recuperación BM25 sobre la bóveda, y que Claude solo vea fragmentos relevantes en lugar de libros completos. Esto redujo el costo de tokens por pregunta de ~50k a ~5k.

El nuevo problema: el agente a veces se equivocaba con seguridad — por ejemplo, diciendo "Marco Aurelio escribió sobre la muerte en el Libro IX, sección 3" cuando el pasaje canónico estaba en el Libro IV, sección 5. Lo suficientemente plausible como para requerir verificación manual. Así que el desarrollador construyó un arnés de evaluación usando Claude Sonnet 4.6 como juez LLM, deliberadamente una familia de modelos diferente del agente Kimi para evitar calificar su propia salida.

La rúbrica inicial tenía cuatro categorías, incluyendo un 0.7 "débil pero no incorrecto". Al calificar manualmente, el evaluador humano (el mismo desarrollador, ciego, en un día diferente) también colapsó todo lo límite en 0.7. El número de concordancia parecía respetable, pero en realidad medía un sesgo compartido. Después de cuatro iteraciones de la rúbrica, la versión funcional eliminó por completo la categoría intermedia y añadió una categoría 0.9 para un caso específico: "respuesta correcta, fragmento incorrecto". Este caso antes causaba un falso positivo (1.0 encubriendo una falla de recuperación) o un falso negativo (0.4 castigando una respuesta correcta). La división lo solucionó.

Ad

Bajo la nueva rúbrica, la concordancia del juez con el humano en 18 filas pasó de 7/18 (39%) a 17/18 (94%). Salvedades: 18 filas son una muestra pequeña, un solo evaluador (confiabilidad entre evaluadores no establecida), BM25 no es novedoso (pero funciona bien para corpus técnicos/literarios donde la superposición de vocabulario entre consulta y documento es alta). Un resultado negativo: la misma técnica de fragmentación que elevó un corpus en 33pp hizo retroceder otro en 17pp en la misma evaluación — el arnés lo detectó en la primera ejecución.

El artículo completo con la historia de las cuatro iteraciones de la rúbrica, la hoja de trabajo de calibración y la nota sobre el resultado negativo está en Medium. El autor tiene curiosidad sobre otros que usen Claude Sonnet como juez para sus configuraciones RAG/agente, qué rúbrica adoptaron y cómo manejan la confiabilidad entre evaluadores con un solo humano en el ciclo.

📖 Read the full source: r/ClaudeAI

Ad

👀 Ver también

El Agente OpenClaw Mantiene la Memoria al Cambiar de la Suscripción de Claude a la API
Herramientas

El Agente OpenClaw Mantiene la Memoria al Cambiar de la Suscripción de Claude a la API

Un desarrollador informa haber migrado con éxito su configuración de OpenClaw de una suscripción a Claude a una clave API sin perder la memoria del agente, utilizando la habilidad mengram-memory que guarda en una capa externa. El agente conservó ~100+ hechos aprendidos, procedimientos evolucionados y recuerdos episódicos.

OpenClawRadar
Claude Opus 4.6: Un modelo para tareas de ingeniería sostenida
Herramientas

Claude Opus 4.6: Un modelo para tareas de ingeniería sostenida

Claude Opus 4.6 pone un enfoque sostenido en proyectos a largo plazo, apoyando tareas de varios días con características como un contexto ultra-largo y pensamiento adaptable.

OpenClawRadar
Habilidad apple-music-play de OpenClaw publicada en ClawHub para búsqueda y reproducción en Apple Music
Herramientas

Habilidad apple-music-play de OpenClaw publicada en ClawHub para búsqueda y reproducción en Apple Music

La habilidad apple-music-play publicada en ClawHub permite buscar en el catálogo en línea de Apple Music y reproducir pistas directamente en la aplicación Música de macOS, sin necesidad de que las canciones estén en tu biblioteca local.

OpenClawRadar
Relvy mejora la precisión del análisis de causa raíz de Claude en 12 puntos porcentuales en el benchmark OpenRCA.
Herramientas

Relvy mejora la precisión del análisis de causa raíz de Claude en 12 puntos porcentuales en el benchmark OpenRCA.

Relvy, una herramienta que automatiza los manuales de procedimientos, ha demostrado una mejora de 12 puntos porcentuales en la precisión de Claude en el benchmark OpenRCA para el análisis de causa raíz. Los resultados se compartieron a través de una publicación en Hacker News con 11 puntos.

OpenClawRadar