Investigador Desarrolla Habilidad de Verificación de Veracidad para Código Claude, Encuentra Alucinaciones en su Propia Documentación

✍️ OpenClawRadar📅 Publicado: 20 de abril de 2026🔗 Source
Ad

Arquitectura de la Habilidad de Verificación de Veracidad

Un investigador con formación en ciencia del sueño de la Universidad de Miami creó una habilidad de Claude Code llamada /veracity-tweaked-555 que descompone documentos en afirmaciones atómicas y verifica cada una mediante búsqueda web. La herramienta utiliza 16 agentes paralelos en 4 oleadas por ejecución y fue desarrollada en colaboración con Claude Code (Opus 4.6), donde Claude redactó el código mientras el investigador diseñó la metodología.

Resultados de Autoauditoría y Patrones de Error

Cuando el investigador ejecutó el verificador de veracidad en su propia documentación SKILL.md, obtuvo 62 de 100 puntos. La habilidad diseñada para detectar alucinaciones había generado hechos falsos en su propia documentación, incluyendo:

  • Fabricar una estadística de rendimiento ("3 veces más preciso" para SAFE, lo cual el artículo nunca afirma)
  • Exagerar una afirmación de mejora de un artículo ("+35.5%" era en realidad +5.5% sobre el estado del arte)
  • Inventar una expansión de acrónimo para una técnica real

Después de correcciones iniciales, la puntuación alcanzó 80, luego 84 tras una tercera ejecución. Una semana después, tras un ciclo de convergencia más riguroso con 6 ejecuciones, 19 agentes y 35 correcciones adicionales, se estabilizó en 96.5/100. Sin embargo, la auditoría v3 cayó a 74 porque las correcciones de v1 habían introducido nuevos errores (un costo de tokens subestimado y una lista de herramientas incompleta).

Los errores siguen patrones consistentes: exageración de atribución (lenguaje ligeramente más fuerte de lo que justifica la fuente), identificadores plausibles-pero-fabricados (PMID, IDs de arXiv que parecen reales pero apuntan a artículos diferentes) y estadísticas desactualizadas presentadas como actuales.

Ad

Desafío de Ingeniería de Contexto

Una sola ejecución de auditoría genera aproximadamente 917K tokens entre 16 agentes, superando la ventana de contexto de 200K de Claude Code. Cuando Claude Code compacta conversaciones para mantenerse dentro de los límites, realiza compresión con pérdida. Después de algunas compactaciones, el agente pierde el rastro de cómo se relacionan los hallazgos entre sí — qué corrección causó qué regresión, qué afirmación contradice a cuál otra. Los hechos individuales (nombres, números, firmas de funciones) sobreviven mejor que las conexiones entre ellos.

El diagnóstico de Claude fue que la información relacional — cadenas causales, referencias cruzadas, dependencias de múltiples pasos — es más difícil de preservar en un resumen que los hechos aislados.

Solución y Auditorías Adicionales de Habilidades

El investigador resolvió esto creando una habilidad complementaria llamada /context-engineer que predice el desbordamiento antes de que ocurra y externaliza el estado relacional a archivos JSON en disco. La prueba de diseño: si puedes /clear toda tu conversación y reanudar solo desde el archivo de estado, la arquitectura es correcta.

Ejecutar verificaciones de veracidad en otras habilidades de Claude Code reveló:

  • Una habilidad tenía un título de artículo fabricado en su sección de atribución — la cita parecía perfecta (autores, evento) pero el título era inventado y el año estaba incorrecto
  • La misma habilidad atribuyó erróneamente un marco de auditoría al organismo de estándares equivocado, apareciendo en múltiples ubicaciones
  • La habilidad /context-engineer tenía inconsistencias internas — el texto decía "5-10K tokens" mientras una tabla decía "5-15K tokens" para la misma métrica

Se necesitaron 12 correcciones en total en todas las habilidades. Todas aprobaron con 95+ en 3 ejecuciones consecutivas después de las correcciones.

📖 Read the full source: r/ClaudeAI

Ad

👀 Ver también

Corbell: CLI de Código Abierto para Análisis de Arquitectura y Documentos de Diseño entre Repositorios
Herramientas

Corbell: CLI de Código Abierto para Análisis de Arquitectura y Documentos de Diseño entre Repositorios

Corbell es una herramienta CLI gratuita y de código abierto que escanea múltiples repositorios para construir un gráfico de arquitectura y generar documentación de diseño localmente. Funciona completamente sin conexión con Ollama o admite varios proveedores de LLM, y nunca envía código fuera de tu máquina.

OpenClawRadar
Corrección de la inflación de contexto en la memoria automática de Claude Code con un esquema de nombres y script de auditoría
Herramientas

Corrección de la inflación de contexto en la memoria automática de Claude Code con un esquema de nombres y script de auditoría

Una habilidad de Claude Code impone un esquema de nomenclatura de 3 tipos, metadatos obligatorios y un script de auditoría en bash para deduplicar archivos de memoria y reducir la carga de contexto.

OpenClawRadar
Configurando OpenClaw como un asistente de IA siempre activo
Herramientas

Configurando OpenClaw como un asistente de IA siempre activo

OpenClaw, configurado como un asistente de IA siempre activo para un pequeño equipo de desarrollo, está alojado en un servidor Railway con Claude como backend e integra Google Workspace, GitHub y más.

OpenClawRadar
El espejismo del trabajo terminado en Claude Code: Por qué revisar el camino del agente importa más que el diff
Herramientas

El espejismo del trabajo terminado en Claude Code: Por qué revisar el camino del agente importa más que el diff

Claude Code puede generar un diff limpio, pruebas que pasan y un buen resumen, pero aún así pasar por alto problemas reales de comportamiento, seguridad o restricciones de arquitectura. El autor sostiene que ahora es esencial revisar la cadena de acciones (planes, archivos leídos, comandos ejecutados, salida de pruebas), no solo el diff final.

OpenClawRadar