Investigador Desarrolla Habilidad de Verificación de Veracidad para Código Claude, Encuentra Alucinaciones en su Propia Documentación

✍️ OpenClawRadar📅 Publicado: 20 de abril de 2026🔗 Source
Ad

Arquitectura de la Habilidad de Verificación de Veracidad

Un investigador con formación en ciencia del sueño de la Universidad de Miami creó una habilidad de Claude Code llamada /veracity-tweaked-555 que descompone documentos en afirmaciones atómicas y verifica cada una mediante búsqueda web. La herramienta utiliza 16 agentes paralelos en 4 oleadas por ejecución y fue desarrollada en colaboración con Claude Code (Opus 4.6), donde Claude redactó el código mientras el investigador diseñó la metodología.

Resultados de Autoauditoría y Patrones de Error

Cuando el investigador ejecutó el verificador de veracidad en su propia documentación SKILL.md, obtuvo 62 de 100 puntos. La habilidad diseñada para detectar alucinaciones había generado hechos falsos en su propia documentación, incluyendo:

  • Fabricar una estadística de rendimiento ("3 veces más preciso" para SAFE, lo cual el artículo nunca afirma)
  • Exagerar una afirmación de mejora de un artículo ("+35.5%" era en realidad +5.5% sobre el estado del arte)
  • Inventar una expansión de acrónimo para una técnica real

Después de correcciones iniciales, la puntuación alcanzó 80, luego 84 tras una tercera ejecución. Una semana después, tras un ciclo de convergencia más riguroso con 6 ejecuciones, 19 agentes y 35 correcciones adicionales, se estabilizó en 96.5/100. Sin embargo, la auditoría v3 cayó a 74 porque las correcciones de v1 habían introducido nuevos errores (un costo de tokens subestimado y una lista de herramientas incompleta).

Los errores siguen patrones consistentes: exageración de atribución (lenguaje ligeramente más fuerte de lo que justifica la fuente), identificadores plausibles-pero-fabricados (PMID, IDs de arXiv que parecen reales pero apuntan a artículos diferentes) y estadísticas desactualizadas presentadas como actuales.

Ad

Desafío de Ingeniería de Contexto

Una sola ejecución de auditoría genera aproximadamente 917K tokens entre 16 agentes, superando la ventana de contexto de 200K de Claude Code. Cuando Claude Code compacta conversaciones para mantenerse dentro de los límites, realiza compresión con pérdida. Después de algunas compactaciones, el agente pierde el rastro de cómo se relacionan los hallazgos entre sí — qué corrección causó qué regresión, qué afirmación contradice a cuál otra. Los hechos individuales (nombres, números, firmas de funciones) sobreviven mejor que las conexiones entre ellos.

El diagnóstico de Claude fue que la información relacional — cadenas causales, referencias cruzadas, dependencias de múltiples pasos — es más difícil de preservar en un resumen que los hechos aislados.

Solución y Auditorías Adicionales de Habilidades

El investigador resolvió esto creando una habilidad complementaria llamada /context-engineer que predice el desbordamiento antes de que ocurra y externaliza el estado relacional a archivos JSON en disco. La prueba de diseño: si puedes /clear toda tu conversación y reanudar solo desde el archivo de estado, la arquitectura es correcta.

Ejecutar verificaciones de veracidad en otras habilidades de Claude Code reveló:

  • Una habilidad tenía un título de artículo fabricado en su sección de atribución — la cita parecía perfecta (autores, evento) pero el título era inventado y el año estaba incorrecto
  • La misma habilidad atribuyó erróneamente un marco de auditoría al organismo de estándares equivocado, apareciendo en múltiples ubicaciones
  • La habilidad /context-engineer tenía inconsistencias internas — el texto decía "5-10K tokens" mientras una tabla decía "5-15K tokens" para la misma métrica

Se necesitaron 12 correcciones en total en todas las habilidades. Todas aprobaron con 95+ en 3 ejecuciones consecutivas después de las correcciones.

📖 Read the full source: r/ClaudeAI

Ad

👀 Ver también

Black LLAB: Arquitectura de Código Abierto para Enrutamiento Dinámico de Modelos y Agentes de IA en Sandbox de Docker
Herramientas

Black LLAB: Arquitectura de Código Abierto para Enrutamiento Dinámico de Modelos y Agentes de IA en Sandbox de Docker

Un desarrollador ha hecho de código abierto Black LLAB, un sistema que utiliza Mistral 3B para dirigir solicitudes entre modelos locales y en la nube, y ejecuta agentes de IA en contenedores Docker aislados con integración de OpenClaw.

OpenClawRadar
Claudius: Widget de Chat de IA Incrustable de Código Abierto para Claude
Herramientas

Claudius: Widget de Chat de IA Incrustable de Código Abierto para Claude

Claudius es un widget de chat de código abierto y autoalojado impulsado por Claude que se puede integrar en cualquier sitio web con una etiqueta de script. Funciona en Cloudflare Workers con un frontend en React e incluye funciones como indicaciones de sistema personalizadas, limitación de velocidad y cumplimiento de accesibilidad.

OpenClawRadar
El Benchmark PhAIL Evalúa Modelos VLA en Tareas Reales de Robots de Almacén
Herramientas

El Benchmark PhAIL Evalúa Modelos VLA en Tareas Reales de Robots de Almacén

PhAIL es un punto de referencia para robots reales que evalúa cuatro modelos de visión-lenguaje-acción en la recolección de pedidos de contenedor a contenedor utilizando un robot Franka FR3. El mejor modelo logró 64 unidades por hora, en comparación con 330 UPH para la teleoperación humana y más de 1,300 UPH para el trabajo manual humano.

OpenClawRadar
Atoo Studio: Espacio de Trabajo de Código Abierto para Gestionar Flujos de Trabajo Multi-Proyecto con Claude
Herramientas

Atoo Studio: Espacio de Trabajo de Código Abierto para Gestionar Flujos de Trabajo Multi-Proyecto con Claude

Atoo Studio es un espacio de trabajo de código abierto creado para abordar el caos de terminales y pestañas al usar Claude Code en múltiples proyectos. Introduce la bifurcación de sesiones como ramas de Git y permite la continuidad entre Claude Code, Codex CLI y Gemini CLI.

OpenClawRadar