Experimento de Auditoría de Seguridad Muestra que el Rendimiento del Agente de IA Depende del Acceso al Conocimiento

Un usuario de Reddit realizó un experimento comparando enfoques de auditoría de seguridad con IA en la misma base de código para probar cómo el acceso al conocimiento afecta los resultados. El experimento utilizó el kit de inicio SaaS de código abierto Next.js de BoxyHQ como sujeto de prueba.
Tres métodos de auditoría comparados
El desarrollador ejecutó tres auditorías de seguridad independientes:
- Revisión de seguridad incorporada de Claude Code: Encontró 1 crítica, 6 altas y 13 medias de severidad
- Agente de IA sin contexto adicional: Encontró 1 crítica, 5 altas y 14 medias de severidad
- Agente de IA con 10 libros profesionales de seguridad: Encontró 8 críticas, 9 altas y 10 medias de severidad
Hallazgos clave
El agente equipado con libros identificó vulnerabilidades que los otros métodos pasaron por completo, incluyendo:
- Tokens de restablecimiento de contraseña almacenados en texto plano
- Una condición de carrera TOCTOU (Time-of-Check to Time-of-Use) en la validación de tokens
- Una bandera de característica que llama a
res.status(404)pero no retorna, permitiendo que la ejecución continúe
El desarrollador señaló que estos no son casos límite oscuros sino el tipo de problemas que aparecen en violaciones de seguridad reales. El experimento utilizó la misma base de código y el mismo modelo de IA en las tres pruebas, siendo la única variable el conocimiento al que el agente tenía acceso.
Implicaciones para el desarrollo asistido por IA
El experimento sugiere que los agentes de IA no están limitados por la inteligencia sino por qué conocimiento pueden acceder cuando es necesario. El desarrollador concluyó que el conocimiento de seguridad "vive por encima del código" en lugar de dentro de él, destacando la importancia de proporcionar referencias específicas del dominio a las herramientas de IA en lugar de confiar únicamente en su entrenamiento base.
Este enfoque de aumentar los agentes de IA con fuentes de conocimiento especializadas podría ser particularmente relevante para desarrolladores que utilizan asistentes de codificación con IA para revisiones de seguridad, donde el acceso a referencias de seguridad actuales y mejores prácticas impacta significativamente la calidad de los hallazgos.
📖 Read the full source: r/ClaudeAI
👀 Ver también

Inyección de mensajes en la capa de audio contra Claude: Lo que no está en la transcripción
Un constructor de una API de detección de inyección de prompts comparte hallazgos sobre ataques en la capa de audio contra Claude, revelando que los ataques en la señal (no en la transcripción) son invisibles en los registros y representan una amenaza real para los agentes de voz.

Los Guardarrieles de los Agentes de IA se Deterioran con el Tiempo sin Mantenimiento Activo
Las barreras de protección de los agentes de IA se degradan con el tiempo a medida que los prompts del sistema acumulan actualizaciones, cambian las versiones del modelo y se añaden nuevas herramientas, lo que a menudo resulta en reglas de seguridad contradictorias o ignoradas que requieren revisión y pruebas periódicas.

Usuario de OpenClaw Agrega TOTP 2FA Después de que Agente Expusiera Claves API en Texto Plano
Un usuario de OpenClaw creó una habilidad de seguridad llamada 'Secure Reveal' que requiere autenticación TOTP a través de Telegram antes de mostrar las credenciales almacenadas, después de que su agente de IA filtrara accidentalmente claves API y contraseñas en texto plano durante una demostración.

OpenClaw Fortalecimiento de Seguridad: Protección Multicapa Contra Riesgos de Agentes Autónomos
Un desarrollador modificó la base de código de OpenClaw para agregar una pila de seguridad de múltiples capas que incluye un guardia de regex de denegación estricta, un desofuscador recursivo, un perfil de AppArmor e integración de auditoría para evitar comandos destructivos y exfiltración de datos por parte de agentes autónomos.