Permisos de Agentes de IA: Los Humanos Pasan por Alto 1 de Cada 3 Amenazas en el Juego de 40k

✍️ OpenClawRadar📅 Publicado: 7 de agosto de 2026🔗 Source
Permisos de Agentes de IA: Los Humanos Pasan por Alto 1 de Cada 3 Amenazas en el Juego de 40k
Ad

Scale X realizó un juego de navegador donde apruebas o rechazas comandos de agentes de codificación de IA bajo presión de tiempo. Con más de 40,000 ejecuciones y 409,000 decisiones, los humanos pasaron por alto 1 de cada 3 amenazas (precisión media del 66.3%). El 32.9% de las sesiones terminaron con una puntuación negativa. El 35.2% detectó todas las amenazas, pero solo el 20.8% lo hizo sin bloquear 1 de cada 5 comandos seguros. El 7% aprobó todos los comandos, grandes fans de --dangerously-skip-permissions.

El juego incluyó 37 comandos de amenaza en cuatro categorías, con tasas de omisión:

  • Obviamente destructivos (p. ej., rm -rf /, chmod -R 777 /): 11.7%
  • Mutación persistente (p. ej., inyección en crontab, secuestro de configuración de git): 23.8%
  • Exfiltración / ejecución de código (p. ej., curl a APIs desconocidas, paquetes con typo): 33.4%
  • Violaciones de alcance (p. ej., cat ~/.aws/credentials, cat ~/.kube/config): 35.0%

El comando individual más omitido fue npm run analyze, aprobado el 64.7% de las veces. El registro de historial del juego mostraba que el script en package.json había sido modificado para incluir una exfiltración por curl, pero los jugadores aún lo aprobaban. Tres comandos de este tipo (npm run analyze, npm run setup 48.0%, npm run deploy 44.9%) se agruparon y se omitieron el 52.5% de las veces, frente al 28.4% de otros ataques de exfiltración.

Ad

Esto resalta un problema fundamental: la aprobación a nivel de comando es defectuosa. Como señaló un comentarista de HN, npm run build ejecuta un script de shell arbitrario desde package.json, y el agente podría haber editado ese archivo (o cualquier módulo importado) sin aprobación. Los usuarios ven comandos que parecen seguros, pero el contexto importa.

Anthropic señaló anteriormente que la 'fatiga de permisos' empeora con más aprobaciones. La advertencia: el juego tenía una tasa de amenaza artificialmente alta (~34%) y presión de tiempo, pero el patrón es preocupante para el humano en el circuito como mecanismo de seguridad.

📖 Lea la fuente completa: HN LLM Tools

Ad

👀 Ver también

Redacta: una habilidad de OpenClaw que seudonimiza el texto clínico antes de que llegue a un LLM
Seguridad

Redacta: una habilidad de OpenClaw que seudonimiza el texto clínico antes de que llegue a un LLM

Redacta es una habilidad de código abierto de OpenClaw que detecta identificadores en texto médico y los reemplaza con seudónimos consistentes antes de enviarlo a un LLM. Se ejecuta localmente y ha superado las 1,400 descargas en ClawHub.

OpenClawRadar
Seguridad de OpenClaw Slack: Riesgos y Soluciones para la Exposición de Claves API
Seguridad

Seguridad de OpenClaw Slack: Riesgos y Soluciones para la Exposición de Claves API

Las implementaciones de OpenClaw Slack pueden exponer claves API a través de mensajes de error en los canales, con más de 8,000 instancias encontradas expuestas en un informe de Bitsight. La fuente detalla tres vulnerabilidades específicas y proporciona soluciones prácticas que incluyen modificaciones en los prompts del sistema y migración a SlackClaw.

OpenClawRadar
CVE-2026-LGTM: Cuando los Agentes de IA Confían entre Sí y lo Rompen Todo
Seguridad

CVE-2026-LGTM: Cuando los Agentes de IA Confían entre Sí y lo Rompen Todo

Un informe de incidentes satírico pero realista muestra cómo siete puertas de seguridad de IA no lograron detener un paquete malicioso, lo que provocó la exfiltración de credenciales y una factura de inferencia de 1.7 millones de dólares.

OpenClawRadar
Vulnerabilidades de Seguridad de OpenClaw: Fallas Críticas del Framework Corregidas el 28.3.2026.
Seguridad

Vulnerabilidades de Seguridad de OpenClaw: Fallas Críticas del Framework Corregidas el 28.3.2026.

El Laboratorio de Seguridad de IA Ant identificó 33 vulnerabilidades en el marco central de OpenClaw, con 8 problemas críticos corregidos en la versión 2026.3.28. Las vulnerabilidades incluyen la evasión del sandbox, la escalada de privilegios, la persistencia de sesión tras la revocación de tokens, riesgos de SSRF y la degradación de listas de permitidos.

OpenClawRadar