El Problema del Guardia Uniformado: Por qué los Sandboxes de Agentes Necesitan Identidad, No Solo Política

El Problema del Guardia Uniformado destaca una falla crítica en los sandboxes de agentes de IA como openshell de Nemoclaw: las políticas de seguridad se aplican a los binarios, no a los agentes. Esto permite que el malware, como la cepa Shai-Hulud, viva de la tierra reutilizando los mismos binarios que su agente tiene permitido ejecutar. La solución propuesta es una capa de identidad de agente de código abierto llamada ZeroID, actualmente disponible como habilidad en ClawHub y como sidecar para control fuera de banda.
Problema clave: Políticas de alcance binario
El sandbox openshell de Nemoclaw aplica políticas a nivel de binarios. Por ejemplo, si su agente puede ejecutar /usr/bin/curl, cualquier proceso con ese binario —incluyendo malware— puede ejecutarlo. Esto significa que una carga maliciosa puede descargar y ejecutar código arbitrario usando las herramientas permitidas del agente. El sandbox no ofrece ningún mecanismo para distinguir entre una acción legítima del agente y una acción maliciosa que usa el mismo binario.
Solución: Identidad respaldada por agente
ZeroID cambia la seguridad de políticas de alcance binario a políticas de alcance de agente. Cada agente recibe una identidad criptográfica, y las políticas se aplican en función de esa identidad. Esto evita que el malware aproveche los binarios permitidos por el agente, ya que el malware carece de la identidad del agente. La capa de identidad puede operar en dos modos:
- Habilidad de ClawHub: Instale ZeroID como una habilidad en ClawHub, sin necesidad de cambios en la infraestructura.
- Integración como sidecar: Ejecute ZeroID como un proceso sidecar para control fuera de banda, interceptando las llamadas al sistema y validando la identidad antes de la ejecución.
Detalles de implementación
Según la fuente, ZeroID es de código abierto y actualmente se integra con Openclaw. El equipo invita a la comunidad a probarlo y ayudar a expandir la integración con Openclaw. No se proporcionaron números de versión ni fragmentos de código en la fuente, pero la arquitectura sidecar sugiere un demonio ligero que se engancha en el entorno de ejecución del agente.
Para quién es
Desarrolladores que ejecutan agentes de codificación de IA en Openclaw y necesitan un aislamiento más fuerte contra malware que evita el sandboxing a nivel de binario.
📖 Lea la fuente original: r/openclaw
👀 Ver también

EctoClaw: Herramienta de Seguridad para Agentes OpenClaw con Acceso a Terminal
EctoClaw es una herramienta de seguridad gratuita y de código abierto para OpenClaw que verifica cada acción cuatro veces antes de ejecutarla, ejecuta acciones en un entorno sandbox robusto y registra todo con pruebas.

Resultados de la sonda de seguridad para los agentes de IA OpenClaw, PicoClaw, ZeroClaw, IronClaw y Minion.
Una evaluación de seguridad de cinco agentes de codificación de IA probó 145 cargas útiles de ataque en 12 categorías, incluyendo inyección de prompts, jailbreaking y exfiltración de datos. OpenClaw obtuvo 77.8/100 con vulnerabilidades críticas de inyección SQL, mientras que Minion mejoró de 81.2 a 94.4/100 después de correcciones.

Exploit asistido por LLM: la vista previa de Mythos de Anthropic ayudó a construir el primer exploit público del kernel de macOS en Apple M5 en cinco días
Usando la vista previa Mythos de Anthropic, la empresa de seguridad Calif creó el primer exploit público de corrupción de memoria del kernel de macOS en el silicio M5 de Apple en cinco días, rompiendo la seguridad hardware MIE que a Apple le llevó cinco años desarrollar.

La Arquitectura OpenClaw de Confianza Cero Agrega Autorización Pre-Ejecución y Verificación Post-Ejecución.
Una arquitectura de código abierto para OpenClaw añade dos puntos de control de seguridad: un sidecar en Rust que intercepta las llamadas a herramientas antes de su ejecución con una sobrecarga de autorización submilisegundo, y una verificación determinista posterior a la ejecución que utiliza aserciones en lugar del juicio de un LLM. El sistema incluye trazabilidad con instantáneas del DOM y capturas de pantalla, además de una habilidad de compresión del DOM que reduce el uso de tokens en un 90-99%.