La Función de Uso de Computadora de Anthropic Provoca un Bloqueo de Gobernanza en una Prueba Real

Qué Ocurrió
Anthropic lanzó funcionalidad de uso informático. Un desarrollador estaba trabajando dentro de una sesión gobernada de Claude Code para añadir cobertura de aplicación para estas nuevas herramientas cuando el sistema entró en modo BLOQUEO.
Detalles Clave del Incidente
El sistema de gobernanza rastrea el riesgo acumulado de operaciones denegadas. Cuando este riesgo superó 0.50, el sistema escaló automáticamente a postura de BLOQUEO con estos efectos:
- La sesión aún podía leer archivos
- Todas las operaciones de escritura fueron bloqueadas
- Los comandos de modificación no podían ejecutarse
- Se impidieron los envíos a GitHub
- La capa de gobernanza bloqueó a su propio operador de completar el trabajo que habría fortalecido el sistema de gobernanza
Mecanismo de Aplicación
El BLOQUEO se aplica mecánicamente por el sistema de ganchos con estas características:
- No existe canal de anulación
- El modelo no puede eludir la puerta mediante conversación
- El operador no puede emitir excepciones internas
- El único camino de recuperación requiere salir completamente de la sesión
Proceso de Resolución
Para continuar el trabajo, el desarrollador tuvo que:
- Salir de la sesión gobernada
- Abrir una terminal en su máquina local
- Enviar el commit manualmente
El sistema forzó la intervención humana fuera de su jurisdicción, creando lo que el desarrollador describe como "la diferencia entre la gobernanza que describes y la gobernanza que aplicas".
Notas sobre el Comportamiento del Sistema
La implementación del BLOQUEO no se degrada gradualmente, no pide confirmación y mantiene el estado detenido hasta que ocurre una acción humana externamente. El desarrollador señala: "Esa negativa es el producto".
📖 Leer la fuente completa: r/ClaudeAI
👀 Ver también

Resultados de la sonda de seguridad para los agentes de IA OpenClaw, PicoClaw, ZeroClaw, IronClaw y Minion.
Una evaluación de seguridad de cinco agentes de codificación de IA probó 145 cargas útiles de ataque en 12 categorías, incluyendo inyección de prompts, jailbreaking y exfiltración de datos. OpenClaw obtuvo 77.8/100 con vulnerabilidades críticas de inyección SQL, mientras que Minion mejoró de 81.2 a 94.4/100 después de correcciones.

Vulnerabilidades de Seguridad de la Función 'Permitir Siempre' de OpenClaw y Alternativas Más Seguras
La función de aprobación 'permitir siempre' de OpenClaw ha sido objeto de dos CVEs este mes, permitiendo la ejecución de comandos no autorizados mediante la vinculación de comandos wrapper y la omisión de continuación de línea en el shell. El problema más profundo es cómo esta función entrena a los usuarios para dejar de prestar atención a las solicitudes de seguridad.

Permisos de Agentes de IA: Los Humanos Pasan por Alto 1 de Cada 3 Amenazas en el Juego de 40k
En un juego de navegador con 40,000 partidas, los humanos pasaron por alto 1 de cada 3 comandos maliciosos de agentes de IA, con una tasa de omisión del 35% para la exfiltración de credenciales. El comando más omitido fue `npm run analyze` con un 64.7%.

ClawGuard: Un Cortafuegos de Denegación por Defecto para Agentes de IA Locales
ClawGuard intercepta cada llamada de herramienta de los agentes OpenClaw/Hermes aplicando una política de denegación por defecto para bloquear operaciones peligrosas como leer .env o rm -rf, y requiere aprobación telefónica para acciones ambiguas.