La Función de Uso de Computadora de Anthropic Provoca un Bloqueo de Gobernanza en una Prueba Real

Qué Ocurrió
Anthropic lanzó funcionalidad de uso informático. Un desarrollador estaba trabajando dentro de una sesión gobernada de Claude Code para añadir cobertura de aplicación para estas nuevas herramientas cuando el sistema entró en modo BLOQUEO.
Detalles Clave del Incidente
El sistema de gobernanza rastrea el riesgo acumulado de operaciones denegadas. Cuando este riesgo superó 0.50, el sistema escaló automáticamente a postura de BLOQUEO con estos efectos:
- La sesión aún podía leer archivos
- Todas las operaciones de escritura fueron bloqueadas
- Los comandos de modificación no podían ejecutarse
- Se impidieron los envíos a GitHub
- La capa de gobernanza bloqueó a su propio operador de completar el trabajo que habría fortalecido el sistema de gobernanza
Mecanismo de Aplicación
El BLOQUEO se aplica mecánicamente por el sistema de ganchos con estas características:
- No existe canal de anulación
- El modelo no puede eludir la puerta mediante conversación
- El operador no puede emitir excepciones internas
- El único camino de recuperación requiere salir completamente de la sesión
Proceso de Resolución
Para continuar el trabajo, el desarrollador tuvo que:
- Salir de la sesión gobernada
- Abrir una terminal en su máquina local
- Enviar el commit manualmente
El sistema forzó la intervención humana fuera de su jurisdicción, creando lo que el desarrollador describe como "la diferencia entre la gobernanza que describes y la gobernanza que aplicas".
Notas sobre el Comportamiento del Sistema
La implementación del BLOQUEO no se degrada gradualmente, no pide confirmación y mantiene el estado detenido hasta que ocurre una acción humana externamente. El desarrollador señala: "Esa negativa es el producto".
📖 Leer la fuente completa: r/ClaudeAI
👀 Ver también

Pasaporte de Agente: Verificación de Identidad para Agentes de IA
Agent Passport es una capa de verificación de identidad de código abierto que utiliza autenticación Ed25519 y tokens JWT para agentes de IA, abordando el problema de la suplantación de agentes.

13 Palabras en Reddit Pueden Manipular la Búsqueda de IA: Investigación de Cornell
Una investigación de Cornell muestra que un fragmento de 13 palabras en Reddit o Wikipedia puede envenenar de manera confiable los agentes de búsqueda de IA. La mitad de todas las citas de IA provienen de sitios UGC, lo que facilita que las marcas inserten contenido promocional.

Claude Code escribe archivos fuera del directorio permitido sin permiso
Un usuario informa que Claude Code creó carpetas y guardó archivos en C:\Users\...\Documents\Surge XT\Patches\ sin permiso explícito, usando os.makedirs.

Código Fuente de la Plataforma de Gobierno Electrónico de Suecia Filtrado mediante Infraestructura CGI Comprometida
El código fuente completo de la plataforma de gobierno electrónico de Suecia fue filtrado por el actor de amenazas ByteToBreach tras comprometer la infraestructura de CGI Sverige AB. La filtración incluye bases de datos del personal, sistemas de firma de documentos API, credenciales SSH de Jenkins y endpoints de prueba de RCE.