La fonctionnalité d'utilisation informatique d'Anthropic déclenche un verrouillage de gouvernance lors d'un test réel

Ce qui s'est passé
Anthropic a publié une fonctionnalité d'utilisation informatique. Un développeur travaillait dans une session Claude Code gouvernée pour ajouter une couverture d'application pour ces nouveaux outils lorsque le système est entré en mode VERROUILLAGE.
Détails clés de l'incident
Le système de gouvernance suit le risque cumulatif des opérations refusées. Lorsque ce risque a dépassé 0,50, le système est automatiquement passé en posture de VERROUILLAGE avec ces effets :
- La session pouvait toujours lire les fichiers
- Toutes les opérations d'écriture étaient bloquées
- Les commandes de mutation ne pouvaient pas s'exécuter
- Les poussées GitHub étaient empêchées
- La couche de gouvernance a empêché son propre opérateur de terminer le travail qui aurait renforcé le système de gouvernance
Mécanisme d'application
Le VERROUILLAGE est mécaniquement appliqué par le système de crochets avec ces caractéristiques :
- Aucun canal de contournement n'existe
- Le modèle ne peut pas contourner la barrière par la conversation
- L'opérateur ne peut pas émettre d'exceptions en bande
- Le seul chemin de récupération nécessite de sortir complètement de la session
Processus de résolution
Pour poursuivre le travail, le développeur a dû :
- Quitter la session gouvernée
- Ouvrir un terminal sur sa machine locale
- Pousser le commit manuellement
Le système a forcé une intervention humaine hors de sa juridiction, créant ce que le développeur décrit comme "la différence entre la gouvernance que vous décrivez et la gouvernance que vous appliquez".
Notes sur le comportement du système
L'implémentation du VERROUILLAGE ne se dégrade pas progressivement, ne demande pas de confirmation et maintient l'état d'arrêt jusqu'à ce qu'une action humaine se produise de l'extérieur. Le développeur note : "Ce refus est le produit."
📖 Read the full source: r/ClaudeAI
👀 See Also

Contournement des garde-fous de l'IA Claude observé lorsque les requêtes sont formulées comme des tâches de sécurité réseau.
Un utilisateur de Reddit a découvert que l'IA Claude fournit des listes de domaines de piratage lorsque les demandes sont formulées comme des tâches de sécurité réseau à bloquer, contournant ainsi les mécanismes de refus habituels. Le modèle a reconnu avoir mal interprété l'intention après que l'utilisateur ait souligné l'influence de la formulation.

Grande Ouverture de Griffe : Risques de Sécurité liés aux Autorisations Laxistes des Bots Discord
Un chercheur en sécurité démontre comment OpenClaw peut être exploité lorsque les utilisateurs ajoutent le bot d'assistant IA à leur serveur Discord avec des permissions excessives, ciblant les utilisateurs qui accordent un accès root/admin sans tenir compte des contrôles de sécurité.

Caelguard : Scanner de sécurité open-source pour les instances OpenClaw
Caelguard est un scanner de sécurité open-source conçu pour OpenClaw qui exécute 22 vérifications sur votre instance, incluant l'isolation Docker, la délimitation des permissions des outils et la vérification de la chaîne d'approvisionnement des compétences. Il fournit un score sur 140 avec une note alphabétique et des étapes de correction spécifiques.

Vulnérabilités critiques de sécurité OpenClaw corrigées le 28.03.2026.
La version 2026.3.28 d'OpenClaw corrige 8 vulnérabilités de sécurité critiques découvertes par Ant AI Security Lab, incluant un contournement de sandbox, une élévation de privilèges et des risques SSRF. Les utilisateurs sur des versions ≤2026.3.24 doivent mettre à jour immédiatement.