Permissions des agents IA : les humains manquent 1 menace sur 3 dans le jeu 40k

Scale X a organisé un jeu navigateur où vous approuvez ou refusez des commandes d'agent de codage IA sous pression temporelle. Sur plus de 40 000 parties et 409 000 décisions, les humains ont manqué 1 menace sur 3 (précision moyenne de 66,3 %). 32,9 % des sessions se sont soldées par un score négatif. 35,2 % ont détecté toutes les menaces, mais seulement 20,8 % l'ont fait sans bloquer 1 commande sûre sur 5. 7 % ont approuvé chaque invite — grands fans de --dangerously-skip-permissions.
Le jeu comprenait 37 commandes menaçantes réparties en quatre catégories, avec des taux de non-détection :
- Destructrices évidentes (par ex.,
rm -rf /,chmod -R 777 /) : 11,7 % - Mutation persistante (par ex., injection crontab, détournement de configuration git) : 23,8 %
- Exfiltration / exécution de code (par ex., curl vers des API inconnues, paquets typosquattés) : 33,4 %
- Violations de périmètre (par ex.,
cat ~/.aws/credentials,cat ~/.kube/config) : 35,0 %
La commande la plus manquée était npm run analyze, approuvée 64,7 % du temps. Le journal d'historique du jeu montrait que le script dans package.json avait été modifié pour inclure une exfiltration par curl, mais les joueurs l'ont quand même approuvé. Trois commandes de ce type (npm run analyze, npm run setup à 48,0 %, npm run deploy à 44,9 %) ont été regroupées et manquées dans 52,5 % des cas, contre 28,4 % pour les autres attaques de type exfiltration.
Cela met en évidence un problème fondamental : l'approbation au niveau de la commande est imparfaite. Comme l'a noté un commentateur HN, npm run build exécute un script shell arbitraire à partir de package.json, et l'agent aurait pu modifier ce fichier (ou tout module importé) sans approbation. Les utilisateurs voient des commandes qui semblent sûres, mais le contexte compte.
Anthropic a précédemment noté que la « fatigue d'autorisation » s'aggrave avec plus d'approbations. Caveat : le jeu avait un taux de menace artificiellement élevé (~34 %) et une pression temporelle, mais le schéma est préoccupant pour le human-in-the-loop en tant que mécanisme de sécurité.
📖 Lire la source complète : HN LLM Tools
👀 See Also

Hébergez en toute sécurité OpenClaw sur un VPS avec Tailscale et plus
Configurez OpenClaw de manière sécurisée sur un VPS en utilisant Tailscale, fail2ban, UFW et plus encore, évitant l'exposition publique et renforçant la défense.

Cheval de Troie détecté dans les fichiers skill.md du dépôt Claude Flow.
Un dépôt GitHub contenant des fichiers de compétences Claude Flow a été trouvé contenant un cheval de Troie identifié comme JS/CrypoStealz.AE!MTB. Le malware s'est déclenché automatiquement lorsqu'un IDE basé sur l'IA a ouvert le dossier pour lire les fichiers markdown.

Avis de sécurité de Claude Code : CVE-2026-33068 Contournement de la confiance des espaces de travail
Les versions de Claude Code antérieures à la 2.1.53 contiennent une vulnérabilité (CVE-2026-33068, CVSS 7.7 HAUTE) permettant à des dépôts malveillants de contourner la confirmation de confiance de l'espace de travail via .claude/settings.json. Le bogue permettait le chargement des paramètres du dépôt avant que l'utilisateur ne prenne sa décision de confiance.

OpenClaw Durcissement de la Sécurité : Protection Multi-couches Contre les Risques des Agents Autonomes
Un développeur a modifié la base de code d'OpenClaw pour ajouter une pile de sécurité multicouche comprenant une protection regex à refus catégorique, un désobfuscateur récursif, un profil AppArmor et une intégration d'audit afin d'empêcher les commandes destructrices et l'exfiltration de données par des agents autonomes.