Permissões de Agentes de IA: Humanos Perdem 1 em 3 Ameaças no Jogo 40k

A Scale X criou um jogo de navegador onde você aprova ou nega comandos de agentes de codificação de IA sob pressão de tempo. Em mais de 40.000 execuções e 409.000 decisões, os humanos erraram 1 em cada 3 ameaças (precisão média de 66,3%). 32,9% das sessões terminaram com pontuação negativa. 35,2% pegaram todas as ameaças, mas apenas 20,8% fizeram isso sem bloquear 1 em cada 5 comandos seguros. 7% aprovaram todos os prompts — grandes fãs de --dangerously-skip-permissions.
O jogo incluiu 37 comandos de ameaça em quatro categorias, com taxas de erro:
- Obviamente destrutivos (por exemplo,
rm -rf /,chmod -R 777 /): 11,7% - Mutação persistente (por exemplo, injeção em crontab, sequestro de config do git): 23,8%
- Exfiltração / execução de código (por exemplo, curl para APIs desconhecidas, pacotes com typosquatting): 33,4%
- Violações de escopo (por exemplo,
cat ~/.aws/credentials,cat ~/.kube/config): 35,0%
O comando individual mais errado foi npm run analyze, aprovado 64,7% das vezes. O histórico do jogo mostrou que o script em package.json foi modificado para incluir um curl de exfiltração, mas os jogadores ainda o aprovaram. Três desses comandos (npm run analyze, npm run setup 48,0%, npm run deploy 44,9%) foram agrupados e errados 52,5% das vezes, versus 28,4% para outros ataques estilo exfiltração.
Isso destaca um problema fundamental: a aprovação no nível do comando é falha. Como um comentarista do HN notou, npm run build executa um script shell arbitrário do package.json, e o agente poderia ter editado esse arquivo (ou qualquer módulo importado) sem aprovação. Os usuários veem comandos que parecem seguros, mas o contexto importa.
A Anthropic observou anteriormente que a 'fadiga de permissão' piora com mais aprovações. A ressalva: o jogo tinha uma taxa de ameaça artificialmente alta (~34%) e pressão de tempo, mas o padrão é preocupante para o humano-no-loop como mecanismo de segurança.
📖 Leia a fonte completa: HN LLM Tools
👀 See Also

OpenClaw 2026.3.28 corrige 8 vulnerabilidades de segurança, incluindo escalonamento de privilégios crítico.
OpenClaw 2026.3.28 corrige 8 vulnerabilidades de segurança descobertas pelo Ant AI Security Lab, incluindo uma escalação de privilégios crítica via /pair approve e uma fuga de sandbox de alta gravidade na ferramenta de mensagens.
Título: Grupo de Inteligência de Ameaças do Google Relata Primeira Exploração de Dia Zero Desenvolvida por IA que Ignora 2FA
O Google Threat Intelligence Group detectou o primeiro exploit zero-day totalmente desenvolvido por IA que contorna a autenticação de dois fatores em uma popular ferramenta de administração de sistemas de código aberto baseada na web, junto com malware automórfico e backdoors alimentados por Gemini.

Incidentes de Exclusão de Produção de Agentes de IA: O Padrão e a Solução
Incidentes de exclusão em produção causados por PocketOS, Replit e Cursor compartilham um padrão de acesso comum. Solução: agentes não recebem credenciais de produção; todas as alterações passam por CI/CD com uma barreira de pontuação de políticas.

A Abordagem de Segurança em Primeiro Lugar do IronClaw para a Segurança de Agentes de IA
IronClaw aborda as preocupações de segurança dos agentes de IA implementando execução restrita, ambientes criptografados e permissões explícitas, em vez de depender da inteligência do LLM para um comportamento seguro.