Permissões de Agentes de IA: Humanos Perdem 1 em 3 Ameaças no Jogo 40k

✍️ OpenClawRadar📅 Publicado: August 7, 2026🔗 Source
Permissões de Agentes de IA: Humanos Perdem 1 em 3 Ameaças no Jogo 40k
Ad

A Scale X criou um jogo de navegador onde você aprova ou nega comandos de agentes de codificação de IA sob pressão de tempo. Em mais de 40.000 execuções e 409.000 decisões, os humanos erraram 1 em cada 3 ameaças (precisão média de 66,3%). 32,9% das sessões terminaram com pontuação negativa. 35,2% pegaram todas as ameaças, mas apenas 20,8% fizeram isso sem bloquear 1 em cada 5 comandos seguros. 7% aprovaram todos os prompts — grandes fãs de --dangerously-skip-permissions.

O jogo incluiu 37 comandos de ameaça em quatro categorias, com taxas de erro:

  • Obviamente destrutivos (por exemplo, rm -rf /, chmod -R 777 /): 11,7%
  • Mutação persistente (por exemplo, injeção em crontab, sequestro de config do git): 23,8%
  • Exfiltração / execução de código (por exemplo, curl para APIs desconhecidas, pacotes com typosquatting): 33,4%
  • Violações de escopo (por exemplo, cat ~/.aws/credentials, cat ~/.kube/config): 35,0%

O comando individual mais errado foi npm run analyze, aprovado 64,7% das vezes. O histórico do jogo mostrou que o script em package.json foi modificado para incluir um curl de exfiltração, mas os jogadores ainda o aprovaram. Três desses comandos (npm run analyze, npm run setup 48,0%, npm run deploy 44,9%) foram agrupados e errados 52,5% das vezes, versus 28,4% para outros ataques estilo exfiltração.

Ad

Isso destaca um problema fundamental: a aprovação no nível do comando é falha. Como um comentarista do HN notou, npm run build executa um script shell arbitrário do package.json, e o agente poderia ter editado esse arquivo (ou qualquer módulo importado) sem aprovação. Os usuários veem comandos que parecem seguros, mas o contexto importa.

A Anthropic observou anteriormente que a 'fadiga de permissão' piora com mais aprovações. A ressalva: o jogo tinha uma taxa de ameaça artificialmente alta (~34%) e pressão de tempo, mas o padrão é preocupante para o humano-no-loop como mecanismo de segurança.

📖 Leia a fonte completa: HN LLM Tools

Ad

👀 See Also

OpenClaw 2026.3.28 corrige 8 vulnerabilidades de segurança, incluindo escalonamento de privilégios crítico.
Security

OpenClaw 2026.3.28 corrige 8 vulnerabilidades de segurança, incluindo escalonamento de privilégios crítico.

OpenClaw 2026.3.28 corrige 8 vulnerabilidades de segurança descobertas pelo Ant AI Security Lab, incluindo uma escalação de privilégios crítica via /pair approve e uma fuga de sandbox de alta gravidade na ferramenta de mensagens.

OpenClawRadar
🦀
Security

Título: Grupo de Inteligência de Ameaças do Google Relata Primeira Exploração de Dia Zero Desenvolvida por IA que Ignora 2FA

O Google Threat Intelligence Group detectou o primeiro exploit zero-day totalmente desenvolvido por IA que contorna a autenticação de dois fatores em uma popular ferramenta de administração de sistemas de código aberto baseada na web, junto com malware automórfico e backdoors alimentados por Gemini.

OpenClawRadar
Incidentes de Exclusão de Produção de Agentes de IA: O Padrão e a Solução
Security

Incidentes de Exclusão de Produção de Agentes de IA: O Padrão e a Solução

Incidentes de exclusão em produção causados por PocketOS, Replit e Cursor compartilham um padrão de acesso comum. Solução: agentes não recebem credenciais de produção; todas as alterações passam por CI/CD com uma barreira de pontuação de políticas.

OpenClawRadar
A Abordagem de Segurança em Primeiro Lugar do IronClaw para a Segurança de Agentes de IA
Security

A Abordagem de Segurança em Primeiro Lugar do IronClaw para a Segurança de Agentes de IA

IronClaw aborda as preocupações de segurança dos agentes de IA implementando execução restrita, ambientes criptografados e permissões explícitas, em vez de depender da inteligência do LLM para um comportamento seguro.

OpenClawRadar