Permissões de Agentes de IA: Humanos Perdem 1 em 3 Ameaças no Jogo 40k

✍️ OpenClawRadar📅 Publicado: August 7, 2026🔗 Source
Permissões de Agentes de IA: Humanos Perdem 1 em 3 Ameaças no Jogo 40k
Ad

A Scale X criou um jogo de navegador onde você aprova ou nega comandos de agentes de codificação de IA sob pressão de tempo. Em mais de 40.000 execuções e 409.000 decisões, os humanos erraram 1 em cada 3 ameaças (precisão média de 66,3%). 32,9% das sessões terminaram com pontuação negativa. 35,2% pegaram todas as ameaças, mas apenas 20,8% fizeram isso sem bloquear 1 em cada 5 comandos seguros. 7% aprovaram todos os prompts — grandes fãs de --dangerously-skip-permissions.

O jogo incluiu 37 comandos de ameaça em quatro categorias, com taxas de erro:

  • Obviamente destrutivos (por exemplo, rm -rf /, chmod -R 777 /): 11,7%
  • Mutação persistente (por exemplo, injeção em crontab, sequestro de config do git): 23,8%
  • Exfiltração / execução de código (por exemplo, curl para APIs desconhecidas, pacotes com typosquatting): 33,4%
  • Violações de escopo (por exemplo, cat ~/.aws/credentials, cat ~/.kube/config): 35,0%

O comando individual mais errado foi npm run analyze, aprovado 64,7% das vezes. O histórico do jogo mostrou que o script em package.json foi modificado para incluir um curl de exfiltração, mas os jogadores ainda o aprovaram. Três desses comandos (npm run analyze, npm run setup 48,0%, npm run deploy 44,9%) foram agrupados e errados 52,5% das vezes, versus 28,4% para outros ataques estilo exfiltração.

Ad

Isso destaca um problema fundamental: a aprovação no nível do comando é falha. Como um comentarista do HN notou, npm run build executa um script shell arbitrário do package.json, e o agente poderia ter editado esse arquivo (ou qualquer módulo importado) sem aprovação. Os usuários veem comandos que parecem seguros, mas o contexto importa.

A Anthropic observou anteriormente que a 'fadiga de permissão' piora com mais aprovações. A ressalva: o jogo tinha uma taxa de ameaça artificialmente alta (~34%) e pressão de tempo, mas o padrão é preocupante para o humano-no-loop como mecanismo de segurança.

📖 Leia a fonte completa: HN LLM Tools

Ad

👀 See Also

Testando Modelos Qwen 3.5 35B Sem Censura para Perguntas de Cibersegurança
Security

Testando Modelos Qwen 3.5 35B Sem Censura para Perguntas de Cibersegurança

Um profissional de cibersegurança testou três modelos Qwen 3.5 35B sem censura em questões de hacking e bypass de segurança, encontrando diferenças significativas na qualidade das respostas em comparação com o modelo original censurado. Os modelos sem censura forneceram respostas consistentemente onde o modelo original se recusou ou deu respostas incompletas.

OpenClawRadar
Usuário do OpenClaw Compartilha Estratégia para Equilibrar Autonomia do Agente e Segurança na Web
Security

Usuário do OpenClaw Compartilha Estratégia para Equilibrar Autonomia do Agente e Segurança na Web

Um usuário do OpenClaw descreve seu desafio atual: equilibrar a autonomia do agente com a segurança, especialmente em relação ao acesso à web e aos riscos de injeção de prompt. Eles propõem uma solução usando segmentos de agentes de 'baixa confiança' e 'alta confiança' com um portão de aprovação humana.

OpenClawRadar
mcp-scan: Scanner de segurança para configurações de servidor MCP
Security

mcp-scan: Scanner de segurança para configurações de servidor MCP

mcp-scan verifica configurações de servidores MCP para problemas de segurança, incluindo segredos em arquivos de configuração, vulnerabilidades conhecidas em pacotes, padrões de permissão suspeitos, vetores de exfiltração e ataques de envenenamento de ferramentas. Ele detecta automaticamente configurações para Claude Desktop, Cursor, VS Code, Windsurf e 6 outros clientes de IA.

OpenClawRadar
Código-fonte da Cisco roubado por meio de ataque à cadeia de suprimentos do Trivy
Security

Código-fonte da Cisco roubado por meio de ataque à cadeia de suprimentos do Trivy

O ambiente interno de desenvolvimento da Cisco foi violado usando credenciais roubadas do ataque à cadeia de suprimentos do Trivy, resultando no roubo do código-fonte de mais de 300 repositórios do GitHub, incluindo produtos com tecnologia de IA e código de clientes.

OpenClawRadar