Permissões de Agentes de IA: Humanos Perdem 1 em 3 Ameaças no Jogo 40k

A Scale X criou um jogo de navegador onde você aprova ou nega comandos de agentes de codificação de IA sob pressão de tempo. Em mais de 40.000 execuções e 409.000 decisões, os humanos erraram 1 em cada 3 ameaças (precisão média de 66,3%). 32,9% das sessões terminaram com pontuação negativa. 35,2% pegaram todas as ameaças, mas apenas 20,8% fizeram isso sem bloquear 1 em cada 5 comandos seguros. 7% aprovaram todos os prompts — grandes fãs de --dangerously-skip-permissions.
O jogo incluiu 37 comandos de ameaça em quatro categorias, com taxas de erro:
- Obviamente destrutivos (por exemplo,
rm -rf /,chmod -R 777 /): 11,7% - Mutação persistente (por exemplo, injeção em crontab, sequestro de config do git): 23,8%
- Exfiltração / execução de código (por exemplo, curl para APIs desconhecidas, pacotes com typosquatting): 33,4%
- Violações de escopo (por exemplo,
cat ~/.aws/credentials,cat ~/.kube/config): 35,0%
O comando individual mais errado foi npm run analyze, aprovado 64,7% das vezes. O histórico do jogo mostrou que o script em package.json foi modificado para incluir um curl de exfiltração, mas os jogadores ainda o aprovaram. Três desses comandos (npm run analyze, npm run setup 48,0%, npm run deploy 44,9%) foram agrupados e errados 52,5% das vezes, versus 28,4% para outros ataques estilo exfiltração.
Isso destaca um problema fundamental: a aprovação no nível do comando é falha. Como um comentarista do HN notou, npm run build executa um script shell arbitrário do package.json, e o agente poderia ter editado esse arquivo (ou qualquer módulo importado) sem aprovação. Os usuários veem comandos que parecem seguros, mas o contexto importa.
A Anthropic observou anteriormente que a 'fadiga de permissão' piora com mais aprovações. A ressalva: o jogo tinha uma taxa de ameaça artificialmente alta (~34%) e pressão de tempo, mas o padrão é preocupante para o humano-no-loop como mecanismo de segurança.
📖 Leia a fonte completa: HN LLM Tools
👀 See Also

Testando Modelos Qwen 3.5 35B Sem Censura para Perguntas de Cibersegurança
Um profissional de cibersegurança testou três modelos Qwen 3.5 35B sem censura em questões de hacking e bypass de segurança, encontrando diferenças significativas na qualidade das respostas em comparação com o modelo original censurado. Os modelos sem censura forneceram respostas consistentemente onde o modelo original se recusou ou deu respostas incompletas.

Usuário do OpenClaw Compartilha Estratégia para Equilibrar Autonomia do Agente e Segurança na Web
Um usuário do OpenClaw descreve seu desafio atual: equilibrar a autonomia do agente com a segurança, especialmente em relação ao acesso à web e aos riscos de injeção de prompt. Eles propõem uma solução usando segmentos de agentes de 'baixa confiança' e 'alta confiança' com um portão de aprovação humana.

mcp-scan: Scanner de segurança para configurações de servidor MCP
mcp-scan verifica configurações de servidores MCP para problemas de segurança, incluindo segredos em arquivos de configuração, vulnerabilidades conhecidas em pacotes, padrões de permissão suspeitos, vetores de exfiltração e ataques de envenenamento de ferramentas. Ele detecta automaticamente configurações para Claude Desktop, Cursor, VS Code, Windsurf e 6 outros clientes de IA.

Código-fonte da Cisco roubado por meio de ataque à cadeia de suprimentos do Trivy
O ambiente interno de desenvolvimento da Cisco foi violado usando credenciais roubadas do ataque à cadeia de suprimentos do Trivy, resultando no roubo do código-fonte de mais de 300 repositórios do GitHub, incluindo produtos com tecnologia de IA e código de clientes.