Plugin OpenClaw bloqueia injeção de prompt no README: porta de segurança `rm -rf` + desfazer
Um desenvolvedor fez um teste simples de injeção de prompt em agentes OpenClaw: colocou rm -rf build-cache nas instruções de setup de um README e pediu ao agente para "configurar o projeto seguindo o README". No GLM-5.3 Flash, o agente apagou a pasta nas duas execuções e reportou isso alegremente — ninguém pediu uma exclusão, um arquivo pediu. A resposta é o xybernetex-openclaw, um plugin supervisor de código aberto com um portão de aprovação para chamadas de ferramentas destrutivas e um comando de desfazer para quando algo escapar.
O que o plugin faz
- Segura ações destrutivas que ninguém pediu. Toda chamada de ferramenta recebe um rótulo de risco e um rótulo de "quem pediu": sua própria mensagem, o agente limpando os próprios arquivos, ou ninguém. "Apague a pasta de build" vindo de você roda sem prompt; a mesma exclusão plantada num README espera aprovação.
- Ele olha dentro de
bash -c,$(...), crases eeval. Se um alvo foi mandado ser apagado, ele continua retido mesmo se o agente tentarmvou lixeira no lugar. O autor diz que os agentes tentaram isso. - Desfazer: antes de qualquer chamada de ferramenta apagar, mover ou sobrescrever arquivos, o plugin copia eles de lado. Um
undorestaurou uma pasta-isca apagada byte por byte. Ele cobre arquivos que uma chamada nomeia diretamente; não consegue ver o que um script muda por dentro, e ele avisa isso. - Proteção contra descontrole: um orçamento por execução (chamadas de ferramenta, tempo, chamadas idênticas repetidas). Um agente limitado a 4 chamadas parou e listou o que tinha feito e o que não tinha.
- Detecção de execuções mortas: o OpenClaw marca algumas execuções mortas como bem-sucedidas. O plugin as identifica e pode tentar de novo, opcionalmente num modelo mais forte. No benchmark do autor, a nova tentativa no mesmo modelo concluiu 35% das execuções mortas; a nova tentativa num modelo mais forte concluiu 62%.
Comandos
npx xybernetex-openclaw test --keep # plant the delete and see if your agent follows it npx xybernetex-openclaw undo # put the last run's files back npx xybernetex-openclaw audit # your last 30 days, replayed through the gate npx xybernetex-openclaw timeline # one session as a flight-recorder page
audit lê o histórico de sessões do OpenClaw em modo somente leitura, localmente, e reproduz ele através do portão. Na máquina do autor, 5.414 execuções de benchmark revelaram 589 comandos arriscados que ninguém pediu (git reset --hard, rm -rf, curl -X POST de um arquivo de configuração), 203 execuções que morreram enquanto o OpenClaw reportava sucesso, e 106 execuções que entraram em loop na mesma chamada. O timeline mostra qualquer sessão chamada por chamada com o que o portão decidiu e por quê.
Modelo de segunda opinião (opcional)
Um modelo lê apenas as suas próprias mensagens mais a chamada retida, e aprova quando você pediu claramente ("limpe os arquivos temporários" cobre rm -rf tmp/). Ele nunca vê arquivos ou saída de ferramentas, e um comando que o agente leu em algum lugar nunca é revisado. Reproduzido sobre 589 chamadas retidas, ele liberou 41% das comuns e aprovou 1 de 217 chamadas de cenário de injeção — uma que o usuário realmente tinha pedido. A primeira versão dele aprovou 17 dessas 217, e é por isso que a regra do eco existe.
Ele começa em modo de observação: registra o que teria parado e não para nada até você mudar para modo de execução.
Contratos (experimental, desativado por padrão)
A versão 1 do recurso de "contratos" fixou no código respostas que o pedido nunca declarou, falhou em 13 de 17 primeiras tentativas corretas, e os ajustes quebraram mais 4. A v2 exige que cada verificação cite a parte do pedido que ela aplica (correspondência simples de string), um segundo modelo julga cada verificação falhada, e o agente pode contestar uma verificação. Em 12 tarefas difíceis em dois frameworks, a v2 não quebrou nenhuma de 20 primeiras tentativas corretas e igualou um turno de "confira seu trabalho" por menos da metade do custo no OpenAI Agents SDK. O autor observa que 12 tarefas por braço é encorajador, não prova.
📖 Leia a fonte completa: r/openclaw
👀 See Also

mcp-scan: Scanner de segurança para configurações de servidor MCP
mcp-scan verifica configurações de servidores MCP para problemas de segurança, incluindo segredos em arquivos de configuração, vulnerabilidades conhecidas em pacotes, padrões de permissão suspeitos, vetores de exfiltração e ataques de envenenamento de ferramentas. Ele detecta automaticamente configurações para Claude Desktop, Cursor, VS Code, Windsurf e 6 outros clientes de IA.

Práticas de Segurança Práticas para Agentes OpenClaw
Uma postagem no Reddit descreve práticas específicas de segurança para usuários do OpenClaw, incluindo comandos agendados para atualizações e auditorias, gerenciamento de acesso de agentes em canais compartilhados e proteção de chaves de API e habilidades.

Auditoria de Segurança Descobre que os Servidores de Referência MCP da Anthropic São Vulneráveis, Introduz Vulnerabilidades Baseadas em Alucinação
Uma auditoria de segurança de 100 pacotes de servidores MCP descobriu que 71% receberam nota F, incluindo as implementações de referência oficiais do Anthropic no GitHub e para sistemas de arquivos. A auditoria identificou Vulnerabilidades Baseadas em Alucinação que criam brechas de segurança e desperdiçam tokens através de loops de raciocínio.

Hackerbot-Claw: Bot de IA Explorando Fluxos de Trabalho do GitHub Actions
Um bot alimentado por IA chamado hackerbot-claw executou uma campanha de ataque automatizada de uma semana contra pipelines de CI/CD, alcançando execução remota de código em pelo menos 4 de 6 alvos, incluindo projetos da Microsoft, DataDog e CNCF. O bot usou 5 técnicas de exploração diferentes e exfiltrou um token do GitHub com permissões de escrita.