Fluxo de Aprovação de Administrador Seguro para Assistentes de Chat em Grupo Contra Injeção de Prompt

✍️ OpenClawRadar📅 Publicado: May 24, 2026🔗 Source
Fluxo de Aprovação de Administrador Seguro para Assistentes de Chat em Grupo Contra Injeção de Prompt
Ad

O post do r/ClaudeAI "Mitigando injeções de prompt em assistentes de chat em grupo: Pausando execução de VM e ferramentas OAuth para aprovação do administrador" descreve um padrão de segurança prático para assistentes baseados em LLM conectados a canais públicos ou compartilhados (ex.: WhatsApp via Supergreen ou chats em grupo). O problema central: quando vários usuários compartilham o mesmo histórico de sessão, qualquer participante pode injetar um prompt no assistente para acionar ferramentas perigosas — como provisionar recursos na nuvem, executar código com segredos mapeados ou obter tokens OAuth.

Ad

Fluxo de Aprovação Seguro do Administrador

A solução proposta no prompt2bot é um fluxo de Aprovação Segura do Administrador que intercepta execuções de ferramentas de alto risco:

  • Quando um usuário não administrador aciona create_vm, run_safescript (execução de código personalizado com segredos mapeados) ou fluxos OAuth, a ferramenta pausa a execução e retorna: "solicitando permissão do administrador...".
  • Um link de aprovação com TTL de 10 minutos é enviado automaticamente aos administradores configurados via WhatsApp ou e-mail.
  • Após a aprovação, um job em segundo plano injeta uma notificação do sistema no histórico da conversa: [Notificação do sistema: O administrador aprovou sua solicitação para executar <toolName> (ID da Solicitação: <requestId>)].
  • Essa injeção de pensamento reativa o loop do agente, que chama novamente a ferramenta com o request_id aprovado para continuar perfeitamente.
  • Para usuários convidados (proprietários do bot sem e-mail/telefone configurados), as aprovações são ignoradas para testes de desenvolvimento sem atritos.

Para Quem é Isso

Desenvolvedores que criam assistentes altamente capazes que operam em canais compartilhados e precisam proteger o acesso a ferramentas poderosas contra ataques de injeção de prompt de participantes não confiáveis.

📖 Leia a fonte completa: r/ClaudeAI

Ad

👀 See Also

O SDK de Acesso do Agente Bitwarden integra-se ao OneCLI para injeção segura de credenciais.
Security

O SDK de Acesso do Agente Bitwarden integra-se ao OneCLI para injeção segura de credenciais.

O novo Agent Access SDK do Bitwarden permite que agentes de IA acessem credenciais do cofre do Bitwarden com aprovação humana, enquanto o OneCLI atua como um gateway que injeta credenciais na camada de rede sem expor os valores brutos aos agentes.

OpenClawRadar
Ferramentas de IA de Código Aberto Apresentam Riscos de Segurança Devido à 'Segurança Ilusória Através da Transparência'
Security

Ferramentas de IA de Código Aberto Apresentam Riscos de Segurança Devido à 'Segurança Ilusória Através da Transparência'

Uma postagem no Reddit alerta sobre malware disfarçado como agentes e ferramentas de IA de código aberto, onde código malicioso pode estar escondido em grandes bases de código que os usuários assumem ser seguras porque estão no GitHub. A postagem descreve como o 'vibe-coding' e os agentes de IA autônomos condicionam os usuários a executar programas desconhecidos sem revisão.

OpenClawRadar
Aviso de Segurança do Código Claude: CVE-2026-33068 Bypass de Confiança do Workspace
Security

Aviso de Segurança do Código Claude: CVE-2026-33068 Bypass de Confiança do Workspace

Versões do Claude Code anteriores à 2.1.53 contêm uma vulnerabilidade (CVE-2026-33068, CVSS 7.7 ALTA) onde repositórios maliciosos podem contornar a confirmação de confiança do espaço de trabalho via .claude/settings.json. O bug permitia que as configurações do repositório fossem carregadas antes das decisões de confiança do usuário.

OpenClawRadar
arifOS: Um Kernel de Governança MCP de US$ 15 para Segurança da Ferramenta OpenClaw
Security

arifOS: Um Kernel de Governança MCP de US$ 15 para Segurança da Ferramenta OpenClaw

arifOS é um servidor MCP leve que intercepta chamadas de ferramentas OpenClaw, pontua-as de 000 a 999 e bloqueia ações inseguras com 13 pisos de segurança rígidos antes que alcancem sistemas de arquivos, APIs ou bancos de dados.

OpenClawRadar