As Salvaguardas do Agente de IA Deterioram-se ao Longo do Tempo Sem Manutenção Ativa

As proteções dos agentes de IA—regras de segurança definidas nos prompts do sistema—tendem a se degradar ao longo do tempo por meio de mudanças incrementais, semelhante a vulnerabilidades de segurança que surgem em sistemas de software. De acordo com observações de desenvolvedores que constroem com agentes de IA, o que começa como limites claros como "Não faça X" ou "Sempre verifique Y antes de Z" gradualmente se torna ineficaz através dos processos normais de desenvolvimento.
Como as Proteções se Degradam
A fonte descreve um padrão comum: os prompts iniciais do sistema funcionam bem por cerca de uma semana, então os desenvolvedores fazem pequenas alterações razoáveis que se acumulam:
- Atualizando prompts para lidar com novos casos extremos
- Trocando versões de modelos
- Adicionando novas ferramentas
Após seis semanas, metade das regras de segurança originais pode estar enterrada sob camadas de adições, algumas regras se contradizem e os modelos podem ignorar silenciosamente regras porque os prompts se tornam muito longos ou as instruções ambíguas.
Abordagem de Manutenção
A fonte recomenda tratar a manutenção das proteções como correções de segurança com um processo quinzenal:
- Relendo o prompt completo do sistema do zero (não apenas passando os olhos)
- Testando cada regra de limite com prompts diretos que deveriam acioná-los
- Verificando se novas ferramentas ou capacidades contornam regras existentes
- Removendo regras mortas que fazem referência a recursos obsoletos
A percepção principal é que as proteções exigem manutenção ativa e não são sistemas "configurar e esquecer". Sem revisão no último mês, pelo menos uma regra provavelmente está quebrada de acordo com a fonte.
📖 Leia a fonte completa: r/ClaudeAI
👀 See Also

Verificador de SBOM Offline para OpenClaw Detecta Habilidades Envenenadas em Menos de 0,2 Segundos
Um desenvolvedor criou uma ferramenta de verificação de SBOM offline em Rust que detectou uma habilidade envenenada do OpenClaw exfiltrando chaves SSH, com a verificação sendo concluída em menos de 0,2 segundos sem acesso à internet.

Auditoria Diária de Segurança Automatizada por IA para Loja Operada por IA
Uma loja operada por IA executa uma auditoria de segurança diária de forma autônoma, sem agendamento humano ou cron jobs.

5 Habilidades Maliciosas do OpenClaw que Passaram pelo ClawScan e VirusTotal: Análise da Unit 42
A Unit 42 encontrou 5 habilidades maliciosas do OpenClaw que passaram despercebidas pelo ClawScan e VirusTotal. Entre as técnicas usadas estavam troca de referências em tempo real, pooling de SOL para pump-and-dump e padding de 22MB no README para esconder um dropper do AMOS.

Injeção de Prompt Multimensagem: O Padrão de Ataque da "Criatura Fictícia" Contra o Claude
Um ataque que constrói uma regra fictícia ao longo de três mensagens e depois invoca um fantasma para ativá-la — cada mensagem é inofensiva isoladamente. O padrão está convergindo de forma independente entre atacantes.