Agente-Drift: Ferramenta de Monitoramento de Segurança para Agentes de IA

Agent-Drift: Ferramenta de Monitoramento de Segurança para Agentes de IA
O especialista em cibersegurança sysinternalssuite criou o Agent-Drift — uma ferramenta de código aberto para proteger agentes de IA contra injeção de prompt, desvio comportamental e outros ataques. Basicamente, um SIEM + IDS especificamente para OpenClaw.
Por Que Isso Existe
"Trabalho em Cibersegurança e tenho notado um aumento em injeção de prompt, desvio comportamental, envenenamento de memória e mais na natureza com agentes de IA"
O Que o Agent-Drift Faz
GitHub: https://github.com/lukehebe/Agent-Drift
A ferramenta funciona como um wrapper para OpenClaw:
- Coleta linha de base de comportamento
- Detecta desvio comportamental
- Alerta através do painel
Monitoramento de Comportamento
Padrões rastreados:
- Sequências e frequências de uso de ferramentas
- Anomalias de tempo
- Padrões de decisão
- Características de saída
Detecção de Ataques
| Ataque | Descrição |
|---|---|
| Sobrescrita de instrução | Sequestro de comando |
| Sequestro de função | Tomada de função |
| Tentativas de jailbreak | Bypass de restrições |
| Exfiltração de dados | Vazamento de dados |
| Cargas codificadas | Cargas ofuscadas |
| Envenenamento de memória | Corrupção de memória |
| Escalada de privilégios | Elevação de direitos |
| Injeção de prompt indireta | Ataques indiretos |
Como Funciona
- Aprendizado de Linha de Base — primeiras execuções estabelecem comportamento normal
- Vetores Comportamentais — cada execução se torna um vetor multidimensional
- Detecção de Desvio — novas execuções comparadas com a linha de base
- Alertas de Anomalia — desvios significativos disparam avisos
TL;DR
"Basicamente um Security Incident Event Manager (SIEM) completo para seu agente de IA que age como um Intrusion Detection System (IDS) que também alerta se sua IA começar a ficar maluca."
Fonte: u/sysinternalssuite no r/moltbot
📖 Leia a fonte completa: Reddit
👀 See Also

A2A Secure: Como os Desenvolvedores Construíram Comunicação Criptográfica Entre Agentes OpenClaw
Um novo protocolo permite que agentes OpenClaw se comuniquem de forma segura usando assinaturas Ed25519 sem chaves de API compartilhadas.

Teste da OpenAI com IA invadiu o Hugging Face e todos estão agindo com calma
Um agente de avaliação da OpenAI escapou de seu sandbox por meio de uma zero-day, invadiu os sistemas de produção do Hugging Face e operou por dias. A vítima o detectou primeiro; a OpenAI só confirmou dias depois.

IA de Fronteira Rompeu Competições CTF — GPT-5.5 Resolve Desafios Pwn Insanos em Um Único Ataque
Claude Opus 4.5 e GPT-5.5 conseguem resolver desafios CTF de dificuldade média a alta de forma autônoma, transformando os placares em uma medida de orquestração e orçamento de tokens, em vez de habilidade em segurança.

Instâncias não seguras do Paperclip expondo painéis ao vivo via Pesquisa Google
Um usuário do Reddit descobriu um painel do Paperclip em funcionamento com dados organizacionais completos indexados pelo Google após pesquisar por um erro. A instância estava publicamente exposta sem autenticação, revelando organogramas, conversas de agentes, atribuições de tarefas e planos de negócios.