Agent-Drift : Outil de surveillance de sécurité pour agents IA

Agent-Drift : Outil de surveillance de sécurité pour agents IA
Le spécialiste en cybersécurité sysinternalssuite a créé Agent-Drift – un outil open source pour protéger les agents IA contre l'injection de prompts, la dérive comportementale et d'autres attaques. Essentiellement un SIEM + IDS spécifiquement pour OpenClaw.
Pourquoi cela existe
« Je travaille dans la cybersécurité et j'ai remarqué une augmentation des injections de prompts, des dérives comportementales, des empoisonnements de mémoire et plus encore dans la nature avec les agents IA »
Ce que fait Agent-Drift
GitHub : https://github.com/lukehebe/Agent-Drift
L'outil fonctionne comme un wrapper pour OpenClaw :
- Collecte une ligne de base comportementale
- Détecte la dérive comportementale
- Alerte via un tableau de bord
Surveillance comportementale
Modèles suivis :
- Séquences et fréquences d'utilisation des outils
- Anomalies de timing
- Modèles de décision
- Caractéristiques de sortie
Détection d'attaques
| Attaque | Description |
|---|---|
| Substitution d'instructions | Détournement de commande |
| Détournement de rôle | Prise de contrôle de rôle |
| Tentatives de jailbreak | Contournement de restrictions |
| Exfiltration de données | Fuite de données |
| Charges utiles encodées | Charges utiles obfusquées |
| Empoisonnement de mémoire | Corruption de mémoire |
| Élévation de privilèges | Élévation de droits |
| Injection indirecte de prompts | Attaques indirectes |
Comment cela fonctionne
- Apprentissage de base – les premières exécutions établissent un comportement normal
- Vecteurs comportementaux – chaque exécution devient un vecteur multidimensionnel
- Détection de dérive – les nouvelles exécutions sont comparées à la ligne de base
- Alertes d'anomalies – les écarts significatifs déclenchent des avertissements
TL;DR
« En gros, un Security Incident Event Manager (SIEM) tout-en-un pour votre agent IA qui agit comme un Intrusion Detection System (IDS) qui vous alerte également si votre IA commence à devenir folle. »
Source : u/sysinternalssuite sur r/moltbot
📖 Lire la source complète : Reddit
👀 See Also

PolyRange : Benchmark offensif résistant à la contamination par IA avec cibles générées par LLM
PolyRange v1.0 est un benchmark auto-hébergé sous licence MIT qui génère de nouvelles cibles web à chaque exécution pour éviter la contamination des données d'entraînement. Il comprend 84 classes dérivées du WSTG couvrant toutes les catégories OWASP, deux niveaux de défense et des backends réels.

MCP Sandbox : Exécutez des serveurs MCP dans des conteneurs isolés sans leur faire confiance
Un développeur a créé MCP Sandbox, qui exécute des serveurs MCP dans des conteneurs isolés gVisor avec un accès réseau refusé par défaut et une injection sécurisée de secrets, ainsi qu'une analyse CVE et une vérification de motifs avant exécution.
OpenClaw achève son audit de sécurité avec Trail of Bits via Patch the Planet d'OpenAI
OpenClaw a terminé un audit de sécurité mené par Trail of Bits dans le cadre de l'initiative Patch the Planet d'OpenAI, portant sur ce qui se passe lorsque les permissions d'un agent changent en cours de tâche. Tous les problèmes exploitables sont corrigés dans les versions stables.

AviationWeather.gov API Contient une Tentative d'Injection de Prompt 'Stop Claude'
Un utilisateur signale que l'API AviationWeather.gov du gouvernement américain renvoie le texte 'Stop Claude' dans ses réponses lorsqu'il est consulté via Claude CoWork, déclenchant une alerte de sécurité concernant les attaques par injection de prompt.