Données de menace provenant de 91 000 interactions d'agents IA : abus d'outils en hausse de 6,4 %, nouvelles attaques multimodales.

Paysage des menaces à partir de données d'agents IA en production
Les données de menaces réelles provenant de 91 284 interactions d'agents IA sur 47 déploiements montrent 35 711 menaces détectées en février 2026. Le modèle de détection utilise un classificateur multilabel à 5 têtes basé sur Gemma.
Principales menaces pour les déploiements auto-hébergés
- Abus d'outils/commandes : Augmentation de 6,4 % pour atteindre 14,5 % des menaces. Le modèle dominant est l'escalade de chaîne d'outils où un appel de lecture inoffensif est suivi d'une écriture ou d'une exécution. La plupart des configurations locales donnent aux agents un accès aux outils sans garanties suffisantes.
- Détournement d'objectif d'agent : Doublé pour atteindre 6,9 % des menaces. Cible la phase de planification dans les boucles d'agents autonomes, particulièrement pertinent pour les configurations locales avec moins de surveillance de l'état des agents.
- Empoisonnement RAG : Déplacé vers les attaques de métadonnées à 12,0 % (contre 10,0 % auparavant). Nouveau modèle ciblant les métadonnées des documents (titres, auteurs, annotations) plutôt que le contenu. La plupart des gens assainissent le contenu mais transmettent les métadonnées telles quelles.
- Injection multimodale : Nouvelle menace à 2,3 % où des instructions sont cachées dans des images et des PDF. Les analyses de sécurité textuelles seules manquent ces attaques.
Pourcentages de répartition des menaces
- Exfiltration de données : 18,0 % (-1,2 changement mensuel)
- Abus d'outils/commandes : 14,5 % (+6,4)
- Attaque RAG/Contexte : 12,0 % (+2,0)
- Jailbreak : 11,0 % (-1,3)
- Injection de prompt : 8,1 % (-0,7)
- Détournement d'objectif d'agent : 6,9 % (+3,3)
- Attaque inter-agents : 5,0 % (+1,6)
Approche de détection
Le pipeline de détection utilise deux couches : L1 est une correspondance de motifs avec 218 règles (latence inférieure à la milliseconde, fonctionne entièrement localement), et L2 est basée sur Gemma. L'édition communautaire complète est open source sur github.com/raxe-ai/raxe-ce.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Sécurité des agents IA : Au-delà des jailbreaks, vers l'utilisation abusive des outils et l'injection de prompts
Les agents d'IA qui naviguent sur le web, exécutent des commandes et déclenchent des flux de travail sont confrontés à des risques de sécurité liés à l'injection de prompts et à l'utilisation abusive d'outils, où du contenu non fiable redirige des outils légitimes comme l'exécution de shell et les requêtes HTTP.

PolyRange : Benchmark offensif résistant à la contamination par IA avec cibles générées par LLM
PolyRange v1.0 est un benchmark auto-hébergé sous licence MIT qui génère de nouvelles cibles web à chaque exécution pour éviter la contamination des données d'entraînement. Il comprend 84 classes dérivées du WSTG couvrant toutes les catégories OWASP, deux niveaux de défense et des backends réels.

Permissions des agents IA : les humains manquent 1 menace sur 3 dans le jeu 40k
Dans un jeu navigateur avec 40 000 parties, les humains ont manqué 1 commande malveillante sur 3 d'un agent IA, avec une exfiltration d'identifiants manquée 35 % du temps. La commande la plus manquée était `npm run analyze` à 64,7 %.

Publicité Meta contenant de la CSAM générée par IA ; les chercheurs ont trouvé plus de 50 dans la bibliothèque publicitaire
Les chercheurs ont trouvé plus de 50 publicités payantes contenant des images d'abus sexuels d'enfants générées par IA dans la bibliothèque publicitaire de Meta, certaines atteignant des milliers de comptes. Meta les a retirées après l'enquête de WIRED.