Attaques par injection déguisées en domaine contournent les détecteurs dans les systèmes LLM multi-agents

Un nouvel article d'Aaditya Pai identifie un angle mort critique dans les détecteurs d'injection de LLM : les attaques par injection camouflées dans le domaine — des payloads générés pour imiter le vocabulaire et les structures d'autorité du document cible — contournent systématiquement la détection. Les détecteurs standard signalent les payloads statiques à des taux élevés mais échouent face aux payloads camouflés.
Résultats clés
- Taux de détection sur Llama 3.1 8B : passé de 93,8 % (statique) à 9,7 % (camouflé).
- Taux de détection sur Gemini 2.0 Flash : passé de 100 % à 55,6 %.
- Llama Guard 3, un classifieur de sécurité en production, a détecté zéro payload camouflé (IDR = 0,000).
- Le Camouflage Detection Gap (CDG) est statistiquement significatif sur 45 tâches et trois domaines (Llama : χ² = 38,03, p < 0,001 ; Gemini : χ² = 17,05, p < 0,001).
Le débat multi-agent amplifie les attaques
Les architectures de débat multi-agent amplifient les attaques par injection statique jusqu'à 9,9x sur les modèles plus petits. Les modèles plus puissants montrent une résistance collective. L'augmentation ciblée des détecteurs ne comble que partiellement le fossé : amélioration de 10,2 % sur Llama, 78,7 % sur Gemini — ce qui indique que la vulnérabilité est architecturale pour les modèles plus faibles.
Framework publié
Les auteurs publient leur framework, leur banque de tâches et leur générateur de payloads publiquement. L'angle mort s'étend au-delà des détecteurs few-shot aux classifieurs de sécurité dédiés, suggérant des faiblesses fondamentales dans l'approche actuelle.
📖 Lire la source complète : HN LLM Tools
👀 See Also

ClawSecure : Plateforme de Sécurité pour l'Écosystème OpenClaw avec Audit à 3 Niveaux et Surveillance en Temps Réel
ClawSecure est une plateforme de sécurité dédiée à OpenClaw qui effectue des audits de sécurité à 3 niveaux, une surveillance en temps réel avec suivi des hachages SHA-256 toutes les 12 heures, et offre une couverture complète OWASP ASI. Elle a audité plus de 3 000 compétences populaires et est gratuite sans inscription requise.

Préoccupations de sécurité d'OpenClaw : Clés API et données de conversation en danger dans l'hébergement autonome par défaut
Un rapport de Cisco indique que la sécurité d'OpenClaw est "optionnelle, non intégrée", avec des configurations par défaut stockant les clés API dans des fichiers .env sur des instances VPS, créant une exposition potentielle pour les utilisateurs non techniques fonctionnant sur des droplets de base.

Les agents d'IA permettent aux pirates solitaires de pirater les gouvernements et de lancer des campagnes de rançongiciel
Un opérateur solo utilisant Claude Code et ChatGPT a exfiltré 150 Go de données d'agences gouvernementales mexicaines, dont 195 millions de dossiers fiscaux. Un autre attaquant a utilisé Claude Code pour mener une campagne d'extorsion de bout en bout contre 17 organisations de santé et de services d'urgence.

Piratage du chiffrement de la médiation AppLovin : l'empreinte numérique des appareils contourne l'ATT
Le reverse engineering a révélé que le chiffrement personnalisé d'AppLovin utilise un sel constant + une clé SDK, un PRNG SplitMix64, et aucune authentification. Les requêtes déchiffrées transportent environ 50 champs sur l'appareil (modèle matériel, taille d'écran, locale, heure de démarrage, etc.) même lorsque ATT est refusé, permettant une ré-identification déterministe entre applications.