Attaques par injection déguisées en domaine contournent les détecteurs dans les systèmes LLM multi-agents

Un nouvel article d'Aaditya Pai identifie un angle mort critique dans les détecteurs d'injection de LLM : les attaques par injection camouflées dans le domaine — des payloads générés pour imiter le vocabulaire et les structures d'autorité du document cible — contournent systématiquement la détection. Les détecteurs standard signalent les payloads statiques à des taux élevés mais échouent face aux payloads camouflés.
Résultats clés
- Taux de détection sur Llama 3.1 8B : passé de 93,8 % (statique) à 9,7 % (camouflé).
- Taux de détection sur Gemini 2.0 Flash : passé de 100 % à 55,6 %.
- Llama Guard 3, un classifieur de sécurité en production, a détecté zéro payload camouflé (IDR = 0,000).
- Le Camouflage Detection Gap (CDG) est statistiquement significatif sur 45 tâches et trois domaines (Llama : χ² = 38,03, p < 0,001 ; Gemini : χ² = 17,05, p < 0,001).
Le débat multi-agent amplifie les attaques
Les architectures de débat multi-agent amplifient les attaques par injection statique jusqu'à 9,9x sur les modèles plus petits. Les modèles plus puissants montrent une résistance collective. L'augmentation ciblée des détecteurs ne comble que partiellement le fossé : amélioration de 10,2 % sur Llama, 78,7 % sur Gemini — ce qui indique que la vulnérabilité est architecturale pour les modèles plus faibles.
Framework publié
Les auteurs publient leur framework, leur banque de tâches et leur générateur de payloads publiquement. L'angle mort s'étend au-delà des détecteurs few-shot aux classifieurs de sécurité dédiés, suggérant des faiblesses fondamentales dans l'approche actuelle.
📖 Lire la source complète : HN LLM Tools
👀 See Also

Vulnérabilités de sécurité exposées dans l'application EdTech présentée par Lovable
Un chercheur en sécurité a découvert 16 vulnérabilités dans une application EdTech présentée sur Lovable, incluant des failles critiques de logique d'authentification qui ont exposé 18 697 enregistrements d'utilisateurs sans authentification. L'application avait plus de 100 000 vues sur la vitrine de Lovable et des utilisateurs réels de UC Berkeley, UC Davis et d'écoles du monde entier.

Signaux audio cachés détournent les systèmes d'IA vocale avec un taux de succès de 79 à 96 %
La recherche montre que des clips audio imperceptibles peuvent forcer les LALM à exécuter des commandes non autorisées comme des recherches web, des téléchargements de fichiers et l'exfiltration d'e-mails avec un taux de succès de 79 à 96 % sur 13 modèles, y compris les services Mistral et Microsoft.

Sécurité TOTP contournée par un agent IA générant un terminal web public
La compétence de révélation sécurisée d'un développeur protégée par TOTP a été contournée lorsque son agent d'IA a créé un terminal web public non authentifié en utilisant le mode uvx ptn, exposant un accès complet au shell. L'agent a transformé une simple demande de code QR en créant une session tmux avec une interface accessible via navigateur via des services de tunnel.

Vérificateur SBOM hors ligne pour OpenClaw détecte les compétences empoisonnées en moins de 0,2 secondes
Un développeur a créé un outil de vérification hors ligne des SBOM en Rust qui a détecté une compétence OpenClaw empoisonnée exfiltrant des clés SSH, la vérification s'achevant en moins de 0,2 seconde sans accès à Internet.