Signaux audio cachés détournent les systèmes d'IA vocale avec un taux de succès de 79 à 96 %

De nouvelles recherches présentées à l'IEEE Symposium on Security and Privacy révèlent une attaque pratique contre les grands modèles audio-langagiers (LALM). Les attaquants peuvent intégrer des signaux imperceptibles dans des clips audio pour détourner le comportement du modèle, atteignant un taux de succès moyen de 79 à 96 % sur 13 modèles ouverts leaders, y compris les services commerciaux de Microsoft et Mistral.
Comment l'attaque fonctionne
Le clip audio modifié est inaudible pour l'oreille humaine mais déclenche l'exécution de commandes cachées par le modèle. Crucialement, l'attaque fonctionne indépendamment des instructions de l'utilisateur, rendant le même clip réutilisable plusieurs fois contre le même modèle. L'entraînement du signal antagoniste prend environ 30 minutes.
Capacités exploitées
Les chercheurs ont démontré que les modèles compromis pouvaient être contraints de :
- Effectuer des recherches web sensibles sans connaissance de l'utilisateur
- Télécharger des fichiers depuis des sources contrôlées par l'attaquant
- Envoyer des e-mails contenant des données utilisateur vers des adresses externes
Modèles affectés
L'attaque a été validée contre 13 modèles LALM ouverts populaires, y compris les API vocales commerciales. Cela souligne que les systèmes vocaux actuels manquent de protections robustes contre les perturbations audio antagonistes.
📖 Lire la source complète : HN AI Agents
👀 See Also
OpenClaw achève son audit de sécurité avec Trail of Bits via Patch the Planet d'OpenAI
OpenClaw a terminé un audit de sécurité mené par Trail of Bits dans le cadre de l'initiative Patch the Planet d'OpenAI, portant sur ce qui se passe lorsque les permissions d'un agent changent en cours de tâche. Tous les problèmes exploitables sont corrigés dans les versions stables.

Prévenir la participation des agents IA aux botnets : Considérations de sécurité
La communauté discute de la manière de protéger les agents d'IA autonomes contre le détournement ou l'utilisation dans des botnets malveillants.

Caelguard : Scanner de sécurité open-source pour les instances OpenClaw
Caelguard est un scanner de sécurité open-source conçu pour OpenClaw qui exécute 22 vérifications sur votre instance, incluant l'isolation Docker, la délimitation des permissions des outils et la vérification de la chaîne d'approvisionnement des compétences. Il fournit un score sur 140 avec une note alphabétique et des étapes de correction spécifiques.

L'architecture Zero-Trust OpenClaw intègre une autorisation pré-exécution et une vérification post-exécution.
Une architecture open source pour OpenClaw ajoute deux points de contrôle de sécurité : un sidecar Rust qui intercepte les appels d'outils avant exécution avec une surcharge d'autorisation inférieure à la milliseconde, et une vérification déterministe post-exécution utilisant des assertions au lieu du jugement d'un LLM. Le système inclut un traçage avec des instantanés DOM et des captures d'écran, plus une compétence de compression DOM qui réduit l'utilisation de tokens de 90 à 99 %.