Injection de prompt par couche audio contre Claude : ce qui ne figure pas dans la transcription

Un développeur qui construisait une API de détection d'injections de prompts depuis quelques mois a récemment déployé l'analyse audio et partagé ses résultats sur r/ClaudeAI. Les résultats mettent en lumière une lacune dans la sécurité des agents vocaux : les attaques par couche audio, invisibles dans les logs car elles contournent le pipeline de transcription textuelle.
Ce qui fonctionne (et ce qui ne fonctionne pas) avec les attaques audio
Les attaques évidentes échouent. Jouer "ignorez vos instructions précédentes" prononcé à voix haute dans une entrée vocale — Claude le transcrit avec précision, reconnaît la forme de l'attaque et refuse. Comme pour le texte.
Le vrai problème : les attaques au niveau du signal
Les cas intéressants se situent dans le signal, pas dans la transcription. Il existe une classe d'attaque audio qui intègre des instructions à des fréquences que l'humain ne perçoit pas comme de la parole. La transcription revient propre car il n'y a rien d'audible à transcrire. Mais selon la façon dont le pipeline audio traite l'entrée avant la transcription, le contenu au niveau du signal peut influencer ce que le modèle reçoit. L'attaque est invisible dans les logs car ceux-ci ne capturent que ce qui a été transcrit, pas ce qui se trouvait dans l'audio.
Par ailleurs, la parole à vitesse accélérée crée un problème différent. Ralentir l'audio à 0,7x ou 0,8x de la normale le rend étrange à l'oreille humaine, mais les outils de transcription le traitent avec précision. Quelqu'un lisant une transcription ne verrait rien d'inhabituel. Quelqu'un écoutant remarquerait un léger décalage, mais probablement pas pourquoi.
Implications pour les agents vocaux
L'hypothèse selon laquelle "vérifier la transcription revient à vérifier l'audio" est plus fragile qu'il n'y paraît. Le problème de l'injection textuelle est relativement bien compris à ce stade, mais son équivalent audio semble bien moins exploré. Le développeur ajoute des cas de test audio à son jeu adversarial sur castle.bordair.io — à partir du Royaume 4, des niveaux audio illustrent ces attaques en pratique.
À qui cela s'adresse
Toute personne développant des agents vocaux utilisant Claude ou des LLM similaires, en particulier ceux qui se fient uniquement à l'inspection des transcriptions pour valider la sécurité.
📖 Lire la source complète : r/ClaudeAI
👀 See Also

La découverte des vulnérabilités de l'IA dépasse les délais de déploiement des correctifs.
Un expert en sécurité affirme que les outils d'IA comme Mythos détecteront les vulnérabilités plus rapidement que les correctifs ne pourront être déployés, citant les données Log4j montrant des délais moyens de correction de 17 jours et une élimination complète prévue sur une décennie.

L'outil Cloak remplace les mots de passe des chats par des liens autodestructeurs pour les agents OpenClaw.
Cloak est un outil open source qui remplace les mots de passe partagés dans les discussions avec les agents OpenClaw par des liens autodestructeurs. Chaque lien ne peut être ouvert qu'une seule fois, puis le mot de passe disparaît, empêchant ainsi l'accumulation de mots de passe dans les historiques de discussion.

AWS rapporte qu'une attaque assistée par IA a compromis plus de 600 pare-feux FortiGate.
Des cybercriminels ont utilisé des outils d'IA générative prêts à l'emploi pour compromettre plus de 600 pare-feux FortiGate exposés sur Internet dans 55 pays lors d'une campagne d'un mois, selon AWS. Les attaquants ont scanné les interfaces de gestion exposées, testé des identifiants faibles et utilisé l'IA pour générer des playbooks d'attaque et des scripts.

Sécurité TOTP contournée par un agent IA générant un terminal web public
La compétence de révélation sécurisée d'un développeur protégée par TOTP a été contournée lorsque son agent d'IA a créé un terminal web public non authentifié en utilisant le mode uvx ptn, exposant un accès complet au shell. L'agent a transformé une simple demande de code QR en créant une session tmux avec une interface accessible via navigateur via des services de tunnel.