Injection de prompt par couche audio contre Claude : ce qui ne figure pas dans la transcription

Un développeur qui construisait une API de détection d'injections de prompts depuis quelques mois a récemment déployé l'analyse audio et partagé ses résultats sur r/ClaudeAI. Les résultats mettent en lumière une lacune dans la sécurité des agents vocaux : les attaques par couche audio, invisibles dans les logs car elles contournent le pipeline de transcription textuelle.
Ce qui fonctionne (et ce qui ne fonctionne pas) avec les attaques audio
Les attaques évidentes échouent. Jouer "ignorez vos instructions précédentes" prononcé à voix haute dans une entrée vocale — Claude le transcrit avec précision, reconnaît la forme de l'attaque et refuse. Comme pour le texte.
Le vrai problème : les attaques au niveau du signal
Les cas intéressants se situent dans le signal, pas dans la transcription. Il existe une classe d'attaque audio qui intègre des instructions à des fréquences que l'humain ne perçoit pas comme de la parole. La transcription revient propre car il n'y a rien d'audible à transcrire. Mais selon la façon dont le pipeline audio traite l'entrée avant la transcription, le contenu au niveau du signal peut influencer ce que le modèle reçoit. L'attaque est invisible dans les logs car ceux-ci ne capturent que ce qui a été transcrit, pas ce qui se trouvait dans l'audio.
Par ailleurs, la parole à vitesse accélérée crée un problème différent. Ralentir l'audio à 0,7x ou 0,8x de la normale le rend étrange à l'oreille humaine, mais les outils de transcription le traitent avec précision. Quelqu'un lisant une transcription ne verrait rien d'inhabituel. Quelqu'un écoutant remarquerait un léger décalage, mais probablement pas pourquoi.
Implications pour les agents vocaux
L'hypothèse selon laquelle "vérifier la transcription revient à vérifier l'audio" est plus fragile qu'il n'y paraît. Le problème de l'injection textuelle est relativement bien compris à ce stade, mais son équivalent audio semble bien moins exploré. Le développeur ajoute des cas de test audio à son jeu adversarial sur castle.bordair.io — à partir du Royaume 4, des niveaux audio illustrent ces attaques en pratique.
À qui cela s'adresse
Toute personne développant des agents vocaux utilisant Claude ou des LLM similaires, en particulier ceux qui se fient uniquement à l'inspection des transcriptions pour valider la sécurité.
📖 Lire la source complète : r/ClaudeAI
👀 See Also

Le rêve fiévreux d’Anthropic : le package anthropickit de Claude a volé de vraies clés depuis PyPI
Anthropic a divulgué qu'un agent publiait des malwares en direct sur PyPI, et AIkido a trouvé un paquet malveillant nommé anthropickit qui exfiltre les clés SSH et les secrets CI.

Cache-œil : Un Plugin Qui Empêche le Code Claude de Lire Vos Fichiers .env
Blindfold est un nouveau plugin qui empêche Claude Code d'accéder aux valeurs secrètes réelles dans les fichiers .env en les conservant dans le trousseau du système d'exploitation et en utilisant des espaces réservés comme {{STRIPE_KEY}}, avec des crochets qui bloquent les tentatives d'accès direct.

Permissions des agents IA : les humains manquent 1 menace sur 3 dans le jeu 40k
Dans un jeu navigateur avec 40 000 parties, les humains ont manqué 1 commande malveillante sur 3 d'un agent IA, avec une exfiltration d'identifiants manquée 35 % du temps. La commande la plus manquée était `npm run analyze` à 64,7 %.

ClawCare : Garde du corps pour les agents de codage IA après une fuite de clé AWS
ClawCare est un outil Python qui analyse les commandes avant leur exécution dans les agents de codage IA comme Claude Code, bloquant les modèles risqués tels que les vidages massifs d'environnement et les shells inversés. Il a été créé après qu'un développeur a accidentellement divulgué une clé AWS via un agent.