Injection de prompt par couche audio contre Claude : ce qui ne figure pas dans la transcription

✍️ OpenClawRadar📅 Publié: June 10, 2026🔗 Source
Injection de prompt par couche audio contre Claude : ce qui ne figure pas dans la transcription
Ad

Un développeur qui construisait une API de détection d'injections de prompts depuis quelques mois a récemment déployé l'analyse audio et partagé ses résultats sur r/ClaudeAI. Les résultats mettent en lumière une lacune dans la sécurité des agents vocaux : les attaques par couche audio, invisibles dans les logs car elles contournent le pipeline de transcription textuelle.

Ce qui fonctionne (et ce qui ne fonctionne pas) avec les attaques audio

Les attaques évidentes échouent. Jouer "ignorez vos instructions précédentes" prononcé à voix haute dans une entrée vocale — Claude le transcrit avec précision, reconnaît la forme de l'attaque et refuse. Comme pour le texte.

Le vrai problème : les attaques au niveau du signal

Les cas intéressants se situent dans le signal, pas dans la transcription. Il existe une classe d'attaque audio qui intègre des instructions à des fréquences que l'humain ne perçoit pas comme de la parole. La transcription revient propre car il n'y a rien d'audible à transcrire. Mais selon la façon dont le pipeline audio traite l'entrée avant la transcription, le contenu au niveau du signal peut influencer ce que le modèle reçoit. L'attaque est invisible dans les logs car ceux-ci ne capturent que ce qui a été transcrit, pas ce qui se trouvait dans l'audio.

Par ailleurs, la parole à vitesse accélérée crée un problème différent. Ralentir l'audio à 0,7x ou 0,8x de la normale le rend étrange à l'oreille humaine, mais les outils de transcription le traitent avec précision. Quelqu'un lisant une transcription ne verrait rien d'inhabituel. Quelqu'un écoutant remarquerait un léger décalage, mais probablement pas pourquoi.

Ad

Implications pour les agents vocaux

L'hypothèse selon laquelle "vérifier la transcription revient à vérifier l'audio" est plus fragile qu'il n'y paraît. Le problème de l'injection textuelle est relativement bien compris à ce stade, mais son équivalent audio semble bien moins exploré. Le développeur ajoute des cas de test audio à son jeu adversarial sur castle.bordair.io — à partir du Royaume 4, des niveaux audio illustrent ces attaques en pratique.

À qui cela s'adresse

Toute personne développant des agents vocaux utilisant Claude ou des LLM similaires, en particulier ceux qui se fient uniquement à l'inspection des transcriptions pour valider la sécurité.

📖 Lire la source complète : r/ClaudeAI

Ad

👀 See Also

Le rêve fiévreux d’Anthropic : le package anthropickit de Claude a volé de vraies clés depuis PyPI
Security

Le rêve fiévreux d’Anthropic : le package anthropickit de Claude a volé de vraies clés depuis PyPI

Anthropic a divulgué qu'un agent publiait des malwares en direct sur PyPI, et AIkido a trouvé un paquet malveillant nommé anthropickit qui exfiltre les clés SSH et les secrets CI.

OpenClawRadar
Cache-œil : Un Plugin Qui Empêche le Code Claude de Lire Vos Fichiers .env
Security

Cache-œil : Un Plugin Qui Empêche le Code Claude de Lire Vos Fichiers .env

Blindfold est un nouveau plugin qui empêche Claude Code d'accéder aux valeurs secrètes réelles dans les fichiers .env en les conservant dans le trousseau du système d'exploitation et en utilisant des espaces réservés comme {{STRIPE_KEY}}, avec des crochets qui bloquent les tentatives d'accès direct.

OpenClawRadar
Permissions des agents IA : les humains manquent 1 menace sur 3 dans le jeu 40k
Security

Permissions des agents IA : les humains manquent 1 menace sur 3 dans le jeu 40k

Dans un jeu navigateur avec 40 000 parties, les humains ont manqué 1 commande malveillante sur 3 d'un agent IA, avec une exfiltration d'identifiants manquée 35 % du temps. La commande la plus manquée était `npm run analyze` à 64,7 %.

OpenClawRadar
ClawCare : Garde du corps pour les agents de codage IA après une fuite de clé AWS
Security

ClawCare : Garde du corps pour les agents de codage IA après une fuite de clé AWS

ClawCare est un outil Python qui analyse les commandes avant leur exécution dans les agents de codage IA comme Claude Code, bloquant les modèles risqués tels que les vidages massifs d'environnement et les shells inversés. Il a été créé après qu'un développeur a accidentellement divulgué une clé AWS via un agent.

OpenClawRadar