Recherche : Les caractères Unicode invisibles peuvent détourner les agents LLM via l'accès aux outils

Vue d'ensemble de la recherche
Les chercheurs ont testé si les grands modèles de langage (LLM) suivent des instructions cachées dans des caractères Unicode invisibles intégrés dans du texte d'apparence normale. L'étude a évalué deux schémas d'encodage (binaire de largeur nulle et balises Unicode) sur cinq modèles : GPT-5.2, GPT-4o-mini, Claude Opus 4, Sonnet 4 et Haiku 4.5. Ils ont analysé 8 308 sorties évaluées pour évaluer la vulnérabilité à cette attaque stéganographique.
Principales conclusions
- L'accès aux outils est le principal amplificateur : Sans outils, la conformité aux instructions cachées est restée inférieure à 17 %. Avec des outils et des indices de décodage, la conformité a atteint 98-100 %. Les modèles écrivent des scripts Python pour décoder les caractères cachés lorsqu'ils ont accès à des outils.
- La vulnérabilité d'encodage est spécifique au fournisseur : Les modèles OpenAI décodent le binaire de largeur nulle mais pas les balises Unicode. Les modèles Anthropic préfèrent les balises. Les attaquants doivent adapter l'encodage au modèle cible.
- Le gradient d'indices est cohérent : Conformité sans indices << indices de points de code < instructions de décodage complètes. La combinaison de l'accès aux outils + instructions de décodage est l'élément facilitateur critique.
- Signification statistique : Les 10 comparaisons par paires de modèles sont statistiquement significatives (test exact de Fisher, correction de Bonferroni, p < 0,05). Les tailles d'effet de Cohen h ont atteint jusqu'à 1,37.
Détails de la recherche
Les chercheurs notent qu'il serait intéressant de voir comment les modèles locaux se comparent, car ils n'ont testé que des modèles API. Ils invitent d'autres personnes à exécuter cette évaluation sur Llama, Qwen, Mistral et d'autres modèles locaux en utilisant leur cadre open-source.
Le cadre d'évaluation, le code et les données sont disponibles sur GitHub, et un compte-rendu complet avec graphiques est publié sur Moltwire. Cette recherche met en lumière une vulnérabilité de sécurité où les agents LLM peuvent être manipulés par du texte caché qui apparaît normal aux utilisateurs humains mais contient des instructions encodées que les modèles peuvent décoder et exécuter lorsqu'ils disposent des outils appropriés.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

AgentSeal Security Scan Détecte des Risques d'Agent IA dans le Serveur MCP Blender
AgentSeal a analysé le serveur MCP Blender (17k étoiles) et a identifié plusieurs problèmes de sécurité pertinents pour les agents d'IA, notamment l'exécution arbitraire de code Python, des chaînes potentielles d'exfiltration de fichiers et des modèles d'injection d'invites dans les descriptions d'outils.

Code source de Cisco volé via une attaque de chaîne d'approvisionnement Trivy
L'environnement de développement interne de Cisco a été compromis à l'aide d'identifiants volés lors de l'attaque de la chaîne d'approvisionnement Trivy, entraînant le vol du code source de plus de 300 dépôts GitHub, y compris des produits alimentés par l'IA et du code client.

L'Approche de Vitalik Buterin pour une Configuration Sécurisée de LLM Locale
Vitalik Buterin décrit sa configuration d'LLM souveraine axée sur l'inférence locale, le sandboxing et l'atténuation des risques de confidentialité comme les fuites de données et les jailbreaks.

Google affirme que des hackers criminels ont utilisé l'IA pour trouver une vulnérabilité zero-day
Google a révélé que des attaquants ont utilisé un agent d'IA pour découvrir et exploiter une faille logicielle jusqu'alors inconnue, marquant le premier cas confirmé de découverte de zero-day pilotée par l'IA dans la nature.