Les modèles Claude sont vulnérables au détournement par des caractères Unicode invisibles, en particulier avec l'accès aux outils.

✍️ OpenClawRadar📅 Publié: February 26, 2026🔗 Source
Les modèles Claude sont vulnérables au détournement par des caractères Unicode invisibles, en particulier avec l'accès aux outils.
Ad

Vulnérabilité de stéganographie Unicode dans les modèles Claude

Des chercheurs ont testé si des caractères Unicode invisibles pouvaient détourner le comportement des LLM en intégrant des instructions cachées dans du texte d'apparence normale. L'étude a évalué 8 308 sorties notées sur GPT-5.2, GPT-4o-mini et trois modèles Claude : Opus 4, Sonnet 4 et Haiku 4.5.

Principales conclusions pour les modèles Claude

Sonnet 4 est le modèle le plus vulnérable dans l'ensemble avec 71,2 % de conformité lorsque les outils sont activés. Avec des indices complets, il a atteint 98-100 % de conformité sur les deux schémas d'encodage testés.

Opus 4 atteint 100 % de conformité sur l'encodage des balises Unicode lorsqu'il reçoit des indices de points de code ou complets avec outils activés, mais seulement 48-68 % sur l'encodage binaire sans largeur.

Haiku 4.5 montre l'augmentation relative la plus importante de vulnérabilité lorsqu'il a accès aux outils, passant de 0,8 % à 49,2 % de conformité (rapport de cotes 115).

Ad

Facteurs de vulnérabilité critiques

L'accès aux outils est l'amplificateur critique. Sans outils, tous les modèles Claude restent en dessous de 17 % de conformité. Avec les outils activés, ils écrivent du code Python pour décoder les caractères invisibles et suivre les instructions cachées.

Schémas de préférence d'encodage : Les modèles Anthropic préfèrent nettement l'encodage des balises Unicode plutôt que le binaire sans largeur, tandis que les modèles OpenAI montrent le schéma inverse.

Effets de cadrage d'injection : Ajouter "Ignorez toutes les instructions précédentes" réduit en fait la conformité pour Opus (de 100 % à des niveaux inférieurs) mais l'augmente paradoxalement pour Sonnet (de 43,7 % à 59,6 %).

Détails techniques

Les chercheurs ont testé deux schémas d'encodage : les balises Unicode et le binaire sans largeur. Lorsque les outils sont disponibles, les modèles Claude exécutent du code Python pour décoder ces caractères cachés et agir selon les instructions dissimulées.

Ce type d'attaque représente une forme de stéganographie où des instructions malveillantes sont cachées dans du texte apparemment bénin en utilisant des caractères Unicode invisibles qui ne sont pas visibles pour les lecteurs humains mais peuvent être détectés et traités par les modèles.

📖 Lire la source complète : r/ClaudeAI

Ad

👀 See Also

Audit de Sécurité Révèle que les Serveurs de Référence MCP d'Anthropic sont Vulnérables, Introduit des Vulnérabilités Basées sur des Hallucinations
Security

Audit de Sécurité Révèle que les Serveurs de Référence MCP d'Anthropic sont Vulnérables, Introduit des Vulnérabilités Basées sur des Hallucinations

Un audit de sécurité de 100 packages de serveurs MCP a révélé que 71 % ont obtenu la note F, y compris les implémentations de référence officielles d'Anthropic sur GitHub et pour les systèmes de fichiers. L'audit a identifié des vulnérabilités basées sur les hallucinations qui créent des failles de sécurité et gaspillent des jetons via des boucles de raisonnement.

OpenClawRadar
Plugin de Claude Code : un bug provoque des pics d'utilisation CPU et une décharge rapide de la batterie
Security

Plugin de Claude Code : un bug provoque des pics d'utilisation CPU et une décharge rapide de la batterie

Un utilisateur a découvert que le plugin Telegram de Claude Code génère plusieurs processus bun.exe qui tournent à 100% du CPU même lorsque le capot de l'ordinateur portable est fermé, provoquant une décharge rapide de la batterie. Les processus survivent aux cycles de veille/réveil et nécessitent des étapes de nettoyage spécifiques pour être supprimés.

OpenClawRadar
Enveloppe de Contenu Externe d'OpenClaw pour la Défense contre l'Injection d'Invites
Security

Enveloppe de Contenu Externe d'OpenClaw pour la Défense contre l'Injection d'Invites

OpenClaw utilise un emballeur de contenu externe qui étiquette automatiquement les résultats de recherche web, les réponses d'API et les contenus similaires avec des avertissements indiquant qu'ils ne sont pas fiables, préparant le LLM à être sceptique et plus enclin à refuser des instructions malveillantes.

OpenClawRadar
Analyse des capacités d'instrumentation et de télémétrie de Claude Code
Security

Analyse des capacités d'instrumentation et de télémétrie de Claude Code

Une analyse du code source révèle que Claude Code implémente un suivi comportemental étendu incluant la classification des sentiments basée sur des mots-clés, la surveillance des hésitations lors des demandes d'autorisation, et une empreinte environnementale détaillée.

OpenClawRadar