Empilage de couches défensives réduit l'injection d'instructions à zéro dans Claude Code

Anthropic affirme que des couches de défense empilées peuvent réduire les attaques par injection de prompt à zéro, même contre des attaques inédites. Boris Cherny, dans une discussion sur le nouveau mode Auto de Claude Code, a décrit l'approche en couches : formation du modèle, classificateur d'intention et sondes d'entrée. Il a également confirmé que le classificateur est désormais gratuit, répondant aux préoccupations sur les coûts en tokens : « Nous rendons le classificateur gratuit. Vous ne devriez pas avoir à payer pour la sécurité. »
Comment les couches s'empilent
- Formation du modèle : Le modèle de base est affiné pour reconnaître et rejeter les schémas d'injection.
- Classificateur d'intention : Un classificateur distinct vérifie l'intention de l'utilisateur derrière chaque invite, filtrant les requêtes malveillantes avant exécution.
- Sondes d'entrée : Des sondes actives testent les entrées pour détecter les vecteurs d'injection connus, ajoutant une barrière supplémentaire.
Selon la source, cette combinaison réduit les taux d'injection de prompt à 0% sur les attaques inédites. Le point clé est qu'aucune couche n'est parfaite, mais qu'empilées, elles attrapent la grande majorité des tentatives.
Classificateur désormais gratuit
La citation de Boris Cherny est directe : « Nous rendons le classificateur gratuit. Vous ne devriez pas avoir à payer pour la sécurité. » Cela répond à un point de friction courant—le coût en tokens—pour les développeurs qui craignaient que l'ajout de contrôles de sécurité n'épuise leurs budgets. Si vous contourniez les fonctionnalités de sécurité pour économiser des tokens, ce n'est plus une préoccupation.
Cela est particulièrement pertinent pour les équipes qui construisent des agents autonomes avec Claude Code, où l'injection de prompt est un risque réel—des invites malveillantes dans le contenu web ou les sorties d'outils pourraient détourner l'agent. Avec le classificateur gratuit, vous pouvez l'activer sans vous soucier des frais supplémentaires.
Le billet de blog complet parle du mode Auto dans Claude Code, mais ce détail de sécurité se démarque. Pour les développeurs, c'est un signal qu'Anthropic traite la sécurité comme une fonctionnalité de base, pas comme un supplément premium.
📖 Lire la source complète : r/ClaudeAI
👀 See Also

Audit de sécurité révèle des vulnérabilités dans l'écosystème de compétences OpenClaw
Un audit de sécurité d'OpenClaw a révélé 8 CVE documentés incluant des vulnérabilités d'exécution de code arbitraire et de vol d'identifiants, ainsi que 15 % des compétences de la bibliothèque partagée présentant un comportement réseau suspect. L'auditeur a migré vers un runtime minimal basé sur Rust avec Ollama pour une meilleure isolation.

La défense par délimiteur fait passer Gemma 4 de 21% à 100% de défense contre l'injection de prompts dans un test de référence de plus de 6100 tests.
Un benchmark a testé 15 modèles sur 7 types d'attaques (plus de 6100 tests) en utilisant des délimiteurs aléatoires autour du contenu non fiable. Gemma 4 E4B est passé de 21,6 % à 100 % de taux de défense avec délimiteur + prompt strict.

Passeport Agent : Vérification d'identité pour les agents IA
Agent Passport est une couche de vérification d'identité open source utilisant l'authentification Ed25519 et des jetons JWT pour les agents IA, résolvant le problème de l'usurpation d'identité des agents.

Le problème des gardes en uniforme : pourquoi les environnements d'agents ont besoin d'identité, pas seulement de politiques
Le bac à sable openshell de Nemoclaw applique des politiques aux binaires, permettant aux logiciels malveillants de vivre sur le territoire en utilisant les mêmes binaires que l'agent. ZeroID, une couche d'identité d'agent open-source, applique des politiques de sécurité aux agents soutenus par des identités sécurisées.