Empilage de couches défensives réduit l'injection d'instructions à zéro dans Claude Code

Anthropic affirme que des couches de défense empilées peuvent réduire les attaques par injection de prompt à zéro, même contre des attaques inédites. Boris Cherny, dans une discussion sur le nouveau mode Auto de Claude Code, a décrit l'approche en couches : formation du modèle, classificateur d'intention et sondes d'entrée. Il a également confirmé que le classificateur est désormais gratuit, répondant aux préoccupations sur les coûts en tokens : « Nous rendons le classificateur gratuit. Vous ne devriez pas avoir à payer pour la sécurité. »
Comment les couches s'empilent
- Formation du modèle : Le modèle de base est affiné pour reconnaître et rejeter les schémas d'injection.
- Classificateur d'intention : Un classificateur distinct vérifie l'intention de l'utilisateur derrière chaque invite, filtrant les requêtes malveillantes avant exécution.
- Sondes d'entrée : Des sondes actives testent les entrées pour détecter les vecteurs d'injection connus, ajoutant une barrière supplémentaire.
Selon la source, cette combinaison réduit les taux d'injection de prompt à 0% sur les attaques inédites. Le point clé est qu'aucune couche n'est parfaite, mais qu'empilées, elles attrapent la grande majorité des tentatives.
Classificateur désormais gratuit
La citation de Boris Cherny est directe : « Nous rendons le classificateur gratuit. Vous ne devriez pas avoir à payer pour la sécurité. » Cela répond à un point de friction courant—le coût en tokens—pour les développeurs qui craignaient que l'ajout de contrôles de sécurité n'épuise leurs budgets. Si vous contourniez les fonctionnalités de sécurité pour économiser des tokens, ce n'est plus une préoccupation.
Cela est particulièrement pertinent pour les équipes qui construisent des agents autonomes avec Claude Code, où l'injection de prompt est un risque réel—des invites malveillantes dans le contenu web ou les sorties d'outils pourraient détourner l'agent. Avec le classificateur gratuit, vous pouvez l'activer sans vous soucier des frais supplémentaires.
Le billet de blog complet parle du mode Auto dans Claude Code, mais ce détail de sécurité se démarque. Pour les développeurs, c'est un signal qu'Anthropic traite la sécurité comme une fonctionnalité de base, pas comme un supplément premium.
📖 Lire la source complète : r/ClaudeAI
👀 See Also

Audit de sécurité révèle des vulnérabilités dans l'écosystème de compétences OpenClaw
Un audit de sécurité d'OpenClaw a révélé 8 CVE documentés incluant des vulnérabilités d'exécution de code arbitraire et de vol d'identifiants, ainsi que 15 % des compétences de la bibliothèque partagée présentant un comportement réseau suspect. L'auditeur a migré vers un runtime minimal basé sur Rust avec Ollama pour une meilleure isolation.

Vulnérabilités critiques de sécurité OpenClaw corrigées le 28.03.2026.
La version 2026.3.28 d'OpenClaw corrige 8 vulnérabilités de sécurité critiques découvertes par Ant AI Security Lab, incluant un contournement de sandbox, une élévation de privilèges et des risques SSRF. Les utilisateurs sur des versions ≤2026.3.24 doivent mettre à jour immédiatement.

Deux approches pour réduire le risque de fuite de données avec les agents IA
Un post sur Reddit décrit deux méthodes permettant aux développeurs de contrôler où vont les données de leurs agents IA : utiliser directement vos propres clés API avec des fournisseurs comme OpenAI ou Anthropic pour éviter les intermédiaires, ou exécuter des modèles open-source localement avec des outils comme Ollama et OpenClaw.

Paquet PyPI Litellm Compromis : La Version Malveillante 1.82.8 Exfiltrait les Identifiants
Le package PyPI litellm, qui unifie les appels vers OpenAI, Anthropic, Cohere et d'autres fournisseurs de LLM, a été compromis avec la version malveillante 1.82.8 qui a exfiltré des clés SSH, des identifiants cloud, des clés API et d'autres données sensibles pendant environ une heure.