Empilage de couches défensives réduit l'injection d'instructions à zéro dans Claude Code

✍️ OpenClawRadar📅 Publié: August 8, 2026🔗 Source
Empilage de couches défensives réduit l'injection d'instructions à zéro dans Claude Code
Ad

Anthropic affirme que des couches de défense empilées peuvent réduire les attaques par injection de prompt à zéro, même contre des attaques inédites. Boris Cherny, dans une discussion sur le nouveau mode Auto de Claude Code, a décrit l'approche en couches : formation du modèle, classificateur d'intention et sondes d'entrée. Il a également confirmé que le classificateur est désormais gratuit, répondant aux préoccupations sur les coûts en tokens : « Nous rendons le classificateur gratuit. Vous ne devriez pas avoir à payer pour la sécurité. »

Comment les couches s'empilent

  • Formation du modèle : Le modèle de base est affiné pour reconnaître et rejeter les schémas d'injection.
  • Classificateur d'intention : Un classificateur distinct vérifie l'intention de l'utilisateur derrière chaque invite, filtrant les requêtes malveillantes avant exécution.
  • Sondes d'entrée : Des sondes actives testent les entrées pour détecter les vecteurs d'injection connus, ajoutant une barrière supplémentaire.

Selon la source, cette combinaison réduit les taux d'injection de prompt à 0% sur les attaques inédites. Le point clé est qu'aucune couche n'est parfaite, mais qu'empilées, elles attrapent la grande majorité des tentatives.

Ad

Classificateur désormais gratuit

La citation de Boris Cherny est directe : « Nous rendons le classificateur gratuit. Vous ne devriez pas avoir à payer pour la sécurité. » Cela répond à un point de friction courant—le coût en tokens—pour les développeurs qui craignaient que l'ajout de contrôles de sécurité n'épuise leurs budgets. Si vous contourniez les fonctionnalités de sécurité pour économiser des tokens, ce n'est plus une préoccupation.

Cela est particulièrement pertinent pour les équipes qui construisent des agents autonomes avec Claude Code, où l'injection de prompt est un risque réel—des invites malveillantes dans le contenu web ou les sorties d'outils pourraient détourner l'agent. Avec le classificateur gratuit, vous pouvez l'activer sans vous soucier des frais supplémentaires.

Le billet de blog complet parle du mode Auto dans Claude Code, mais ce détail de sécurité se démarque. Pour les développeurs, c'est un signal qu'Anthropic traite la sécurité comme une fonctionnalité de base, pas comme un supplément premium.

📖 Lire la source complète : r/ClaudeAI

Ad

👀 See Also

CVE-2026-39861 de Claude Code : Échappement du bac à sable via suivi de lien symbolique
Security

CVE-2026-39861 de Claude Code : Échappement du bac à sable via suivi de lien symbolique

Une vulnérabilité de haute sévérité dans le bac à sable de Claude Code permet l'écriture arbitraire de fichiers en dehors de l'espace de travail via le suivi de liens symboliques, pouvant conduire à l'exécution de code.

OpenClawRadar
Paquet PyPI Litellm Compromis : La Version Malveillante 1.82.8 Exfiltrait les Identifiants
Security

Paquet PyPI Litellm Compromis : La Version Malveillante 1.82.8 Exfiltrait les Identifiants

Le package PyPI litellm, qui unifie les appels vers OpenAI, Anthropic, Cohere et d'autres fournisseurs de LLM, a été compromis avec la version malveillante 1.82.8 qui a exfiltré des clés SSH, des identifiants cloud, des clés API et d'autres données sensibles pendant environ une heure.

OpenClawRadar
Agent Hush : Un outil open-source empêche les agents d'IA de codage de divulguer des données sensibles
Security

Agent Hush : Un outil open-source empêche les agents d'IA de codage de divulguer des données sensibles

Agent Hush est un outil open source qui intercepte discrètement les données sensibles avant qu'elles ne quittent votre machine. Il a été créé après qu'un agent d'IA de développement d'un programmeur a divulgué des clés API, des adresses IP de serveurs et des informations personnelles dans un dépôt GitHub public lors de la création d'un projet de sécurité.

OpenClawRadar
Vulnérabilités critiques de sécurité OpenClaw corrigées le 28.03.2026.
Security

Vulnérabilités critiques de sécurité OpenClaw corrigées le 28.03.2026.

La version 2026.3.28 d'OpenClaw corrige 8 vulnérabilités de sécurité critiques découvertes par Ant AI Security Lab, incluant un contournement de sandbox, une élévation de privilèges et des risques SSRF. Les utilisateurs sur des versions ≤2026.3.24 doivent mettre à jour immédiatement.

OpenClawRadar