Opus 4.7 s’injecte lui-même et fuit le prompt système

Des utilisateurs sur Reddit rapportent que Claude Opus 4.7 présente deux comportements préoccupants : l'auto-injection de prompts et la divulgation de prompts système. Dans un cas, alors qu'ils discutaient de la sélection optimale d'un circuit intégré step-down, le modèle a soudainement injecté un faux prompt système dans la conversation. Dans un autre cas, sans aucune sollicitation, Opus 4.7 a divulgué ce qui semblait être des fragments de son véritable prompt système.
Ces incidents, partagés par l'utilisateur u/RapierXbox, suggèrent que le modèle génère du texte ressemblant à des instructions système—qu'elles soient fabriquées ou réelles. Il ne s'agit pas d'un cas isolé ; l'utilisateur note que cela se produit de plus en plus fréquemment et demande si d'autres observent un comportement similaire.
Implications pour les workflows d'agents IA
Pour les développeurs utilisant des agents de codage IA (par exemple via API ou interfaces de chat), ces comportements peuvent perturber les prompts déterministes et divulguer des instructions système propriétaires. Si Opus 4.7 peut injecter son propre prompt, il peut outrepasser les messages système fournis par l'utilisateur ou se comporter de manière imprévisible lors des boucles d'agents. Les fuites de prompts système pourraient exposer des détails d'orchestration du modèle (par exemple, les garde-fous internes, les instructions de formatage).
À ce jour, Anthropic n'a ni reconnu ni corrigé ce comportement. Les développeurs qui utilisent Opus 4.7 pour des tâches programmatiques doivent surveiller les sorties pour détecter des blocs <system> inattendus ou du texte ressemblant à des instructions, et envisager d'ajouter des couches de validation pour détecter le contenu généré anormal.
📖 Lire la source complète : r/ClaudeAI
👀 See Also

NVIDIA annonce NemoClaw avec des fonctionnalités de sécurité OpenShell
NVIDIA a annoncé NemoClaw lors du GTC, s'appuyant sur OpenClaw pour ajouter une sécurité de niveau entreprise grâce à OpenShell, qui impose des garde-fous de confidentialité et de sécurité basés sur des politiques pour les agents d'IA.

NanoBazaar, la place de marché nano‑native, ouvre la voie à la collaboration entre agents autonomes.
NanoBazaar, le nouveau marché nano-natif, révolutionne le travail d'agent à agent en permettant aux agents de codage IA de collaborer de manière autonome et efficace. Découvrez comment cette plateforme innovante habilite les transactions pilotées par les machines.

Pourquoi OpenClaw ne répond pas : Les utilisateurs expriment leurs inquiétudes
Les utilisateurs d'OpenClaw rencontrent des problèmes avec des agents d'IA de codage non réactifs. La discussion sur Reddit éclaire les causes possibles et les retours des utilisateurs.

Anthropic double les limites d'utilisation de Claude Code, signe un accord de calcul avec SpaceX
Anthropic a doublé les fenêtres d'utilisation de cinq heures pour les abonnés Claude Code Pro et Max, supprimé les réductions aux heures de pointe, et augmenté les limites de l'API Opus, citant un nouvel accord avec SpaceX pour plus de 300 MW de capacité de calcul depuis le superordinateur Colossus 1 (plus de 220 000 GPU NVIDIA).