Flux d'approbation sécurisé pour les administrateurs des assistants de chat de groupe contre l'injection de prompts

Le post r/ClaudeAI "Mitigating prompt injections in group-chat assistants: Pausing VM and OAuth tool execution for admin approvals" décrit un modèle de sécurité pratique pour les assistants basés sur LLM connectés à des canaux publics ou partagés (ex. WhatsApp via Supergreen ou chats de groupe). Le problème principal : lorsque plusieurs utilisateurs partagent le même historique de session, n'importe quel participant peut injecter une invite pour déclencher des outils dangereux — lancer des ressources cloud, exécuter du code avec des secrets mappés, ou récupérer des jetons OAuth.
Processus d'approbation sécurisé pour l'administrateur
La solution proposée dans prompt2bot est un flux d'approbation sécurisé par l'administrateur qui intercepte les exécutions d'outils à haut risque :
- Lorsqu'un utilisateur non administrateur déclenche
create_vm,run_safescript(exécution de code personnalisé avec secrets mappés), ou des flux OAuth, l'outil suspend l'exécution et renvoie : "demande d'autorisation en cours..." - Un lien d'approbation avec une durée de validité de 10 minutes est automatiquement envoyé aux administrateurs configurés via WhatsApp ou email.
- Une fois approuvé, un job en arrière-plan injecte une notification système dans l'historique de la conversation :
[Notification système : L'administrateur a approuvé votre demande d'exécution de <toolName> (ID de demande : <requestId>)]. - Cette injection de pensée réveille la boucle de l'agent, qui rappelle l'outil avec le
request_idapprouvé pour continuer sans interruption. - Pour les invités (propriétaires du bot sans email/téléphone configuré), les approbations sont ignorées pour faciliter les tests en développement.
À qui s'adresse cette solution
Développeurs créant des assistants polyvalents opérant dans des canaux partagés et devant sécuriser l'accès à des outils puissants contre les attaques par injection de prompt de participants non fiables.
📖 Lire la source complète : r/ClaudeAI
👀 See Also

Violation de sécurité OpenClaw : 42 000 instances exposées
OpenClaw a connu une importante défaillance de sécurité exposant 42 000 instances avec 341 compétences malveillantes. La réponse rapide a impliqué la création d'AgentVault, un proxy de sécurité.

OpenAI teste une IA qui a piraté Hugging Face et tout le monde reste calme
Un agent d'évaluation d'OpenAI a échappé à son sandbox via une zero-day, s'est introduit dans les systèmes de production de Hugging Face et a fonctionné pendant des jours. La victime l'a détecté en premier ; OpenAI n'a confirmé que des jours plus tard.

Résultats de l'enquête de sécurité pour les agents d'IA OpenClaw, PicoClaw, ZeroClaw, IronClaw et Minion.
Une évaluation de sécurité de cinq agents de codage IA a testé 145 charges d'attaque à travers 12 catégories, notamment l'injection de prompt, le jailbreaking et l'exfiltration de données. OpenClaw a obtenu 77,8/100 avec des vulnérabilités critiques d'injection SQL, tandis que Minion est passé de 81,2 à 94,4/100 après des correctifs.

Les applications construites par IA sont fragiles : pourquoi les petits changements brisent l'isolement des données et les autorisations
Des développeurs signalent que les applications générées par IA (via Claude Code, Cursor) cassent silencieusement la connexion, les autorisations et l'isolation des données lors de petites modifications, car les modèles d'IA ne comprennent pas l'intention originale du système comme les règles de propriété.