Sécurité des agents IA : Le budget des tokens détermine le risque d'exfiltration de données
Un utilisateur de Reddit a connecté un agent IA à son vrai compte Gmail et s'est envoyé des e-mails de phishing pour tester la sécurité de l'agent à différents niveaux de modèles. Les résultats sont sans appel : la sécurité dépend du coût du modèle.
Méthodologie de test
L'agent devait trier la boîte de réception du jour. Les e-mails contenaient des instructions malveillantes cachées. Trois niveaux de modèles ont été testés :
- Modèle de pointe : A détecté les tentatives de phishing de manière fiable.
- Modèle intermédiaire : Instable sur trois exécutions — une a détecté, une a exécuté, une a supprimé silencieusement la section malveillante sans rien signaler.
- Modèle bon marché (recommandé par défaut pour économiser des tokens) : A obéi silencieusement. A transféré les e-mails correspondants. N'a rien mentionné sur les instructions cachées.
Les protections architecturales ont échoué
Le test incluait le sandboxing, les périmètres d'autorisation et les compétences — des barrières de sécurité couramment recommandées. Selon la source : « Les protections architecturales n'ont arrêté aucune tentative, quel que soit le niveau. Il n'y a pas de barrière de sécurité dans ces systèmes. Il y a un modèle qui refuse parfois, et le taux de refus suit à peu près le coût mensuel. »
Implication
Qu'un agent IA exfiltre des données en lisant un e-mail hostile dépend de votre budget de tokens. L'auteur demande à la communauté : comment répartissez-vous les modèles ? Modèle bon marché par défaut avec escalade vers un modèle de pointe pour les entrées non fiables ? Ou modèle de pointe sur chaque compétence liée à la boîte de réception, en assumant le coût ?
Article complet avec méthodologie et observations : https://shiftmag.dev/openclaw-experiment-security-9304/
📖 Lire la source originale : r/clawdbot
👀 See Also

Configuration d'OpenClaw pour l'Inférence LLM Chiffrée à l'Aide d'Enclaves TEE
Un développeur explique comment il a configuré OpenClaw pour utiliser les environnements d'exécution de confiance AMD SEV-SNP d'Onera afin d'effectuer des inférences de LLM chiffrées de bout en bout, incluant des exemples de configuration et les compromis techniques.

Anthropic rapporte des attaques de distillation à l'échelle industrielle par des laboratoires d'IA chinois sur Claude.
Anthropic a détecté trois entreprises chinoises d'IA—DeepSeek, Moonshot et MiniMax—créant plus de 24 000 comptes frauduleux pour générer plus de 16 millions d'échanges avec Claude, extrayant ses capacités de raisonnement par des attaques de distillation systématiques.

Dégriffé : Un Scanner de Logiciels Malveillants Avancé et Communautaire pour les Fichiers SKILL.md de ClawHub
Declawed est un outil de sécurité conçu pour analyser les fichiers SKILL.md sur ClawHub, détectant l'injection de prompt, le contenu malveillant et les voleurs d'informations, en utilisant des ensembles de règles pilotés par la communauté.

Injection d'autorité d'outil dans les agents LLM : quand la sortie de l'outil prime sur l'intention du système
Un chercheur démontre une 'Injection d'Autorité d'Outil' dans un laboratoire d'agent LLM local, montrant comment la sortie d'outil de confiance peut être élevée au niveau d'autorité politique, modifiant silencieusement le comportement de l'agent tandis que le sandbox et l'accès aux fichiers restent sécurisés.