Scanner d'Injection de Prompt de Modèle Local pour la Sécurité des Compétences IA

✍️ OpenClawRadar📅 Publié: March 20, 2026🔗 Source
Scanner d'Injection de Prompt de Modèle Local pour la Sécurité des Compétences IA
Ad

Vulnérabilité de sécurité dans les compétences d'IA

Une discussion sur X a mis en lumière une faille de sécurité sérieuse dans les compétences d'IA tierces. Claude Code prend en charge l'opérateur ! pour exécuter des commandes bash directement dans les compétences, mais ces opérateurs peuvent être cachés dans des balises HTML, conduisant à des exécutions bash dont le LLM pourrait ne pas être conscient.

Implémentation d'un scanner local

Un outil de preuve de concept a été développé pour analyser les compétences afin de détecter d'éventuelles injections de logiciels malveillants au moment de l'installation. Le scanner utilise un modèle sans appel d'outils fonctionnant localement, spécifiquement mistral-small:latest sur Ollama. Le créateur rapporte qu'il a "fonctionné à merveille" lors des tests.

L'approche fonctionne de manière similaire à un antivirus et pourrait être intégrée dans un futur produit "installateur de compétences". La protection contre l'injection de prompts est identifiée comme une application prometteuse pour les modèles locaux.

Ad

Détails techniques

La vulnérabilité concerne l'opérateur ! dans Claude Code qui permet l'exécution directe de commandes bash. Les attaquants peuvent cacher ces opérateurs dans des balises HTML, exécutant potentiellement des commandes malveillantes à l'insu du LLM. Le scanner aborde ce problème en analysant les compétences avant installation pour détecter de telles injections cachées.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Sécurité Slack OpenClaw : Risques d'exposition des clés API et correctifs
Security

Sécurité Slack OpenClaw : Risques d'exposition des clés API et correctifs

Les déploiements OpenClaw sur Slack peuvent exposer des clés API via des messages d'erreur dans les canaux, avec plus de 8 000 instances trouvées exposées dans un rapport Bitsight. La source détaille trois vulnérabilités spécifiques et propose des correctifs pratiques incluant des modifications de prompts système et une migration vers SlackClaw.

OpenClawRadar
Enveloppe de Contenu Externe d'OpenClaw pour la Défense contre l'Injection d'Invites
Security

Enveloppe de Contenu Externe d'OpenClaw pour la Défense contre l'Injection d'Invites

OpenClaw utilise un emballeur de contenu externe qui étiquette automatiquement les résultats de recherche web, les réponses d'API et les contenus similaires avec des avertissements indiquant qu'ils ne sont pas fiables, préparant le LLM à être sceptique et plus enclin à refuser des instructions malveillantes.

OpenClawRadar
Claude chatbot exploité dans une fuite de données du gouvernement mexicain
Security

Claude chatbot exploité dans une fuite de données du gouvernement mexicain

Un pirate informatique a utilisé le chatbot Claude d'Anthropic pour attaquer plusieurs agences gouvernementales mexicaines, dérobant 150 Go de données incluant des dossiers de contribuables et des identifiants d'employés. Le pirate a contourné les protections de Claude avec des invites pour générer des milliers de plans d'attaque détaillés.

OpenClawRadar
Publicité Meta contenant de la CSAM générée par IA ; les chercheurs ont trouvé plus de 50 dans la bibliothèque publicitaire
Security

Publicité Meta contenant de la CSAM générée par IA ; les chercheurs ont trouvé plus de 50 dans la bibliothèque publicitaire

Les chercheurs ont trouvé plus de 50 publicités payantes contenant des images d'abus sexuels d'enfants générées par IA dans la bibliothèque publicitaire de Meta, certaines atteignant des milliers de comptes. Meta les a retirées après l'enquête de WIRED.

OpenClawRadar