KnightClaw : Extension de Sécurité Locale pour les Agents OpenClaw

KnightClaw est une extension de sécurité conçue pour protéger les agents de codage IA OpenClaw contre les invites adverses. L'outil répond à un modèle de menace spécifique où un seul message malveillant dans la fenêtre de contexte peut amener un agent à suivre les instructions de l'attaquant au lieu des commandes de l'utilisateur.
Fonctionnalités principales
KnightClaw fonctionne comme une extension prête à l'emploi sans configuration requise, sans clés API et sans dépendance au cloud. Il intercepte chaque message avant qu'il n'atteigne l'agent.
Système de détection
Le garde-barrière utilise une approche de détection hybride à 8 couches :
- Modèles d'expressions régulières
- Détection d'homoglyphes
- Analyse des jetons de frontière
- Évaluation de perplexité
- Analyse d'entropie
- Heuristiques
- Incorporations sémantiques (utilisant un modèle BGE quantifié local)
Les blocages se produisent en microsecondes.
Mesures de sécurité supplémentaires
- Rédaction de sortie : Supprime les secrets des réponses sortantes avant qu'elles ne quittent l'agent
- Journaux d'audit à chaînage de hachage : Journaux inviolables, en ajout uniquement, avec chronologie complète de chaque blocage, autorisation et changement de configuration
- Disjoncteur de vélocité : 10 blocages en 60 secondes déclenchent un verrouillage automatique sans intervention manuelle
- Interrupteur d'arrêt d'urgence : Une commande arrête tout :
openclaw knight lockdown on
Détails techniques
L'extension fonctionne entièrement en local sans aucune télémétrie et est sous licence MIT. Le code source est disponible pour les tests et contributions.
📖 Lire le code source complet : r/openclaw
👀 See Also

L'étudiant contribue deux correctifs de sécurité au système de production OpenClaw.
Un développeur étudiant a corrigé une vulnérabilité 'fail-open' dans la logique de la passerelle d'OpenClaw (PR #29198) et une vulnérabilité de tabnabbing dans les images de chat (PR #18685), les deux correctifs ayant été intégrés respectivement dans les versions de production v2026.3.1 et v2026.2.24.

Les LLM peuvent identifier les utilisateurs anonymes de forums avec une précision de 68 % et une exactitude de 90 %.
Des chercheurs ont utilisé Gemini et ChatGPT pour analyser des publications de Hacker News et Reddit, identifiant 68 % des utilisateurs anonymes avec une précision de 90 %. Les modèles ont accompli en quelques minutes ce qui prendrait des heures aux humains ou serait impossible.

Agent-Drift : Outil de surveillance de sécurité pour agents IA
Aucun

OpenClaw a bloqué un script douteux d'un manuel de productivité, puis a continué à construire un classeur financier.
Un utilisateur a donné à OpenClaw un zip contenant un supposé guide de productivité suspect. OpenClaw a refusé d'exécuter le script, l'a signalé pour auto-installation dans le répertoire des compétences, et a construit manuellement le classeur en utilisant ses compétences intégrées.