KnightClaw: Lokale Sicherheitserweiterung für OpenClaw-Agenten

KnightClaw ist eine Sicherheitserweiterung, die OpenClaw-KI-Codierungsagenten vor adversarischen Eingabeaufforderungen schützt. Das Tool adressiert ein spezifisches Bedrohungsmodell, bei dem eine einzige bösartige Nachricht im Kontextfenster dazu führen kann, dass ein Agent Anweisungen des Angreifers statt Benutzerbefehlen folgt.
Kernfunktionen
KnightClaw funktioniert als Plug-and-Play-Erweiterung ohne erforderliche Konfiguration, ohne API-Schlüssel und ohne Cloud-Abhängigkeit. Es fängt jede Nachricht ab, bevor sie den Agenten erreicht.
Erkennungssystem
Die Schutzfunktion verwendet einen 8-Schichten-Hybrid-Erkennungsansatz:
- Regex-Muster
- Homoglyphen-Erkennung
- Grenztoken-Analyse
- Perplexity-Bewertung
- Entropie-Analyse
- Heuristiken
- Semantische Einbettungen (unter Verwendung eines lokalen, quantisierten BGE-Modells)
Blockierungen erfolgen in Mikrosekunden.
Zusätzliche Sicherheitsmaßnahmen
- Ausgangsredaktion: Entfernt Geheimnisse aus ausgehenden Antworten, bevor sie den Agenten verlassen
- Hash-verkettete Prüfprotokolle: Manipulationssichere, nur-anhängende Protokolle mit vollständiger Zeitleiste jeder Blockierung, Zulassung und Konfigurationsänderung
- Geschwindigkeits-Schutzschalter: 10 Blockierungen in 60 Sekunden lösen automatische Sperrung ohne manuelles Eingreifen aus
- Notausschalter: Ein Befehl stoppt alles:
openclaw knight lockdown on
Technische Details
Die Erweiterung läuft vollständig lokal ohne jegliche Telemetrie und ist unter der MIT-Lizenz lizenziert. Der Quellcode ist für Tests und Beiträge verfügbar.
📖 Read the full source: r/openclaw
👀 Siehe auch

OpenClaw-Sicherheitsbedenken: API-Schlüssel und Konversationsdaten im Standard-Selbsthosting gefährdet
Ein Cisco-Bericht weist darauf hin, dass die OpenClaw-Sicherheit "optional, nicht eingebaut" ist, wobei Standardkonfigurationen API-Schlüssel in .env-Dateien auf VPS-Instanzen speichern, was potenzielle Sicherheitslücken für nicht-technische Nutzer auf einfachen Droplets schafft.

Meta-Sicherheitsvorfall verursacht durch fehlerhaften KI-Agenten, der ungenaue technische Ratschläge erteilte
Ein Meta-Ingenieur nutzte einen internen KI-Agenten, der OpenClaw ähnelt, um eine technische Frage zu analysieren. Der Agent veröffentlichte jedoch ungenaue Ratschläge öffentlich statt privat, was zu einem SEV1-Sicherheitsvorfall führte, bei dem vorübergehend sensible Daten offengelegt wurden.

Sieb: Lokaler geheimer Scanner für KI-Coding-Tool-Chatverläufe
Sieve durchsucht Cursor-, Claude Code-, Copilot- und andere KI-Chatverläufe nach durchgesickerten API-Schlüsseln und Tokens. Die gesamte Überprüfung erfolgt lokal, mit Schwärzung und macOS-Schlüsselbund-Vault.

KI-Agent nutzt SQL-Injection aus, um McKinseys Lilli-Chatbot zu kompromittieren
Sicherheitsforscher von CodeWall nutzten einen autonomen KI-Agenten, um den internen Lilli-Chatbot von McKinsey zu hacken. Sie erlangten innerhalb von zwei Stunden über eine SQL-Injection-Schwachstelle in nicht authentifizierten API-Endpunkten vollständigen Lese- und Schreibzugriff auf die Produktionsdatenbank.