KI-Agenten-Sicherheit: Über Jailbreaks hinaus zu Werkzeugmissbrauch und Prompt-Injection

Wandel der KI-Agenten-Sicherheit
Der Sicherheitsfokus in der KI hat sich von traditionellen Jailbreaks – bei denen raffinierte Prompts Modelle dazu bringen, Anweisungen zu ignorieren – zu komplexeren Risiken in Agentensystemen verlagert. Im Gegensatz zu Chatbots führen moderne KI-Agenten Aktionen aus: Sie surfen im Web, lesen Dokumente, rufen Tools auf, führen Befehle aus und lösen Workflows aus. Diese Fähigkeit, Aktionen durchzuführen, verändert das Sicherheitsmodell grundlegend.
Wichtige Sicherheitsmuster
Tests zeigen konsistente Muster in Agenten-Workflows:
- Prompt-Injection: Nicht vertrauenswürdige Inhalte beeinflussen, wie Agenten ihre Tools verwenden.
- Tool-Missbrauch: Legitime Tools (Shell-Ausführung, HTTP-Anfragen, Nachrichtenversand usw.) werden von Angreifern umgeleitet, die den Text manipulieren, den der Agent liest.
- Anweisungslecks: Agenten können unbeabsichtigt interne Kontexte durch manipulierte Anweisungen preisgeben.
Ein konkretes dokumentiertes Beispiel betrifft einen Agenten, der seine eigenen Nachrichtentools verwendet, um nach Erhalt einer injizierten Anweisung interne Kontexte nach außen zu senden.
Praktische Auswirkungen
Für Entwickler, die KI-Agenten erstellen oder damit experimentieren, bedeutet dies, dass Sicherheitsüberlegungen über die Verhinderung von Jailbreaks hinausgehen müssen. Die Interaktion zwischen Agenten-Tools und nicht vertrauenswürdigen Inhalten schafft Schwachstellen, bei denen Angreifer die Tool-Nutzung umleiten können, ohne die Tools selbst zu kompromittieren.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Sicherheitsaudit deckt Schwachstellen im OpenClaw-Skill-Ökosystem auf
Eine Sicherheitsprüfung von OpenClaw ergab 8 dokumentierte CVEs, darunter Schwachstellen für beliebige Codeausführung und den Diebstahl von Zugangsdaten, sowie dass 15 % der Fähigkeiten in der gemeinsamen Bibliothek verdächtiges Netzwerkverhalten aufweisen. Der Prüfer wechselte zu einer minimalen Rust-basierten Laufzeitumgebung mit Ollama für bessere Isolation.

Die Überprüfung des OpenClaw-Setups mit Claude deckt Sicherheitsprobleme auf.
Ein Entwickler nutzte Claude, um seine OpenClaw-Installation zu überprüfen, und entdeckte, dass der Bot API-Schlüssel im Klartext im Speicher und in JSON-Dateien schrieb, zusammen mit anderen Sicherheitsbedenken.

Agent-Pass: Identitätsverifizierung für KI-Agenten
Agent Passport ist eine Open-Source-Identitätsüberprüfungsschicht, die Ed25519-Authentifizierung und JWT-Token für KI-Agenten verwendet und das Problem der Identitätsanmaßung angeht.

MCP Sandbox: Führen Sie MCP-Server in isolierten Containern aus, ohne ihnen vertrauen zu müssen
Ein Entwickler hat MCP Sandbox erstellt, das MCP-Server in isolierten gVisor-Containern mit standardmäßig verweigerter Netzwerkzugriff und sicherer Geheimniseinschleusung ausführt, plus CVE-Scanning und Musterprüfung vor der Ausführung.