Geschichtete Verteidigungsebenen senken Prompt-Injection auf 0 in Claude Code

✍️ OpenClawRadar📅 Veröffentlicht: 8. August 2026🔗 Source
Geschichtete Verteidigungsebenen senken Prompt-Injection auf 0 in Claude Code
Ad

Anthropic behauptet, dass gestapelte Abwehrschichten Prompt-Injection-Angriffe auf null reduzieren können, selbst bei unbekannten Angriffen. Boris Cherny skizzierte in einer Diskussion über den neuen Auto-Modus von Claude Code den mehrschichtigen Ansatz: Modelltraining, Intent-Klassifikator und Eingabeproben. Er bestätigte auch, dass der Klassifikator jetzt kostenlos ist, und reagierte damit auf Bedenken bezüglich der Token-Kosten: „Wir machen den Klassifikator kostenlos. Sie sollten nicht für Sicherheit bezahlen müssen.“

Wie die Schichten zusammenwirken

  • Modelltraining: Das Basismodell wird feinabgestimmt, um Injektionsmuster zu erkennen und abzulehnen.
  • Intent-Klassifikator: Ein separater Klassifikator prüft die Absicht des Benutzers hinter jeder Eingabeaufforderung und filtert bösartige Anfragen vor der Ausführung heraus.
  • Eingabeproben: Aktive Sonden testen Eingaben auf bekannte Injektionsvektoren und bilden eine weitere Barriere.

Laut der Quelle reduziert diese Kombination die Rate der Prompt-Injection bei unbekannten Angriffen auf 0%. Der Schlüssel liegt darin, dass keine einzelne Schicht perfekt ist, aber gestapelt fangen sie die überwiegende Mehrheit der Versuche ab.

Ad

Klassifikator jetzt kostenlos

Boris Chernys Zitat ist direkt: „Wir machen den Klassifikator kostenlos. Sie sollten nicht für Sicherheit bezahlen müssen.“ Dies spricht einen häufigen Schmerzpunkt an – die Token-Kosten – für Entwickler, die befürchteten, dass zusätzliche Sicherheitsprüfungen ihre Budgets belasten würden. Wenn Sie Sicherheitsfunktionen bisher umgangen haben, um Token zu sparen, ist das kein Problem mehr.

Dies ist besonders relevant für Teams, die autonome Agenten mit Claude Code entwickeln, wo Prompt-Injection ein echtes Risiko darstellt – bösartige Eingaben in Webinhalten oder Tool-Ausgaben könnten den Agenten kapern. Mit dem kostenlosen Klassifikator können Sie ihn aktivieren, ohne sich um zusätzliche Gebühren zu sorgen.

Der vollständige Blogbeitrag handelt vom Auto-Modus in Claude Code, aber dieses Sicherheitsdetail sticht hervor. Für Entwickler ist es ein Zeichen, dass Anthropic Sicherheit als Basisfunktion behandelt und nicht als kostenpflichtiges Extra.

📖 Lesen Sie die vollständige Quelle: r/ClaudeAI

Ad

👀 Siehe auch

Die menschliche Wurzel des Vertrauens: Verantwortung für autonome KI-Agenten etablieren.
Sicherheit

Die menschliche Wurzel des Vertrauens: Verantwortung für autonome KI-Agenten etablieren.

Der Human Root of Trust ist ein Open-Source-Rahmenwerk, das das Fehlen von Verantwortung für autonome KI-Agenten durch kryptographische Mittel adressiert.

OpenClawRadar
McpVanguard-Proxy blockiert OpenClaw-Fähigkeitsdaten-Exfiltration
Sicherheit

McpVanguard-Proxy blockiert OpenClaw-Fähigkeitsdaten-Exfiltration

Ein Entwickler hat McpVanguard erstellt, einen Proxy, der zwischen KI-Agenten und ihren Werkzeugen sitzt, um bösartige Aufrufketten wie Datendiebstahl zu blockieren. Dies erfolgte als Reaktion auf Ciscos Entdeckung, dass OpenClaw-Fähigkeiten heimlichen Datendiebstahl durchführen. Es nutzt Mustererkennung, semantische Absichtsbewertung und Verhaltensketten-Erkennung.

OpenClawRadar
Open-Source-Spielplatz für Red-Teaming von KI-Agenten mit veröffentlichten Exploits
Sicherheit

Open-Source-Spielplatz für Red-Teaming von KI-Agenten mit veröffentlichten Exploits

Fabraix hat eine Live-Umgebung als Open Source veröffentlicht, um KI-Agenten-Abwehrmaßnahmen durch adversarische Herausforderungen zu testen. Jede Herausforderung setzt einen Live-Agenten mit echten Werkzeugen und veröffentlichten Systemprompts ein, wobei gewinnende Gesprächsprotokolle und Schutzmaßnahmen-Logs öffentlich dokumentiert werden.

OpenClawRadar
KI-automatisierte tägliche Sicherheitsüberprüfung für KI-betriebene Geschäfte
Sicherheit

KI-automatisierte tägliche Sicherheitsüberprüfung für KI-betriebene Geschäfte

Ein KI-betriebener Laden führt täglich autonom eine Sicherheitsprüfung durch, ohne menschliche Planung oder Cron-Jobs. Der KI-Agent prüft auf SSRF-Schwachstellen, Injektionsrisiken und Authentifizierungslücken und erstellt dann einen Bericht zur Überprüfung durch einen Senior-Entwickler.

OpenClawRadar