Geschichtete Verteidigungsebenen senken Prompt-Injection auf 0 in Claude Code

Anthropic behauptet, dass gestapelte Abwehrschichten Prompt-Injection-Angriffe auf null reduzieren können, selbst bei unbekannten Angriffen. Boris Cherny skizzierte in einer Diskussion über den neuen Auto-Modus von Claude Code den mehrschichtigen Ansatz: Modelltraining, Intent-Klassifikator und Eingabeproben. Er bestätigte auch, dass der Klassifikator jetzt kostenlos ist, und reagierte damit auf Bedenken bezüglich der Token-Kosten: „Wir machen den Klassifikator kostenlos. Sie sollten nicht für Sicherheit bezahlen müssen.“
Wie die Schichten zusammenwirken
- Modelltraining: Das Basismodell wird feinabgestimmt, um Injektionsmuster zu erkennen und abzulehnen.
- Intent-Klassifikator: Ein separater Klassifikator prüft die Absicht des Benutzers hinter jeder Eingabeaufforderung und filtert bösartige Anfragen vor der Ausführung heraus.
- Eingabeproben: Aktive Sonden testen Eingaben auf bekannte Injektionsvektoren und bilden eine weitere Barriere.
Laut der Quelle reduziert diese Kombination die Rate der Prompt-Injection bei unbekannten Angriffen auf 0%. Der Schlüssel liegt darin, dass keine einzelne Schicht perfekt ist, aber gestapelt fangen sie die überwiegende Mehrheit der Versuche ab.
Klassifikator jetzt kostenlos
Boris Chernys Zitat ist direkt: „Wir machen den Klassifikator kostenlos. Sie sollten nicht für Sicherheit bezahlen müssen.“ Dies spricht einen häufigen Schmerzpunkt an – die Token-Kosten – für Entwickler, die befürchteten, dass zusätzliche Sicherheitsprüfungen ihre Budgets belasten würden. Wenn Sie Sicherheitsfunktionen bisher umgangen haben, um Token zu sparen, ist das kein Problem mehr.
Dies ist besonders relevant für Teams, die autonome Agenten mit Claude Code entwickeln, wo Prompt-Injection ein echtes Risiko darstellt – bösartige Eingaben in Webinhalten oder Tool-Ausgaben könnten den Agenten kapern. Mit dem kostenlosen Klassifikator können Sie ihn aktivieren, ohne sich um zusätzliche Gebühren zu sorgen.
Der vollständige Blogbeitrag handelt vom Auto-Modus in Claude Code, aber dieses Sicherheitsdetail sticht hervor. Für Entwickler ist es ein Zeichen, dass Anthropic Sicherheit als Basisfunktion behandelt und nicht als kostenpflichtiges Extra.
📖 Lesen Sie die vollständige Quelle: r/ClaudeAI
👀 Siehe auch

Betrugswarnung: Gefälschtes GitHub-Airdrop zielt auf CLAW-Token-Nutzer ab
Ein Phishing-Betrug kursiert, der angeblich $CLAW-Token-Airdrops für GitHub-Beiträge anbietet. Der Betrug nutzt einen Google-Share-Link, der auf eine verdächtige .xyz-Website weiterleitet und Benutzer auffordert, ihre Wallets zu verbinden, was möglicherweise zum Leeren der Wallets führt.

Snowflake Cortex Code CLI-Schwachstelle ermöglichte Sandbox-Escape und Malware-Ausführung
Eine Sicherheitslücke in Snowflake Cortex Code CLI Version 1.0.25 und früher ermöglichte die Ausführung beliebiger Befehle ohne menschliche Genehmigung über eine Prozesssubstitutionsumgehung, was die Installation von Malware und das Umgehen der Sandbox durch indirekte Prompt-Injection erlaubte.

Coldkey: Schlüsselgenerierung und Papier-Backup-Tool für das Post-Quantenzeitalter
Coldkey generiert Post-Quanten-Alter-Schlüssel (ML-KEM-768 + X25519) und erstellt einseitige druckbare HTML-Backups mit QR-Codes zur Offline-Speicherung.

FORGE: Open-Source-Framework für KI-Sicherheitstests von LLM-Systemen
FORGE ist ein autonomes KI-Sicherheitstest-Framework, das während des Betriebs eigene Tools erstellt, sich selbst in einen Schwarm repliziert und OWASP LLM Top 10-Schwachstellen abdeckt, einschließlich Prompt-Injection, Jailbreak-Fuzzing und RAG-Leaks.