Geschichtete Verteidigungsebenen senken Prompt-Injection auf 0 in Claude Code

✍️ OpenClawRadar📅 Veröffentlicht: 8. August 2026🔗 Source
Geschichtete Verteidigungsebenen senken Prompt-Injection auf 0 in Claude Code
Ad

Anthropic behauptet, dass gestapelte Abwehrschichten Prompt-Injection-Angriffe auf null reduzieren können, selbst bei unbekannten Angriffen. Boris Cherny skizzierte in einer Diskussion über den neuen Auto-Modus von Claude Code den mehrschichtigen Ansatz: Modelltraining, Intent-Klassifikator und Eingabeproben. Er bestätigte auch, dass der Klassifikator jetzt kostenlos ist, und reagierte damit auf Bedenken bezüglich der Token-Kosten: „Wir machen den Klassifikator kostenlos. Sie sollten nicht für Sicherheit bezahlen müssen.“

Wie die Schichten zusammenwirken

  • Modelltraining: Das Basismodell wird feinabgestimmt, um Injektionsmuster zu erkennen und abzulehnen.
  • Intent-Klassifikator: Ein separater Klassifikator prüft die Absicht des Benutzers hinter jeder Eingabeaufforderung und filtert bösartige Anfragen vor der Ausführung heraus.
  • Eingabeproben: Aktive Sonden testen Eingaben auf bekannte Injektionsvektoren und bilden eine weitere Barriere.

Laut der Quelle reduziert diese Kombination die Rate der Prompt-Injection bei unbekannten Angriffen auf 0%. Der Schlüssel liegt darin, dass keine einzelne Schicht perfekt ist, aber gestapelt fangen sie die überwiegende Mehrheit der Versuche ab.

Ad

Klassifikator jetzt kostenlos

Boris Chernys Zitat ist direkt: „Wir machen den Klassifikator kostenlos. Sie sollten nicht für Sicherheit bezahlen müssen.“ Dies spricht einen häufigen Schmerzpunkt an – die Token-Kosten – für Entwickler, die befürchteten, dass zusätzliche Sicherheitsprüfungen ihre Budgets belasten würden. Wenn Sie Sicherheitsfunktionen bisher umgangen haben, um Token zu sparen, ist das kein Problem mehr.

Dies ist besonders relevant für Teams, die autonome Agenten mit Claude Code entwickeln, wo Prompt-Injection ein echtes Risiko darstellt – bösartige Eingaben in Webinhalten oder Tool-Ausgaben könnten den Agenten kapern. Mit dem kostenlosen Klassifikator können Sie ihn aktivieren, ohne sich um zusätzliche Gebühren zu sorgen.

Der vollständige Blogbeitrag handelt vom Auto-Modus in Claude Code, aber dieses Sicherheitsdetail sticht hervor. Für Entwickler ist es ein Zeichen, dass Anthropic Sicherheit als Basisfunktion behandelt und nicht als kostenpflichtiges Extra.

📖 Lesen Sie die vollständige Quelle: r/ClaudeAI

Ad

👀 Siehe auch

Überwachung von OpenClaw-Befehlen mit Python und Gemini Flash für die Sicherheit
Sicherheit

Überwachung von OpenClaw-Befehlen mit Python und Gemini Flash für die Sicherheit

Ein Benutzer erstellte ein Python-Skript, das von OpenClaw injizierte Befehle verfolgt, sie mit Gemini Flash analysiert und bei alarmierender oder unregelmäßiger Aktivität Benachrichtigungen über einen Discord-Webhook sendet, was etwa 0,14 US-Dollar pro Tag kostet.

OpenClawRadar
Axios 1.14.1 kompromittiert mit Malware, zielt auf KI-gestützte Entwicklungs-Workflows ab
Sicherheit

Axios 1.14.1 kompromittiert mit Malware, zielt auf KI-gestützte Entwicklungs-Workflows ab

Axios Version 1.14.1 wurde in einem Supply-Chain-Angriff kompromittiert, der stillschweigend [email protected] einbindet, einen verschleierten RAT-Dropper. Entwickler, die KI-Coding-Assistenten wie Claude verwenden, sollten sofort ihre Lockfiles und Maschinen auf Infektionen überprüfen.

OpenClawRadar
🦀
Sicherheit

Israelisches Startup Irregular mit Schurken-KI-Hacks bei OpenAI, Anthropic und Meta in Verbindung gebracht

CNBC berichtet, dass das israelische Startup Irregular mit rogue AI-Hacks bei OpenAI, Anthropic und Meta in Verbindung gebracht wird. Die Angriffe zielten auf KI-Systeme ab und werfen Fragen zur KI-Sicherheit auf.

OpenClawRadar
Cyberkriminelle wehren sich gegen KI-generierten Schrott in Untergrundforen
Sicherheit

Cyberkriminelle wehren sich gegen KI-generierten Schrott in Untergrundforen

Neue Forschungsergebnisse zeigen, dass minderqualifizierte Hacker und Betrüger sich über KI-generierte Beiträge in Cyberkriminalitätsforen beschweren, da sie diese als minderwertiges Rauschen betrachten, das das Vertrauen in die Gemeinschaft und die soziale Interaktion untergräbt.

OpenClawRadar