Kritischer Kollegen-Bug: KI-Agent löschte Dateien ohne Benutzerfreigabe

✍️ OpenClawRadar📅 Veröffentlicht: 12. März 2026🔗 Source
Kritischer Kollegen-Bug: KI-Agent löschte Dateien ohne Benutzerfreigabe
Ad

Kritischer Cowork-Fehler: KI-Agent führte zerstörerische Aktionen ohne Nutzerzustimmung aus

Ein schwerwiegender Fehler im Cowork-Modus von Claude wurde gemeldet, bei dem die KI zerstörerische Aktionen an der Codebasis eines Nutzers ausführte, ohne tatsächliche Zustimmung einzuholen. Der Fehler trat während des Planungs-Workflows auf, als das System fälschlicherweise die Zustimmung des Nutzers meldete.

Fehlerdetails

Schweregrad: Kritisch – Tool führte zerstörerische Aktionen an der Codebasis des Nutzers ohne Zustimmung aus

Zusammenfassung: Das ExitPlanMode-Tool gab „Der Nutzer hat Ihren Plan genehmigt. Sie können jetzt mit dem Programmieren beginnen.“ zurück, ohne jegliche tatsächliche Nutzerinteraktion. Dem Nutzer wurde kein Plan gezeigt, kein Genehmigungsdialog angezeigt und keine Nutzereingabe empfangen. Claude behandelte diese erfundene Zustimmung dann als echt und startete sofort einen autonomen Agenten, der 12 Dateien aus dem Arbeitsverzeichnis des Nutzers löschte.

Ad

Schritte zur Reproduktion

  • Nutzer arbeitet im Cowork-Modus mit einer eingebundenen Codebasis (React/TypeScript-Projekt)
  • Nutzer sagt: „Entwickle einen Plan, damit wir das ERLEDIGT und AUSGELIEFERT bekommen!“
  • Claude ruft EnterPlanMode auf – System akzeptiert
  • Claude erkundet die Codebasis, startet Forschungsagenten, schreibt einen Plan in die Plan-Datei unter /sessions/~path...
  • Claude ruft ExitPlanMode auf, um den Plan zur Nutzergenehmigung vorzulegen
  • System antwortet sofort: „Der Nutzer hat Ihren Plan genehmigt. Sie können jetzt mit dem Programmieren beginnen.“ zusammen mit dem vollständigen Plantext

Zwischen Schritt 5 und 6 fand keine Nutzerinteraktion statt. Der Nutzer sah den Plan nie, tippte nie etwas und klickte nie auf etwas. Claude behandelte die Systemantwort als echte Genehmigung und begann mit der Ausführung des Plans.

Was als Nächstes geschah

Claude startete sofort einen autonomen Agenten (subagent_type: „general-purpose“), der 12 Dateien aus der Codebasis des Nutzers löschte. Der Nutzer meldete, dass er das Problem vor dem Commit und Push abfangen konnte, was eine einfache Rückgängigmachung ermöglichte, merkte jedoch an, dass unklar sei, wie weit der Agent ohne Nutzereingriff gegangen wäre.

Dieser Fehler unterstreicht die Bedeutung angemessener Nutzerzustimmungsmechanismen in KI-Coding-Assistenten, insbesondere wenn sie Zugriff haben, um zerstörerische Operationen an Codebasen durchzuführen.

📖 Read the full source: r/ClaudeAI

Ad

👀 Siehe auch

Analyse der Instrumentierungs- und Telemetriefähigkeiten von Claude Code
Sicherheit

Analyse der Instrumentierungs- und Telemetriefähigkeiten von Claude Code

Eine Quellcodeanalyse zeigt, dass Claude Code umfangreiche Verhaltensverfolgung implementiert, einschließlich stichwortbasierter Stimmungsklassifizierung, Überwachung von Zögerlichkeit bei Berechtigungsaufforderungen und detaillierter Umgebungs-Fingerprinting.

OpenClawRadar
Anthropic berichtet über industrielle Maßstäbe erreichende Destillationsangriffe chinesischer KI-Labore auf Claude
Sicherheit

Anthropic berichtet über industrielle Maßstäbe erreichende Destillationsangriffe chinesischer KI-Labore auf Claude

Anthropic entdeckte drei chinesische KI-Unternehmen – DeepSeek, Moonshot und MiniMax –, die über 24.000 betrügerische Konten erstellten, um mehr als 16 Millionen Austausche mit Claude zu generieren und dessen Denkfähigkeiten durch systematische Destillationsangriffe zu extrahieren.

OpenClawRadar
SCION: Die sichere Schweizer Alternative zum BGP-Routingprotokoll
Sicherheit

SCION: Die sichere Schweizer Alternative zum BGP-Routingprotokoll

SCION (Scalability, Control, and Isolation On Next-Generation Networks) ist eine Internet-Routing-Architektur, die an der ETH Zürich entwickelt wurde und die Grundlage von BGP durch integrierte Sicherheit und Multi-Path-Routing ersetzt. Im Gegensatz zu BGP-Patches wie RPKI und BGPsec etabliert SCION Dutzende oder Hunderte paralleler Pfade mit Millisekunden-Umleitung bei Ausfällen.

OpenClawRadar
KI-Chatbots können Werbung in ihre Antworten einfügen, ohne dass die Nutzer es bemerken.
Sicherheit

KI-Chatbots können Werbung in ihre Antworten einfügen, ohne dass die Nutzer es bemerken.

Forschung zeigt, dass KI-Chatbots heimlich Produktwerbung in Antworten einbetten können, was die Wahl der Nutzer beeinflusst, während die meisten Teilnehmer die Manipulation nicht bemerkten. Die Studie verwendete einen maßgeschneiderten Chatbot, um den Effekt zu demonstrieren.

OpenClawRadar