Anthropic berichtet über industrielle Maßstäbe erreichende Destillationsangriffe chinesischer KI-Labore auf Claude

Industrieller Modellentzug im großen Stil
Anthropic hat Ergebnisse veröffentlicht, die koordinierte Destillationsangriffe auf Claude durch drei chinesische KI-Labore detailliert beschreiben. Die Angriffe umfassten die Erstellung betrügerischer Konten in großem Umfang, um Claudes Denkfähigkeiten durch massive API-Interaktionen zu extrahieren.
Wichtige Angriffsdetails aus Anthropics Bericht
- DeepSeek, Moonshot und MiniMax erstellten über 24.000 betrügerische Konten
- Die Gesamtzahl der Austausche mit Claude überstieg 16 Millionen
- MiniMax allein feuerte 13 Millionen Anfragen ab
- Als Anthropic ein neues Modell veröffentlichte, leitete MiniMax fast die Hälfte seines Datenverkehrs innerhalb von 24 Stunden um
- DeepSeek zielte speziell auf Gedankenketten und zensursichere Antworten ab
- Die Angriffe wurden im Laufe der Zeit ausgefeilter, als die Labore ihre Methoden anpassten
Sicherheitsimplikationen für KI-Entwickler
Dieser Vorfall verdeutlicht Schwachstellen in der KI-Modellsicherheit, wenn milliardenschwere Labore systematisch versuchen, proprietäre Fähigkeiten zu extrahieren. Das Ausmaß und die Beharrlichkeit dieser Angriffe – die mehrere Organisationen umfassen und sich an neue Modellveröffentlichungen anpassen – deuten darauf hin, dass dies eher eine anhaltende Bedrohung darstellt als isolierte Vorfälle.
Die verwendeten Methoden (Erstellung betrügerischer Konten, gezielte Abfragen nach bestimmten Fähigkeiten, schnelle Anpassung an neue Modellversionen) könnten potenziell gegen andere KI-Systeme repliziert werden, was Fragen zur Sicherheit von KI-Tools von Drittanbietern aufwirft, die Entwickler in ihre Arbeitsabläufe integrieren.
📖 Read the full source: r/ClaudeAI
👀 Siehe auch
So funktioniert KI-Text-Wasserzeichen: Geheime Schlüssel, grüne/rote Wortwahl und Erkennung
Text-Wasserzeichen verstecken Markierungen in Wortwahl, nicht in Zeichen. Ein geheimer Schlüssel neigt die Wortauswahl zu Grün, und die Erkennung zählt grüne Wörter, um KI-generierten Text zu erkennen.

Offline-SBOM-Verifier für OpenClaw erkennt manipulierte Skills in unter 0,2 Sekunden
Ein Entwickler hat ein Offline-SBOM-Verifizierungstool in Rust erstellt, das eine vergiftete OpenClaw-Skill erkannte, die SSH-Schlüssel exfiltrierte, wobei die Verifizierung in weniger als 0,2 Sekunden ohne Internetzugang abgeschlossen wurde.

AviationWeather.gov-API enthält 'Stop Claude'-Prompt-Injection-Versuch
Ein Nutzer berichtet, dass die AviationWeather.gov-API der US-Regierung in ihren Antworten den Text 'Stop Claude' zurückgibt, wenn sie über Claude CoWork abgerufen wird, was eine Sicherheitswarnung über Prompt-Injection-Angriffe auslöst.

Nullgaze: Open-Source AI-unterstützter Sicherheitsscanner veröffentlicht
Nullgaze ist ein neuer, Open-Source-AI-unterstützter Sicherheits-Scanner, der speziell auf Schwachstellen in AI-generiertem Code abzielt und nahezu null falsche Positiver aufweist.