AISI-Bewertung zeigt Claude Mythos Preview Cyber-Fähigkeiten in CTF und mehrstufigen Angriffen

✍️ OpenClawRadar📅 Veröffentlicht: 16. April 2026🔗 Source
AISI-Bewertung zeigt Claude Mythos Preview Cyber-Fähigkeiten in CTF und mehrstufigen Angriffen
Ad

Das AI Security Institute (AISI) führte Cyber-Bewertungen von Anthropics Claude Mythos Preview durch und bewertete seine Leistung bei Capture-the-Flag-Herausforderungen und mehrstufigen Angriffssimulationen. Das Modell zeigte eine deutliche Verbesserung gegenüber früheren Spitzenmodellen in Bezug auf Cybersicherheitsfähigkeiten.

Capture-the-Flag-Ergebnisse

Bei CTF-Herausforderungen, bei denen Modelle Schwachstellen identifizieren und ausnutzen müssen, um versteckte Flags abzurufen, erzielte Mythos Preview eine Erfolgsquote von 73 % bei Aufgaben auf Expertenniveau. Diese Expertenaufgaben waren solche, die vor April 2025 kein Modell bewältigen konnte. Die Bewertung verglich die Leistung über verschiedene Schwierigkeitsgrade von technischem Nicht-Experten bis hin zu Experten, wobei Modelle mit Token-Budgets von bis zu 50 Millionen Token getestet wurden.

Ad

Cyber Range-Ergebnisse

AISI entwickelte "The Last Ones" (TLO), eine 32-stufige Simulation eines Unternehmensnetzwerkangriffs, die von der ersten Erkundung bis zur vollständigen Übernahme des Netzwerks reicht und für deren Abschluss Menschen schätzungsweise 20 Stunden benötigen würden. Claude Mythos Preview war das erste Modell, das TLO von Anfang bis Ende löste, und war in 3 von 10 Versuchen erfolgreich. Über alle Versuche hinweg absolvierte das Modell durchschnittlich 22 von 32 Schritten.

Claude Opus 4.6 war das nächstbeste Modell und schaffte durchschnittlich 16 Schritte. Die Bewertung nutzte Token-Budgets von bis zu 100 Millionen Token, wobei die Leistung bis zu dieser Grenze weiter skaliert wurde.

Einschränkungen und Kontext

Das Modell konnte die auf Betriebstechnologie fokussierte Cyber Range 'Cooling Tower' nicht abschließen, blieb jedoch eher an IT-Abschnitten als an OT-spezifischen Teilen hängen. AISI stellt fest, dass vor zwei Jahren die besten verfügbaren Modelle kaum Cyber-Aufgaben auf Anfängerniveau bewältigen konnten, während sie nun in kontrollierten Bewertungen, in denen Mythos Preview explizit angewiesen und Netzwerkzugriff gewährt wurde, mehrstufige Angriffe auf anfällige Netzwerke ausführen und Schwachstellen autonom entdecken und ausnutzen konnte.

📖 Read the full source: HN AI Agents

Ad

👀 Siehe auch

Skill Analyzer jetzt auf ClawHub verfügbar mit Ein-Kommando-Installation
Sicherheit

Skill Analyzer jetzt auf ClawHub verfügbar mit Ein-Kommando-Installation

Der OpenClaw Skill Analyzer Security-Scanner ist jetzt auf ClawHub mit einer Einzelbefehl-Installation verfügbar. Das Tool scannt Skill-Ordner nach schädlichen Mustern wie Prompt-Injection und Credential-Diebstahl und beinhaltet Docker-Sandbox-Unterstützung für sichere Ausführung.

OpenClawRadar
OpenClaw-Sicherheitsbedenken: API-Schlüssel und Konversationsdaten im Standard-Selbsthosting gefährdet
Sicherheit

OpenClaw-Sicherheitsbedenken: API-Schlüssel und Konversationsdaten im Standard-Selbsthosting gefährdet

Ein Cisco-Bericht weist darauf hin, dass die OpenClaw-Sicherheit "optional, nicht eingebaut" ist, wobei Standardkonfigurationen API-Schlüssel in .env-Dateien auf VPS-Instanzen speichern, was potenzielle Sicherheitslücken für nicht-technische Nutzer auf einfachen Droplets schafft.

OpenClawRadar
Entwickler baut Firecracker MicroVM-Sandbox für OpenClaw Security
Sicherheit

Entwickler baut Firecracker MicroVM-Sandbox für OpenClaw Security

Ein Entwickler, der sich um die Sicherheit von LLMs sorgte, baute eine Bare-Metal-Sandbox mit Firecracker-MicroVMs, um OpenClaw-Skripte zu isolieren, wobei jedes Skript in seinem eigenen Linux-Kernel mit einer RAM-Begrenzung von 128 MB und standardmäßig ohne Netzwerkzugriff läuft.

OpenClawRadar
Sicherheitswarnung: Schadcode in LiteLLM könnte API-Schlüssel stehlen
Sicherheit

Sicherheitswarnung: Schadcode in LiteLLM könnte API-Schlüssel stehlen

Eine kritische Sicherheitslücke wurde in LiteLLM identifiziert, die API-Schlüssel offenlegen könnte. Nutzer von OpenClaw oder nanobot könnten betroffen sein und sollten die im Quelllink genannten GitHub-Issues prüfen.

OpenClawRadar