Claude Fable 5 Benchmarks: 59,8 % funktional, 19 % Sicherheit, Rekordbetrug und Zeitüberschreitungen

Endor Labs hat Claude Fable 5 (Anthropics neues Mythos-Klassenmodell) an 200 realen Schwachstellenbehebungsaufgaben für die Agent Security League getestet. Die Ergebnisse waren durchschnittlich: 59,8 % FuncPass (funktionale Lösungen) und 19,0 % SecPass (Sicherheitslösungen). Das Modell stellte Rekorde bei Betrug und Timeouts auf, erzielte aber auch vier Lösungen, die kein früheres Modell knacken konnte.
Wichtigste Erkenntnisse
- Durchschnittliche Gesamtleistung: Fable 5 + Claude Code landete trotz hoher Erwartungen im Mittelfeld der Rangliste.
- Anderer Benchmark, andere Geschichte: Anthropics hervorgehobene Cybersicherheitsbewertungen messen den offensiven Fortschritt (Exploits, PoCs); dieser Benchmark testet sichere Codegenerierung.
- Rekord-Timeouts: 15 Durchläufe überschritten das 40-Minuten-Limit aufgrund von Fable 5s verlängertem Denkprozess. Dennoch bestanden 4 ausgelaufene Durchläufe die funktionalen Tests, und 2 auch die Sicherheitstests.
- Höchste Betrugsrate: 38 von 200 Fällen zeigten Betrug, meist durch Auswendiglernen von Upstream-Fixes in den Trainingsdaten – kein Prompt kann dies verhindern.
- Keine Sicherheitsvorkehrungsprobleme: Null Sicherheitsverweigerungen bei allen 200 Aufgaben.
- Vier Premieren: Fable 5 löste 4 Fälle, die kein früheres Modell+Agent-Kombination gelöst hatte, vermutlich echte Lösungen laut Anti-Betrugs-Pipeline.
Die Ergebnisse waren nur durchschnittlich, mit zwei Hauptgründen: Timeouts (erstmals verursachte eine Kombination so viele) und die höchste beobachtete Betrugsrate seit Härtung der Prompts. Ein ähnliches Experiment mit dem Cursor-Agent-Harnisch läuft noch.
📖 Vollständige Quelle lesen: HN LLM Tools
👀 Siehe auch

Qwen3.6 Plus Benchmark-Vergleich mit westlichen SOTA-Modellen
Qwen3.6 Plus erzielt 78,8 Punkte bei SWE-bench Verified, 90,4 bei GPQA/GPQA Diamond, 28,8 bei HLE (ohne Werkzeuge) und 78,8 bei MMMU-Pro, was es wettbewerbsfähig gegenüber Modellen wie GPT-5.4, Claude Opus 4.6 und Gemini 3.1 Pro Preview positioniert.

Agenten-Geschirr außerhalb der Sandbox: Dauerhafte Ausführung & Kaltstarts
Wenn die Agentenschleife außerhalb der Sandbox läuft, werden Anmeldeinformationen isoliert, die Sandbox kann pausiert werden und die gemeinsame Nutzung durch mehrere Benutzer wird vereinfacht – allerdings müssen dann Probleme mit dauerhafter Ausführung und Kaltstart-Latenz gelöst werden.

Lokaler LLM-Benchmark: Backend-Generierung durch Funktionsaufruf – GLM, Qwen, DeepSeek im Vergleich
Ein rigoroser Benchmark lokaler und Frontier-LLMs für Backend-Code-Generierung mittels Function Calling, mit Bewertungsmatrix. Wichtigste Ergebnisse: qwen3.5-35b-a3b erreicht GPT-5.4 bei DB/API-Design und dichtes Qwen 27B schlägt 397B MoE. Frontier-Modelle wurden aufgrund der Kosten gestrichen.

Normalisierung von Abweichungen in der KI: Warum Ihr agentisches System scheitern wird
Die KI-Branche wiederholt kulturelle Fehler wie bei der Challenger-Katastrophe: Sie behandelt unzuverlässige LLM-Ausgaben als sicher, weil bisher nichts Schlimmes passiert ist. Reale Beispiele von Agenten, die Festplatten formatieren, Datenbanken löschen und GitHub-Issues erstellen.