Claude Opus 5.5: 40 % günstiger als Opus 5, 66,4 % auf Terminal-Bench 4.0
Anthropic hat Claude Opus 5.5 veröffentlicht, das erste Modell der neuen Claude-5.5-Familie. Es performt auf dem Niveau von Claude Fable 5.1 bei den meisten Arbeiten und kostet 40 % weniger im Betrieb als Opus 5. Input- und Output-Token kosten 4 bzw. 20 $ pro Million – 20 % weniger als Opus 5 – während Cache-Reads, die laut Anthropic den Großteil der Kosten für agentische und Coding-Arbeit ausmachen, auf 0,20 $ pro Million sinken, eine Reduktion um 60 %. Die Ausgabe wird über 30 % schneller generiert als bei Opus 5.
Benchmarks
Opus 5.5 führt bei agentischem Coding, Computer-Nutzung und Wissensarbeit:
- Terminal-Bench 4.0: 66,4 % (vs. 55,8 % Fable 5.1, 52,3 % Opus 5, 57,9 % GPT-6 Astra, 37,3 % GPT-5.6 Sol)
- FrontierCode v1.1 (Main): 54,4 % (Fable 5.1: 50,3 %, Opus 5: 48,0 %)
- CursorBench 4.0: 57,8 % (Fable 5.1: 51,8 %, Opus 5: 46,6 %)
- GDPval-AA v2.1: 1846 (Fable 5.1: 1735, Opus 5: 1708)
- AutomationBench: 40,0 % (Fable 5.1: 31,4 %, Opus 5: 26,9 %)
- Humanity's Last Exam: 67,7 % mit Tools (Fable 5.1: 65,6 %, Opus 5: 63,6 %)
- Terminal-Bench-Science 0.1: 58,7 % (Fable 5.1: 52,6 %, Opus 5: 29,0 %, GPT-6 Astra: 64,6 %)
Anthropic merkt an, dass Benchmark-Unterschiede auf diesem Niveau ein weniger verlässlicher Indikator für reale Unterschiede geworden sind und dass die Lücke zwischen Opus 5.5 und Fable 5.1 in der Praxis kleiner ist, als die Scores vermuten lassen.
Berichtete Workloads
Ein Tester schloss eine Migration von 680.000 Codezeilen in unter einem Tag ab. In einem internen Test zur Reduzierung der Ladezeiten auf jeder Seite einer Web-App war Opus 5.5 in 39 von 40 Fällen erfolgreich – Opus 5 erzielte kleinere Verbesserungen, veränderte aber auch das App-Verhalten. Ein weiterer Tester ließ mehrere Claude-Modelle ein Spiel aus einem einzigen Prompt bauen; Opus 5.5 erzielte die höchsten Werte bei Grafik und Feinschliff.
Sicherheit und Verifikation
Opus 5.5 erzielt die bisher besten Werte in Anthropics automatisiertem Verhaltensaudit, einer Suite, die Claude in Tausenden simulierten Szenarien testet. Es ist weniger wahrscheinlich als aktuelle Modelle, schwer rückgängig zu machende Aktionen durchzuführen oder außerhalb vorgegebener Grenzen zu handeln, und ist resistenter gegen Prompt-Injection als Opus 5. Die Tests decken nun längere Aufgaben, unmögliche Aufgaben und Szenarien nach realen Vorfällen ab. Da es in Biologie und Cybersicherheit mit Claude Mythos 5.1 vergleichbar ist, setzt Anthropic es mit ähnlichen Schutzmaßnahmen wie Claude Fable 5.1 ein.
Geprüfte Organisationen können sich für das Life Sciences Verification Program für biologische Forschungszwecke bewerben; das Cyber Verification Program wird in den kommenden Wochen für verifizierte Praktiker erweitert.
Limits und Verfügbarkeit
Die 5-Stunden-Nutzungslimits bei Pro-, Max-, Team- und sitzbasierten Enterprise-Plänen werden erhöht. Abonnement-Nutzer erhalten ein Rate-Limit-Reset, das gespeichert und nach Belieben verwendet werden kann. Claude Sonnet 5.5 und Claude Haiku 5.5 folgen in den kommenden Wochen mit ähnlichen Verbesserungen bei Leistung, Effizienz und Sicherheit.
📖 Read the full source: HN AI Agents
👀 Siehe auch

NHS England zieht sich von Open Source zurück: Offener Brief fordert Rücknahme der SDLC-8-Richtlinie
Ein offener Brief mit 74 Unterschriften fordert NHS England auf, SDLC-8 zurückzuziehen – eine Richtlinie, die den gesamten NHS-Quellcode verbirgt – und bekräftigt Prinzip 12 des NHS Service Standard: 'Machen Sie neuen Quellcode offen.'

ClawCast Ep.3: Überarbeitung des Onboardings, abgesagte Demo und OpenClaw vs. Codex für langfristige Workflows
Episode 3 des ClawCast behandelt die Überarbeitung des Onboardings von OpenClaw, warum die Demo abgesagt wurde, Lehren aus Hermes' Selbstverbesserungssystem und wie OpenClaw im Vergleich zu Codex für langlebige autonome Workflows abschneidet.

NVIDIA kündigt NemoClaw mit OpenShell-Sicherheitsfunktionen an
NVIDIA kündigte NemoClaw auf der GTC an, das auf OpenClaw aufbaut, um durch OpenShell unternehmensgerechte Sicherheit hinzuzufügen, die richtlinienbasierte Datenschutz- und Sicherheitsvorkehrungen für KI-Agenten durchsetzt.

Claude Code v2.1.79 OAuth-Anmeldung nach automatischem Update defekt: Problemumgehung und Lösung
Claude Code v2.1.79 hat einen bestätigten OAuth-Login-Fehler, bei dem die CLI nach der Browser-Autorisierung eine Zeitüberschreitung aufweist. Das Problem rührt daher, dass der native Installer automatisch auf diese Version aktualisiert, und die Lösung besteht darin, auf v2.1.75 zurückzustufen, indem die native Installation entfernt wird.