Grok 4.5 vs Claude Code: Akzeptierte Änderungen pro Dollar sind der wahre Maßstab
xAIs Grok 4.5 Launch (53% auf DeepSWE 1.1 vs Opus 4.8 mit 59%, 29,0% pass@1 auf SWE Marathon vs 26,0%, 80 Tokens/Sekunde bei $2/M Input, $6/M Output) lohnt sich als praktischer Vergleich mit Claude Code, nicht nur als weiterer Leaderboard-Anspruch. Die richtige Metrik für Entwickler, die KI-Coding-Agenten nutzen, ist akzeptierte Änderungen pro Dollar bei identischem Repository, Prompt, Tool-Berechtigungen, Testbefehl, Timeout und Review-Schwelle.
Wichtige Details
Grok 4.5 ist in Grok Build, Cursor und per API verfügbar. Es unterstützt die Reasoning-Modi niedrig, mittel und hoch. Ein Drittanbieter-Test vom 20. Juli (via The New Stack) ließ Grok und Opus im Cursor-Agent-Modus drei identische Rust-Aufgaben bearbeiten:
- Bug-Fix: Beide bestanden die ersten Tests.
- Multi-File-Refaktor: Beide abgeschlossen, aber Opus bearbeitete eine Datei mehr.
- Feature-Build (der praktischste Test): Beide funktionierten, aber Opus erweiterte die Testabdeckung und schrieb den Manpage-Eintrag.
Opus' zusätzliche Bearbeitungen sind wichtig für akzeptierte Änderungen pro Dollar: Ein günstigeres Modell, das einen zusätzlichen Reparaturdurchlauf benötigt, ist vielleicht nicht günstiger. Die Community empfiehlt, Folgendes zu protokollieren: Ersttest-Erfolg, Nacharbeitsschritte, Ausgabe-Token, Echtzeit und Prüfer-Korrekturen.
Für wen geeignet
Jeder, der Claude Code, Cursor oder Grok Build für agentisches Codieren nutzt und die Gesamtkosten der ausgelieferten Änderungen bewerten möchte.
📖 Vollständige Quelle lesen: r/ClaudeAI
👀 Siehe auch

Anthropic sichert sich 300 MW Rechenleistung bei Colossus 1 mit 220.000 NVIDIA GPUs durch SpaceX-Partnerschaft
Anthropic gab eine Partnerschaft mit SpaceX bekannt, um die gesamte Rechenkapazität des Colossus-1-Rechenzentrums zu nutzen und innerhalb eines Monats über 300 MW und mehr als 220.000 NVIDIA-GPUs zu erhalten.

Claude Opus 4.7 lässt in Logik und Konversation nach, berichten Nutzer
Opus 4.7 führt einen neuen Tokenizer ein, der 30-50% mehr kostet, weist Meta-Erzählung, Positionsinstabilität und Planung ohne Ausführung auf – und ist damit für technische Zusammenarbeit schlechter als 4.6.
Opus 4.7 Aufmerksamkeitsverschlechterung: MRCR-Werte fallen von 92% auf 59% bei 256k Kontext
Opus 4.7 zeigt einen signifikanten Recall-Rückgang im MRCR v2 8-Nadel-Test: von 91,9% auf 59,2% bei 256k Kontext und von 78,3% auf 32,2% bei 1M. Anthropic stellt MRCR zugunsten von Graphwalks ein, aber die Verschlechterung deckt sich mit den Berichten der Nutzer.

Vier UX-/Produktlücken im Onboarding-Erlebnis von Claude identifiziert
Ein Nutzer identifizierte vier spezifische UX-/Produktlücken während der Einrichtung von Claude auf Desktop, Cowork, Dispatch und der iPhone-App im aktiven Gebrauch. Probleme umfassen Dispatch-Aufgaben, die in Endlosschleifen geraten, wenn der Desktop offline ist, einzelne persistente Threads in Dispatch, tab-verankerte Chat-Panels in Chrome und fehlende Google Drive-Dateien in der mobilen App-Wissensdatenbank-UI.