Grok 4.5 vs Claude Code: Akzeptierte Änderungen pro Dollar sind der wahre Maßstab

✍️ OpenClawRadar📅 Veröffentlicht: 23. Juli 2026🔗 Source
Ad

xAIs Grok 4.5 Launch (53% auf DeepSWE 1.1 vs Opus 4.8 mit 59%, 29,0% pass@1 auf SWE Marathon vs 26,0%, 80 Tokens/Sekunde bei $2/M Input, $6/M Output) lohnt sich als praktischer Vergleich mit Claude Code, nicht nur als weiterer Leaderboard-Anspruch. Die richtige Metrik für Entwickler, die KI-Coding-Agenten nutzen, ist akzeptierte Änderungen pro Dollar bei identischem Repository, Prompt, Tool-Berechtigungen, Testbefehl, Timeout und Review-Schwelle.

Ad

Wichtige Details

Grok 4.5 ist in Grok Build, Cursor und per API verfügbar. Es unterstützt die Reasoning-Modi niedrig, mittel und hoch. Ein Drittanbieter-Test vom 20. Juli (via The New Stack) ließ Grok und Opus im Cursor-Agent-Modus drei identische Rust-Aufgaben bearbeiten:

  • Bug-Fix: Beide bestanden die ersten Tests.
  • Multi-File-Refaktor: Beide abgeschlossen, aber Opus bearbeitete eine Datei mehr.
  • Feature-Build (der praktischste Test): Beide funktionierten, aber Opus erweiterte die Testabdeckung und schrieb den Manpage-Eintrag.

Opus' zusätzliche Bearbeitungen sind wichtig für akzeptierte Änderungen pro Dollar: Ein günstigeres Modell, das einen zusätzlichen Reparaturdurchlauf benötigt, ist vielleicht nicht günstiger. Die Community empfiehlt, Folgendes zu protokollieren: Ersttest-Erfolg, Nacharbeitsschritte, Ausgabe-Token, Echtzeit und Prüfer-Korrekturen.

Für wen geeignet

Jeder, der Claude Code, Cursor oder Grok Build für agentisches Codieren nutzt und die Gesamtkosten der ausgelieferten Änderungen bewerten möchte.

📖 Vollständige Quelle lesen: r/ClaudeAI

Ad

👀 Siehe auch

Anthropic sichert sich 300 MW Rechenleistung bei Colossus 1 mit 220.000 NVIDIA GPUs durch SpaceX-Partnerschaft
Nachrichten

Anthropic sichert sich 300 MW Rechenleistung bei Colossus 1 mit 220.000 NVIDIA GPUs durch SpaceX-Partnerschaft

Anthropic gab eine Partnerschaft mit SpaceX bekannt, um die gesamte Rechenkapazität des Colossus-1-Rechenzentrums zu nutzen und innerhalb eines Monats über 300 MW und mehr als 220.000 NVIDIA-GPUs zu erhalten.

OpenClawRadar
Claude Opus 4.7 lässt in Logik und Konversation nach, berichten Nutzer
Nachrichten

Claude Opus 4.7 lässt in Logik und Konversation nach, berichten Nutzer

Opus 4.7 führt einen neuen Tokenizer ein, der 30-50% mehr kostet, weist Meta-Erzählung, Positionsinstabilität und Planung ohne Ausführung auf – und ist damit für technische Zusammenarbeit schlechter als 4.6.

OpenClawRadar
🦀
Nachrichten

Opus 4.7 Aufmerksamkeitsverschlechterung: MRCR-Werte fallen von 92% auf 59% bei 256k Kontext

Opus 4.7 zeigt einen signifikanten Recall-Rückgang im MRCR v2 8-Nadel-Test: von 91,9% auf 59,2% bei 256k Kontext und von 78,3% auf 32,2% bei 1M. Anthropic stellt MRCR zugunsten von Graphwalks ein, aber die Verschlechterung deckt sich mit den Berichten der Nutzer.

OpenClawRadar
Vier UX-/Produktlücken im Onboarding-Erlebnis von Claude identifiziert
Nachrichten

Vier UX-/Produktlücken im Onboarding-Erlebnis von Claude identifiziert

Ein Nutzer identifizierte vier spezifische UX-/Produktlücken während der Einrichtung von Claude auf Desktop, Cowork, Dispatch und der iPhone-App im aktiven Gebrauch. Probleme umfassen Dispatch-Aufgaben, die in Endlosschleifen geraten, wenn der Desktop offline ist, einzelne persistente Threads in Dispatch, tab-verankerte Chat-Panels in Chrome und fehlende Google Drive-Dateien in der mobilen App-Wissensdatenbank-UI.

OpenClawRadar