Grok 4.5 vs Claude Code: Akzeptierte Änderungen pro Dollar sind der wahre Maßstab

✍️ OpenClawRadar📅 Veröffentlicht: 23. Juli 2026🔗 Source
Ad

xAIs Grok 4.5 Launch (53% auf DeepSWE 1.1 vs Opus 4.8 mit 59%, 29,0% pass@1 auf SWE Marathon vs 26,0%, 80 Tokens/Sekunde bei $2/M Input, $6/M Output) lohnt sich als praktischer Vergleich mit Claude Code, nicht nur als weiterer Leaderboard-Anspruch. Die richtige Metrik für Entwickler, die KI-Coding-Agenten nutzen, ist akzeptierte Änderungen pro Dollar bei identischem Repository, Prompt, Tool-Berechtigungen, Testbefehl, Timeout und Review-Schwelle.

Ad

Wichtige Details

Grok 4.5 ist in Grok Build, Cursor und per API verfügbar. Es unterstützt die Reasoning-Modi niedrig, mittel und hoch. Ein Drittanbieter-Test vom 20. Juli (via The New Stack) ließ Grok und Opus im Cursor-Agent-Modus drei identische Rust-Aufgaben bearbeiten:

  • Bug-Fix: Beide bestanden die ersten Tests.
  • Multi-File-Refaktor: Beide abgeschlossen, aber Opus bearbeitete eine Datei mehr.
  • Feature-Build (der praktischste Test): Beide funktionierten, aber Opus erweiterte die Testabdeckung und schrieb den Manpage-Eintrag.

Opus' zusätzliche Bearbeitungen sind wichtig für akzeptierte Änderungen pro Dollar: Ein günstigeres Modell, das einen zusätzlichen Reparaturdurchlauf benötigt, ist vielleicht nicht günstiger. Die Community empfiehlt, Folgendes zu protokollieren: Ersttest-Erfolg, Nacharbeitsschritte, Ausgabe-Token, Echtzeit und Prüfer-Korrekturen.

Für wen geeignet

Jeder, der Claude Code, Cursor oder Grok Build für agentisches Codieren nutzt und die Gesamtkosten der ausgelieferten Änderungen bewerten möchte.

📖 Vollständige Quelle lesen: r/ClaudeAI

Ad

👀 Siehe auch