Grok 4.5 vs Claude Code: Akzeptierte Änderungen pro Dollar sind der wahre Maßstab
xAIs Grok 4.5 Launch (53% auf DeepSWE 1.1 vs Opus 4.8 mit 59%, 29,0% pass@1 auf SWE Marathon vs 26,0%, 80 Tokens/Sekunde bei $2/M Input, $6/M Output) lohnt sich als praktischer Vergleich mit Claude Code, nicht nur als weiterer Leaderboard-Anspruch. Die richtige Metrik für Entwickler, die KI-Coding-Agenten nutzen, ist akzeptierte Änderungen pro Dollar bei identischem Repository, Prompt, Tool-Berechtigungen, Testbefehl, Timeout und Review-Schwelle.
Wichtige Details
Grok 4.5 ist in Grok Build, Cursor und per API verfügbar. Es unterstützt die Reasoning-Modi niedrig, mittel und hoch. Ein Drittanbieter-Test vom 20. Juli (via The New Stack) ließ Grok und Opus im Cursor-Agent-Modus drei identische Rust-Aufgaben bearbeiten:
- Bug-Fix: Beide bestanden die ersten Tests.
- Multi-File-Refaktor: Beide abgeschlossen, aber Opus bearbeitete eine Datei mehr.
- Feature-Build (der praktischste Test): Beide funktionierten, aber Opus erweiterte die Testabdeckung und schrieb den Manpage-Eintrag.
Opus' zusätzliche Bearbeitungen sind wichtig für akzeptierte Änderungen pro Dollar: Ein günstigeres Modell, das einen zusätzlichen Reparaturdurchlauf benötigt, ist vielleicht nicht günstiger. Die Community empfiehlt, Folgendes zu protokollieren: Ersttest-Erfolg, Nacharbeitsschritte, Ausgabe-Token, Echtzeit und Prüfer-Korrekturen.
Für wen geeignet
Jeder, der Claude Code, Cursor oder Grok Build für agentisches Codieren nutzt und die Gesamtkosten der ausgelieferten Änderungen bewerten möchte.
📖 Vollständige Quelle lesen: r/ClaudeAI
👀 Siehe auch

Georgia KI-Rechenzentrum verbrauchte 29 Millionen Gallonen ungemessenen Wassers
Der QTS-Campus in Fayetteville entnahm über 15 Monate hinweg 29 Millionen Gallonen Wasser über zwei nicht genehmigte Anschlüsse, was zu Beschwerden über niedrigen Wasserdruck führte. Der Bezirk verzichtete auf Strafen und berechnete 147.000 USD nachträglich.

OpenClaw April-Updates: Ein Monat der bahnbrechenden Änderungen und des verlorenen Vertrauens
Die April-Updates von OpenClaw zeigen ein Muster: Neue Funktionen und Fehlerbehebungen werden zusammen mit kritischen Bugs ausgeliefert. Postinstall-Skripte löschen Dateien, Sicherheitslücken auftauchen und Fähigkeiten sind defekt – das untergräbt das Vertrauen.

Testing OpenClaw auf UmbrelOS: Was Sie wissen sollten
Die Integration von OpenClaw mit UmbrelOS wird untersucht, was möglicherweise eine neue Umgebung für KI-unterstützte Codierungswerkzeuge bietet.

Vibe-Coding vs. Agentisches Engineering: Die Grenzen verschwimmen unangenehm
Simon Willison reflektiert darüber, wie Vibe Coding und agentisches Engineering in seinem eigenen Arbeitsablauf zusammenfließen, und stellt fest, dass er Claude Code nun vertraut, JSON-API-Endpunkte für die Produktion zu schreiben, ohne jede Zeile zu überprüfen – und das fühlt sich komisch an.