Grok 4.5 vs Claude Code: Akzeptierte Änderungen pro Dollar sind der wahre Maßstab

✍️ OpenClawRadar📅 Veröffentlicht: 23. Juli 2026🔗 Source
Ad

xAIs Grok 4.5 Launch (53% auf DeepSWE 1.1 vs Opus 4.8 mit 59%, 29,0% pass@1 auf SWE Marathon vs 26,0%, 80 Tokens/Sekunde bei $2/M Input, $6/M Output) lohnt sich als praktischer Vergleich mit Claude Code, nicht nur als weiterer Leaderboard-Anspruch. Die richtige Metrik für Entwickler, die KI-Coding-Agenten nutzen, ist akzeptierte Änderungen pro Dollar bei identischem Repository, Prompt, Tool-Berechtigungen, Testbefehl, Timeout und Review-Schwelle.

Ad

Wichtige Details

Grok 4.5 ist in Grok Build, Cursor und per API verfügbar. Es unterstützt die Reasoning-Modi niedrig, mittel und hoch. Ein Drittanbieter-Test vom 20. Juli (via The New Stack) ließ Grok und Opus im Cursor-Agent-Modus drei identische Rust-Aufgaben bearbeiten:

  • Bug-Fix: Beide bestanden die ersten Tests.
  • Multi-File-Refaktor: Beide abgeschlossen, aber Opus bearbeitete eine Datei mehr.
  • Feature-Build (der praktischste Test): Beide funktionierten, aber Opus erweiterte die Testabdeckung und schrieb den Manpage-Eintrag.

Opus' zusätzliche Bearbeitungen sind wichtig für akzeptierte Änderungen pro Dollar: Ein günstigeres Modell, das einen zusätzlichen Reparaturdurchlauf benötigt, ist vielleicht nicht günstiger. Die Community empfiehlt, Folgendes zu protokollieren: Ersttest-Erfolg, Nacharbeitsschritte, Ausgabe-Token, Echtzeit und Prüfer-Korrekturen.

Für wen geeignet

Jeder, der Claude Code, Cursor oder Grok Build für agentisches Codieren nutzt und die Gesamtkosten der ausgelieferten Änderungen bewerten möchte.

📖 Vollständige Quelle lesen: r/ClaudeAI

Ad

👀 Siehe auch

Glomz Octagon: Multi-Agent-Code-Reviews – 179 Agents, 1.333 Reviews und der Netzwerkeffekt
Nachrichten

Glomz Octagon: Multi-Agent-Code-Reviews – 179 Agents, 1.333 Reviews und der Netzwerkeffekt

Glomz.com führte ein Experiment durch, bei dem 179 KI-Agenten registriert wurden, 433 Code-Beiträge einreichten und 1.333 Bewertungen in einer „Octagon"-Arena generierten. Der Netzwerkeffekt der „Review-Kaskade" ist real – Beiträge mit 3-5 ersten Bewertungen zogen mehr Agenten an, wobei der beste Beitrag 21 Bewertungen erhielt.

OpenClawRadar
Anthropic veröffentlicht Blender MCP Connector – Claude steuert jetzt Blender über die Python-API
Nachrichten

Anthropic veröffentlicht Blender MCP Connector – Claude steuert jetzt Blender über die Python-API

Anthropic hat offizielle MCP-Connector für Blender, Adobe, Splice und SketchUp veröffentlicht, die es Claude ermöglicht, 3D-Szenen in Echtzeit aus natürlichen Sprachbefehlen zu erstellen.

OpenClawRadar
OpenClaw 2026.3.28: Breaking Changes für MiniMax-Nutzer, Konfigurations-Autoreparatur entfernt
Nachrichten

OpenClaw 2026.3.28: Breaking Changes für MiniMax-Nutzer, Konfigurations-Autoreparatur entfernt

OpenClaw 2026.3.28 entfernt die automatische Reparatur für veraltete Konfigurationsschlüssel und entfernt mehrere MiniMax-Modelle. Benutzer müssen ihre Konfigurationen vor dem Upgrade aktualisieren, um Gateway-Startfehler zu vermeiden.

OpenClawRadar
Uber verbrennt KI-Budget für 2026 in 4 Monaten mit Claude Code — 500–2.000 Dollar pro Ingenieur monatlich
Nachrichten

Uber verbrennt KI-Budget für 2026 in 4 Monaten mit Claude Code — 500–2.000 Dollar pro Ingenieur monatlich

Uber hat sein gesamtes KI-Budget für 2026 bis April für Claude Code und Cursor ausgegeben. Die monatlichen API-Kosten betragen 500 bis 2.000 US-Dollar pro Ingenieur. 95 % der Ingenieure nutzen monatlich KI-Tools; 70 % des Committed Codes sind KI-generiert.

OpenClawRadar