Claude Code vs. Codex: Realer Build-Test – 36 Dateien vs. 28, Endlosschleife und 0,46-Dollar-Kostendifferenz

Ein Entwickler führte einen direkten Vergleich zwischen Claude Code und Codex (via Cursor) mit identischen Prompts und der gleichen MCP-Konfiguration (GitHub + Slack) durch. Keine Hinweise, keine zusätzliche Hilfe. Zwei Aufgaben:
- Aufgabe 1: PR-Triage-Bot – offene PRs lesen, Komplexität bewerten, Bericht schreiben, bei hoher Priorität in Slack benachrichtigen. Erforderlich: Wiederholungslogik, Fehlerprotokollierung, striktes TypeScript (kein
any). - Aufgabe 2: Echtzeit-Code-Review-Oberfläche – React, WebSocket, Inline-Kommentare, optimistische Updates mit Rückrollfunktion, virtualisierte Diff-Ansicht, erneute Verbindung mit Backoff. Keine UI-Bibliotheken, alles von Grund auf.
Ergebnisse
- Claude Code: Überprüfte, ob MCP-Tools aktiv waren, bevor Code geschrieben wurde. Erstellte 36 Dateien in 12 Minuten. Enthielt einen nicht angeforderten WebSocket-Smoke-Test mit zwei Clients. Broadcast-Latenz: 3 ms. Kein einziges
any. Bestand den Typtest beim ersten Versuch. - Codex (Cursor): Konnte bei Aufgabe 1 nicht auf GitHub MCP zugreifen (Cursor's Ausführungspfad legte keine Tool-Beschreibungen offen). Nach 3 Wiederholungen
tool not found, aber sauber protokolliert und behandelt – Umgebungsproblem, keine Modellqualität. Aufgabe 2 lieferte eine funktionierende Oberfläche in ~15 Minuten, 5 ms Latenz. Der erste Compile-Lauf hatte TypeScript-Fehler und eine Endlos-Schleife in React (useEffectruft wiederholthydrateauf), die einen Ref-Guard-Patch erforderte.
Kosten
API-Kosten für beide Aufgaben: Claude ~2,50 $, Codex ~2,04 $. Claude war ~23 % teurer, lieferte aber eine detailliertere Architektur und eine sofort saubere Oberfläche.
Wichtige Erkenntnisse
Der Autor stellt fest, dass die beiden Tools nicht wirklich für denselben Anwendungsfall konkurrieren. Claude Code fühlt sich an wie die Zusammenarbeit mit jemandem, der zuerst die Dokumentation liest; Codex fühlt sich an wie ein Senior-Entwickler, der schnell liefern will. Keines der Tools hat any durchsickern lassen, keines hat einen Tool-Namen halluziniert, und beide haben WebSocket-Broadcasts unter 10 ms erreicht – eine deutliche Verbesserung gegenüber vor sechs Monaten.
📖 Vollständige Quelle lesen: r/LocalLLaMA
👀 Siehe auch

OpenClaw vs Hermes: Unterschiedliche Designphilosophien für KI-Agenten
OpenClaw ist ein Multi-Channel-Gateway, das WhatsApp, Telegram, Discord, Slack und iMessage mit einem umfangreichen Skill-Ökosystem verbindet, während Hermes ein lernender Agent ist, der Aufgaben bewertet, Muster als wiederverwendbare Skills speichert und im Laufe der Zeit ein Modell Ihres Workflows aufbaut.

Gemini 3.1 Pro in Multi-Agenten-Systemen: Hohe Designqualität, 20% Fehlerrate bei Tool-Aufrufen
Entwickler, die Bobr, einen KI-Präsentationsgenerator mit einer Multi-Agenten-Architektur erstellen, berichten, dass Gemini 3.1 Pro beeindruckende Design-Ergebnisse liefert, aber unter einer Ausfallrate von Werkzeugaufrufen von ~20 % und verstümmelter Textkorruption in Produktions-Pipelines leidet.

Fingerprints kostenloses Web-Bot-Authentifizierungstest-Tool für KI-Agenten-Entwickler
Fingerprint hat einen kostenlosen, öffentlichen Endpunkt für das Testen von Web Bot Auth-Implementierungen veröffentlicht. Das Tool validiert kryptografische Signaturen auf HTTP-Anfragen und hilft Entwicklern von Bots und KI-Agenten sicherzustellen, dass ihre WBA-Einrichtung korrekt funktioniert, bevor sie in die Produktion gehen.
Claude Code vs. Codex: 36 vs. 28 Dateien, 2,50 $ vs. 2,04 $, Endlosschleife erkannt — Praxisvergleich
Ein Entwickler führt die gleichen zwei Aufgaben mit Claude Code und Codex (Cursor) aus: PR-Triage-Bot und Echtzeit-Code-Review-UI. Ergebnisse: 36 vs. 28 Dateien, 2,50 $ vs. 2,04 $ Kosten, Claude produzierte weniger TypeScript-Fehler, Codex hatte eine Endlosschleife in React.