Warum Codex für komplexe Python-Monolithen immer noch besser ist als Claude Code

Im letzten Jahr hat ein Entwickler, der an einem komplexen Python-Monolithen arbeitet, hauptsächlich Codex verwendet. Nach einem Monat Test von Claude Code mit Opus 4.6 und 4.7 bevorzugt er für diese Codebasis immer noch Codex. Die Anwendung ist kein einfacher CRUD-Server – sie hat eine neuere DDD-ähnliche Schicht, älteren gut strukturierten Code und fragilen Legacy-Spaghetticode. Das Team vermeidet es, alte Teile neu zu schreiben, es sei denn, es ist notwendig.
Wichtige Vorteile von Codex
- Harness-Engineering-Prinzipien: Codex folgt zuverlässig dem Harness-Engineering-Workflow ohne explizite Anweisungen. Claude tut dies nur, wenn
AGENTS.mdeine Anweisung wie „Lies exec_plan.md und befolge sie“ enthält. - Wiederverwendung vorhandener Tools und Muster: Claude erstellt häufiger neue Tools, anstatt die Codebasis nach vorhandenen zu durchsuchen. In einer Codebasis mit vielen projektspezifischen Helfern ist Wiederverwendung entscheidend.
- Bessere Planung und Kontextbewusstsein: Claude liest oft zu wenig, bevor er neue Funktionalitäten platziert. Der Entwickler musste wiederholt korrigieren:
„Setze diese Funktionalität stattdessen in Modul A, nicht im Controller.“
„Konstruiere das Antwortobjekt nicht mit den Status, die du in der Anfrage gesendet hast. Die API gibt bereits das aktualisierte Objekt zurück – verwende diese Antwort.“
„Validiere es im selben Modul, dem diese Grenze gehört.“
Codex bemerkt häufiger fehlenden Kontext und stellt klärende Fragen, bevor er Architekturänderungen vornimmt.
Wo Claude glänzt
Für Frontend-Arbeiten war Opus 4.6 viel besser als Codex 5.3 und GPT-5.4. Der Entwickler bevorzugt derzeit Claude für UI-Aufgaben. Er hat GPT-5.5 noch nicht bei UI-lastigen Arbeiten getestet.
Tool-Konfiguration
Beide LLMs nutzen eine einzige gemeinsame Fähigkeit: Befehle zum Starten und Stoppen von Docker Compose und zum Ausführen von Tests innerhalb des Containers.
Dies ist kein Benchmark, sondern nur eine Erfahrung aus dem täglichen Gebrauch mit einer Produktionscodebasis.
📖 Read the full source: HN AI Agents
👀 Siehe auch

Agint: Ein Rust-CLI-Tool, das Widersprüche in KI-Agenten-Anweisungsdateien erkennt
Agint ist ein kostenloses, quelloffenes Rust-CLI-Tool, das Anleitungsdateien wie CLAUDE.md und AGENTS.md auf Widersprüche, fehlende Dateiverweise und Synchronisationsprobleme überprüft. Es nutzt statische Analyse für strukturelle Probleme und optional Claude-API-Aufrufe zur Erkennung semantischer Widersprüche.

yburn: Tool zur Überprüfung und zum Ersetzen unnötiger KI-Agent-Cron-Jobs
yburn ist ein Python-Tool, das KI-Agenten-Cronjobs überprüft und solche, die keine LLMs benötigen, durch eigenständige Python-Skripte ersetzt. Der Ersteller stellte fest, dass 58 % von 98 Cronjobs rein mechanische Aufgaben wie Systemgesundheitsprüfungen und Git-Backups waren.

Hybride Suche mit RRF verbessert KI-Gedächtnissystem im Vergleich zu reiner Vektorsuche
Ein Open-Source-AI-Gedächtnissystem mit PostgreSQL und pgvector stellte fest, dass reine Vektorsuche für exakte Übereinstimmungen unzureichend ist, fügte daher Volltextsuche hinzu und fusionierte Ergebnisse mittels Reciprocal Rank Fusion (RRF) mit k=60 sowie Abfrageanreicherung via Tokenizer.

OpenMontage: Open-Source Agentisches Videoproduktionssystem für KI-Codierungsassistenten
OpenMontage ist ein Open-Source-Video-Produktionssystem, das KI-Codierungsassistenten wie Claude Code in vollwertige Produktionsstudios verwandelt. Es übernimmt Recherche, Szenenplanung, Skripterstellung, Sprachaufnahmen, Musikauswahl, Untertitelgenerierung und Validierung durch automatisierte Pipelines.