GPT-5.5 Codex gegen Claude Opus 4.7: Praxisnahe KI-Coding-Benchmarks

Ein Reddit-Nutzer testete GPT-5.5 Codex (via Cursor) gegen Claude Opus 4.7 (Claude Code) bei zwei produktionsreifen Aufgaben. Beide verwendeten dieselben Prompts, MCPs (GitHub + Slack) und dieselbe Maschine. Die Ergebnisse verdeutlichen Kompromisse bei Kosten, Architektur und Zuverlässigkeit.
Test 1: PR-Triage-Bot
- GitHub MCP, Bewertungsformel, Slack-Benachrichtigungen, Wiederholungen, striktes TypeScript (kein
any). - Claude Code: Überprüfte die Erreichbarkeit von MCP vor dem Schreiben von Code. Erstellte 36 Dateien in 12 Minuten. Schrieb seinen eigenen WebSocket-Smoke-Test (3ms Broadcast). Null Fehler beim ersten Durchlauf. Gesamtkosten: ~2,50 $.
- Codex: Fehlgeschlagen – GitHub MCP aufgrund eines Cursor-Umgebungsproblems nicht erreichbar (kein Modellfehler). Konnte die Aufgabe nicht abschließen.
Test 2: Echtzeit-Code-Review-Oberfläche
- React, WebSockets, optimistisches Rollback, virtualisierter Diff, WS-Wiederverbindung.
- Claude Code: Gleiche saubere Auslieferung, 36 Dateien, keine Fehler.
- Codex: In 28 Dateien ausgeliefert (kompaktere Architektur). Erforderte einen manuellen Patch für eine unendliche React-Schleife. Gesamtkosten: ~2,04 $ (18 % günstiger als Claude).
Fazit: Für komplexe, architekturlastige Arbeiten führt Opus 4.7 weiterhin – bessere Werkzeughandhabung, Ausgabe ohne Umschreiben und gründliche MCP-Validierung. Codex ist schlanker und günstiger, geeignet für enge, in sich geschlossene Aufgaben, bei denen es auf schnelle Auslieferung ankommt und man einen kleinen Patchedurchlauf tolerieren kann. Der Nutzer wechselt noch nicht, beobachtet aber die Preislücke.
📖 Read the full source: r/ClaudeAI
👀 Siehe auch

MOOSE-Star: Ein 7B-Modell und 108K-Papierdatensatz für die wissenschaftliche Hypothesenentdeckung – ICML 2026
MiroMind veröffentlicht MOOSE-Star auf Hugging Face: ein 7B-Modell (DeepSeek-R1-Distill-Qwen-7B-Feintuning) für die Entdeckung wissenschaftlicher Hypothesen, zusammen mit dem 108.000 Paper umfassenden TOMATO-Star-Datensatz. Benchmarks zeigen, dass MS-7B eine Inspirationsabrufgenauigkeit von 54,34 % erreicht und damit GPT-5.4 übertrifft und sich Gemini-3 Pro annähert.

Verwendung eines lokalen LLM als Claude-Code-Subagent zur Reduzierung des Kontextverbrauchs
Ein Entwickler teilt eine Methode, um Claude Code zu nutzen, um Aufgaben über die LM Studio API an ein lokales LLM zu delegieren, wobei der Dateiinhalt aus dem Kontext von Claude ferngehalten wird. Der Ansatz verwendet ein Python-Skript von etwa 120 Zeilen mit Tool-Calling, um Dateien lokal zu lesen und Zusammenfassungen zurückzugeben.

LobsterBoard fügt Themesystem und Vorlagen-Galerie hinzu
LobsterBoard umfasst nun ein Themesystem mit fünf visuellen Optionen und eine Vorlagengalerie, die es Nutzern ermöglicht, Dashboard-Layouts zu exportieren und zu importieren, wobei sensible Daten automatisch entfernt werden.

Unterstudie: Ein lehrbarer Desktop-Agent, der Aufgaben durch Vorführung lernt
Understudy ist eine lokal-first Desktop-Agenten-Laufzeitumgebung, die GUI-Apps, Browser, Shell-Tools, Dateien und Messaging in einer Sitzung bedienen kann. Sie demonstrieren eine Aufgabe einmal, sie zeichnet Bildschirmvideo und semantische Ereignisse auf, extrahiert die Absicht statt Koordinaten und verwandelt sie in eine wiederverwendbare Fähigkeit.