KI-Code-Review-Benchmark: Claude, Gemini, Codex, Qwen und MiniMax im Vergleich

Vergleich der KI-Code-Review-Leistung
Ein kürzliches Experiment verglich fünf führende KI-Modelle für Code-Reviews anhand von 15 Pull-Requests von Milvus, einer Open-Source-Vektordatenbank. Jeder PR enthielt bekannte Fehler, die nach dem Mergen in der Produktion auftraten, und bot so einen realistischen Testdatensatz.
Modelle und Aufbau
Die getesteten Modelle waren:
- Claude Opus 4.6
- Gemini 3 Pro
- GPT-5.2-Codex
- Qwen-3.5-Plus
- MiniMax-M2.5
Der Benchmark nutzte Magpie, ein Open-Source-Tool, das den Kontext vorbereitet, indem es umgebenden Code, Aufrufketten und verwandte Module einbezieht, bevor es ihn an das Modell weitergibt.
Schwierigkeitsgrade der Fehler
Fehler wurden nach Schwierigkeit kategorisiert:
- L1: Sichtbar allein aus dem Diff (alle Modelle erkannten diese, daher aus der Wertung ausgeschlossen)
- L2 (10 Fälle): Erfordert Verständnis des umgebenden Codes (Schnittstellenänderungen, Nebenläufigkeitsprobleme)
- L3 (5 Fälle): Erfordert systemweites Verständnis (modulübergreifende Inkonsistenzen, Upgrade-Kompatibilität)
Ergebnisse nach Modell
Zwei Auswertungsmodi wurden verwendet:
- Roh: Modell sieht nur PR-Diff und Inhalt
- R1: Magpie liefert umgebenden Kontext
Gesamterkennungsraten (nur L2 + L3):
- Claude: 53 % roh, 47 % mit Kontext
- Gemini: 13 % roh, 33 % mit Kontext
- Codex: 33 % roh, 27 % mit Kontext
- MiniMax: 27 % roh, 33 % mit Kontext
- Qwen: 33 % roh, 40 % mit Kontext
Wesentliche Erkenntnisse
Claude dominierte den Roh-Review mit 53 % Erkennung und perfekten 5/5 bei L3-Fehlern. Es ist hervorragend darin, seinen eigenen Kontext zu organisieren, sodass zusätzlicher Kontext seine Leistung tatsächlich verringerte.
Gemini schnitt im Rohmodus schlecht ab (13 %), verbesserte sich aber mit Kontext deutlich (33 %), was darauf hindeutet, dass es Kontext von vornherein benötigt.
Qwen war mit 40 % der stärkste kontextunterstützte Performer mit der höchsten L2-Fehlererkennung (5/10).
Ergebnisse der gegnerischen Debatte
Wenn Modelle fünf Runden lang miteinander debattierten, stieg die Fehlererkennung von 53 % (bestes Einzelmodell) auf 80 %. Die schwierigsten L3-Fehler erreichten im Debattenmodus 100 % Erkennung.
Das Experiment zeigt, dass verschiedene Modelle komplementäre Stärken haben: Claudes Gründlichkeit, Geminis designfokussierte Analyse bei gegebenem Kontext, Codex' konkrete, umsetzbare Rückmeldungen und Qwens starke kontextunterstützte Leistung.
📖 Read the full source: HN AI Agents
👀 Siehe auch

KI-Handelsagent mit Risikobegrenzungen für Bildungsinvestitionen
Ein Entwickler hat einen KI-gestützten Handelsassistenten gebaut, der Claude mit einem Brokerage-Konto verbindet, wobei eine Risiko-Engine zwischen der KI und dem Geld positioniert ist. Das System umfasst Sicherheitsprüfungen wie das Blockieren von Trades, die 50 % der Portfoliostruktur überschreiten, eine automatische Abschaltung bei 3 % Tagesverlust und einen Notausschalter bei 20 % Verlust.

Claude Hindsight: Beobachtungstool für Claude-Code-Sitzungen
Claude Hindsight ist eine Open-Source-Beobachtungsschicht für Claude Code, die Tool-Aufrufe, Tokens und Fehler in ein erkundbares Dashboard erfasst. Der Ersteller nutzte es, um ein Open-Source-Projekt in einer einzigen 11-stündigen Sitzung mit 733 Tool-Aufrufen und 692,8M Cache-Tokens zu refaktorisieren.

Lumyr: Dashboard-Generierung mit Claude, Python und Streamlit-Automatisierung
Lumyr ist ein Tool, das live, teilbare Dashboards aus einfachen englischen Beschreibungen generiert, indem es Claude für die Dashboard-Erstellung nutzt und die Python- und Streamlit-Ebene automatisiert. Benutzer müssen kein Python schreiben, Streamlit öffnen, etwas bereitstellen, Hosting einrichten oder Infrastruktur verwalten.

Codeset verbessert Codierungsagenten mit repositoriums-spezifischem Kontext aus dem Git-Verlauf.
Codeset generiert statische Dateien aus dem Git-Verlauf, die Kontextinformationen wie frühere Fehler, Ursachen und Co-Change-Beziehungen liefern. Tests zeigten eine Verbesserung von 5,3 Prozentpunkten bei codeset-gym-python und 2 Prozentpunkten bei SWE-Bench Pro mit OpenAI Codex.