KI-Code-Review-Benchmark: Claude, Gemini, Codex, Qwen und MiniMax im Vergleich

✍️ OpenClawRadar📅 Veröffentlicht: 27. Februar 2026🔗 Source
KI-Code-Review-Benchmark: Claude, Gemini, Codex, Qwen und MiniMax im Vergleich
Ad

Vergleich der KI-Code-Review-Leistung

Ein kürzliches Experiment verglich fünf führende KI-Modelle für Code-Reviews anhand von 15 Pull-Requests von Milvus, einer Open-Source-Vektordatenbank. Jeder PR enthielt bekannte Fehler, die nach dem Mergen in der Produktion auftraten, und bot so einen realistischen Testdatensatz.

Modelle und Aufbau

Die getesteten Modelle waren:

  • Claude Opus 4.6
  • Gemini 3 Pro
  • GPT-5.2-Codex
  • Qwen-3.5-Plus
  • MiniMax-M2.5

Der Benchmark nutzte Magpie, ein Open-Source-Tool, das den Kontext vorbereitet, indem es umgebenden Code, Aufrufketten und verwandte Module einbezieht, bevor es ihn an das Modell weitergibt.

Schwierigkeitsgrade der Fehler

Fehler wurden nach Schwierigkeit kategorisiert:

  • L1: Sichtbar allein aus dem Diff (alle Modelle erkannten diese, daher aus der Wertung ausgeschlossen)
  • L2 (10 Fälle): Erfordert Verständnis des umgebenden Codes (Schnittstellenänderungen, Nebenläufigkeitsprobleme)
  • L3 (5 Fälle): Erfordert systemweites Verständnis (modulübergreifende Inkonsistenzen, Upgrade-Kompatibilität)

Ergebnisse nach Modell

Zwei Auswertungsmodi wurden verwendet:

  • Roh: Modell sieht nur PR-Diff und Inhalt
  • R1: Magpie liefert umgebenden Kontext

Gesamterkennungsraten (nur L2 + L3):

  • Claude: 53 % roh, 47 % mit Kontext
  • Gemini: 13 % roh, 33 % mit Kontext
  • Codex: 33 % roh, 27 % mit Kontext
  • MiniMax: 27 % roh, 33 % mit Kontext
  • Qwen: 33 % roh, 40 % mit Kontext
Ad

Wesentliche Erkenntnisse

Claude dominierte den Roh-Review mit 53 % Erkennung und perfekten 5/5 bei L3-Fehlern. Es ist hervorragend darin, seinen eigenen Kontext zu organisieren, sodass zusätzlicher Kontext seine Leistung tatsächlich verringerte.

Gemini schnitt im Rohmodus schlecht ab (13 %), verbesserte sich aber mit Kontext deutlich (33 %), was darauf hindeutet, dass es Kontext von vornherein benötigt.

Qwen war mit 40 % der stärkste kontextunterstützte Performer mit der höchsten L2-Fehlererkennung (5/10).

Ergebnisse der gegnerischen Debatte

Wenn Modelle fünf Runden lang miteinander debattierten, stieg die Fehlererkennung von 53 % (bestes Einzelmodell) auf 80 %. Die schwierigsten L3-Fehler erreichten im Debattenmodus 100 % Erkennung.

Das Experiment zeigt, dass verschiedene Modelle komplementäre Stärken haben: Claudes Gründlichkeit, Geminis designfokussierte Analyse bei gegebenem Kontext, Codex' konkrete, umsetzbare Rückmeldungen und Qwens starke kontextunterstützte Leistung.

📖 Read the full source: HN AI Agents

Ad

👀 Siehe auch

KI-Handelsagent mit Risikobegrenzungen für Bildungsinvestitionen
Werkzeuge

KI-Handelsagent mit Risikobegrenzungen für Bildungsinvestitionen

Ein Entwickler hat einen KI-gestützten Handelsassistenten gebaut, der Claude mit einem Brokerage-Konto verbindet, wobei eine Risiko-Engine zwischen der KI und dem Geld positioniert ist. Das System umfasst Sicherheitsprüfungen wie das Blockieren von Trades, die 50 % der Portfoliostruktur überschreiten, eine automatische Abschaltung bei 3 % Tagesverlust und einen Notausschalter bei 20 % Verlust.

OpenClawRadar
Claude Hindsight: Beobachtungstool für Claude-Code-Sitzungen
Werkzeuge

Claude Hindsight: Beobachtungstool für Claude-Code-Sitzungen

Claude Hindsight ist eine Open-Source-Beobachtungsschicht für Claude Code, die Tool-Aufrufe, Tokens und Fehler in ein erkundbares Dashboard erfasst. Der Ersteller nutzte es, um ein Open-Source-Projekt in einer einzigen 11-stündigen Sitzung mit 733 Tool-Aufrufen und 692,8M Cache-Tokens zu refaktorisieren.

OpenClawRadar
Lumyr: Dashboard-Generierung mit Claude, Python und Streamlit-Automatisierung
Werkzeuge

Lumyr: Dashboard-Generierung mit Claude, Python und Streamlit-Automatisierung

Lumyr ist ein Tool, das live, teilbare Dashboards aus einfachen englischen Beschreibungen generiert, indem es Claude für die Dashboard-Erstellung nutzt und die Python- und Streamlit-Ebene automatisiert. Benutzer müssen kein Python schreiben, Streamlit öffnen, etwas bereitstellen, Hosting einrichten oder Infrastruktur verwalten.

OpenClawRadar
Codeset verbessert Codierungsagenten mit repositoriums-spezifischem Kontext aus dem Git-Verlauf.
Werkzeuge

Codeset verbessert Codierungsagenten mit repositoriums-spezifischem Kontext aus dem Git-Verlauf.

Codeset generiert statische Dateien aus dem Git-Verlauf, die Kontextinformationen wie frühere Fehler, Ursachen und Co-Change-Beziehungen liefern. Tests zeigten eine Verbesserung von 5,3 Prozentpunkten bei codeset-gym-python und 2 Prozentpunkten bei SWE-Bench Pro mit OpenAI Codex.

OpenClawRadar