KI-Code-Review-Benchmark: Claude, Gemini, Codex, Qwen und MiniMax im Vergleich

✍️ OpenClawRadar📅 Veröffentlicht: 27. Februar 2026🔗 Source
KI-Code-Review-Benchmark: Claude, Gemini, Codex, Qwen und MiniMax im Vergleich
Ad

Vergleich der KI-Code-Review-Leistung

Ein kürzliches Experiment verglich fünf führende KI-Modelle für Code-Reviews anhand von 15 Pull-Requests von Milvus, einer Open-Source-Vektordatenbank. Jeder PR enthielt bekannte Fehler, die nach dem Mergen in der Produktion auftraten, und bot so einen realistischen Testdatensatz.

Modelle und Aufbau

Die getesteten Modelle waren:

  • Claude Opus 4.6
  • Gemini 3 Pro
  • GPT-5.2-Codex
  • Qwen-3.5-Plus
  • MiniMax-M2.5

Der Benchmark nutzte Magpie, ein Open-Source-Tool, das den Kontext vorbereitet, indem es umgebenden Code, Aufrufketten und verwandte Module einbezieht, bevor es ihn an das Modell weitergibt.

Schwierigkeitsgrade der Fehler

Fehler wurden nach Schwierigkeit kategorisiert:

  • L1: Sichtbar allein aus dem Diff (alle Modelle erkannten diese, daher aus der Wertung ausgeschlossen)
  • L2 (10 Fälle): Erfordert Verständnis des umgebenden Codes (Schnittstellenänderungen, Nebenläufigkeitsprobleme)
  • L3 (5 Fälle): Erfordert systemweites Verständnis (modulübergreifende Inkonsistenzen, Upgrade-Kompatibilität)

Ergebnisse nach Modell

Zwei Auswertungsmodi wurden verwendet:

  • Roh: Modell sieht nur PR-Diff und Inhalt
  • R1: Magpie liefert umgebenden Kontext

Gesamterkennungsraten (nur L2 + L3):

  • Claude: 53 % roh, 47 % mit Kontext
  • Gemini: 13 % roh, 33 % mit Kontext
  • Codex: 33 % roh, 27 % mit Kontext
  • MiniMax: 27 % roh, 33 % mit Kontext
  • Qwen: 33 % roh, 40 % mit Kontext
Ad

Wesentliche Erkenntnisse

Claude dominierte den Roh-Review mit 53 % Erkennung und perfekten 5/5 bei L3-Fehlern. Es ist hervorragend darin, seinen eigenen Kontext zu organisieren, sodass zusätzlicher Kontext seine Leistung tatsächlich verringerte.

Gemini schnitt im Rohmodus schlecht ab (13 %), verbesserte sich aber mit Kontext deutlich (33 %), was darauf hindeutet, dass es Kontext von vornherein benötigt.

Qwen war mit 40 % der stärkste kontextunterstützte Performer mit der höchsten L2-Fehlererkennung (5/10).

Ergebnisse der gegnerischen Debatte

Wenn Modelle fünf Runden lang miteinander debattierten, stieg die Fehlererkennung von 53 % (bestes Einzelmodell) auf 80 %. Die schwierigsten L3-Fehler erreichten im Debattenmodus 100 % Erkennung.

Das Experiment zeigt, dass verschiedene Modelle komplementäre Stärken haben: Claudes Gründlichkeit, Geminis designfokussierte Analyse bei gegebenem Kontext, Codex' konkrete, umsetzbare Rückmeldungen und Qwens starke kontextunterstützte Leistung.

📖 Read the full source: HN AI Agents

Ad

👀 Siehe auch

Slate: Open-Source macOS AI-Chat-App mit integriertem Browser
Werkzeuge

Slate: Open-Source macOS AI-Chat-App mit integriertem Browser

Slate ist eine native macOS-App, die KI-Chat und Web-Browsing in einem einzigen Fenster kombiniert und Anthropic-, OpenAI-, Gemini- und Ollama-Modelle unterstützt. Sie ist mit SwiftUI und WebKit entwickelt, läuft ressourcenschonend und ist unter der MIT-Lizenz verfügbar.

OpenClawRadar
Slack-Nachrichtenformatierer: Repariere Claudes kaputtes Markdown in Slack
Werkzeuge

Slack-Nachrichtenformatierer: Repariere Claudes kaputtes Markdown in Slack

Ein Entwickler hat eine Fähigkeit erstellt, die von Claude generiertes Markdown in eine ordnungsgemäße Slack-Formatierung umwandelt. Damit werden Probleme gelöst, bei denen fettgedruckter Text als Sternchen angezeigt wird, Links roh erscheinen und Tabellen zerbrechen. Das Tool bietet sowohl eine Browser-Vorschau mit reichhaltigem HTML-Kopieren und Einfügen als auch API-Webhook-Unterstützung.

OpenClawRadar
Drop-in OAuth-Anbieter für persönliche FastMCP-Server auf allen Claude-Plattformen
Werkzeuge

Drop-in OAuth-Anbieter für persönliche FastMCP-Server auf allen Claude-Plattformen

Ein Entwickler hat einen Python-OAuth-Provider in einer einzigen Datei erstellt, der es persönlichen FastMCP-Servern ermöglicht, auf Claude.ai Web, Mobile und Desktop Plattformen zu arbeiten, ohne externe Identitätsdienste wie Auth0 oder Google zu benötigen.

OpenClawRadar
hiresTI: Nativeer Linux TIDAL-Player mit OpenClaw/MCP-Unterstützung
Werkzeuge

hiresTI: Nativeer Linux TIDAL-Player mit OpenClaw/MCP-Unterstützung

hiresTI ist ein nativer Linux-Desktop-Client für TIDAL, der sich auf stabilen Wiedergabe, hochwertige Audioausgabe, eine GTK4/Libadwaita-Benutzeroberfläche und OpenClaw-Integration über MCP zur Fernsteuerung konzentriert. Die App kombiniert eine Python-UI-Schicht mit einem Rust-Audio-Kern.

OpenClawRadar