AIコードレビューベンチマーク:Claude、Gemini、Codex、Qwen、MiniMaxの比較

✍️ OpenClawRadar📅 公開日: February 27, 2026🔗 Source
AIコードレビューベンチマーク:Claude、Gemini、Codex、Qwen、MiniMaxの比較
Ad

AIコードレビュー性能比較

最近の実験では、オープンソースのベクトルデータベースであるMilvusの15件のプルリクエストを使用して、5つの主要AIモデルのコードレビュー性能をベンチマーク評価しました。各PRには、マージ後に本番環境で発覚した既知のバグが含まれており、現実的なテストセットを提供しています。

モデルと設定

テストされたモデルは以下の通りです:

  • Claude Opus 4.6
  • Gemini 3 Pro
  • GPT-5.2-Codex
  • Qwen-3.5-Plus
  • MiniMax-M2.5

このベンチマークでは、周辺コード、呼び出しチェーン、関連モジュールを収集してコンテキストを準備するオープンソースツール「Magpie」を使用してから、モデルに情報を提供しました。

バグの難易度レベル

バグは難易度別に分類されました:

  • L1:差分のみで可視(全モデルが検出したため、スコアから除外)
  • L2(10ケース):周辺コードの理解が必要(インターフェース変更、並行性競合)
  • L3(5ケース):システムレベルの理解が必要(モジュール間の不整合、アップグレード互換性)

モデル別結果

2つの評価モードが使用されました:

  • 生:モデルはPR差分と内容のみを確認
  • R1:Magpieが周辺コンテキストを提供

全体検出率(L2 + L3のみ):

  • Claude:生53%、コンテキスト付き47%
  • Gemini:生13%、コンテキスト付き33%
  • Codex:生33%、コンテキスト付き27%
  • MiniMax:生27%、コンテキスト付き33%
  • Qwen:生33%、コンテキスト付き40%
Ad

主な発見

Claudeは生レビューで53%の検出率を達成し、L3バグでは完璧な5/5を記録して圧倒的な性能を示しました。自らコンテキストを整理する能力に優れており、追加コンテキストは実際に性能を低下させました。

Geminiは生モードでは低調な13%でしたが、コンテキスト付きでは大幅に改善され33%となり、事前にコンテキストを提供する必要性が示唆されました。

Qwenはコンテキスト支援型で最高の40%を達成し、L2バグ検出でも最高の5/10を記録しました。

敵対的議論の結果

モデル同士が5ラウンドの議論を行った場合、バグ検出率は53%(最優秀単体モデル)から80%に急上昇しました。最も難しいL3バグは議論モードで100%検出に達しました。

この実験は、異なるモデルが補完的な強みを持つことを明らかにしました:Claudeの徹底性、Geminiのコンテキスト提供時の設計重視分析、Codexの具体的で実践的なフィードバック、そしてQwenの強力なコンテキスト支援性能です。

📖 完全なソースを読む: HN AI Agents

Ad

👀 See Also

Eden AI: AIモデルのための欧州APIハブ – OpenRouterの代替として方向転換
Tools

Eden AI: AIモデルのための欧州APIハブ – OpenRouterの代替として方向転換

Eden AIは、スマートルーティング、フォールバックメカニズム、リージョンコントロールを備え、500以上のAIモデル(LLM、ビジョン、OCR、音声)にアクセスできる単一の統一APIを提供します。OpenRouterの欧州版として位置づけられています。

OpenClawRadar
Screenbox:音声のみで構築されたAIエージェント向けオープンソース仮想デスクトップ
Tools

Screenbox:音声のみで構築されたAIエージェント向けオープンソース仮想デスクトップ

Screenboxは、AIエージェント向けにDocker内で隔離されたLinuxデスクトップを提供し、複数のエージェントを並列実行する際の競合を解決します。このプロジェクトはClaude Codeを使用した音声コマンドのみで構築され、作成者はコードの一行も見たことがありません。

OpenClawRadar
Hermes Agent v0.6.0は、モデルごとのツール呼び出しパーサーによる強化されたローカルモデルサポートを提供します。
Tools

Hermes Agent v0.6.0は、モデルごとのツール呼び出しパーサーによる強化されたローカルモデルサポートを提供します。

Nous ResearchによるHermes Agent v0.6.0は、30Bクラスのモデルで適切にツール呼び出しを処理するモデルごとのツールコールパーサーを提供し、Ollama、vLLM、sglangをすぐにサポートし、サーバーレス展開のためのModalやDaytonaを含む6つのターミナルバックエンドを備えています。

OpenClawRadar
MCPサーバー:ローカルとクラウドのLLMをディベート機能で比較
Tools

MCPサーバー:ローカルとクラウドのLLMをディベート機能で比較

MCPサーバーは、開発者がOllamaを介してローカルモデルと様々なクラウドLLMをクエリできるようにし、並列比較や構造化された議論機能などの特徴を提供します。

OpenClawRadar