AI 코드 리뷰 벤치마크: Claude, Gemini, Codex, Qwen, MiniMax 비교

✍️ OpenClawRadar📅 게시일: February 27, 2026🔗 Source
AI 코드 리뷰 벤치마크: Claude, Gemini, Codex, Qwen, MiniMax 비교
Ad

AI 코드 리뷰 성능 비교

최근 실험에서 오픈소스 벡터 데이터베이스인 Milvus의 15개 풀 리퀘스트를 사용해 5개의 주요 AI 모델을 코드 리뷰용으로 벤치마크했습니다. 각 PR에는 병합 후 실제 운영에서 발견된 알려진 버그가 포함되어 있어 현실적인 테스트 세트를 제공했습니다.

모델 및 설정

테스트된 모델은 다음과 같습니다:

  • Claude Opus 4.6
  • Gemini 3 Pro
  • GPT-5.2-Codex
  • Qwen-3.5-Plus
  • MiniMax-M2.5

벤치마크는 Magpie라는 오픈소스 도구를 사용했으며, 이 도구는 모델에 입력하기 전에 주변 코드, 호출 체인, 관련 모듈을 가져와 컨텍스트를 준비합니다.

버그 난이도 수준

버그는 난이도에 따라 분류되었습니다:

  • L1: diff만으로 확인 가능 (모든 모델이 이를 발견했으므로 점수에서 제외)
  • L2 (10개 사례): 주변 코드 이해 필요 (인터페이스 변경, 동시성 경합)
  • L3 (5개 사례): 시스템 수준 이해 필요 (모듈 간 불일치, 업그레이드 호환성)

모델별 결과

두 가지 평가 모드가 사용되었습니다:

  • 원시: 모델이 PR diff와 내용만 확인
  • R1: Magpie가 주변 컨텍스트 제공

전체 탐지율 (L2 + L3만):

  • Claude: 원시 53%, 컨텍스트 47%
  • Gemini: 원시 13%, 컨텍스트 33%
  • Codex: 원시 33%, 컨텍스트 27%
  • MiniMax: 원시 27%, 컨텍스트 33%
  • Qwen: 원시 33%, 컨텍스트 40%
Ad

주요 발견 사항

Claude는 원시 리뷰에서 53% 탐지율로 압도적 성능을 보였으며 L3 버그에서 완벽한 5/5 성적을 기록했습니다. 이 모델은 자체적으로 컨텍스트를 구성하는 데 탁월하여 추가 컨텍스트가 오히려 성능을 저하시켰습니다.

Gemini는 원시 모드에서 저조한 성능(13%)을 보였지만 컨텍스트 제공 시 크게 향상된 성능(33%)을 보여, 사전에 컨텍스트가 제공되어야 함을 시사합니다.

Qwen은 컨텍스트 지원 모드에서 40%로 가장 강력한 성능을 보였으며, L2 버그 탐지에서 가장 높은 성적(5/10)을 기록했습니다.

적대적 토론 결과

모델들이 서로 5라운드 동안 토론할 때 버그 탐지율은 53%(단일 모델 최고 성능)에서 80%로 급증했습니다. 가장 어려운 L3 버그는 토론 모드에서 100% 탐지율에 도달했습니다.

이 실험은 서로 다른 모델이 상호 보완적 강점을 가지고 있음을 보여줍니다: Claude의 철저함, 컨텍스트 제공 시 Gemini의 설계 중심 분석, Codex의 구체적 실행 가능한 피드백, 그리고 Qwen의 강력한 컨텍스트 지원 성능.

📖 전체 출처 읽기: HN AI Agents

Ad

👀 See Also

CostClaw: OpenClaw 에이전트를 위한 무료 로컬 비용 추적 대시보드
Tools

CostClaw: OpenClaw 에이전트를 위한 무료 로컬 비용 추적 대시보드

CostClaw는 OpenClaw의 네이티브 훅을 통해 모든 LLM 호출을 캡처하고 모델 분석, 세션별 비용, 시간별 지출 차트를 보여주는 대시보드를 제공하는 무료 로컬 플러그인입니다. 개발자는 자신의 하트비트 에이전트가 3분마다 24시간 내내 Claude Sonnet을 실행하여 아무것도 하지 않는데도 월 60달러를 소모하고 있음을 발견했고, 이를 Haiku로 전환하여 약 65%의 비용을 절감했습니다.

OpenClawRadar
wmux: MCP를 통한 브라우저 제어 기능을 갖춘 Windows용 Electron 터미널 멀티플렉서
Tools

wmux: MCP를 통한 브라우저 제어 기능을 갖춘 Windows용 Electron 터미널 멀티플렉서

wmux는 Windows 10/11용 오픈소스 Electron 터미널 멀티플렉서로, tmux 스타일 분할 화면, 지속적 세션, Claude Code와 같은 AI 코딩 에이전트를 위한 Chrome DevTools Protocol을 통한 브라우저 제어 기능을 제공합니다. 이는 자동으로 MCP 서버로 등록되며, 에이전트가 여러 세션을 나란히 실행하면서 브라우저와 상호작용할 수 있게 합니다.

OpenClawRadar
홈클로 플러그인은 애플 홈킷을 오픈클로에 연결합니다
Tools

홈클로 플러그인은 애플 홈킷을 오픈클로에 연결합니다

HomeClaw는 Apple Home/HomeKit 기기와 OpenClaw를 연결하는 OpenClaw 플러그인입니다. Apple HomeKit의 공인 배포에 대한 제한으로 인해 빌드 및 실행을 위해서는 Apple 개발자 계정이 필요합니다.

OpenClawRadar
오크스트라: 오픈클로를 위한 비용 인식 LLM 라우팅 레이어, API 비용을 60-80% 절감
Tools

오크스트라: 오픈클로를 위한 비용 인식 LLM 라우팅 레이어, API 비용을 60-80% 절감

Orkestra는 OpenClaw의 LLM 호출 앞에 위치하는 모듈형 라우팅 레이어로, 의미론적 분류를 통해 프롬프트를 예산, 균형, 프리미엄 모델 계층으로 라우팅합니다. 이 접근 방식은 프롬프트 재작성이나 복잡한 규칙 없이 API 비용을 60-80% 절감했습니다.

OpenClawRadar