AI 코드 리뷰 벤치마크: Claude, Gemini, Codex, Qwen, MiniMax 비교

✍️ OpenClawRadar📅 게시일: February 27, 2026🔗 Source
AI 코드 리뷰 벤치마크: Claude, Gemini, Codex, Qwen, MiniMax 비교
Ad

AI 코드 리뷰 성능 비교

최근 실험에서 오픈소스 벡터 데이터베이스인 Milvus의 15개 풀 리퀘스트를 사용해 5개의 주요 AI 모델을 코드 리뷰용으로 벤치마크했습니다. 각 PR에는 병합 후 실제 운영에서 발견된 알려진 버그가 포함되어 있어 현실적인 테스트 세트를 제공했습니다.

모델 및 설정

테스트된 모델은 다음과 같습니다:

  • Claude Opus 4.6
  • Gemini 3 Pro
  • GPT-5.2-Codex
  • Qwen-3.5-Plus
  • MiniMax-M2.5

벤치마크는 Magpie라는 오픈소스 도구를 사용했으며, 이 도구는 모델에 입력하기 전에 주변 코드, 호출 체인, 관련 모듈을 가져와 컨텍스트를 준비합니다.

버그 난이도 수준

버그는 난이도에 따라 분류되었습니다:

  • L1: diff만으로 확인 가능 (모든 모델이 이를 발견했으므로 점수에서 제외)
  • L2 (10개 사례): 주변 코드 이해 필요 (인터페이스 변경, 동시성 경합)
  • L3 (5개 사례): 시스템 수준 이해 필요 (모듈 간 불일치, 업그레이드 호환성)

모델별 결과

두 가지 평가 모드가 사용되었습니다:

  • 원시: 모델이 PR diff와 내용만 확인
  • R1: Magpie가 주변 컨텍스트 제공

전체 탐지율 (L2 + L3만):

  • Claude: 원시 53%, 컨텍스트 47%
  • Gemini: 원시 13%, 컨텍스트 33%
  • Codex: 원시 33%, 컨텍스트 27%
  • MiniMax: 원시 27%, 컨텍스트 33%
  • Qwen: 원시 33%, 컨텍스트 40%
Ad

주요 발견 사항

Claude는 원시 리뷰에서 53% 탐지율로 압도적 성능을 보였으며 L3 버그에서 완벽한 5/5 성적을 기록했습니다. 이 모델은 자체적으로 컨텍스트를 구성하는 데 탁월하여 추가 컨텍스트가 오히려 성능을 저하시켰습니다.

Gemini는 원시 모드에서 저조한 성능(13%)을 보였지만 컨텍스트 제공 시 크게 향상된 성능(33%)을 보여, 사전에 컨텍스트가 제공되어야 함을 시사합니다.

Qwen은 컨텍스트 지원 모드에서 40%로 가장 강력한 성능을 보였으며, L2 버그 탐지에서 가장 높은 성적(5/10)을 기록했습니다.

적대적 토론 결과

모델들이 서로 5라운드 동안 토론할 때 버그 탐지율은 53%(단일 모델 최고 성능)에서 80%로 급증했습니다. 가장 어려운 L3 버그는 토론 모드에서 100% 탐지율에 도달했습니다.

이 실험은 서로 다른 모델이 상호 보완적 강점을 가지고 있음을 보여줍니다: Claude의 철저함, 컨텍스트 제공 시 Gemini의 설계 중심 분석, Codex의 구체적 실행 가능한 피드백, 그리고 Qwen의 강력한 컨텍스트 지원 성능.

📖 전체 출처 읽기: HN AI Agents

Ad

👀 See Also

클로드 코드, 연구 프리뷰에 에이전트 팀 기반 리뷰 시스템 추가
Tools

클로드 코드, 연구 프리뷰에 에이전트 팀 기반 리뷰 시스템 추가

클로드 코드는 이제 에이전트 팀을 활용한 앤트로픽의 내부 프로세스를 모델로 한 철저한 코드 리뷰 시스템을 포함합니다. 이 기능은 연구 프리뷰로 이용 가능합니다.

OpenClawRadar
VS Code를 위한 Kotlin 공식 지원, 알파 버전 출시 — IntelliJ의 언어 서버 기반
Tools

VS Code를 위한 Kotlin 공식 지원, 알파 버전 출시 — IntelliJ의 언어 서버 기반

JetBrains가 Kotlin for VS Code 알파 버전을 출시했습니다. IntelliJ IDEA의 코드 분석 인프라를 기반으로 구축된 Kotlin 언어 서버가 코드 완성, 진단, 탐색, 빠른 수정, 포맷팅 및 프로젝트 가져오기를 제공합니다.

OpenClawRadar
OpenClaw 메모 플러그인, AI 코딩 에이전트의 메모리 핸드오프 문제 해결
Tools

OpenClaw 메모 플러그인, AI 코딩 에이전트의 메모리 핸드오프 문제 해결

한 레딧 사용자가 Claude 코드 유출 사건이 AI 코딩 에이전트의 메모리 핸드오프 문제를 부각시켰다고 공유했습니다. 이는 부풀려진 대화 기록이 모델 전환 시 문제를 일으키는 상황입니다. 이들은 OpenClaw에 메모스 플러그인을 도입하여 선택적 회상 전략으로 최근 작업을 압축하고 오래된 도구 호출을 제거했습니다.

OpenClawRadar
🦀
Tools

Claude Garmin MCP 서버: 더 스마트한 훈련 조언을 위한 실제 피트니스 데이터

Claude Desktop을 Garmin Connect에 연결하는 MCP 서버로, 데이터 기반 훈련 계획을 위한 8가지 도구(회복 준비도, HRV, VO2max 등)를 제공합니다.

OpenClawRadar