Referência de Revisão de Código por IA: Claude, Gemini, Codex, Qwen e MiniMax Comparados

✍️ OpenClawRadar📅 Publicado: February 27, 2026🔗 Source
Referência de Revisão de Código por IA: Claude, Gemini, Codex, Qwen e MiniMax Comparados
Ad

Comparação de Desempenho em Revisão de Código por IA

Um experimento recente avaliou cinco modelos de IA de ponta para revisão de código usando 15 pull requests do Milvus, um banco de dados vetorial de código aberto. Cada PR continha bugs conhecidos que surgiram em produção após a mesclagem, fornecendo um conjunto de testes realista.

Modelos e Configuração

Os modelos testados foram:

  • Claude Opus 4.6
  • Gemini 3 Pro
  • GPT-5.2-Codex
  • Qwen-3.5-Plus
  • MiniMax-M2.5

O benchmark usou o Magpie, uma ferramenta de código aberto que prepara o contexto coletando código circundante, cadeias de chamadas e módulos relacionados antes de alimentar o modelo.

Níveis de Dificuldade dos Bugs

Os bugs foram categorizados por dificuldade:

  • L1: Visíveis apenas pelo diff (todos os modelos os detectaram, portanto excluídos da pontuação)
  • L2 (10 casos): Requer compreensão do código circundante (mudanças de interface, condições de corrida)
  • L3 (5 casos): Requer compreensão em nível de sistema (inconsistências entre módulos, compatibilidade de atualização)

Resultados por Modelo

Dois modos de avaliação foram usados:

  • Bruto: O modelo vê apenas o diff e o conteúdo do PR
  • R1: O Magpie fornece contexto circundante

Taxas gerais de detecção (apenas L2 + L3):

  • Claude: 53% bruto, 47% com contexto
  • Gemini: 13% bruto, 33% com contexto
  • Codex: 33% bruto, 27% com contexto
  • MiniMax: 27% bruto, 33% com contexto
  • Qwen: 33% bruto, 40% com contexto
Ad

Principais Descobertas

O Claude dominou a revisão bruta com 53% de detecção e perfeitos 5/5 em bugs L3. Ele se destaca em organizar seu próprio contexto, então contexto adicional realmente reduziu seu desempenho.

O Gemini teve desempenho fraco no modo bruto (13%), mas melhorou significativamente com contexto (33%), sugerindo que precisa de contexto fornecido antecipadamente.

O Qwen foi o melhor desempenho assistido por contexto com 40%, com a maior detecção de bugs L2 (5/10).

Resultados do Debate Adversário

Quando os modelos debateram entre si por cinco rodadas, a detecção de bugs saltou de 53% (melhor modelo individual) para 80%. Os bugs L3 mais difíceis atingiram 100% de detecção no modo de debate.

O experimento revela que diferentes modelos têm pontos fortes complementares: a meticulosidade do Claude, a análise focada em design do Gemini quando recebe contexto, o feedback concreto e acionável do Codex e o forte desempenho assistido por contexto do Qwen.

📖 Leia a fonte completa: HN AI Agents

Ad

👀 See Also

quorum: Ferramenta de Governança de Código com IA Aplica Revisão Independente de Modelos
Tools

quorum: Ferramenta de Governança de Código com IA Aplica Revisão Independente de Modelos

quorum é uma camada de governança para desenvolvimento assistido por IA que aplica um protocolo de consenso exigindo que o código seja revisado de forma independente por um modelo diferente antes de ser confirmado. Inclui três portões estruturais que bloqueiam o progresso: portões de auditoria, retrospectiva e qualidade.

OpenClawRadar
SkillsGate: Mercado de Código Aberto para Habilidades de Agentes de Programação de IA
Tools

SkillsGate: Mercado de Código Aberto para Habilidades de Agentes de Programação de IA

SkillsGate é um mercado de código aberto que indexa mais de 45.000 habilidades para agentes de IA de codificação como Claude Code, Cursor e Windsurf. Ele fornece busca semântica com embeddings vetoriais e instalação com um único comando via npx.

OpenClawRadar
Usando Claude para Extrair Dados de um Jogo Football Manager de 1997
Tools

Usando Claude para Extrair Dados de um Jogo Football Manager de 1997

Ben Nuttall usou Claude para extrair dados de jogadores, times e estádios do FIFA Soccer Manager 97. A IA analisou o arquivo SM97.DAT, exportou CSV e construiu um site pesquisável. Todo o código Python está no GitHub.

OpenClawRadar
Plugins essenciais do OpenClaw para desenvolvedores que usam agentes de IA para codificação
Tools

Plugins essenciais do OpenClaw para desenvolvedores que usam agentes de IA para codificação

Um desenvolvedor testou plugins do OpenClaw e identificou ferramentas essenciais, incluindo env-guard para segurança, commit-guard para evitar commits ruins, composio para conexão com mais de 860 ferramentas, cortex-memory para sessões longas, cost-tracker para visibilidade de gastos e openclaw-better-gateway para corrigir conexões instáveis.

OpenClawRadar