Grok 4.5 vs Claude Code: Mudanças Aceitas por Dólar É o Verdadeiro Benchmarck

✍️ OpenClawRadar📅 Publicado: July 23, 2026🔗 Source
Ad

O lançamento do Grok 4.5 do xAI (53% no DeepSWE 1.1 contra 59% do Opus 4.8, 29,0% pass@1 no SWE Marathon contra 26,0%, 80 tokens/seg a $2/M input, $6/M output) merece ser tratado como uma comparação prática com o Claude Code, não apenas mais uma alegação de ranking. A métrica certa para desenvolvedores que usam agentes de codificação de IA é mudanças aceitas por dólar com o mesmo repositório, prompt, permissões de ferramentas, comando de teste, tempo limite e padrão de revisão.

Ad

Detalhes Principais

O Grok 4.5 está disponível no Grok Build, Cursor e via API. Ele suporta modos de raciocínio baixo, médio e alto. No entanto, um teste de terceiros de 20 de julho (via The New Stack) executou Grok e Opus no modo Cursor Agent em três tarefas Rust idênticas:

  • Correção de bug: Ambos passaram nos testes iniciais.
  • Refatoração multi-arquivo: Ambos concluíram, mas o Opus tocou mais um arquivo.
  • Construção de recurso (o teste mais prático): Ambos funcionaram, mas o Opus adicionou mais cobertura de testes e escreveu a entrada da página de manual.

Os toques extras do Opus importam para mudanças aceitas por dólar: um modelo mais barato que precisa de um ciclo extra de reparo pode não ser mais barato. A comunidade recomenda registrar: sucesso no teste inicial, ciclos de retrabalho, tokens de saída, tempo decorrido e correções do revisor.

Para Quem É

Qualquer pessoa que use Claude Code, Cursor ou Grok Build para codificação agentiva e queira avaliar o custo total das mudanças entregues.

📖 Leia a fonte completa: r/ClaudeAI

Ad

👀 See Also