Grok 4.5 vs Claude Code: Mudanças Aceitas por Dólar É o Verdadeiro Benchmarck
O lançamento do Grok 4.5 do xAI (53% no DeepSWE 1.1 contra 59% do Opus 4.8, 29,0% pass@1 no SWE Marathon contra 26,0%, 80 tokens/seg a $2/M input, $6/M output) merece ser tratado como uma comparação prática com o Claude Code, não apenas mais uma alegação de ranking. A métrica certa para desenvolvedores que usam agentes de codificação de IA é mudanças aceitas por dólar com o mesmo repositório, prompt, permissões de ferramentas, comando de teste, tempo limite e padrão de revisão.
Detalhes Principais
O Grok 4.5 está disponível no Grok Build, Cursor e via API. Ele suporta modos de raciocínio baixo, médio e alto. No entanto, um teste de terceiros de 20 de julho (via The New Stack) executou Grok e Opus no modo Cursor Agent em três tarefas Rust idênticas:
- Correção de bug: Ambos passaram nos testes iniciais.
- Refatoração multi-arquivo: Ambos concluíram, mas o Opus tocou mais um arquivo.
- Construção de recurso (o teste mais prático): Ambos funcionaram, mas o Opus adicionou mais cobertura de testes e escreveu a entrada da página de manual.
Os toques extras do Opus importam para mudanças aceitas por dólar: um modelo mais barato que precisa de um ciclo extra de reparo pode não ser mais barato. A comunidade recomenda registrar: sucesso no teste inicial, ciclos de retrabalho, tokens de saída, tempo decorrido e correções do revisor.
Para Quem É
Qualquer pessoa que use Claude Code, Cursor ou Grok Build para codificação agentiva e queira avaliar o custo total das mudanças entregues.
📖 Leia a fonte completa: r/ClaudeAI
👀 See Also

Claude Code v2.1.153 lança Skip LFS, correções MCP e preenchimento automático do agente
Claude Code v2.1.153 adiciona opção skipLfs para evitar Git LFS, corrige loops de reconexão de servidores MCP e melhora o dispatch de agente com autocomplete nativo de comandos de barra.

Relatório da Anthropic Detalha Destilação em Massa do Claude por Empresas Chinesas de IA
A Anthropic publicou evidências de que DeepSeek, Moonshot AI e MiniMax usaram 24.000 contas falsas e mais de 16 milhões de interações para destilar as capacidades do Claude, comprometendo os mecanismos de segurança nos modelos copiados.
Qwen3 27B supera Gemma 4 26B em chamada de ferramentas no mundo real para pipeline de vídeo AI local
Um experimento de pipeline de vídeo com IA local mostra o Qwen3 27B lidando com chamadas de ferramentas de forma limpa, enquanto o Gemma 4 26B entrava em loops. Também aborda Said Image Turbo para geração local de imagens e orquestração OpenCode atingindo 174K de contexto.

Mark Zuckerberg Desenvolve Agente de IA para Assistência a CEOs
Mark Zuckerberg está construindo um agente de IA para auxiliar nas responsabilidades de CEO, de acordo com um relatório do Wall Street Journal discutido no Hacker News com 37 pontos e 30 comentários.