Grok 4.5 vs Claude Code: Mudanças Aceitas por Dólar É o Verdadeiro Benchmarck
O lançamento do Grok 4.5 do xAI (53% no DeepSWE 1.1 contra 59% do Opus 4.8, 29,0% pass@1 no SWE Marathon contra 26,0%, 80 tokens/seg a $2/M input, $6/M output) merece ser tratado como uma comparação prática com o Claude Code, não apenas mais uma alegação de ranking. A métrica certa para desenvolvedores que usam agentes de codificação de IA é mudanças aceitas por dólar com o mesmo repositório, prompt, permissões de ferramentas, comando de teste, tempo limite e padrão de revisão.
Detalhes Principais
O Grok 4.5 está disponível no Grok Build, Cursor e via API. Ele suporta modos de raciocínio baixo, médio e alto. No entanto, um teste de terceiros de 20 de julho (via The New Stack) executou Grok e Opus no modo Cursor Agent em três tarefas Rust idênticas:
- Correção de bug: Ambos passaram nos testes iniciais.
- Refatoração multi-arquivo: Ambos concluíram, mas o Opus tocou mais um arquivo.
- Construção de recurso (o teste mais prático): Ambos funcionaram, mas o Opus adicionou mais cobertura de testes e escreveu a entrada da página de manual.
Os toques extras do Opus importam para mudanças aceitas por dólar: um modelo mais barato que precisa de um ciclo extra de reparo pode não ser mais barato. A comunidade recomenda registrar: sucesso no teste inicial, ciclos de retrabalho, tokens de saída, tempo decorrido e correções do revisor.
Para Quem É
Qualquer pessoa que use Claude Code, Cursor ou Grok Build para codificação agentiva e queira avaliar o custo total das mudanças entregues.
📖 Leia a fonte completa: r/ClaudeAI
👀 See Also

Compreendendo a Ponderação de Diretrizes em LLMs: Por que o Claude às vezes ignora comandos
Uma investigação do Reddit revela como o Claude pode ignorar instruções explícitas como 'não faça correspondência de padrões' ao gerar revisões de código, demonstrando que as diretrizes de LLMs são contexto ponderado, não restrições.

Claude-Code v2.1.31 Lançamento: Principais Atualizações e Correções de Bugs
Claude-Code v2.1.31 foi lançado com melhorias importantes, incluindo dicas de retomada de sessão, suporte a IME japonês e correções de bugs para manipulação de PDF e solicitações de API.

A Atlassian Habilita a Coleta de Dados Padrão para Treinamento de IA
A Atlassian habilitou a coleta de dados padrão em seus produtos para treinar modelos de IA, de acordo com uma fonte publicada no Hacker News com 312 pontos e 75 comentários.

Do Prompting à Engenharia de Especificação: A Mudança para a Arquitetura Planejador-Executor
O desenvolvimento de IA está mudando de prompts baseados em chat simples para uma arquitetura planejador-trabalhador, onde humanos atuam como engenheiros de especificação. Isso requer definir critérios de aceitação rigorosos, arquitetura de restrições e padrões de decomposição para agentes de IA autônomos.