Benchmark de Esforço de Raciocínio do Opus 4.7: Médio Supera Alto e Máximo em Tarefas Reais

✍️ OpenClawRadar📅 Publicado: May 13, 2026🔗 Source
Ad

O usuário do Reddit ktane testou o Claude Opus 4.7 no Claude Code em cinco configurações de esforço de raciocínio (baixo, médio, alto, muito alto, máximo) em 29 tarefas reais do repositório open-source GraphQL-go-tools. O resultado: o esforço médio de raciocínio superou consistentemente as configurações mais altas em taxa de aprovação de testes, equivalência semântica com patches humanos, taxa de aprovação em revisão de código e pontuações agregadas de craft/disciplina.

Ad

Resultados Principais

  • Taxa de aprovação em todas as tarefas: Médio 28/29, Máximo 27/29, Alto 26/29, Muito Alto 25/29, Baixo 23/29
  • Patches equivalentes: Médio 14/29, Máximo 13/29, Alto 12/29, Muito Alto 11/29, Baixo 10/29
  • Taxa de aprovação em revisão de código: Médio 10/29, Alto 7/29, Máximo 8/29, Muito Alto 4/29, Baixo 5/29
  • Média da rubrica de revisão de código: Médio 2.716, Alto 2.509, Muito Alto 2.482, Máximo 2.431, Baixo 2.426
  • Risco de footprint (quanto menor, melhor): Baixo 0.155, Médio 0.189, Alto 0.206, Máximo 0.227, Muito Alto 0.238
  • Custo por tarefa: Baixo $2.50, Médio $3.15, Alto $5.01, Muito Alto $6.51, Máximo $8.84
  • Duração por tarefa: Baixo 383.8s, Médio 450.7s, Alto 716.4s, Muito Alto 803.8s, Máximo 996.9s
  • Passes equivalentes por dólar: Baixo 4.0, Médio 4.4, Alto 2.4, Muito Alto 1.7, Máximo 1.5

O autor observa que o Opus 4.7 usa pensamento adaptativo — ele já aloca orçamento de raciocínio por tarefa. O botão de esforço, portanto, influencia uma política já adaptativa, em vez de adicionar inteligência bruta. Notavelmente, em um PR (#1260), as configurações alta e muito alta desperdiçaram raciocínio extra procurando hashes de commits de PRs anteriores e concluíram que 'nenhum trabalho necessário', enquanto a média e a máxima leram corretamente o fluxo de controle e produziram uma correção.

Isso contrasta com o GPT-5.5 no Codex, que mostrou a curva monotônica intuitiva onde mais raciocínio melhorava a qualidade. O relatório interativo completo com detalhamentos por tarefa está disponível em stet.sh.

📖 Leia a fonte completa: r/ClaudeAI

Ad

👀 See Also

Richard Dawkins acredita que seu chatbot Claude AI é consciente: A ilusão Claude no HN
News

Richard Dawkins acredita que seu chatbot Claude AI é consciente: A ilusão Claude no HN

Richard Dawkins supostamente acredita que seu chatbot de IA feminino (Claude) é consciente, gerando uma discussão no HN com 57 pontos e 66 comentários.

OpenClawRadar
Harmonic-9B: Ajuste fino em duas etapas do Qwen3.5-9B para agentes de IA
News

Harmonic-9B: Ajuste fino em duas etapas do Qwen3.5-9B para agentes de IA

O desenvolvedor DJLougen lançou o Harmonic-9B, um fine-tune do Qwen3.5-9B otimizado para uso em agentes com uma abordagem de treinamento em duas etapas. A Etapa 1 (raciocínio pesado) está completa, enquanto a Etapa 2 (chamada leve de ferramentas) ainda está em treinamento. Versões quantizadas GGUF já estão disponíveis.

OpenClawRadar
Google's TimesFM 2.5: modelo de séries temporais com 200 milhões de parâmetros e contexto de 16k
News

Google's TimesFM 2.5: modelo de séries temporais com 200 milhões de parâmetros e contexto de 16k

O Google Research lançou o TimesFM 2.5, um modelo de base com apenas decodificador de 200 milhões de parâmetros para previsão de séries temporais, com comprimento de contexto de 16k e previsão de quantis contínuos até o horizonte de 1k.

OpenClawRadar
Fable 5 vence na detecção de fraudes do mundo real: Família Claude 4.x vs GPT-5.5 comparados
News

Fable 5 vence na detecção de fraudes do mundo real: Família Claude 4.x vs GPT-5.5 comparados

Cinco modelos de fronteira (Fable 5, Opus 4.8, Sonnet 4.6, Haiku 4.5, GPT-5.5-high) receberam o mesmo prompt frio para auditar campanhas de crowdfunding ao vivo em zooid.fund. Apenas o Fable 5 verificou alegações na web aberta, detectando criadores duplicados e eventos reais.

OpenClawRadar