Opus 4.6 destaca-se em pesquisa, Gemini 3.1 Pro tem melhor julgamento em benchmark de previsão

✍️ OpenClawRadar📅 Publicado: May 7, 2026🔗 Source
Opus 4.6 destaca-se em pesquisa, Gemini 3.1 Pro tem melhor julgamento em benchmark de previsão
Ad

Um usuário do Reddit publicou resultados de um benchmark comparando quatro modelos de fronteira — Claude Opus 4.6, GPT-5.4, Gemini 3.1 Pro e Grok 4.20 — em 1.417 questões de previsão binária de outubro a dezembro de 2025. A principal inovação é decompor o desempenho em duas condições de avaliação: agentiva (cada modelo realiza sua própria pesquisa na web usando ferramentas) e evidências fixas (todos os modelos recebem o mesmo dossiê de pesquisa de ~12.000 caracteres compilado pela metodologia de padronização Bosse et al. 2026).

Principais descobertas

  • Opus 4.6 tem desempenho dramaticamente melhor na condição agentiva: é melhor em descobrir o que pesquisar, decidir quais páginas ler e extrair detalhes relevantes. No entanto, quando a pesquisa é removida, sua vantagem desaparece.
  • Gemini 3.1 Pro oferece julgamento mais preciso sobre evidências fixas — pondera informações com mais precisão em tarefas de previsão. Sua calibração na verdade melhora quando recebe o dossiê padronizado, enquanto a calibração do Opus cai drasticamente.
  • GPT-5.4 e Grok 4.20 quase não mudaram entre as condições, sugerindo que seu desempenho depende menos da estratégia de busca.
  • A ordem de classificação inverteu entre Opus e Gemini nas condições, o que o autor argumenta indicar que a avaliação não é falha ou tendenciosa (uma avaliação tendenciosa provavelmente moveria todos os modelos na mesma direção).
Ad

Interpretação

A assimetria na calibração — a calibração do Opus cai quando a pesquisa é removida, enquanto a do Gemini melhora — sugere que o Opus pode estar usando seu traço de pesquisa como andaime para atribuição de probabilidade. Em outras palavras, o ato de conduzir o loop de pesquisa por si só faz parte do trabalho epistêmico, separado das informações que ele traz à tona. Esta é uma descoberta inovadora que pode ter implicações sobre como avaliamos e projetamos agentes de pesquisa de IA.

Limitações e recursos

Os dossiês de evidências fixas são eles próprios produzidos por LM, portanto o teste pode medir quão bem cada modelo interpreta uma versão padronizada específica das evidências, em vez de julgamento abstrato. O autor nota isso como uma limitação, mas argumenta que o comportamento divergente entre os modelos reduz a preocupação.

Pontuações completas de calibração, pontuações de refinamento e análise por condição estão disponíveis em: futuresearch.ai/opus-research-gemini-judgment. O benchmark e o leaderboard estão em: evals.futuresearch.ai.

Até onde o autor sabe, esta é a primeira avaliação direta de modelos de fronteira que decompõe o desempenho em estágios de pesquisa vs. julgamento. Eles convidam à replicação em outros domínios.

📖 Leia a fonte original: r/ClaudeAI

Ad

👀 See Also

Ferramentas de IA Aumentam a Carga de Trabalho em Engenharia e Transformam Funções Profissionais
News

Ferramentas de IA Aumentam a Carga de Trabalho em Engenharia e Transformam Funções Profissionais

Um estudo da Harvard Business Review de fevereiro de 2026 descobriu que 83% dos trabalhadores relataram aumento na carga de trabalho devido a ferramentas de IA, com 62% experimentando esgotamento. O artigo descreve como a IA mudou os papéis da engenharia de escrever código para revisar código gerado por IA.

OpenClawRadar
Claude Code v2.1.218 Corrige /code-review, Autenticação MCP, Corrupção de Caminho no Windows
News

Claude Code v2.1.218 Corrige /code-review, Autenticação MCP, Corrupção de Caminho no Windows

Claude Code v2.1.218 traz /code-review como subagente em segundo plano, corrige corrupção de caminhos no Windows com prefixo \u, melhora suporte a leitores de tela e corrige contagem excessiva na autenticação MCP.

OpenClawRadar
Administração Trump autoriza modelo de IA Mythos da Anthropic para uso governamental
News

Administração Trump autoriza modelo de IA Mythos da Anthropic para uso governamental

A administração Trump autorizou a Anthropic a lançar seu modelo de IA Mythos para empresas e agências governamentais selecionadas, conforme relatos da CNBC.

OpenClawRadar
Claude-Code v2.1.79 adiciona controle remoto, corrige travamentos de subprocessos e melhora o uso de memória
News

Claude-Code v2.1.79 adiciona controle remoto, corrige travamentos de subprocessos e melhora o uso de memória

O Claude-Code v2.1.79 introduz um comando /remote-control para o VSCode para conectar sessões ao claude.ai/code, corrige o travamento do claude -p em subprocessos e reduz o uso de memória na inicialização em aproximadamente 18MB. A versão também adiciona uma flag --console para autenticação no Anthropic Console e melhora o tratamento de timeouts da API.

OpenClawRadar