Opus 4.6 destaca-se em pesquisa, Gemini 3.1 Pro tem melhor julgamento em benchmark de previsão

Um usuário do Reddit publicou resultados de um benchmark comparando quatro modelos de fronteira — Claude Opus 4.6, GPT-5.4, Gemini 3.1 Pro e Grok 4.20 — em 1.417 questões de previsão binária de outubro a dezembro de 2025. A principal inovação é decompor o desempenho em duas condições de avaliação: agentiva (cada modelo realiza sua própria pesquisa na web usando ferramentas) e evidências fixas (todos os modelos recebem o mesmo dossiê de pesquisa de ~12.000 caracteres compilado pela metodologia de padronização Bosse et al. 2026).
Principais descobertas
- Opus 4.6 tem desempenho dramaticamente melhor na condição agentiva: é melhor em descobrir o que pesquisar, decidir quais páginas ler e extrair detalhes relevantes. No entanto, quando a pesquisa é removida, sua vantagem desaparece.
- Gemini 3.1 Pro oferece julgamento mais preciso sobre evidências fixas — pondera informações com mais precisão em tarefas de previsão. Sua calibração na verdade melhora quando recebe o dossiê padronizado, enquanto a calibração do Opus cai drasticamente.
- GPT-5.4 e Grok 4.20 quase não mudaram entre as condições, sugerindo que seu desempenho depende menos da estratégia de busca.
- A ordem de classificação inverteu entre Opus e Gemini nas condições, o que o autor argumenta indicar que a avaliação não é falha ou tendenciosa (uma avaliação tendenciosa provavelmente moveria todos os modelos na mesma direção).
Interpretação
A assimetria na calibração — a calibração do Opus cai quando a pesquisa é removida, enquanto a do Gemini melhora — sugere que o Opus pode estar usando seu traço de pesquisa como andaime para atribuição de probabilidade. Em outras palavras, o ato de conduzir o loop de pesquisa por si só faz parte do trabalho epistêmico, separado das informações que ele traz à tona. Esta é uma descoberta inovadora que pode ter implicações sobre como avaliamos e projetamos agentes de pesquisa de IA.
Limitações e recursos
Os dossiês de evidências fixas são eles próprios produzidos por LM, portanto o teste pode medir quão bem cada modelo interpreta uma versão padronizada específica das evidências, em vez de julgamento abstrato. O autor nota isso como uma limitação, mas argumenta que o comportamento divergente entre os modelos reduz a preocupação.
Pontuações completas de calibração, pontuações de refinamento e análise por condição estão disponíveis em: futuresearch.ai/opus-research-gemini-judgment. O benchmark e o leaderboard estão em: evals.futuresearch.ai.
Até onde o autor sabe, esta é a primeira avaliação direta de modelos de fronteira que decompõe o desempenho em estágios de pesquisa vs. julgamento. Eles convidam à replicação em outros domínios.
📖 Leia a fonte original: r/ClaudeAI
👀 See Also

Falhas de Memória do Claude Opus 4.6: Agente Esquece Tudo Exceto Renomear Arquivo
Um desenvolvedor documenta as 228 entradas de log, 95 ações de agente e 38 execuções de código do Claude Opus 4.6 que produziram apenas 1 memória: a string 'Agent Zero Tune-Up'.

SenseNova-U1-8B-MoT: Modelo Nativo Multimodal de Código Aberto com Arquitetura NEO-Unify
SenseNova lançou o SenseNova-U1-8B-MoT, um modelo multimodal nativo que elimina tanto o codificador visual quanto o VAE, usando a arquitetura NEO-Unify para compreensão, raciocínio e geração unificados. Ele se destaca em texto para infográficos, edição de imagens e geração intercalada de texto e imagem.

A Bolha de IA Não É Como a Bolha da Internet — Trabalhadores Não Vão Contrabandear IA Como Contrabandearam Planilhas
Cory Doctorow argumenta que a bolha de IA difere fundamentalmente da era pontocom: trabalhadores contrabandeavam ferramentas da internet para as redes corporativas porque elas ajudavam a fazer seus trabalhos. Ninguém está contrabandeando agentes de IA — eles estão sendo empurrados pela gerência.

Anthropic Esclarece Política de Uso do CLI Claude para Integração OpenClaw
A Anthropic confirmou que o uso do Claude CLI no estilo OpenClaw está permitido novamente, permitindo que os desenvolvedores reutilizem logins existentes do Claude CLI diretamente. A documentação detalha tanto os métodos de autenticação por chave de API quanto por CLI, juntamente com opções de configuração para os modelos Claude 4.6, modo rápido e cache de prompt.