O benchmark IDP Leaderboard mostra que o Claude Sonnet 4.6 iguala o Opus 4.6 em tarefas de IA para documentos.

O IDP Leaderboard, um benchmark aberto para IA de documentos, publicou resultados comparando os modelos Claude em tarefas de processamento de documentos. O benchmark testou 16 modelos em várias categorias usando mais de 9.000 documentos reais.
Resultados do Benchmark
As pontuações dos modelos Claude no IDP Leaderboard:
- Claude Sonnet 4.6: 80,8 no geral
- Claude Opus 4.6: 80,3 no geral
- Claude Haiku 4.5: 69,6 no geral
Sonnet e Opus tiveram desempenho essencialmente equivalente em tarefas de extração, incluindo texto, tabelas, fórmulas e análise de layout. Os gráficos de radar de ambos os modelos são idênticos de acordo com os resultados do benchmark.
Comparação de Custos
A fonte observa diferenças significativas de custo:
- Sonnet custa US$ 24 por 1.000 páginas
- Opus custa US$ 40 por 1.000 páginas
Para cargas de trabalho de processamento de documentos, o benchmark sugere que não há motivo para usar o Opus, considerando o desempenho equivalente a um custo menor.
Advertência Importante
Uma descoberta notável: os modelos Claude tinham moderação de conteúdo mais rigorosa, o que afetou o desempenho em certos tipos de documentos. Digitalizações de jornais antigos, páginas de livros didáticos e documentos históricos às vezes acionaram filtros de conteúdo. Esse problema só apareceu nos benchmarks OlmOCR e OmniDoc.
Todas as previsões do benchmark estão visíveis no Results Explorer em idp-leaderboard.org, onde você pode ver exatamente o que cada modelo Claude produziu em cada documento.
📖 Leia a fonte completa: r/ClaudeAI
👀 See Also

Claude Code v2.1.160: Prompts de Segurança para Config do Shell, Proteção de Arquivos acceptEdits e Dezenas de Correções de Bugs
A Anthropic lançou o Claude Code v2.1.160 com prompts de segurança antes de escrever em arquivos de inicialização do shell e configurações de ferramentas de build no modo acceptEdits, suporte aprimorado à área de transferência no Windows e correção de perda de histórico de sessão.

Claude Code v2.1.158: Modo Auto Agora no Bedrock, Vertex, Foundry para Opus 4.7/4.8
Claude Code v2.1.158 ativa o modo automático no Bedrock, Vertex e Foundry para Opus 4.7 e 4.8. Ative com CLAUDE_CODE_ENABLE_AUTO_MODE=1.

Claude Opus 4.7: Alterações no Prompt do Sistema: Renomeação da Plataforma, Integração de Ferramentas e Atualizações Comportamentais
A Anthropic atualizou o prompt do sistema Claude Opus da versão 4.6 (5 de fevereiro de 2026) para a 4.7 (16 de abril de 2026), renomeando a 'plataforma de desenvolvedor' para 'Plataforma Claude', adicionando o Claude no Powerpoint à lista de ferramentas, expandindo as instruções de segurança infantil e implementando novas diretrizes comportamentais para uso de ferramentas e concisão nas respostas.

Databricks reduz custos de codificação de IA em 70%: flexibilidade de modelos, código aberto e a fronteira de eficiência
A Databricks reduziu os gastos com codificação de IA em 70% ao adotar rapidamente modelos de código aberto eficientes, criar benchmarks internos e impor flexibilidade de modelos. Principais alavancas: implantação do GLM e recusa do Opus 5.0 devido a regressões de custo.