O benchmark IDP Leaderboard mostra que o Claude Sonnet 4.6 iguala o Opus 4.6 em tarefas de IA para documentos.

✍️ OpenClawRadar📅 Publicado: March 11, 2026🔗 Source
O benchmark IDP Leaderboard mostra que o Claude Sonnet 4.6 iguala o Opus 4.6 em tarefas de IA para documentos.
Ad

O IDP Leaderboard, um benchmark aberto para IA de documentos, publicou resultados comparando os modelos Claude em tarefas de processamento de documentos. O benchmark testou 16 modelos em várias categorias usando mais de 9.000 documentos reais.

Resultados do Benchmark

As pontuações dos modelos Claude no IDP Leaderboard:

  • Claude Sonnet 4.6: 80,8 no geral
  • Claude Opus 4.6: 80,3 no geral
  • Claude Haiku 4.5: 69,6 no geral

Sonnet e Opus tiveram desempenho essencialmente equivalente em tarefas de extração, incluindo texto, tabelas, fórmulas e análise de layout. Os gráficos de radar de ambos os modelos são idênticos de acordo com os resultados do benchmark.

Comparação de Custos

A fonte observa diferenças significativas de custo:

  • Sonnet custa US$ 24 por 1.000 páginas
  • Opus custa US$ 40 por 1.000 páginas

Para cargas de trabalho de processamento de documentos, o benchmark sugere que não há motivo para usar o Opus, considerando o desempenho equivalente a um custo menor.

Ad

Advertência Importante

Uma descoberta notável: os modelos Claude tinham moderação de conteúdo mais rigorosa, o que afetou o desempenho em certos tipos de documentos. Digitalizações de jornais antigos, páginas de livros didáticos e documentos históricos às vezes acionaram filtros de conteúdo. Esse problema só apareceu nos benchmarks OlmOCR e OmniDoc.

Todas as previsões do benchmark estão visíveis no Results Explorer em idp-leaderboard.org, onde você pode ver exatamente o que cada modelo Claude produziu em cada documento.

📖 Leia a fonte completa: r/ClaudeAI

Ad

👀 See Also

Claude Code v2.1.160: Prompts de Segurança para Config do Shell, Proteção de Arquivos acceptEdits e Dezenas de Correções de Bugs
News

Claude Code v2.1.160: Prompts de Segurança para Config do Shell, Proteção de Arquivos acceptEdits e Dezenas de Correções de Bugs

A Anthropic lançou o Claude Code v2.1.160 com prompts de segurança antes de escrever em arquivos de inicialização do shell e configurações de ferramentas de build no modo acceptEdits, suporte aprimorado à área de transferência no Windows e correção de perda de histórico de sessão.

OpenClawRadar
Claude Code v2.1.158: Modo Auto Agora no Bedrock, Vertex, Foundry para Opus 4.7/4.8
News

Claude Code v2.1.158: Modo Auto Agora no Bedrock, Vertex, Foundry para Opus 4.7/4.8

Claude Code v2.1.158 ativa o modo automático no Bedrock, Vertex e Foundry para Opus 4.7 e 4.8. Ative com CLAUDE_CODE_ENABLE_AUTO_MODE=1.

OpenClawRadar
Claude Opus 4.7: Alterações no Prompt do Sistema: Renomeação da Plataforma, Integração de Ferramentas e Atualizações Comportamentais
News

Claude Opus 4.7: Alterações no Prompt do Sistema: Renomeação da Plataforma, Integração de Ferramentas e Atualizações Comportamentais

A Anthropic atualizou o prompt do sistema Claude Opus da versão 4.6 (5 de fevereiro de 2026) para a 4.7 (16 de abril de 2026), renomeando a 'plataforma de desenvolvedor' para 'Plataforma Claude', adicionando o Claude no Powerpoint à lista de ferramentas, expandindo as instruções de segurança infantil e implementando novas diretrizes comportamentais para uso de ferramentas e concisão nas respostas.

OpenClawRadar
Databricks reduz custos de codificação de IA em 70%: flexibilidade de modelos, código aberto e a fronteira de eficiência
News

Databricks reduz custos de codificação de IA em 70%: flexibilidade de modelos, código aberto e a fronteira de eficiência

A Databricks reduziu os gastos com codificação de IA em 70% ao adotar rapidamente modelos de código aberto eficientes, criar benchmarks internos e impor flexibilidade de modelos. Principais alavancas: implantação do GLM e recusa do Opus 5.0 devido a regressões de custo.

OpenClawRadar