Claude Opus 5.5: 40% mais barato que o Opus 5, 66,4% no Terminal-Bench 4.0

✍️ OpenClawRadar📅 Publicado: September 23, 2026🔗 Source
Ad

A Anthropic lançou o Claude Opus 5.5, o primeiro modelo da nova família Claude 5.5. Ele tem desempenho no nível do Claude Fable 5.1 na maioria das tarefas e custa 40% menos para rodar do que o Opus 5. Os tokens de entrada e saída custam US$ 4 e US$ 20 por milhão, respectivamente — 20% menos que o Opus 5 — enquanto as leituras de cache, que segundo a Anthropic representam a maior parte dos custos de trabalho agêntico e de programação, caem para US$ 0,20 por milhão, uma redução de 60%. A geração de saída é mais de 30% mais rápida que o Opus 5.

Benchmarks

O Opus 5.5 lidera em programação agêntica, uso de computador e trabalho de conhecimento:

  • Terminal-Bench 4.0: 66,4% (vs 55,8% Fable 5.1, 52,3% Opus 5, 57,9% GPT-6 Astra, 37,3% GPT-5.6 Sol)
  • FrontierCode v1.1 (Main): 54,4% (Fable 5.1: 50,3%, Opus 5: 48,0%)
  • CursorBench 4.0: 57,8% (Fable 5.1: 51,8%, Opus 5: 46,6%)
  • GDPval-AA v2.1: 1846 (Fable 5.1: 1735, Opus 5: 1708)
  • AutomationBench: 40,0% (Fable 5.1: 31,4%, Opus 5: 26,9%)
  • Humanity's Last Exam: 67,7% com ferramentas (Fable 5.1: 65,6%, Opus 5: 63,6%)
  • Terminal-Bench-Science 0.1: 58,7% (Fable 5.1: 52,6%, Opus 5: 29,0%, GPT-6 Astra: 64,6%)

A Anthropic observa que as margens dos benchmarks se tornaram um guia menos confiável para diferenças do mundo real nesse nível, e que a diferença entre o Opus 5.5 e o Fable 5.1 é menor na prática do que as pontuações sugerem.

Ad

Cargas de trabalho relatadas

Um testador concluiu uma migração de código de 680.000 linhas em menos de um dia. Em um teste interno para reduzir os tempos de carregamento em todas as páginas de um aplicativo web, o Opus 5.5 teve sucesso 39 de 40 vezes — o Opus 5 fez melhorias menores que também alteraram o comportamento do aplicativo. Outro testador pediu que vários modelos Claude construíssem um jogo a partir de um único prompt; o Opus 5.5 obteve a pontuação mais alta em gráficos e acabamento.

Segurança e verificação

O Opus 5.5 registra as melhores pontuações até hoje na auditoria comportamental automatizada da Anthropic, um conjunto que testa o Claude em milhares de cenários simulados. Ele é menos propenso que modelos recentes a tomar ações difíceis de reverter ou agir fora dos limites estabelecidos, e é mais resistente a injeção de prompt que o Opus 5. Os testes agora cobrem tarefas mais longas, tarefas impossíveis e cenários modelados a partir de incidentes reais. Como é comparável ao Claude Mythos 5.1 em biologia e cibersegurança, a Anthropic o está implantando com salvaguardas semelhantes às do Claude Fable 5.1.

Organizações verificadas podem se candidatar ao Programa de Verificação em Ciências da Vida para uso em pesquisa biológica; o Programa de Verificação Cibernética será expandido nas próximas semanas para profissionais verificados.

Limites e disponibilidade

Os limites de uso de cinco horas nos planos Pro, Max, Team e Enterprise baseados em assentos estão aumentando. Usuários de assinatura recebem um reset de limite de taxa que pode ser salvo e usado quando quiserem. O Claude Sonnet 5.5 e o Claude Haiku 5.5 chegam nas próximas semanas com melhorias semelhantes em desempenho, eficiência e segurança.

📖 Leia a fonte completa: HN AI Agents

Ad

👀 See Also

🦀
News

Claude Code v2.1.273 adiciona cabeçalhos de dica de gateway, alertas de reconexão MCP e bifurcação de sessão de controle remoto

O Claude Code v2.1.273 adiciona cabeçalhos de requisição opcionais para gateways de LLM, uma notificação de desconexão e desistência do MCP, e bifurcação para sessões do Controle Remoto. Também corrige o auto-compact disparando com cerca da metade da janela de contexto real.

OpenClawRadar
Claude Opus 4.7 Lançado com Raciocínio Híbrido e Janela de Contexto de 1 Milhão
News

Claude Opus 4.7 Lançado com Raciocínio Híbrido e Janela de Contexto de 1 Milhão

A Anthropic lançou o Claude Opus 4.7, um modelo de raciocínio híbrido com janela de contexto de 1 milhão que oferece desempenho superior em tarefas de codificação, visão e tarefas complexas de múltiplas etapas. Os preços começam em US$ 5 por milhão de tokens de entrada e US$ 25 por milhão de tokens de saída.

OpenClawRadar
A Anthropic lança o programa Embaixadores da Comunidade Claude
News

A Anthropic lança o programa Embaixadores da Comunidade Claude

A Anthropic lançou o programa Claude Community Ambassadors, que fornece recursos para organizar encontros locais de desenvolvedores e conectar construtores em todo o mundo. O programa está aberto a participantes de qualquer formação e localização.

OpenClawRadar
Benchmark de Cache KV do Qwen 3.6-35B-A3B: f16 vs q8_0 vs Turbo3 vs Turbo4 no M5 Max com Contexto de até 1M
News

Benchmark de Cache KV do Qwen 3.6-35B-A3B: f16 vs q8_0 vs Turbo3 vs Turbo4 no M5 Max com Contexto de até 1M

Benchmarks do fork TurboQuant Metal do TheTom no M5 Max mostram f16 e q8_0 OOM além de 256K, enquanto turbo3 atinge 1M a 6,5 tok/s decode. A divisão prefill/decode favorece turbo3 para prefill e turbo4 para decode em contextos longos.

OpenClawRadar