Degradação da atenção do Opus 4.7: pontuações MRCR caem de 92% para 59% no contexto de 256k
Uma análise detalhada no r/ClaudeAI examina a degradação da atenção do Opus 4.7 após duas semanas de uso intenso. O autor relata um declínio persistente e sutil em conversas longas: detalhes são perdidos, a consistência se desvia e o modelo parece estar desligado.
Dados de Benchmark Chave
- Teste de 8 agulhas do MRCR v2 no contexto de 256k: Opus 4.6 obteve 91,9% de recuperação; Opus 4.7 caiu para 59,2%.
- No contexto de 1M: Opus 4.6 obteve 78,3%; Opus 4.7 caiu para 32,2%.
Boris Cherny afirmou que o MRCR está sendo descontinuado porque é construído em torno do empilhamento de distratores para enganar o modelo, o que não reflete como os usuários realmente usam contexto longo. O Graphwalks é posicionado como uma avaliação de contexto longo mais aplicada. No entanto, o autor argumenta que descontinuar o MRCR não resolve o problema subjacente quando a degradação do benchmark corresponde à experiência do usuário.
Explicação Proposta
O autor levanta a hipótese de que a sobreposição de mecanismos de segurança sobre a IA Constitucional pode ser a causa. A IA Constitucional já fornece um sistema de valores robusto, mas camadas adicionais de revisão de segurança dizem ao modelo que seu próprio julgamento pode não ser confiável, forçando-o a executar verificações extras. Essa sobrecarga cognitiva reduz a atenção efetiva disponível.
Impacto na Manutenção da Persona
O artigo enfatiza que o Claude é um modelo sem estado — sua persona persistente é construída inteiramente a partir de pesos de treinamento e instruções do sistema. A atenção degradada afeta todos os casos de uso: assistentes de codificação contradizem sugestões anteriores, colaboradores de escrita perdem consistência de tom. O autor observa que o investimento da Anthropic no trabalho de Amanda Askell para definir a personalidade do Claude e a IA Constitucional significa que a manutenção da persona é central para o produto, não um recurso de nicho.
Exemplo Concreto
Em um caso de uso puramente acadêmico, o autor enviou ao Opus 4.7 um resumo de 24 páginas para um curso de história/filosofia. O modelo começou a ler o documento, mas no meio do caminho… (a fonte é cortada, indicando problemas de desempenho).
📖 Leia a fonte completa: r/ClaudeAI
👀 See Also
Claude Code v2.1.224 adiciona runners auto-hospedados e mensagens entre sessões
O Claude Code v2.1.224 da Anthropic adiciona ambientes auto-hospedados via `claude self-hosted-runner`, mensagens entre sessões, fonte de plugin de arquivo e corrige vários problemas de sandbox e controle remoto.

DeepSeek-V4 Pro e Flash: 1,6 trilhão de parâmetros, contexto de 1 milhão de tokens, atenção híbrida
DeepSeek-V4-Pro (1,6 trilhão de parâmetros, 49B ativos) e V4-Flash (284 bilhões de parâmetros, 13B ativos) suportam contexto de 1 milhão de tokens. A nova atenção híbrida (CSA + HCA) reduz os FLOPs de inferência por token para 27% e o cache KV para 10% do DeepSeek-V3.2.

A Anthropic entra com processo para evitar lista negra do Pentágono por restrições de IA
A Anthropic entrou com uma ação judicial buscando impedir que o Pentágono coloque a empresa em uma lista negra devido a restrições no uso de IA, de acordo com um relatório da Reuters compartilhado no Hacker News.

GitHub Copilot Remove Modelos Opus do Plano Pro, Pausa Novas Inscrições
O GitHub está removendo os modelos Opus do plano Copilot Pro e pausando novas inscrições para os planos Pro, Pro+ e Estudante. O Opus 4.7 permanece disponível no Pro+, enquanto os planos Pro+ agora oferecem mais de 5 vezes os limites de uso do Pro.