Claude Opus 4.1 marca 17,75% no conjunto de dados privado do SWE-Bench Pro, destacando a lacuna entre memorização e raciocínio.

Resultados de benchmark mostram lacuna significativa de desempenho
Claude Opus 4.1 alcançou mais de 80% no SWE-Bench Verified, mas marcou apenas 17,75% no conjunto de dados privado do SWE-Bench Pro. Este conjunto contém 276 tarefas de 18 bases de código proprietárias de startups que nunca estiveram no GitHub, especificamente projetadas para eliminar contaminação de dados através de repositórios públicos licenciados pela GPL.
Outros resultados de modelos no mesmo conjunto de dados privado: GPT-5.2 marcou 23,81% (liderando o ranking) e Gemini 3 Pro marcou 17,95%.
Análise de trajetória revela comportamento de memorização
A análise da Scale AI descobriu que, durante os testes, os modelos conseguiam identificar os caminhos corretos dos arquivos para modificar antes de ler completamente as descrições dos problemas em repositórios familiares. Isso indica que eles estavam navegando por memória em vez de raciocinar através dos problemas.
A pontuação de 80% no SWE-Bench Verified era real, mas media uma capacidade diferente da que a maioria das pessoas presumia - principalmente memória dos dados de treinamento em vez de raciocínio sobre código novo.
Implicações práticas para a implantação de ferramentas de codificação com IA
Para desenvolvedores decidindo onde implantar ferramentas de codificação com IA em seu fluxo de trabalho, a distinção entre memória e raciocínio importa mais do que os números de benchmark em manchetes. Modelos que se saem bem em benchmarks contaminados podem ter dificuldades com bases de código verdadeiramente novas que não viram durante o treinamento.
O SWE-Bench Pro foi criado especificamente para abordar essa questão de contaminação usando código que nunca esteve publicamente disponível no GitHub ou em conjuntos de dados de treinamento.
📖 Leia a fonte completa: r/ClaudeAI
👀 See Also

Claude Code v2.1.205: Bloqueio de adulteração de transcrições, correções no esquema JSON e melhorias no modo automático
Claude Code v2.1.205 adiciona regra no modo automático que bloqueia adulteração de transcrições de sessão, corrige problemas com esquemas JSON grandes, melhora o manuseio de agentes em segundo plano e otimiza atualizações binárias.

O modelo ternário Bonsai 1.7B atinge 442 T/s no M4 Max com kernels Metal ajustados autonomamente
O agente autônomo ata otimizou kernels Metal para Bonsai 1.7B Q2_0, alcançando 442 t/s decodificação (+42%) e 4622 t/s prefill (+9%) no M4 Max vs llama.cpp não modificado.

Claude Code v2.1.198: Chrome GA, Notificações de Agente, /dataviz e AWS Gateway
A Anthropic lançou o Claude Code v2.1.198 com a extensão Chrome GA, notificações de agentes em segundo plano, uma nova habilidade /dataviz e a Claude Platform na AWS como provedor de failover.

O OpenRouter confirma que os modelos Alfa Hunter/Healer são variantes do MiMo V2
Os modelos anteriormente sigilosos Hunter Alpha e Healer Alpha do OpenRouter foram confirmados como variantes do MiMo V2. O Hunter Alpha é o modelo de raciocínio apenas em texto MiMo V2 Pro com janela de contexto de 1M, enquanto o Healer Alpha é o modelo de raciocínio texto+imagem MiMo V2 Omni com janela de contexto de 262K.