Claude Opus 4.1 marca 17,75% no conjunto de dados privado do SWE-Bench Pro, destacando a lacuna entre memorização e raciocínio.

✍️ OpenClawRadar📅 Publicado: March 9, 2026🔗 Source
Claude Opus 4.1 marca 17,75% no conjunto de dados privado do SWE-Bench Pro, destacando a lacuna entre memorização e raciocínio.
Ad

Resultados de benchmark mostram lacuna significativa de desempenho

Claude Opus 4.1 alcançou mais de 80% no SWE-Bench Verified, mas marcou apenas 17,75% no conjunto de dados privado do SWE-Bench Pro. Este conjunto contém 276 tarefas de 18 bases de código proprietárias de startups que nunca estiveram no GitHub, especificamente projetadas para eliminar contaminação de dados através de repositórios públicos licenciados pela GPL.

Outros resultados de modelos no mesmo conjunto de dados privado: GPT-5.2 marcou 23,81% (liderando o ranking) e Gemini 3 Pro marcou 17,95%.

Análise de trajetória revela comportamento de memorização

A análise da Scale AI descobriu que, durante os testes, os modelos conseguiam identificar os caminhos corretos dos arquivos para modificar antes de ler completamente as descrições dos problemas em repositórios familiares. Isso indica que eles estavam navegando por memória em vez de raciocinar através dos problemas.

A pontuação de 80% no SWE-Bench Verified era real, mas media uma capacidade diferente da que a maioria das pessoas presumia - principalmente memória dos dados de treinamento em vez de raciocínio sobre código novo.

Ad

Implicações práticas para a implantação de ferramentas de codificação com IA

Para desenvolvedores decidindo onde implantar ferramentas de codificação com IA em seu fluxo de trabalho, a distinção entre memória e raciocínio importa mais do que os números de benchmark em manchetes. Modelos que se saem bem em benchmarks contaminados podem ter dificuldades com bases de código verdadeiramente novas que não viram durante o treinamento.

O SWE-Bench Pro foi criado especificamente para abordar essa questão de contaminação usando código que nunca esteve publicamente disponível no GitHub ou em conjuntos de dados de treinamento.

📖 Leia a fonte completa: r/ClaudeAI

Ad

👀 See Also

AI Está Me Tornando Burro: A Confissão de um Desenvolvedor sobre Atrofia de Habilidades
News

AI Está Me Tornando Burro: A Confissão de um Desenvolvedor sobre Atrofia de Habilidades

James Pain confessa que depois de um ano ou dois usando IA exclusivamente para programação (sem código escrito à mão), ele esqueceu quase completamente como programar. Agora está se ensinando a programar manualmente novamente e alerta que o uso intenso de IA pode corroer as habilidades de escrita e programação.

OpenClawRadar
Anthropic lança currículo educacional gratuito incluindo cursos Claude Code e MCP Mastery
News

Anthropic lança currículo educacional gratuito incluindo cursos Claude Code e MCP Mastery

A Anthropic disponibilizou todo o seu currículo educacional gratuitamente, incluindo cursos sobre Claude Code, MCP Mastery, uso de API e Fluência em IA. O currículo é descrito como de nível universitário e oferece aprendizado estruturado em comparação com tutoriais aleatórios.

OpenClawRadar
Desenvolvedor troca Cursor Composer 2 e Kimi 2.6 pelo Qwen3.6:35b-a3b para cargas de trabalho empresariais
News

Desenvolvedor troca Cursor Composer 2 e Kimi 2.6 pelo Qwen3.6:35b-a3b para cargas de trabalho empresariais

Um desenvolvedor relata o uso do Qwen3.6:35b-a3b para o trabalho diário em um conjunto de software empresarial de 500-700k LOC, citando desempenho superior ao Kimi 2.6 e DeepSeek 4 Pro/Flash, com custos de ~$0,08/1M tokens no OpenRouter.

OpenClawRadar
OpenClaw v2026.7.1: Reformulação da Interface de Controle, Integração, Aplicativos Móveis, GPT-5.6, Tencent Hy3, Meta Muse Spark 1.1
News

OpenClaw v2026.7.1: Reformulação da Interface de Controle, Integração, Aplicativos Móveis, GPT-5.6, Tencent Hy3, Meta Muse Spark 1.1

OpenClaw v2026.7.1 traz uma grande reformulação na UI de Controle, onboarding redesenhado, aplicativos iOS/Android/macOS atualizados, compatibilidade com GPT-5.6, suporte a Tencent Hy3 e Meta Muse Spark 1.1, e fluxos de trabalho aprimorados para Codex e agentes de código.

OpenClawRadar