Atualização do Ranking SWE-rebench: Resultados de fevereiro de 2026 mostram competição acirrada

✍️ OpenClawRadar📅 Publicado: March 23, 2026🔗 Source
Atualização do Ranking SWE-rebench: Resultados de fevereiro de 2026 mostram competição acirrada
Ad

Resultados do SWE-rebench de Fevereiro de 2026

O quadro de líderes SWE-rebench foi atualizado com as execuções de fevereiro de 2026 em 57 novas tarefas de PR do GitHub. A configuração segue a metodologia padrão do SWE-bench: os modelos leem problemas reais de PR, editam código, executam testes e devem fazer com que toda a suíte de testes passe. As tarefas são restritas a PRs criados no mês anterior.

Ad

Principais Resultados

  • Claude Opus 4.6 permanece no topo com taxa de resolução de 65,3%, continuando a ditar o ritmo com um forte pass@5 (~70%)
  • O nível superior é extremamente apertado: gpt-5.2-medium (64,4%), GLM-5 (62,8%) e gpt-5.4-medium (62,8%) estão todos a poucos pontos do líder
  • Gemini 3.1 Pro Preview (62,3%) e DeepSeek-V3.2 (60,9%) completam um top-6 muito disputado
  • Modelos de código aberto/híbridos continuam melhorando: Qwen3.5-397B (59,9%), Step-3.5-Flash (59,6%) e Qwen3-Coder-Next (54,4%) estão reduzindo a diferença, impulsionados pelo uso aprimorado de contexto longo e escalabilidade
  • MiniMax M2.5 (54,6%) continua se destacando como uma opção econômica com desempenho competitivo

No geral, fevereiro mostra uma fronteira altamente competitiva, com vários modelos dentro de poucos pontos da liderança.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also