Atualização do Ranking SWE-rebench: Resultados de fevereiro de 2026 mostram competição acirrada

Resultados do SWE-rebench de Fevereiro de 2026
O quadro de líderes SWE-rebench foi atualizado com as execuções de fevereiro de 2026 em 57 novas tarefas de PR do GitHub. A configuração segue a metodologia padrão do SWE-bench: os modelos leem problemas reais de PR, editam código, executam testes e devem fazer com que toda a suíte de testes passe. As tarefas são restritas a PRs criados no mês anterior.
Principais Resultados
- Claude Opus 4.6 permanece no topo com taxa de resolução de 65,3%, continuando a ditar o ritmo com um forte pass@5 (~70%)
- O nível superior é extremamente apertado: gpt-5.2-medium (64,4%), GLM-5 (62,8%) e gpt-5.4-medium (62,8%) estão todos a poucos pontos do líder
- Gemini 3.1 Pro Preview (62,3%) e DeepSeek-V3.2 (60,9%) completam um top-6 muito disputado
- Modelos de código aberto/híbridos continuam melhorando: Qwen3.5-397B (59,9%), Step-3.5-Flash (59,6%) e Qwen3-Coder-Next (54,4%) estão reduzindo a diferença, impulsionados pelo uso aprimorado de contexto longo e escalabilidade
- MiniMax M2.5 (54,6%) continua se destacando como uma opção econômica com desempenho competitivo
No geral, fevereiro mostra uma fronteira altamente competitiva, com vários modelos dentro de poucos pontos da liderança.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Claude Code v2.1.128: Isolamento OTEL, correções MCP, suporte a plugins .zip e mais de 20 correções de bugs
Claude Code v2.1.128 impede que subprocessos herdem variáveis de ambiente OTEL_*, adiciona suporte a plugins .zip, corrige inundação de reconexão MCP e corrige cancelamento de chamadas paralelas do shell.

Codex Conversa: O Sucessor do OpenClaw na Automação de IA
O Codex agora pode se comunicar consigo mesmo, anunciando uma nova era na automação impulsionada por IA e substituindo efetivamente o OpenClaw, o antigo líder.

As NPUs da AMD Ryzen AI Ganham Suporte para LLMs no Linux via Lemonade 10.0 e FastFlowLM
As NPUs AMD Ryzen AI agora suportam a execução de modelos de linguagem grandes no Linux através do servidor Lemonade 10.0 com o runtime FastFlowLM, exigindo kernel Linux 7.0 ou back-ports do driver AMDXDNA.

Limites de Taxa do Claude Code Podem Ser Devido à Sobrecarga da Janela de Contexto de 1M
Um usuário do Reddit teoriza que os limites de taxa e interrupções recentes do Claude Code resultam da janela de contexto de 1 milhão de tokens no Opus 4.6, que pode estar causando compressão de contexto ineficiente e sobrecarga do servidor. Mudar para o modelo mais antigo sem contexto de 1M aparentemente melhora a estabilidade.