SWE-CI: Novos Testes de Referência Avaliam Agentes de IA na Manutenção de Código de Longo Prazo via CI

O que o SWE-CI Realmente Faz
O SWE-CI é o primeiro benchmark em nível de repositório construído sobre o ciclo de Integração Contínua. Ele visa mudar o paradigma de avaliação para geração de código da correção funcional estática e de curto prazo para a manutenibilidade dinâmica e de longo prazo.
Detalhes Principais do Artigo
O benchmark compreende 100 tarefas, cada uma correspondendo em média a:
- Histórico de evolução abrangendo 233 dias
- 71 commits consecutivos em um repositório de código do mundo real
O SWE-CI exige que os agentes resolvam sistematicamente essas tarefas através de dezenas de rodadas de análise e iterações de codificação. Isso aborda uma lacuna nos métodos de avaliação atuais: enquanto agentes baseados em LLM demonstraram fortes capacidades na automação de tarefas de engenharia de software, como correção estática de bugs (como mostrado por benchmarks como o SWE-bench), o desenvolvimento do mundo real envolve mudanças complexas de requisitos e iterações de recursos de longo prazo que os paradigmas de reparo estático e único não conseguem capturar.
O artigo observa especificamente que o SWE-CI fornece insights valiosos sobre o quão bem os agentes podem sustentar a qualidade do código ao longo da evolução de longo prazo. Isso vai além da simples correção de bugs para avaliar como os agentes lidam com a natureza iterativa do desenvolvimento de software real.
Contexto Técnico
Esse tipo de benchmark é significativo porque a maioria das avaliações atuais de agentes de codificação com IA se concentra em correções únicas ou problemas de codificação isolados. A abordagem baseada em CI do SWE-CI reflete melhor como o desenvolvimento realmente acontece em projetos de software maduros, onde as mudanças se acumulam ao longo do tempo e devem manter compatibilidade com os sistemas existentes.
Para desenvolvedores que usam agentes de codificação com IA, esse benchmark pode ajudar a identificar quais agentes são mais adequados para a manutenção de projetos de longo prazo versus correções rápidas. A natureza multi-rodada e iterativa das tarefas testa persistência e consistência - qualidades que importam ao integrar assistência de IA em fluxos de trabalho de desenvolvimento em andamento.
📖 Leia a fonte completa: HN AI Agents
👀 See Also

Plugin de Canal Personalizado do WhatsApp para Claude Code Usando Baileys
Um desenvolvedor criou um plugin de canal personalizado que adiciona suporte ao WhatsApp no Claude Code 2.1.80+ usando Baileys v7, implementando o protocolo WhatsApp Web Multi-Device como um servidor MCP com a capacidade experimental claude/channel.

Claude Octopus v8.48: Plugin de Orquestração Multi-IA para Fluxos de Trabalho de Desenvolvimento
Claude Octopus v8.48 é um plugin de código aberto que orquestra os modelos de IA Claude, Codex e Gemini em paralelo com funções distintas nas fases de desenvolvimento. Inclui um portão de consenso de 75% entre as fases, janelas de contexto novas para tarefas complexas e comandos específicos como /octo:embrace para desenvolvimento de ciclo de vida completo.

Servidor MCP para contexto de base de código empacotada em profundidade
Um novo servidor MCP empacota contexto de base de código em 5 níveis de profundidade dentro de orçamentos de tokens, abordando o problema em que agentes de IA para programação ou carregam poucos arquivos ou obtêm mapas de repositório planos sem conteúdo real.

O plano de codificação mensal de US$ 10 da Alibaba oferece acesso de alto volume a múltiplos modelos de IA para usuários do OpenClaw.
Por US$ 10 por mês, o plano da Alibaba oferece acesso aos modelos Qwen3.5-Plus, Kimi-K2.5, GLM-5 e MiniMax-M2.5 com cotas de 1.200 solicitações a cada 5 horas, 9.000 por semana e 18.000 por mês.