Benchmark mostra que o mecanismo de contexto reduz custos de agentes de IA para codificação em 3x no SWE-bench

✍️ OpenClawRadar📅 Publicado: March 23, 2026🔗 Source
Benchmark mostra que o mecanismo de contexto reduz custos de agentes de IA para codificação em 3x no SWE-bench
Ad

Um desenvolvedor avaliou quatro agentes de IA para codificação no SWE-bench Verified usando o mesmo modelo Claude Opus 4.5, com o gerenciamento de contexto como única variável. Os resultados mostram diferenças significativas de custo para níveis de desempenho similares.

Configuração do benchmark

O teste usou um subconjunto estratificado de 100 tarefas do SWE-bench Verified com todos os 12 repositórios representados proporcionalmente. Todos os agentes executaram Claude Opus 4.5 com o mesmo orçamento de $3/tarefa e limite de 250 interações. A única diferença foi a camada de contexto em frente ao modelo.

Resultados

  • Mecanismo de contexto + Claude Code: 73,0% Pass@1, $0,67/tarefa
  • Live-SWE-Agent: 72,0% Pass@1, $0,86/tarefa
  • OpenHands: 70,0% Pass@1, $1,77/tarefa
  • Sonar Foundation: 70,0% Pass@1, $1,98/tarefa

A configuração mais cara custa 3x mais por tarefa para uma taxa de resolução inferior. Oito tarefas foram resolvidas apenas pela configuração com a camada de contexto - bugs que o modelo não conseguiu corrigir sem ver o código correto.

Limitações

No matplotlib (código com renderização intensa e saída visual), o mecanismo de contexto obteve 43% enquanto o Sonar Foundation alcançou 86%. O contexto baseado em grafos é menos eficaz quando o código relevante não segue cadeias de dependência.

Ad

Como a camada de contexto funciona

Em vez de permitir que o Claude leia arquivos inteiros, ela pré-indexa a base de código em um grafo de dependência usando tree-sitter + SQLite (30 linguagens suportadas) e retorna uma cápsula de contexto classificada: código-fonte completo para funções importantes, assinaturas esqueletizadas para tudo conectado a elas. O agente começa cada tarefa já sabendo o que é relevante.

Inclui memória de sessão que persiste entre sessões via MCP. Quando o código muda, observações anteriores são marcadas como desatualizadas automaticamente, para que o agente não re-explore as mesmas coisas.

O sistema é 100% local sem nuvem, sem conta e sem código saindo da sua máquina. Funciona com Claude Code e 11 outros agentes via MCP.

Disponibilidade de código aberto

A estrutura de benchmark, todos os logs de avaliação, resultados por instância e scripts de comparação estão disponíveis no GitHub em github.com/Vexp-ai/vexp-swe-bench. A ferramenta em si está disponível em vexp.dev com um nível gratuito, extensão VS Code ou CLI. Resultados completos do benchmark com gráficos estão em vexp.dev/benchmark.

📖 Read the full source: r/ClaudeAI

Ad

👀 See Also

Contador de Tokens do Claude Atualizado com Recurso de Comparação de Modelos
Tools

Contador de Tokens do Claude Atualizado com Recurso de Comparação de Modelos

A ferramenta Contador de Tokens do Claude de Simon Willison agora suporta a comparação de contagens de tokens entre diferentes modelos do Claude. A atualização revela que o Opus 4.7 usa 1,0–1,35× mais tokens que o Opus 4.6 devido a um tokenizador atualizado, o que pode aumentar os custos em cerca de 40% apesar do preço idêntico.

OpenClawRadar
Memctl: Servidor MCP de Código Aberto para Memória Persistente em Agentes de Codificação de IA
Tools

Memctl: Servidor MCP de Código Aberto para Memória Persistente em Agentes de Codificação de IA

Memctl é um servidor MCP de código aberto que fornece memória persistente para agentes de IA de programação entre sessões, máquinas e IDEs. Construído principalmente com Claude Code em duas semanas, ele armazena o contexto do projeto e o disponibiliza novamente em sessões subsequentes.

OpenClawRadar
Claudebin: Exporte e Compartilhe Suas Sessões de Código do Claude
Tools

Claudebin: Exporte e Compartilhe Suas Sessões de Código do Claude

O Claudebin permite que você exporte sessões completas do Claude Code, tornando-as compartilháveis e retomáveis através de um único URL.

OpenClawRadar
Sgai: Ferramenta de Desenvolvimento de Software Multiagente Orientada a Objetivos
Tools

Sgai: Ferramenta de Desenvolvimento de Software Multiagente Orientada a Objetivos

Sgai é uma ferramenta Go de código aberto que coordena agentes de IA para executar objetivos de software definidos em arquivos GOAL.md. Ele decompõe objetivos em fluxos de trabalho DAG, executa testes para portões de conclusão e opera localmente com um painel web para monitoramento.

OpenClawRadar