El benchmark muestra que el motor de contexto reduce los costos del agente de codificación de IA en 3 veces en SWE-bench.

Un desarrollador evaluó comparativamente cuatro agentes de IA para codificación en SWE-bench Verified utilizando el mismo modelo Claude Opus 4.5, con la gestión de contexto como única variable. Los resultados muestran diferencias significativas de costo para niveles de rendimiento similares.
Configuración de la evaluación
La prueba utilizó un subconjunto estratificado de 100 tareas de SWE-bench Verified con los 12 repositorios representados proporcionalmente. Todos los agentes ejecutaron Claude Opus 4.5 con el mismo presupuesto de $3/tarea y límite de 250 turnos. La única diferencia fue la capa de contexto frente al modelo.
Resultados
- Motor de contexto + Claude Code: 73.0% Pass@1, $0.67/tarea
- Live-SWE-Agent: 72.0% Pass@1, $0.86/tarea
- OpenHands: 70.0% Pass@1, $1.77/tarea
- Sonar Foundation: 70.0% Pass@1, $1.98/tarea
La configuración más costosa cuesta 3 veces más por tarea para una tasa de resolución más baja. Ocho tareas fueron resueltas solo por la configuración con la capa de contexto: errores que el modelo no pudo corregir sin ver el código correcto.
Limitaciones
En matplotlib (código con mucha representación visual y salida gráfica), el motor de contexto obtuvo un 43% mientras que Sonar Foundation alcanzó el 86%. El contexto basado en grafos es menos efectivo cuando el código relevante no sigue cadenas de dependencia.
Cómo funciona la capa de contexto
En lugar de dejar que Claude lea archivos completos, pre-indexa la base de código en un grafo de dependencias usando tree-sitter + SQLite (30 lenguajes soportados) y devuelve una cápsula de contexto clasificada: código fuente completo para las funciones que importan, firmas esqueletizadas para todo lo conectado a ellas. El agente comienza cada tarea ya sabiendo qué es relevante.
Incluye memoria de sesión que persiste entre sesiones a través de MCP. Cuando el código cambia, las observaciones anteriores se marcan automáticamente como obsoletas, para que el agente no vuelva a explorar las mismas cosas.
El sistema es 100% local sin nube, sin cuenta y sin que el código salga de tu máquina. Funciona con Claude Code y otros 11 agentes a través de MCP.
Disponibilidad de código abierto
El entorno de evaluación, todos los registros de evaluación, resultados por instancia y scripts de comparación están disponibles en GitHub en github.com/Vexp-ai/vexp-swe-bench. La herramienta en sí está disponible en vexp.dev con un nivel gratuito, extensión de VS Code o CLI. Los resultados completos de la evaluación con gráficos están en vexp.dev/benchmark.
📖 Read the full source: r/ClaudeAI
👀 Ver también

Eden AI: Centro de API europeo para modelos de IA – Se reposiciona como alternativa a OpenRouter
Eden AI ofrece una API unificada única para acceder a más de 500 modelos de IA (LLM, visión, OCR, voz) con enrutamiento inteligente, mecanismos de respaldo y control de región. Se posiciona como una alternativa europea a OpenRouter.

IM para Agentes: Sala de chat basada en REST para comunicación entre agentes de IA sin SDKs
Un desarrollador creó IM for Agents, una herramienta que crea salas de chat compartidas donde los agentes de IA se comunican directamente a través de API REST sin SDKs ni archivos de configuración. Los agentes usan un simple prompt para unirse a las salas y pueden negociar APIs, escribir código y verificar el trabajo mientras los humanos observan.

Semble: Búsqueda de código para agentes de IA usando un 98% menos de tokens que grep+read
Semble es una biblioteca de búsqueda de código de código abierto para agentes de IA que combina embeddings estáticos Model2Vec con BM25, funcionando completamente en CPU. Indexa un repositorio en ~250 ms y responde consultas en ~1.5 ms, logrando un NDCG@10 de 0.854 — el 99% de la calidad de un transformer de 137M de parámetros — mientras usa un 98% menos de tokens que grep+read.

Graphthulhu MCP Server Proporciona a los Agentes de IA Memoria de Grafo de Conocimiento para Logseq/Obsidian
Graphthulhu es un servidor MCP de código abierto que proporciona a los agentes de IA acceso de lectura y escritura a bóvedas de Logseq u Obsidian, almacenando la memoria como páginas estructuradas con propiedades y enlaces en lugar de incrustaciones vectoriales. Después de un mes, el sistema generó 404 páginas con 1.451 referencias cruzadas.