Le benchmark montre que le moteur de contexte réduit les coûts des agents d'IA de codage par 3 sur SWE-bench.

Un développeur a évalué quatre agents d'IA de codage sur SWE-bench Verified en utilisant le même modèle Claude Opus 4.5, avec la gestion du contexte comme seule variable. Les résultats montrent des différences de coût significatives pour des niveaux de performance similaires.
Configuration du benchmark
Le test a utilisé un sous-ensemble stratifié de 100 tâches de SWE-bench Verified avec les 12 dépôts représentés proportionnellement. Tous les agents ont exécuté Claude Opus 4.5 avec le même budget de 3 $/tâche et une limite de 250 tours. La seule différence était la couche de contexte placée devant le modèle.
Résultats
- Moteur de contexte + Claude Code : 73,0 % Pass@1, 0,67 $/tâche
- Live-SWE-Agent : 72,0 % Pass@1, 0,86 $/tâche
- OpenHands : 70,0 % Pass@1, 1,77 $/tâche
- Sonar Foundation : 70,0 % Pass@1, 1,98 $/tâche
La configuration la plus coûteuse coûte 3 fois plus par tâche pour un taux de résolution inférieur. Huit tâches ont été résolues uniquement par la configuration avec la couche de contexte - des bugs que le modèle ne pouvait pas corriger sans voir le code approprié.
Limitations
Sur matplotlib (code à rendu intensif, sortie visuelle), le moteur de contexte a obtenu 43 % tandis que Sonar Foundation a atteint 86 %. Le contexte basé sur les graphes est moins efficace lorsque le code pertinent ne suit pas les chaînes de dépendances.
Fonctionnement de la couche de contexte
Au lieu de laisser Claude lire des fichiers entiers, il pré-indexe la base de code dans un graphe de dépendances en utilisant tree-sitter + SQLite (30 langages supportés) et renvoie une capsule de contexte classée : le code source complet pour les fonctions importantes, les signatures squelettisées pour tout ce qui leur est connecté. L'agent commence chaque tâche en sachant déjà ce qui est pertinent.
Il inclut une mémoire de session qui persiste entre les sessions via MCP. Lorsque le code change, les observations précédentes sont automatiquement marquées comme obsolètes, de sorte que l'agent ne réexplore pas les mêmes éléments.
Le système est 100 % local, sans cloud, sans compte, et aucun code ne quitte votre machine. Il fonctionne avec Claude Code et 11 autres agents via MCP.
Disponibilité open source
Le cadre de benchmark, tous les journaux d'évaluation, les résultats par instance et les scripts de comparaison sont disponibles sur GitHub à github.com/Vexp-ai/vexp-swe-bench. L'outil lui-même est disponible sur vexp.dev avec un niveau gratuit, une extension VS Code ou une interface CLI. Les résultats complets du benchmark avec graphiques sont sur vexp.dev/benchmark.
📖 Read the full source: r/ClaudeAI
👀 See Also

Logseq Brain v0.6.0 : Plugin de mémoire persistante pour Claude Code avec journal de bord et lectures ciblées par section
Logseq Brain v0.6.0 ajoute un journal de bord pour toutes les opérations, des lectures ciblées par section pour économiser des tokens, et une divulgation progressive pour les fichiers de compétences.

Lumyr : Génération de Tableaux de Bord via Claude avec Automatisation Python et Streamlit
Lumyr est un outil qui génère des tableaux de bord en direct et partageables à partir de descriptions en anglais simple, utilisant Claude pour la génération des tableaux de bord et automatisant la couche Python et Streamlit. Les utilisateurs n'ont pas besoin d'écrire du Python, d'ouvrir Streamlit, de déployer, de configurer l'hébergement ou de gérer l'infrastructure.

Compilateur HEIR de Google : IA privée pratique avec chiffrement homomorphe
Google open-source HEIR, un compilateur qui permet aux développeurs d'exécuter l'inférence IA sur des données chiffrées sans déchiffrement. Les démos incluent la détection de fraude, les recommandations, et plus.

Memorine : Un système de mémoire locale pour agents OpenClaw utilisant Python et SQLite
Memorine est un système de mémoire local pour les agents OpenClaw qui utilise uniquement Python et SQLite, sans dépendances externes, appels API ou télémétrie. Il offre un stockage de faits avec recherche en texte intégral, dégradation de la mémoire, détection de contradictions, chaînage causal d'événements et recherche sémantique optionnelle via fastembed et sqlite-vec.