Le benchmark montre que le moteur de contexte réduit les coûts des agents d'IA de codage par 3 sur SWE-bench.

✍️ OpenClawRadar📅 Publié: March 23, 2026🔗 Source
Le benchmark montre que le moteur de contexte réduit les coûts des agents d'IA de codage par 3 sur SWE-bench.
Ad

Un développeur a évalué quatre agents d'IA de codage sur SWE-bench Verified en utilisant le même modèle Claude Opus 4.5, avec la gestion du contexte comme seule variable. Les résultats montrent des différences de coût significatives pour des niveaux de performance similaires.

Configuration du benchmark

Le test a utilisé un sous-ensemble stratifié de 100 tâches de SWE-bench Verified avec les 12 dépôts représentés proportionnellement. Tous les agents ont exécuté Claude Opus 4.5 avec le même budget de 3 $/tâche et une limite de 250 tours. La seule différence était la couche de contexte placée devant le modèle.

Résultats

  • Moteur de contexte + Claude Code : 73,0 % Pass@1, 0,67 $/tâche
  • Live-SWE-Agent : 72,0 % Pass@1, 0,86 $/tâche
  • OpenHands : 70,0 % Pass@1, 1,77 $/tâche
  • Sonar Foundation : 70,0 % Pass@1, 1,98 $/tâche

La configuration la plus coûteuse coûte 3 fois plus par tâche pour un taux de résolution inférieur. Huit tâches ont été résolues uniquement par la configuration avec la couche de contexte - des bugs que le modèle ne pouvait pas corriger sans voir le code approprié.

Limitations

Sur matplotlib (code à rendu intensif, sortie visuelle), le moteur de contexte a obtenu 43 % tandis que Sonar Foundation a atteint 86 %. Le contexte basé sur les graphes est moins efficace lorsque le code pertinent ne suit pas les chaînes de dépendances.

Ad

Fonctionnement de la couche de contexte

Au lieu de laisser Claude lire des fichiers entiers, il pré-indexe la base de code dans un graphe de dépendances en utilisant tree-sitter + SQLite (30 langages supportés) et renvoie une capsule de contexte classée : le code source complet pour les fonctions importantes, les signatures squelettisées pour tout ce qui leur est connecté. L'agent commence chaque tâche en sachant déjà ce qui est pertinent.

Il inclut une mémoire de session qui persiste entre les sessions via MCP. Lorsque le code change, les observations précédentes sont automatiquement marquées comme obsolètes, de sorte que l'agent ne réexplore pas les mêmes éléments.

Le système est 100 % local, sans cloud, sans compte, et aucun code ne quitte votre machine. Il fonctionne avec Claude Code et 11 autres agents via MCP.

Disponibilité open source

Le cadre de benchmark, tous les journaux d'évaluation, les résultats par instance et les scripts de comparaison sont disponibles sur GitHub à github.com/Vexp-ai/vexp-swe-bench. L'outil lui-même est disponible sur vexp.dev avec un niveau gratuit, une extension VS Code ou une interface CLI. Les résultats complets du benchmark avec graphiques sont sur vexp.dev/benchmark.

📖 Read the full source: r/ClaudeAI

Ad

👀 See Also

Logseq Brain v0.6.0 : Plugin de mémoire persistante pour Claude Code avec journal de bord et lectures ciblées par section
Tools

Logseq Brain v0.6.0 : Plugin de mémoire persistante pour Claude Code avec journal de bord et lectures ciblées par section

Logseq Brain v0.6.0 ajoute un journal de bord pour toutes les opérations, des lectures ciblées par section pour économiser des tokens, et une divulgation progressive pour les fichiers de compétences.

OpenClawRadar
Lumyr : Génération de Tableaux de Bord via Claude avec Automatisation Python et Streamlit
Tools

Lumyr : Génération de Tableaux de Bord via Claude avec Automatisation Python et Streamlit

Lumyr est un outil qui génère des tableaux de bord en direct et partageables à partir de descriptions en anglais simple, utilisant Claude pour la génération des tableaux de bord et automatisant la couche Python et Streamlit. Les utilisateurs n'ont pas besoin d'écrire du Python, d'ouvrir Streamlit, de déployer, de configurer l'hébergement ou de gérer l'infrastructure.

OpenClawRadar
Compilateur HEIR de Google : IA privée pratique avec chiffrement homomorphe
Tools

Compilateur HEIR de Google : IA privée pratique avec chiffrement homomorphe

Google open-source HEIR, un compilateur qui permet aux développeurs d'exécuter l'inférence IA sur des données chiffrées sans déchiffrement. Les démos incluent la détection de fraude, les recommandations, et plus.

OpenClawRadar
Memorine : Un système de mémoire locale pour agents OpenClaw utilisant Python et SQLite
Tools

Memorine : Un système de mémoire locale pour agents OpenClaw utilisant Python et SQLite

Memorine est un système de mémoire local pour les agents OpenClaw qui utilise uniquement Python et SQLite, sans dépendances externes, appels API ou télémétrie. Il offre un stockage de faits avec recherche en texte intégral, dégradation de la mémoire, détection de contradictions, chaînage causal d'événements et recherche sémantique optionnelle via fastembed et sqlite-vec.

OpenClawRadar