Le benchmark montre que le moteur de contexte réduit les coûts des agents d'IA de codage par 3 sur SWE-bench.

✍️ OpenClawRadar📅 Publié: March 23, 2026🔗 Source
Le benchmark montre que le moteur de contexte réduit les coûts des agents d'IA de codage par 3 sur SWE-bench.
Ad

Un développeur a évalué quatre agents d'IA de codage sur SWE-bench Verified en utilisant le même modèle Claude Opus 4.5, avec la gestion du contexte comme seule variable. Les résultats montrent des différences de coût significatives pour des niveaux de performance similaires.

Configuration du benchmark

Le test a utilisé un sous-ensemble stratifié de 100 tâches de SWE-bench Verified avec les 12 dépôts représentés proportionnellement. Tous les agents ont exécuté Claude Opus 4.5 avec le même budget de 3 $/tâche et une limite de 250 tours. La seule différence était la couche de contexte placée devant le modèle.

Résultats

  • Moteur de contexte + Claude Code : 73,0 % Pass@1, 0,67 $/tâche
  • Live-SWE-Agent : 72,0 % Pass@1, 0,86 $/tâche
  • OpenHands : 70,0 % Pass@1, 1,77 $/tâche
  • Sonar Foundation : 70,0 % Pass@1, 1,98 $/tâche

La configuration la plus coûteuse coûte 3 fois plus par tâche pour un taux de résolution inférieur. Huit tâches ont été résolues uniquement par la configuration avec la couche de contexte - des bugs que le modèle ne pouvait pas corriger sans voir le code approprié.

Limitations

Sur matplotlib (code à rendu intensif, sortie visuelle), le moteur de contexte a obtenu 43 % tandis que Sonar Foundation a atteint 86 %. Le contexte basé sur les graphes est moins efficace lorsque le code pertinent ne suit pas les chaînes de dépendances.

Ad

Fonctionnement de la couche de contexte

Au lieu de laisser Claude lire des fichiers entiers, il pré-indexe la base de code dans un graphe de dépendances en utilisant tree-sitter + SQLite (30 langages supportés) et renvoie une capsule de contexte classée : le code source complet pour les fonctions importantes, les signatures squelettisées pour tout ce qui leur est connecté. L'agent commence chaque tâche en sachant déjà ce qui est pertinent.

Il inclut une mémoire de session qui persiste entre les sessions via MCP. Lorsque le code change, les observations précédentes sont automatiquement marquées comme obsolètes, de sorte que l'agent ne réexplore pas les mêmes éléments.

Le système est 100 % local, sans cloud, sans compte, et aucun code ne quitte votre machine. Il fonctionne avec Claude Code et 11 autres agents via MCP.

Disponibilité open source

Le cadre de benchmark, tous les journaux d'évaluation, les résultats par instance et les scripts de comparaison sont disponibles sur GitHub à github.com/Vexp-ai/vexp-swe-bench. L'outil lui-même est disponible sur vexp.dev avec un niveau gratuit, une extension VS Code ou une interface CLI. Les résultats complets du benchmark avec graphiques sont sur vexp.dev/benchmark.

📖 Read the full source: r/ClaudeAI

Ad

👀 See Also

ClawMetry ajoute une surveillance à distance avec chiffrement de bout en bout pour les agents OpenClaw
Tools

ClawMetry ajoute une surveillance à distance avec chiffrement de bout en bout pour les agents OpenClaw

ClawMetry v0.1.0 inclut désormais la synchronisation cloud pour la surveillance à distance des agents OpenClaw depuis n'importe quel navigateur ou application de la barre de menus Mac, avec un chiffrement de bout en bout qui maintient les données chiffrées jusqu'à ce qu'elles atteignent votre client.

OpenClawRadar
Nudge : une application locale qui affiche des plans générés par Claude via des déclencheurs contextuels
Tools

Nudge : une application locale qui affiche des plans générés par Claude via des déclencheurs contextuels

Nudge est une application gratuite iOS/Android priorisant le local, qui vous permet de coller des plans en markdown (depuis Claude, ChatGPT, Notes) et d'y ajouter des déclencheurs comme le temps, la localisation, le Wi-Fi, l'inactivité ou une fois pour les faire apparaître via des notifications locales.

OpenClawRadar
Création d'un Agent de Recherche Autonome avec C# et des LLM Locaux
Tools

Création d'un Agent de Recherche Autonome avec C# et des LLM Locaux

Un agent de recherche en C# automatise le traitement d'URL avec des LLM locaux utilisant Ollama et llama3.1:8b, générant des rapports structurés en markdown à partir de recherches web.

OpenClawRadar
Claude-rank : Plugin Claude Code pour les audits de visibilité dans la recherche IA
Tools

Claude-rank : Plugin Claude Code pour les audits de visibilité dans la recherche IA

Claude-rank est un plugin Claude Code gratuit et une interface en ligne de commande qui audite les fondations techniques pour la visibilité dans les moteurs de recherche IA, gérant le SEO technique, l'évaluation de la citabilité IA, les vérifications de crawlabilité pour les robots IA et les corrections automatisées des problèmes de découvrabilité.

OpenClawRadar