Moteur de Contexte Agentique : Boucle d'Amélioration Automatisée des Agents avec un Gain de Précision de 34,2 %

Automatisation du processus d'amélioration des agents
Un développeur a open-sourcé un système qui automatise l'ensemble du processus d'amélioration des agents IA en leur permettant de s'auto-analyser et de s'auto-corriger. L'outil résout le problème courant de lecture manuelle des logs, d'ajustement des prompts et d'espoir d'améliorations.
Le processus en cinq étapes
La boucle automatisée suit cinq étapes distinctes :
- Analyse des traces : Analyse les traces pour déterminer non seulement ce qui a échoué mais pourquoi, si c'est un problème ponctuel ou systémique, et quelle catégorie d'échec il s'agit. Produit une analyse structurée des modes d'échec plutôt que de simples listes d'erreurs.
- Génération d'évaluations : Crée des évaluations spécifiques pour valider l'analyse et mesurer les correctifs. Les évaluations génériques ne détectent pas les échecs spécifiques. LLM-en-tant-que-juge sert de solution de repli lorsque les données de trace ne sont pas assez structurées pour des évaluations déterministes.
- Mesure de référence : Exécute les évaluations sur l'agent actuel avant d'appliquer des correctifs pour établir des références et valider les évaluations elles-mêmes.
- Mise en œuvre des correctifs : Un développeur examine l'analyse et la base de code pour décider quoi changer. La décision clé est de savoir si le correctif appartient au prompt ou au code environnant (par exemple, lorsque le harnais gère mal les sorties d'outils ou ne transmet pas le bon contexte).
- Vérification et cumul : Après les correctifs, les évaluations sont réexécutées pour vérifier l'amélioration, avec des changements conservés, annulés ou retravaillés.
Détails d'implémentation
La solution automatise l'ensemble de cette boucle de bout en bout avec une seule commande qui invoque un système agentique auto-analysant. L'analyse des traces se produit dans un environnement REPL avec des agents spécialisés pour ce cas d'usage spécifique. Le système fournit l'analyse via un accès CLI à Claude Code pour gérer le reste avec un ensemble de compétences.
Puisque Claude peut vivre dans la base de code, il valide l'analyse et décide de la meilleure ligne de conduite lors de l'étape de correction (prompt vs. code).
Résultats et fonctionnement
Évalué sur Tau-2 Bench en utilisant une seule itération, le premier passage a obtenu un gain de précision de 34,2 % sans intervention manuelle. Le système est conçu pour cumuler les améliorations : de nouvelles traces révèlent de nouveaux problèmes, conduisant à de nouveaux correctifs à chaque cycle.
Vous pouvez le configurer pour boucler entièrement de manière autonome. Une option avec intervention humaine existe si vous souhaitez approuver les correctifs avant l'étape 4, mais lors des tests, le développeur a "simplement laissé faire".
L'outil est open-sourcé sur GitHub : https://github.com/kayba-ai/agentic-context-engine
📖 Read the full source: r/ClaudeAI
👀 See Also

Modèles.dev : Base de données open source des spécifications, prix et capacités des modèles d'IA
Models.dev est une base de données open-source et communautaire de spécifications, tarifs et capacités de modèles d'IA. Elle propose une API et des définitions basées sur TOML pour les fournisseurs et les modèles.

AgentHandover : application de barre de menus Mac qui crée des compétences d'agent en observant votre écran
AgentHandover est une application open-source pour la barre de menus Mac qui utilise Gemma 4 fonctionnant localement via Ollama pour surveiller votre écran et transformer les workflows répétés en fichiers Skill structurés que n'importe quel agent peut suivre. Il propose à la fois l'enregistrement Focus pour des tâches spécifiques et la Découverte Passive qui détecte des modèles à partir d'observations en arrière-plan.

Outil open-source automatise l'analyse des concurrents publicitaires Meta avec Claude Code
Ads Machine est un système open-source construit avec Claude Code qui extrait les publicités des concurrents de la bibliothèque de publicités de Meta, transcrit les vidéos, extrait les accroches et les angles, et évalue les publicités en fonction de leur durée de diffusion. Il peut générer des variations à partir des publicités réussies et pousser les campagnes vers Meta.

Audit SecureCode : Un auditeur de sécurité de serveur Linux construit avec Claude Code
Un développeur indépendant a créé SecureCode Audit à l'aide de Claude Code — exécutez une commande SSH, obtenez un rapport de sécurité avec 22 vérifications et des correctifs priorisés. Les 30 premiers inscrits reçoivent l'audit complet gratuitement.