Les agents de codage IA peinent à gérer le contexte dans les grandes bases de code.

Le goulot d'étranglement de l'exécution n'est pas le problème
Les observations issues de l'utilisation réelle de bases de code montrent que les agents de codage IA consacrent systématiquement un temps significatif à la découverte plutôt qu'à l'exécution. Chaque fois qu'un agent aborde une nouvelle tâche, il effectue 15 à 20 appels d'outils pour des activités d'orientation, notamment :
- Rechercher des routes avec grep
- Lire le middleware
- Vérifier les types
Au moment où l'agent commence à écrire du code, il a déjà consommé une part substantielle de sa fenêtre de contexte pour le travail de découverte.
Preuves issues d'approches simplifiées
Vercel a démontré ce problème sous un angle opposé en supprimant 80 % des outils de leur agent et en lui donnant accès à bash. Cette approche a abouti à une précision de 100 %, suggérant que la capacité d'exécution n'est pas le facteur limitant.
De même, Pi (l'agent de codage minimal) prouve le même point avec seulement 4 outils et un prompt système contenant moins de 1 000 tokens.
Le véritable défi : la gestion du contexte
Si l'exécution est effectivement résolue, le problème réellement difficile devient la gestion du contexte. Plusieurs facteurs contribuent à ce défi :
- Les grandes bases de code ne tiennent pas dans les fenêtres de contexte actuelles
- Les tâches longues accumulent les sorties d'outils qui repoussent les raisonnements initiaux hors de la fenêtre d'attention
- Les environnements dynamiques changent entre les sessions
- La recherche "Lost in the Middle" montre que les modèles raisonnent mieux au début de leur fenêtre de contexte — exactement quand les agents sont encore en train de chercher
L'auteur a publié une analyse plus détaillée explorant ces problèmes et leurs implications pour le développement des agents de codage IA.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Fièvre de l'IA : des tulipes aux jetons — un regard critique sur le cycle de l'engouement pour l'IA
Sean Helvey établit des parallèles entre la tulipomanie et le boom actuel de l'IA, remettant en question la véritable intelligence, la transparence et les externalités de l'IA. Il aborde les coûts énergétiques, l'expansion des centres de données et la nécessité de la souveraineté des données.

L'Orchestrateur : Pourquoi l'intention devrait survivre au processus
Les piles d'agents actuelles inversent l'identité et la surface — la couche orchestrée devrait se situer entre les agents et les runtimes, avec des primitives d'identité, de routage, de transfert et des appels inter-pilotes. Exemple pratique : trier un test instable entre Ollama, Gemini CLI et Grok Build sous une seule intention.

Claude Code v2.1.160 : Invites de sécurité pour la configuration du shell, protection des fichiers acceptEdits et des dizaines de corrections de bogues
Anthropic a publié Claude Code v2.1.160 avec des invites de sécurité avant l'écriture dans les fichiers de démarrage du shell et les configurations d'outils de build en mode acceptEdits, une prise en charge améliorée du presse-papiers Windows et des corrections de perte d'historique de session.

GPT-5.5 sur OpenClaw : les utilisateurs signalent une limite de 5 heures épuisée en 3 requêtes, code cassé
Un utilisateur de Reddit rapporte que GPT-5.5 sur OpenClaw a consommé la limite de 5 heures en 3 invites et introduit des bugs ; DeepSeek V4 Pro a résolu le désordre.