Pourquoi les agents de codage IA produisent du n'importe quoi après 20 tours : cécité contextuelle

Un développeur sur r/LocalLLaMA a audité ses journaux d'API et les charges utiles des invites après avoir remarqué une augmentation de l'utilisation des tokens et une dégradation de la sortie de l'agent en slop après environ 20 tours. Leur conclusion : les modèles ne se font pas lobotomiser ; ils étouffent dans leurs propres fenêtres de contexte gonflées.
Les quatre erreurs structurelles
Après avoir inspecté ce que Cursor et Claude Code font réellement sur un dépôt de 10 000+ lignes, l'auteur a identifié quatre schémas :
- Exploration aveugle : L'agent grep et décharge récursivement ~40 fichiers différents dans le contexte juste pour trouver une fonction utilitaire. Il rate souvent un composant existant et hallucine un double à partir de zéro.
- Ingestion brute : Décharger un fichier de 2 000 lignes dans l'invite pour mettre à jour une interface de 5 lignes. Gâche d'énormes tokens de contexte.
- Diarrhée d'outils : Des journaux de test verbeux et de volumineuses définitions d'outils MCP consomment ~30k tokens avant que le modèle génère un seul token de code.
- Mémoire de poisson rouge : Chaque session démarre de zéro — aucune connaissance du projet — donc les mêmes fichiers sont relus à plusieurs reprises.
Point de bascule à 80% de contexte
Une fois que le contexte atteint ~80% de capacité avec du bruit, le mécanisme d'attention du modèle se dégrade fortement. Le QI tombe visiblement à température ambiante, et il commence à détruire l'architecture. Le RAG par chunking standard ne résout pas cela car c'est nul pour la logique — l'agent reste aveugle à la structure du codebase jusqu'à ce qu'il brûle des tokens en lisant du texte brut.
Solution proposée : AST ou base de données graphe
L'auteur appelle à un agent open source qui analyse le code en un AST ou une base de données graphe avant de consommer le contexte, afin qu'il comprenne la structure sans gaspiller des tokens sur du texte brut. Cela éviterait les spaghettis architecturaux qui coûtent 5 heures à réparer pour chaque heure économisée en frappe.
À qui cela s'adresse
Développeurs utilisant Cursor, Claude Code ou des agents LLM locaux pour des codebases réelles, frustrés par les paradoxes de productivité.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Werld : Simulation de vie artificielle ouverte avec réseaux de neurones évolutifs
Werld est une simulation de vie artificielle en temps réel où des agents dotés de réseaux neuronaux NEAT font évoluer leur propre architecture neuronale, leur traitement sensoriel et leurs comportements sans règles prédéfinies ni fonctions de récompense. La simulation commence avec 30 agents sur un graphe petit-monde de Watts-Strogatz avec 64 canaux sensoriels, 7 fonctions motrices continues et 29 traits génétiques héréditaires.

Auto Router vs Sonnet : Économies de coût vs Qualité de réponse
La fonctionnalité Auto Router d'Open Router sélectionne dynamiquement des LLM en fonction de la complexité du contexte, offrant des économies de coût significatives (0,8 centime contre 0,00071 centime par requête), mais les utilisateurs signalent une dégradation de la qualité des réponses par rapport à Sonnet 4.6.

OpenClaw Nerve WebUI ajoute le contrôle vocal et un tableau de bord de gestion d'équipe.
Nerve est une interface WebUI pour OpenClaw qui offre un tableau de bord tout-en-un pour surveiller et gérer des agents IA, avec contrôle vocal via double-tap shift pour Whisper et des capacités de création d'équipes de sous-agents.

Guilde OpenClaw : Serveur d'agents IA multi-utilisateurs pour les équipes
OpenClaw Guild étend OpenClaw mono-utilisateur en un serveur d'IA multi-utilisateurs avec contrôle d'accès basé sur les rôles, des données isolées par agent et un système de mémoire à 4 niveaux. Il comprend un tableau de bord d'administration web et un déploiement Docker-compose pour une installation en 15 minutes.