Pourquoi les agents de codage IA produisent du n'importe quoi après 20 tours : cécité contextuelle

Un développeur sur r/LocalLLaMA a audité ses journaux d'API et les charges utiles des invites après avoir remarqué une augmentation de l'utilisation des tokens et une dégradation de la sortie de l'agent en slop après environ 20 tours. Leur conclusion : les modèles ne se font pas lobotomiser ; ils étouffent dans leurs propres fenêtres de contexte gonflées.
Les quatre erreurs structurelles
Après avoir inspecté ce que Cursor et Claude Code font réellement sur un dépôt de 10 000+ lignes, l'auteur a identifié quatre schémas :
- Exploration aveugle : L'agent grep et décharge récursivement ~40 fichiers différents dans le contexte juste pour trouver une fonction utilitaire. Il rate souvent un composant existant et hallucine un double à partir de zéro.
- Ingestion brute : Décharger un fichier de 2 000 lignes dans l'invite pour mettre à jour une interface de 5 lignes. Gâche d'énormes tokens de contexte.
- Diarrhée d'outils : Des journaux de test verbeux et de volumineuses définitions d'outils MCP consomment ~30k tokens avant que le modèle génère un seul token de code.
- Mémoire de poisson rouge : Chaque session démarre de zéro — aucune connaissance du projet — donc les mêmes fichiers sont relus à plusieurs reprises.
Point de bascule à 80% de contexte
Une fois que le contexte atteint ~80% de capacité avec du bruit, le mécanisme d'attention du modèle se dégrade fortement. Le QI tombe visiblement à température ambiante, et il commence à détruire l'architecture. Le RAG par chunking standard ne résout pas cela car c'est nul pour la logique — l'agent reste aveugle à la structure du codebase jusqu'à ce qu'il brûle des tokens en lisant du texte brut.
Solution proposée : AST ou base de données graphe
L'auteur appelle à un agent open source qui analyse le code en un AST ou une base de données graphe avant de consommer le contexte, afin qu'il comprenne la structure sans gaspiller des tokens sur du texte brut. Cela éviterait les spaghettis architecturaux qui coûtent 5 heures à réparer pour chaque heure économisée en frappe.
À qui cela s'adresse
Développeurs utilisant Cursor, Claude Code ou des agents LLM locaux pour des codebases réelles, frustrés par les paradoxes de productivité.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Déclawé : Un Scanner de Logiciels Malveillants OpenClaw Piloté par la Communauté
Declawed est un nouveau scanner de logiciels malveillants OpenClaw SKILL.md axé sur la détection d'injections de prompts arbitraires, de contenu malveillant et de voleurs d'informations dans les compétences ClawHub.

Défaillances silencieuses des outils dans les agents de codage : un drain d'efficacité caché
Les agents de codage rencontrent souvent des échecs d'outils qui passent inaperçus car ils se rabattent sur des stratégies alternatives, gaspillant des tokens et réduisant la qualité. L'outil open-source Vibeyard détecte ces échecs et suggère des correctifs.

Développeur Teste Qwen3.5 27B face à des Modèles Plus Grands pour des Tâches de Codage Locales
Un développeur a testé plusieurs modèles Qwen3.5 et Nemotron, constatant que Qwen3.5-27B-GGUF:UD-Q6_K_XL fonctionne bien pour les tâches de développement sur du matériel existant 2x RTX 3090, avec 803 pp et 25 tg/s pour un contexte de 256k sur vast.ai.

Vibeyard : Tableau de bord open source qui lance des sessions Claude depuis les PR, les issues et les cartes Kanban
Vibeyard est un écran d'accueil open-source (MIT) avec des widgets déplaçables pour les PRs, les tickets, les kanbans et les sessions Claude. Cliquez sur n'importe quelle carte pour lancer une session Claude Code pré-ciblée pour une révision, une planification de correctif ou une reprise.