Les frameworks d'agents gaspillent plus de 350 000 jetons par session en renvoyant des fichiers statiques.

Résultats du benchmark sur le gaspillage de tokens
Des mesures sur une configuration locale Qwen 3.5 122B ont révélé que les frameworks d'agents gaspillent plus de 350 000 tokens par session en renvoyant à plusieurs reprises des fichiers statiques. La source décrit ces chiffres comme "irréels".
Approche d'optimisation
Une approche de compilation a été découverte qui réduit le contexte de requête de 1 373 tokens à seulement 73 tokens. Cela représente une réduction de 95 % de l'utilisation des tokens pour ce contexte spécifique.
Le benchmark a également constaté qu'une conversion JSON naïve aggrave le problème de 30 %, augmentant le gaspillage de tokens au-delà des mesures de base.
Contexte technique
Les frameworks d'agents incluent généralement des invites système, des définitions d'outils et d'autres données de configuration qui restent statiques à travers plusieurs interactions au sein d'une session. Lorsque ces données sont renvoyées avec chaque requête, elles consomment des tokens sans fournir de nouvelles informations au modèle. Cela est particulièrement coûteux avec les grands modèles comme Qwen 3.5 122B où le traitement des tokens impacte directement à la fois les performances et le coût.
L'approche de compilation implique probablement un prétraitement des éléments statiques pour qu'ils soient référencés plutôt que renvoyés, similaire à la façon dont les applications web modernes mettent en cache les ressources statiques. Pour les développeurs travaillant avec des agents de codage IA, réduire cette surcharge peut significativement améliorer les temps de réponse et réduire les coûts opérationnels.
📖 Read the full source: r/LocalLLaMA
👀 See Also
Claude Code v2.1.251 : Crochets de changement de modèle, barre de limite de dépenses et correctifs de sécurité
Claude Code v2.1.251 ajoute des hooks PreModelSwitch/PostModelSwitch, le streaming en direct des sous-agents vers Remote Control, une barre de limite de dépenses dans /usage, et corrige des vulnérabilités de symlink et de traversal de chemin.

Problèmes et solutions de contournement liés à la compaction des sessions Claude AI
La compaction par défaut dans les sessions Claude AI peut dégrader la précision de la récupération d'environ 9,75/10 à environ 5/10, provoquant des hallucinations. L'utilisateur a testé avec 418 000 tokens et a constaté que la compaction manuelle utilisant Opus maintient la précision tandis que la compaction par défaut échoue.

Mandala v0.3 : Un runtime asynchrone open-source pour unifier la télémétrie logistique en tant que spans OpenTelemetry pour le raisonnement agentiel
Mandala v0.3 fournit un runtime asynchrone open-source qui ingère la télémétrie de Samsara, Descartes, Vizion et FMCSA via des webhooks, émet des événements sous forme de spans OpenTelemetry et expose les données via des outils MCP pour les agents LLM.
Spine Swarm : Système d'IA Multi-Agents sur Toile Visuelle pour Projets Non-Codés
Spine Swarm est un système multi-agents qui fonctionne sur un canevas visuel infini pour mener à bien des projets complexes non liés au codage, tels que l'analyse concurrentielle, la modélisation financière, les audits SEO, les pitch decks et les prototypes interactifs. Le système utilise des blocs comme abstractions au-dessus des modèles d'IA, qui peuvent être connectés pour transmettre le contexte entre différents types de modèles.