Les frameworks d'agents gaspillent plus de 350 000 jetons par session en renvoyant des fichiers statiques.

✍️ OpenClawRadar📅 Publié: April 13, 2026🔗 Source
Les frameworks d'agents gaspillent plus de 350 000 jetons par session en renvoyant des fichiers statiques.
Ad

Résultats du benchmark sur le gaspillage de tokens

Des mesures sur une configuration locale Qwen 3.5 122B ont révélé que les frameworks d'agents gaspillent plus de 350 000 tokens par session en renvoyant à plusieurs reprises des fichiers statiques. La source décrit ces chiffres comme "irréels".

Approche d'optimisation

Une approche de compilation a été découverte qui réduit le contexte de requête de 1 373 tokens à seulement 73 tokens. Cela représente une réduction de 95 % de l'utilisation des tokens pour ce contexte spécifique.

Le benchmark a également constaté qu'une conversion JSON naïve aggrave le problème de 30 %, augmentant le gaspillage de tokens au-delà des mesures de base.

Ad

Contexte technique

Les frameworks d'agents incluent généralement des invites système, des définitions d'outils et d'autres données de configuration qui restent statiques à travers plusieurs interactions au sein d'une session. Lorsque ces données sont renvoyées avec chaque requête, elles consomment des tokens sans fournir de nouvelles informations au modèle. Cela est particulièrement coûteux avec les grands modèles comme Qwen 3.5 122B où le traitement des tokens impacte directement à la fois les performances et le coût.

L'approche de compilation implique probablement un prétraitement des éléments statiques pour qu'ils soient référencés plutôt que renvoyés, similaire à la façon dont les applications web modernes mettent en cache les ressources statiques. Pour les développeurs travaillant avec des agents de codage IA, réduire cette surcharge peut significativement améliorer les temps de réponse et réduire les coûts opérationnels.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

🦀
Tools

Claude Code v2.1.251 : Crochets de changement de modèle, barre de limite de dépenses et correctifs de sécurité

Claude Code v2.1.251 ajoute des hooks PreModelSwitch/PostModelSwitch, le streaming en direct des sous-agents vers Remote Control, une barre de limite de dépenses dans /usage, et corrige des vulnérabilités de symlink et de traversal de chemin.

OpenClawRadar
Problèmes et solutions de contournement liés à la compaction des sessions Claude AI
Tools

Problèmes et solutions de contournement liés à la compaction des sessions Claude AI

La compaction par défaut dans les sessions Claude AI peut dégrader la précision de la récupération d'environ 9,75/10 à environ 5/10, provoquant des hallucinations. L'utilisateur a testé avec 418 000 tokens et a constaté que la compaction manuelle utilisant Opus maintient la précision tandis que la compaction par défaut échoue.

OpenClawRadar
Mandala v0.3 : Un runtime asynchrone open-source pour unifier la télémétrie logistique en tant que spans OpenTelemetry pour le raisonnement agentiel
Tools

Mandala v0.3 : Un runtime asynchrone open-source pour unifier la télémétrie logistique en tant que spans OpenTelemetry pour le raisonnement agentiel

Mandala v0.3 fournit un runtime asynchrone open-source qui ingère la télémétrie de Samsara, Descartes, Vizion et FMCSA via des webhooks, émet des événements sous forme de spans OpenTelemetry et expose les données via des outils MCP pour les agents LLM.

OpenClawRadar
🦀
Tools

Spine Swarm : Système d'IA Multi-Agents sur Toile Visuelle pour Projets Non-Codés

Spine Swarm est un système multi-agents qui fonctionne sur un canevas visuel infini pour mener à bien des projets complexes non liés au codage, tels que l'analyse concurrentielle, la modélisation financière, les audits SEO, les pitch decks et les prototypes interactifs. Le système utilise des blocs comme abstractions au-dessus des modèles d'IA, qui peuvent être connectés pour transmettre le contexte entre différents types de modèles.

OpenClawRadar