Gonflement des tokens dans les cadres d'agents : un ratio entrée-sortie de 500:1 est normal

Un utilisateur de Reddit, qui exécute un agent IA auto-hébergé basé sur Telegram avec routage multi-fournisseur, a remarqué des ratios de tokens entrée/sortie extrêmes : environ 21k tokens d'entrée par message contre 50 à 200 tokens de sortie, soit des ratios de 100:1 à 500:1. Détail : définitions d'outils ~13k tokens, prompt système ~5k, fichiers de mémoire/contexte ~3k, message utilisateur <100 tokens.
Est-ce normal ?
La réponse de la communauté confirme qu'un contexte de base de 15 à 25k tokens est standard pour les frameworks d'agents comme LangChain et AutoGPT. Le ratio élevé est structurel en raison d'un accès réel aux outils. Recommandations clés :
- Modèle principal bon marché — les coûts restent bornés même avec le gonflement
- Mise en cache du prompt — utile dans les sessions actives mais avec une TTL de 5 minutes, limitant l'efficacité en cas d'inactivité
- Plafonds de dépenses — garde-fou essentiel même avec des modèles bon marché
Stratégies d'atténuation
Les utilisateurs débattent de deux approches : réduire les définitions d'outils par message en fonction de l'intention (sélection dynamique d'outils) vs accepter le gonflement et compter sur le cache. Les benchmarks suggèrent qu'il est rarement nécessaire de forker le framework pour réduire la surcharge, sauf en cas de déploiement à grande échelle. Le consensus : un contexte de 21k tokens est « le coût des affaires » avec les frameworks d'agents.
📖 Lire la source complète : r/openclaw
👀 See Also

Traitement des exécutions d’agents comme des paquets de révision : un modèle pratique pour Claude Code & Codex
Un développeur partage comment la création d'un dossier structuré par exécution d'agent (recherche, brouillons, évaluations, dossier d'approbation, métriques, mémoire) rend les échecs visibles et accélère les itérations.

Cacher les lignes d'exécution d'OpenClaw dans les discussions Telegram : solution en une commande
Empêchez OpenClaw de spammer les commandes exec brutes dans Telegram en définissant streaming.preview.toolProgress et streaming.progress.toolProgress sur false. Une seule commande Python sauvegarde la config, ajoute les clés, et un redémarrage rapide applique le correctif.

Correction de la vitesse de traitement des prompts dans Llama.cpp à l'aide du paramètre --ubatch-size
Un utilisateur a découvert que le réglage de --ubatch-size pour correspondre à la taille du cache L3 du GPU (64 Mo pour la Radeon 9070XT) a considérablement amélioré la vitesse de traitement des invites pour les modèles plus volumineux comme Qwen 27B dans Llama.cpp, rendant l'invocation de code Claude utilisable.

La structure de prompt qui a amélioré les résumés de rapports PDF volumineux par Claude AI
Un développeur explique comment le passage de « résume ceci » à des invites spécifiant le rôle, la décision et l'extraction a transformé les résumés génériques de Claude en indicateurs de risque exploitables et en actions concrètes.