Arrêtez de brûler des tokens Claude Code pour des questions de chat

Un développeur sur r/ClaudeAI atteignait chaque semaine son quota de 20 $ pour Claude Code dès jeudi. Après avoir audité les 50 dernières invites, il a réalisé que la plupart étaient de simples questions de chat ne nécessitant pas un agent : « que dit cette trace de pile », « regex pour trouver X », « explique ce que fait cette commande bash en une ligne », « convertis cette requête curl en httpie », et « quel est le jq pour extraire le champ Y de ceci ».
Chacune de ces invites dans Claude Code payait l'intégralité de la taxe d'agent — chargement du contexte, définitions d'outils, tokens de planification — pour une réponse en une ligne. La solution : router toutes les questions de type chat vers une fenêtre de chat classique utilisant un modèle bon marché (Haiku ou GPT-mini). Réserver Claude Code pour les modifications multi-fichiers, les refactorisations et le débogage nécessitant une lecture du code source.
Résultats après environ 3 semaines
- Passer du quota atteint jeudi à ne plus l'atteindre du tout, en effectuant la même charge de travail.
- Dépense supplémentaire en appels API de modèles bon marché : environ 3–4 $/semaine — négligeable.
- Avantage secondaire : les réponses des modèles bon marché arrivent plus vite que Claude Code qui lance sa boucle d'agent, donc les questions rapides semblent plus rapides aussi.
Note sur le workflow
Pour éviter de basculer entre le terminal (Claude Code) et une fenêtre de chat, ils utilisent désormais un terminal appelé yaw.sh qui intègre un chat multi-fournisseurs à l'invite, à côté de Claude Code. Mais n'importe quel outil de chat dans une autre fenêtre fonctionne — c'est le changement de workflow qui économise les tokens.
TL;DR : Si vous atteignez le quota hebdomadaire de Claude Code, auditez vos 50 dernières invites. La plupart n'ont probablement pas besoin d'un agent. Déplacez-les et vous cesserez probablement d'atteindre le quota.
📖 Lire la source complète : r/ClaudeAI
👀 See Also

Top 5 compétences moins évidentes d'agent pour les développeurs frontend utilisant Claude AI
Un développeur frontend partage 5 compétences spécifiques pour les agents Claude AI qui améliorent la productivité et la qualité du code : Playwright, Types avancés pour TypeScript, LyteNyte Grid, Modèles Tailwind CSS et Compétences PNPM.

3 semaines d'OpenClaw : coûts de jetons, boucles et compaction — leçons du terrain
Après avoir brûlé des jetons sur des vérifications de battement de cœur avec Opus, lutté contre des boucles d'agents et perdu du contexte à cause de la compaction, un utilisateur de Reddit partage les solutions durement acquises : utiliser des modèles moins chers pour les tâches triviales, rédiger des règles anti-boucle et sauvegarder les journaux de décisions.

Correction de la vitesse de traitement des prompts dans Llama.cpp à l'aide du paramètre --ubatch-size
Un utilisateur a découvert que le réglage de --ubatch-size pour correspondre à la taille du cache L3 du GPU (64 Mo pour la Radeon 9070XT) a considérablement amélioré la vitesse de traitement des invites pour les modèles plus volumineux comme Qwen 27B dans Llama.cpp, rendant l'invocation de code Claude utilisable.

Réduisez de 43% les tokens de Cut OpenClaw en affinant l'outil et les fichiers mémoire
Réduction des jetons de démarrage d'environ 9 457 à environ 5 400 (43 % de baisse) en convertissant TOOLS.md en un index, en déplaçant les détails des outils dans des fichiers séparés et en mettant en œuvre une promotion mémoire par étapes.