Optimisation de la valeur des sessions Claude Code : Conseils d'efficacité des jetons

Anthropic a publié un guide pratique pour tirer le meilleur parti de chaque token dépensé dans les sessions Claude Code. Il couvre les mécanismes de tarification des tokens et propose six tactiques concrètes pour réduire le gaspillage sans changer de modèle.
Ce qui détermine le coût des tokens
Vous êtes facturé par token, mais vous payez en réalité pour le temps d'inférence GPU. Trois facteurs déterminent le prix d'un token : la taille du modèle, l'entrée par rapport à la sortie, et la mise en cache. Les tokens de sortie coûtent environ 5 fois plus que ceux d'entrée car le décodage exécute le modèle une fois par token. Les tokens d'entrée mis en cache sont moins chers, et le cache de prompt expire après une heure.
Six façons de réduire le gaspillage de tokens
- Exécutez
/clearentre les tâches — cela évite d'envoyer au modèle un contexte antérieur non pertinent, ce qui réduit l'utilisation de tokens. - Définissez votre modèle et le niveau d'effort avant de commencer — les changer en cours de conversation casse le cache de prompt, augmentant le coût.
- Mentionnez les fichiers avec @ au lieu de les nommer — le fichier s'attache directement à votre message, économisant un appel Read ou une recherche dans le dépôt.
- Ajoutez des flags silencieux aux commandes bruyantes, ou exécutez-les dans un sous-agent — la sortie de commande reste dans la conversation pour le reste de la session.
- Exécutez
/contextune fois dans une nouvelle session — cela montre ce qui est chargé (CLAUDE.md, outils MCP), afin que vous puissiez supprimer les éléments inutiles. /compactavant de faire une pause — le cache de prompt expire après une heure, et résumer pendant qu'il est en cache est moins cher.
Le guide souligne que l'efficacité des tokens ne consiste pas à en utiliser moins en général, mais à s'assurer que ceux que vous utilisez sont consacrés à la tâche réelle. Par exemple, dans une session, Claude lit le test et le fichier qu'il couvre, édite et termine en quelques tours. Dans une autre, il cherche avec grep, lit une douzaine de fichiers pour atteindre les mêmes deux, et traîne tout ce contexte dans chaque tour suivant — coûtant plus cher et faisant réfléchir le modèle à des fichiers non pertinents.
📖 Lire la source complète : HN AI Agents
👀 See Also

Utiliser Claude pour analyser les schémas d'écriture afin d'améliorer les instructions personnalisées.
Un utilisateur de Reddit décrit une méthode pour créer des instructions personnalisées plus efficaces en faisant analyser par Claude 10 échantillons d'écriture afin d'identifier des modèles concrets comme l'évitement de la ponctuation et les sources d'analogies, plutôt que de se fier à des descriptions subjectives du ton.

Exécution de Qwen3.6 27B et 35B sur 6 Go de VRAM avec ik_llama : configurations pratiques et benchmarks
Un utilisateur partage des configurations ik_llama détaillées et des métriques de performance pour exécuter les modèles Qwen3.6 27B et 35B A3B sur un RTX2060 mobile (6 Go VRAM, 32 Go RAM), avec des vitesses de préremplissage de 40-100 t/s et une génération jusqu'à 11 t/s.

OpenClaw Mega Cheatsheet : Votre Portail vers la Maîtrise du Codage IA
Plongez dans le Méga Guide OpenClaw de r/openclaw — un guide complet rempli de conseils essentiels pour les passionnés de codage IA et d'automatisation.

Comment sécuriser Claude Cowork avec une couche proxy : Guide pratique
Un guide pour configurer une couche proxy afin d'observer et de sécuriser le comportement de Claude Cowork, publié par l'équipe General Analysis.