Optimisation de la valeur des sessions Claude Code : Conseils d'efficacité des jetons

Anthropic a publié un guide pratique pour tirer le meilleur parti de chaque token dépensé dans les sessions Claude Code. Il couvre les mécanismes de tarification des tokens et propose six tactiques concrètes pour réduire le gaspillage sans changer de modèle.
Ce qui détermine le coût des tokens
Vous êtes facturé par token, mais vous payez en réalité pour le temps d'inférence GPU. Trois facteurs déterminent le prix d'un token : la taille du modèle, l'entrée par rapport à la sortie, et la mise en cache. Les tokens de sortie coûtent environ 5 fois plus que ceux d'entrée car le décodage exécute le modèle une fois par token. Les tokens d'entrée mis en cache sont moins chers, et le cache de prompt expire après une heure.
Six façons de réduire le gaspillage de tokens
- Exécutez
/clearentre les tâches — cela évite d'envoyer au modèle un contexte antérieur non pertinent, ce qui réduit l'utilisation de tokens. - Définissez votre modèle et le niveau d'effort avant de commencer — les changer en cours de conversation casse le cache de prompt, augmentant le coût.
- Mentionnez les fichiers avec @ au lieu de les nommer — le fichier s'attache directement à votre message, économisant un appel Read ou une recherche dans le dépôt.
- Ajoutez des flags silencieux aux commandes bruyantes, ou exécutez-les dans un sous-agent — la sortie de commande reste dans la conversation pour le reste de la session.
- Exécutez
/contextune fois dans une nouvelle session — cela montre ce qui est chargé (CLAUDE.md, outils MCP), afin que vous puissiez supprimer les éléments inutiles. /compactavant de faire une pause — le cache de prompt expire après une heure, et résumer pendant qu'il est en cache est moins cher.
Le guide souligne que l'efficacité des tokens ne consiste pas à en utiliser moins en général, mais à s'assurer que ceux que vous utilisez sont consacrés à la tâche réelle. Par exemple, dans une session, Claude lit le test et le fichier qu'il couvre, édite et termine en quelques tours. Dans une autre, il cherche avec grep, lit une douzaine de fichiers pour atteindre les mêmes deux, et traîne tout ce contexte dans chaque tour suivant — coûtant plus cher et faisant réfléchir le modèle à des fichiers non pertinents.
📖 Lire la source complète : HN AI Agents
👀 See Also

Comment exécuter en toute sécurité les outils natifs de llama.cpp (exec_shell_command) avec multi-sandboxing sur Linux
Un guide pratique pour activer les outils natifs de llama.cpp, notamment exec_shell_command, et les exécuter dans plusieurs sandbox (Firejail + une petite VM Alpine) pour une récupération web et une exécution de commandes sécurisées via l'interface web llama-server.

Solution de contournement pour l'accès à OpenClaw Claude via l'interface en ligne de commande Claude Code
Une méthode permet de router OpenClaw via l'interface en ligne de commande Claude Code pour maintenir l'accès à l'abonnement Claude après qu'Anthropic ait bloqué les accès directs des outils tiers. Le processus implique l'installation du CLI, la configuration d'un jeton OAuth et la configuration d'OpenClaw pour utiliser le plugin ACP.

Architecture mémoire à trois couches pour le contexte persistant de l'agent OpenClaw
Un développeur a construit un système de mémoire à 3 couches sur l'infrastructure d'OpenClaw pour empêcher les agents de démarrer chaque session sans contexte. L'architecture comprend des fichiers d'espace de travail L1 injectés à chaque tour, une recherche de mémoire sémantique L2 et des documents de référence L3 ouverts à la demande.
Automatisation des mises à niveau d'OpenClaw avec un agent IA : un guide éprouvé sur le terrain
Un développeur explique comment il a entraîné un agent IA Hermes à gérer les mises à niveau d'OpenClaw, réduisant une migration de plusieurs heures, stressante, à « exécuter le playbook, rencontrer deux problèmes connus ».