L'analyse de 100 millions de tokens dans Claude Code révèle une utilisation de 99,4 % des entrées.

Répartition de l'utilisation des tokens sur 100 millions de tokens suivis
Une analyse détaillée de l'utilisation de Claude Code a suivi 1 289 requêtes sur des sessions de codage prolongées, totalisant environ 100,9 millions de tokens. La répartition révèle un déséquilibre significatif entre les tokens d'entrée et de sortie.
Répartition des tokens :
- Tokens d'entrée : 100,3 millions (99,4 % du total)
- Tokens mis en cache : 84,2 millions (84 % des entrées)
- Tokens de sortie : 616 000 (0,6 % du total)
Le goulot d'étranglement de la relecture du contexte
Claude Code consacre 99,4 % de son budget de tokens à lire le contexte et seulement 0,6 % à écrire du code. Ce schéma n'est pas spécifique à Claude Code mais reflète le fonctionnement actuel de tous les systèmes de codage agentique. Chaque fois que Claude Code effectue une action — lire un fichier, exécuter une commande, modifier du code — il nécessite que le contexte complet soit réinjecté, y compris la structure du dépôt, l'historique de la conversation, les résultats des outils et les journaux d'erreurs.
Les 84 millions de tokens mis en cache représentent le même contexte réenvoyé 1 289 fois car le modèle n'a pas de mémoire persistante entre les tours. Contrairement aux développeurs humains qui maintiennent un modèle mental de leur base de code, Claude Code suit un schéma de : tout oublier → tout relire → écrire du code → tout oublier à nouveau.
Limitations de la mise en cache des prompts
La mise en cache des prompts d'Anthropic rend ce processus moins coûteux mais pas plus rapide. Le goulot d'étranglement n'est pas la vitesse d'inférence — c'est la boucle de relecture. L'analyse suggère que le véritable déclencheur pour Claude Code et le codage agentique en général serait une mémoire de projet persistante — pas seulement des faits sauvegardés via des fichiers de mémoire ou CLAUDE.md, mais une compréhension compressée et évolutive de la base de code qui se transmet d'une session à l'autre.
Les systèmes actuels forcent essentiellement l'intelligence par la répétition du contexte au lieu de construire une compréhension. Le jour où cela changera pourrait rendre le codage par IA véritablement plus rapide en éliminant le besoin de traiter les mêmes informations à plusieurs reprises.
📖 Lire la source complète : r/ClaudeAI
👀 See Also

OpenClaw 5.4 ajoute les commandes /steer et /side : rediriger un agent en cours de tâche sans perdre le contexte
OpenClaw 5.4 introduit les commandes /steer et /side qui permettent de rediriger la direction actuelle d'une tâche d'un agent ou de lancer une conversation parallèle sans perdre le contexte de la session.

Anthropic répond à la fuite de code impliquant l'agent d'IA Claude
Anthropic travaille à contenir une fuite de code liée à son agent IA Claude, selon un rapport du WSJ discuté sur Hacker News avec 13 points et 6 commentaires.

Système Claude Code Prompts v2.1.51/52 : Nouveaux Prompts, Mises à Jour du SDK et Fonctionnalités en Disponibilité Générale
Les invites système Claude Code v2.1.51 et v2.1.52 ajoutent six nouvelles invites, mettent à jour les références SDK/API dans sept langages, et promeuvent l'exécution de code et la mémoire en disponibilité générale. Le SDK Agent Python a été retravaillé avec des changements asynchrones et de nouvelles interfaces.

Les tests comparatifs montrent que les modèles distillés égalent les LLM de pointe sur les tâches structurées, pour un coût 10 fois inférieur.
Une comparaison exhaustive des petits modèles Qwen3 distillés (0,6B à 8B) face aux LLM de pointe montre que les modèles distillés égalent ou surpassent les modèles de pointe de niveau intermédiaire sur 6 tâches sur 9, à un coût considérablement inférieur, avec Text2SQL atteignant 98,0 % de précision à 3 $/M de requêtes contre 378 $ pour Claude Haiku.