Agents sous-agents parallèles dans Claude Code : quand ils économisent ou brûlent des jetons

Les chiffres d'Anthropic sont souvent ignorés dans le battage médiatique « utilisez des sous-agents ! » : les systèmes multi-agents consomment environ 15× plus de tokens qu'un simple chat, et ils sont « moins efficaces pour les tâches fortement interdépendantes comme le codage » (source). Cependant, les tokens mis en cache ne coûtent que 10 % du prix normal (90 % de réduction) — mais seulement si le contenu marqué pour la mise en cache est identique d'une requête à l'autre (source).
Le multi-agent multiplie l'utilisation des tokens par 15. Le cache les divise par 10. Que les sous-agents fassent économiser ou perdre de l'argent se résume à une chose : tous les sous-agents partagent-ils le même préfixe ?
Trois façons de déléguer, classées par coût
- 1. Sous-agent avec
subagent_typedéfini. Prompt système personnalisé, outils personnalisés, permissions personnalisées (Anthropic). Prompt différent = cache différent. Aucun partage avec le parent. Plein tarif à chaque création. À utiliser lorsque vous avez réellement besoin d'isolation. - 2. Clone qui hérite du parent. Pas de
subagent_type. Hérite exactement du prompt, des outils et de l'historique du parent. Les enfants 2..N accèdent au cache à 10 % du prix. Cinq clones lisant des fichiers en parallèle ≈ 5× la vitesse pour environ 1,5× le coût. - 3. Pas de sous-agent. Restez dans l'agent principal. Le moins cher par tour. La bonne réponse lorsque le travail dépend de lui-même — refontes où l'étape 2 a besoin du résultat de l'étape 1.
Quand NE PAS déléguer (la propre règle d'Anthropic)
« Meilleur pour les tâches qui peuvent être divisées en branches parallèles de recherche. » Traduction :
- Bon : lire 7 fichiers en parallèle, auditer des dossiers pour un motif, rassembler des informations de nombreuses sources.
- Mauvais : refactoriser un module, corriger un bogue où chaque étape dépend de la précédente. Agent principal uniquement.
Si vous découpez un travail étroitement couplé en sous-agents, vous payez 15× et ne gagnez rien.
Ce qui brise le cache
Anthropic : modifier les définitions d'outils, changer de modèle, ajouter ou supprimer des images, ou modifier la structure antérieure du prompt brise le préfixe mis en cache (source). Donc :
- Installez vos MCPs au début de la session, pas en cours de session.
- Choisissez le modèle dès le départ.
- Ne modifiez pas
CLAUDE.mdou la mémoire automatique en cours de session — ils vivent à l'intérieur du préfixe mis en cache.
📖 Lire la source complète : r/ClaudeAI
👀 See Also

Serveur de Compétence OpenClaw pour l'Analyse et le Trading du Marché Indien
Un terminal de trading open-source pour les marchés indiens a été intégré en tant que serveur de compétences OpenClaw, permettant aux agents de récupérer des données de marché et d'exécuter des analyses multi-agents via HTTP. Le système fournit des plans de trading structurés avec des prix d'entrée, des stop-loss et des objectifs pour trois profils de risque.

Hors réseau : Utiliser le matériel téléphonique pour des applications d'IA hors ligne
Off Grid est une application open-source qui utilise le matériel de votre téléphone pour des tâches d'IA hors ligne, comme la génération de texte et la transcription vocale.

Colony : Une couche de coordination locale qui réduit les jetons de transfert multi-agents de 30 000 à 400
Colony est un substrat de coordination local-first qui réduit les coûts de transfert multi-agents d'environ 30 000 jetons à environ 400 en remplaçant la relecture du contexte par des observations compactes stockées dans SQLite.

Pile de modèles d'IA open source pour un remplacement économique de Claude
Un utilisateur de Reddit partage une pile de modèles d'IA fonctionnelle utilisant des modèles open source comme Llama 3.3 70b et DeepSeek R1 32b pour une exécution locale, réduisant les coûts mensuels d'IA de plus de 60 £ à moins de 3 £ en acheminant 90 % des tâches vers des modèles gratuits.