Параллельные субагенты в Claude Code: когда они экономят токены, а когда сжигают

Цифры Anthropic часто игнорируются в шумихе вокруг «используйте под-агентов!»: системы с несколькими агентами потребляют примерно в 15 раз больше токенов, чем один чат, и они «менее эффективны для тесно взаимосвязанных задач, таких как программирование» (источник). Однако кэшированные токены стоят всего 10% от обычной цены (скидка 90%), но только если содержимое, помеченное для кэширования, одинаково во всех запросах (источник).
Мульти-агент увеличивает использование токенов в 15 раз. Кэш делит это на 10. Окупаются ли под-агенты или сжигают деньги, сводится к одному: все ли под-агенты используют один и тот же префикс?
Три способа делегирования, отсортированные по стоимости
- 1. Под-агент с заданным
subagent_type. Пользовательский системный промпт, пользовательские инструменты, пользовательские разрешения (Anthropic). Другой промпт = другой кэш. Нет общего кэша с родителем. Полная цена каждый раз. Используйте, когда действительно нужна изоляция. - 2. Клон, наследующий родителя. Без
subagent_type. Наследует промпт, инструменты и историю родителя в точности. Дочерние агенты 2..N попадают в кэш по цене 10%. Пять клонов, параллельно читающих файлы, ≈ скорость в 5 раз при стоимости ~1.5×. - 3. Без под-агентов. Оставайтесь в основном агенте. Дешевле всего за один шаг. Правильный ответ, когда работа зависит от самой себя — рефакторинг, где шаг 2 требует результата шага 1.
Когда НЕ нужно делегировать (собственная линия Anthropic)
«Лучше всего подходит для задач, которые можно разделить на параллельные направления исследования.» Перевод:
- Хорошо: прочитать 7 файлов параллельно, проверить папки на шаблон, собрать информацию из многих источников.
- Плохо: рефакторинг модуля, исправление ошибки, где каждый шаг зависит от предыдущего. Только основной агент.
Если вы разделяете тесно связанную работу на под-агентов, вы платите в 15 раз больше и ничего не выигрываете.
Что ломает кэш
Anthropic: редактирование определений инструментов, смена моделей, добавление или удаление изображений, изменение структуры предыдущего промпта ломает кэшированный префикс (источник). Так что:
- Устанавливайте ваши MCP в начале сессии, а не в середине.
- Выбирайте модель заранее.
- Не редактируйте
CLAUDE.mdили авто-память в середине сессии — они находятся внутри кэшированного префикса.
📖 Читать полный источник: r/ClaudeAI
👀 Смотрите также

Управление контекстом ИИ с помощью хранилища знаний SQLite и инструментов MCP
Один разработчик создал RunawayContext — систему с лицензией MIT, которая хранит уроки проекта в SQLite с FTS5 и опциональным sqlite-vec, сохраняя контекст за сессию менее 3K токенов с помощью инструментов запросов MCP и жестко заданных ограничений.

Пястовские ворота: Открытый прокси-API для анонимизации данных LLM
Piast Gate — это API-прокси с открытым исходным кодом, который анонимизирует конфиденциальные данные перед отправкой запросов к LLM и восстанавливает исходные данные в ответах. Текущая MVP-версия поддерживает API Google Gemini, польский язык, локальное выполнение и может анонимизировать текст или документы Word без обработки LLM.

Zerostack 1.0.0: Unix-вдохновленный агент программирования на чистом Rust
Zerostack — это агент для написания кода, написанный на чистом Rust, смоделированный по философии Unix — небольшие компонуемые инструменты, объединённые через stdin/stdout.

Стальной человек R5: Дообученная модель на 14 миллиардов параметров превосходит Claude Opus в генерации кода Ada.
Разработчик дообучил модель Qwen2.5-Coder-14B-Instruct с помощью QLoRA на верифицированном компилятором наборе из 3 430 пар инструкций Ada/SPARK, достигнув 68,6% успешных компиляций в пользовательском тесте против 42,1% у Claude Opus 4.6. Модель доступна через Ollama и занимает 12 ГБ видеопамяти.