Маршрутизация подзадач агента к более дешевым моделям снизила стоимость с $18 до $4 при том же рефакторинге

✍️ OpenClawRadar📅 Опубликовано: 19 мая 2026 г.🔗 Source
Маршрутизация подзадач агента к более дешевым моделям снизила стоимость с $18 до $4 при том же рефакторинге
Ad

Один разработчик на r/ClaudeAI описывает практичную стратегию оптимизации затрат для циклов агентов: направлять рутинные подзадачи на дешевые модели, а дорогие (Opus 4.7) использовать только для сложных рассуждений. Их агент рефакторинга — обрабатывающий переименование CSS-переменных, обновление YAML-конфигов и запуск линтера через MCP — изначально отправлял каждый шаг на Opus 4.7, что обходилось примерно в $18. После внедрения логики маршрутизации 178 из 212 шагов пошли на дешевые модели, снизив стоимость до примерно $4 без заметной разницы в качестве для рутинных изменений.

Логика маршрутизации

  • Сложные подзадачи → Opus 4.7: Архитектура компонентов, отладка ночного кода, все, что требует длительных рассуждений в длинных диалогах. Автор отмечает, что Opus действительно непревзойден в такой работе — предыдущая попытка направить баг с промежуточным слоем аутентификации на более дешевую модель молча сломала обработку сессий, что стоило часа поисков.
  • Рутинные подзадачи → более дешевые модели: Линтинг, переименование, правки конфигов, оркестрация инструментов. Автор остановился на DeepSeek V4 Pro для общих задач кодинга и Tencent Hunyuan Hy3 preview для активного вызова инструментов. На конец апреля Hunyuan Hy3 занимал первое место на OpenRouter по объему вызовов инструментов и почти никогда не портит вызов функций, если схема чистая.
Ad

Сравнение стоимости

  • Opus 4.7: ~$0,18 за миллион входных токенов (оценка на основе контекста, примерно в 28 раз дороже альтернативы).
  • Tencent Hunyuan Hy3: $0,18 за миллион входных токенов, $0,59 за миллион выходных — примерно в 28 раз дешевле Opus 4.7 по входу.
  • Тот же рефакторинг из 212 шагов: 178 шагов в дешевый уровень, 34 шага в Opus. Стоимость упала с $18 до ~$4.

Режимы отказов

  • Модель вызова инструментов галлюцинирует параметры, когда схемы неаккуратны (автор признает, что схемы были плохими).
  • DeepSeek V4 Pro иногда пишет синтаксически идеальный код, который делает противоположное тому, что просили, и это выживает при беглом просмотре.
  • Ни одна дешевая модель не может сравниться с Opus в отладке глубоких проблем (например, поток аутентификации, молча съедающий cookie).

Правило принятия решений

Эвристика маршрутизации автора: «Насколько дорого обойдется ложный ответ?» Плохое исправление линтера стоит 2-секундного отката git; плохое архитектурное решение стоит целого дня.

Экономия позволила выполнять ранее пропущенные задачи — например, писать и запускать тесты для каждого изменения CSS или регенерировать все Open Graph изображения — потому что при долях цента за вызов инструмента нет причин этого не делать.

📖 Читать полный источник: r/ClaudeAI

Ad

👀 Смотрите также

Обеспечение жестких ограничений для ИИ-агентов OpenClaw: управление утверждением и ограничения параллелизма
Советы

Обеспечение жестких ограничений для ИИ-агентов OpenClaw: управление утверждением и ограничения параллелизма

Пользователь r/openclaw спрашивает, как обеспечить соблюдение строгих правил, таких как одобрение электронной почты и ограничения параллелизма, для Discord-бота OpenClaw, работающего на Ollama с GLM. Ответ: перенесите контроль за пределы цикла рассуждений модели.

OpenClawRadar
Источники данных Claude: Когда запрашивать веб-поиск для получения актуальной информации
Советы

Источники данных Claude: Когда запрашивать веб-поиск для получения актуальной информации

Claude иногда полагается на внутренние обучающие данные вместо выполнения веб-поиска, что может предоставлять устаревшую информацию. Пользователи могут специально запрашивать веб-поиск для получения более актуальных результатов.

OpenClawRadar
Попросите ИИ определить свои термины на основе первых принципов для улучшения результатов и проверяемости рассуждений
Советы

Попросите ИИ определить свои термины на основе первых принципов для улучшения результатов и проверяемости рассуждений

Пользователь на r/ClaudeAI обнаружил, что добавление одной инструкции — разбивать неопределенные термины на атомарные значения перед продолжением — дает более конкретные результаты и позволяет отлаживать цепочку рассуждений.

OpenClawRadar
Проблема с доступом к файлам Claude Cowork в режиме потоковой передачи Google Drive и её решение
Советы

Проблема с доступом к файлам Claude Cowork в режиме потоковой передачи Google Drive и её решение

При использовании Claude Cowork с Google Drive для Desktop в потоковом режиме файлы могут не открываться, потому что Coworkу нужны реальные файлы на диске, а не заглушки. Решение включает в себя обеспечение доступности определенных папок в автономном режиме и использование стандартных форматов файлов.

OpenClawRadar