Маршрутизация подзадач агента к более дешевым моделям снизила стоимость с $18 до $4 при том же рефакторинге

✍️ OpenClawRadar📅 Опубликовано: 19 мая 2026 г.🔗 Source
Маршрутизация подзадач агента к более дешевым моделям снизила стоимость с $18 до $4 при том же рефакторинге
Ad

Один разработчик на r/ClaudeAI описывает практичную стратегию оптимизации затрат для циклов агентов: направлять рутинные подзадачи на дешевые модели, а дорогие (Opus 4.7) использовать только для сложных рассуждений. Их агент рефакторинга — обрабатывающий переименование CSS-переменных, обновление YAML-конфигов и запуск линтера через MCP — изначально отправлял каждый шаг на Opus 4.7, что обходилось примерно в $18. После внедрения логики маршрутизации 178 из 212 шагов пошли на дешевые модели, снизив стоимость до примерно $4 без заметной разницы в качестве для рутинных изменений.

Логика маршрутизации

  • Сложные подзадачи → Opus 4.7: Архитектура компонентов, отладка ночного кода, все, что требует длительных рассуждений в длинных диалогах. Автор отмечает, что Opus действительно непревзойден в такой работе — предыдущая попытка направить баг с промежуточным слоем аутентификации на более дешевую модель молча сломала обработку сессий, что стоило часа поисков.
  • Рутинные подзадачи → более дешевые модели: Линтинг, переименование, правки конфигов, оркестрация инструментов. Автор остановился на DeepSeek V4 Pro для общих задач кодинга и Tencent Hunyuan Hy3 preview для активного вызова инструментов. На конец апреля Hunyuan Hy3 занимал первое место на OpenRouter по объему вызовов инструментов и почти никогда не портит вызов функций, если схема чистая.
Ad

Сравнение стоимости

  • Opus 4.7: ~$0,18 за миллион входных токенов (оценка на основе контекста, примерно в 28 раз дороже альтернативы).
  • Tencent Hunyuan Hy3: $0,18 за миллион входных токенов, $0,59 за миллион выходных — примерно в 28 раз дешевле Opus 4.7 по входу.
  • Тот же рефакторинг из 212 шагов: 178 шагов в дешевый уровень, 34 шага в Opus. Стоимость упала с $18 до ~$4.

Режимы отказов

  • Модель вызова инструментов галлюцинирует параметры, когда схемы неаккуратны (автор признает, что схемы были плохими).
  • DeepSeek V4 Pro иногда пишет синтаксически идеальный код, который делает противоположное тому, что просили, и это выживает при беглом просмотре.
  • Ни одна дешевая модель не может сравниться с Opus в отладке глубоких проблем (например, поток аутентификации, молча съедающий cookie).

Правило принятия решений

Эвристика маршрутизации автора: «Насколько дорого обойдется ложный ответ?» Плохое исправление линтера стоит 2-секундного отката git; плохое архитектурное решение стоит целого дня.

Экономия позволила выполнять ранее пропущенные задачи — например, писать и запускать тесты для каждого изменения CSS или регенерировать все Open Graph изображения — потому что при долях цента за вызов инструмента нет причин этого не делать.

📖 Читать полный источник: r/ClaudeAI

Ad

👀 Смотрите также

Подсказка для Клода по визуализации структуры мышления: Намерение, Реальность, Разрыв
Советы

Подсказка для Клода по визуализации структуры мышления: Намерение, Реальность, Разрыв

Пользователь Reddit делится 100-словным промптом для Claude, который просит ИИ замечать и отражать структурные паттерны в разговоре — классифицированные как Намерение (что вы ХОТИТЕ), Реальность (что ЕСТЬ) и Разрыв (что НЕ РЕШЕНО) — а не сам контент.

OpenClawRadar
Запуск OpenClaw внутри Docker-контейнера Ollama для упрощения работы с сетью
Советы

Запуск OpenClaw внутри Docker-контейнера Ollama для упрощения работы с сетью

Пользователь Reddit показывает, как установить OpenClaw внутрь официального Docker-контейнера ollama/ollama, чтобы OpenClaw связывался с Ollama через localhost, избегая host.docker.internal и дополнительной настройки сети. Компромисс — более высокое использование ОЗУ.

OpenClawRadar
Диагностика сниженной производительности Claude: первопричины и исправления
Советы

Диагностика сниженной производительности Claude: первопричины и исправления

Практический разбор того, почему результаты кодирования Claude со временем ухудшаются, и действенные решения, включая управление контекстом и гигиену промптов.

OpenClawRadar
Исправление ошибки Auth 400: Использование пакета mnemonic в Python для обхода триггеров фильтра BIP39
Советы

Исправление ошибки Auth 400: Использование пакета mnemonic в Python для обхода триггеров фильтра BIP39

Пользователь Reddit обнаружил, что контент-фильтр Anthropic вызывает ошибку 400, когда ИИ-агенты пытаются записать полный список слов BIP39 (2048 стандартизированных английских слов) в код Python. Решение заключается в использовании пакета mnemonic для Python, который уже содержит этот список слов внутри себя.

OpenClawRadar