Маршрутизация снижает стоимость использования OpenClaw Max на 85%: с $200/мес до $30/мес с помощью API-маршрутизации

Один пользователь OpenClaw Max подсчитал и обнаружил, что только около 15% ежедневного использования токенов действительно требует модель уровня Opus. Остальное — чтение файлов, git status, сканирование контекста проекта, генерация тестов, создание шаблонов, форматирование, переименование, простые рефакторинги — может выполняться более дешевыми моделями, такими как Sonnet, или даже еще более дешевыми альтернативами.
Разбивка использования токенов
- ~40% — чтение файлов, git status, сканирование контекста проекта: Opus не нужен
- ~25% — генерация тестов, создание шаблонов, стандартный код: Sonnet справляется идентично
- ~20% — форматирование, переименование, простые рефакторинги: любая модель подходит
- ~15% — собственно сложные рассуждения, кросс-файловая архитектура: единственная часть, где нужен Opus
Перейдя с подписки Max за $200/месяц на API с правилами маршрутизации, пользователь настроил Sonnet для рутинных задач и Opus только для кросс-файловых рассуждений. Ежемесячный счет снизился примерно до $30 — сокращение на 85% — без заметного изменения качества вывода, поскольку сложные задачи все еще выполняет Opus.
Пользователь отмечает, что модель подписки намеренно скрывает эту неэффективность: нет разбивки по токенам, нет видимости стоимости за задачу, только квота, которая загадочно уменьшается.
Для команд или частных лиц, платящих за премиум-планы, маршрутизация через API может принести значительную экономию без потери производительности на задачах, которые действительно требуют моделей высшего уровня.
📖 Read the full source: r/openclaw
👀 Смотрите также

Подходы "Укус" против "Покусывание" для ИИ-агентов в программировании
Исследователь в области NLP объясняет две ментальные модели работы с ИИ-агентами для программирования: подход 'укуса' с использованием комплексных файлов инструкций, таких как claude.md, и подход 'покусывания' с постепенным улучшением через несколько проходов.

Не предполагайте, что дорогие модели лучше: пример экономии в 13 раз при тестировании
Пользователь заменил GPT-5.4 на Gemini 3.1 Flash Lite в задаче классификации, получив идентичную точность 85% при затратах в 13 раз меньше, после оценки 21 модели.

Как сократить расходы на OpenClaw Agent на 80% с помощью смены модели
Пользователь отслеживал использование токенов в течение 14 дней и обнаружил, что 67% расходов приходилось на задачи, где дешевые модели Flash соответствовали качеству Opus. Переход на Flash по умолчанию и использование /model во время сессии сократили расходы с ~$170 до ~$35 в месяц.

Память рабочего процесса против инструментов: почему загрузка контекста эффективнее гигантских промптов
Вместо того чтобы запихивать инструкции в промпты, загружайте чек-листы для конкретных рабочих процессов по мере необходимости — чек-лист релиза, правила горячего исправления, шаги миграции — и убирайте их, когда работа завершена.