Гибридный подход "Локальный+API" снижает затраты на ИИ на 79% в ходе месячного тестирования.

Разработчик поделился подробными результатами месячной работы гибридной системы ИИ (локальные модели + API), показав значительную экономию по сравнению с подходами, использующими только API или только локальные модели. Система обрабатывает электронную почту, генерацию кода, исследования и мониторинг, выполняя около 500 API-вызовов в день.
Детализация затрат и экономия
Ежемесячные расходы снизились с $288 до примерно $60, что составляет сокращение на 79%. Разработчик отмечает, что 79% экономии получено за счёт отказа от использования дорогих API-моделей для простых задач, тогда как локальные модели внесли вклад лишь в 15-20% от общей экономии. Решения по маршрутизации задач обеспечили 45% экономии.
Реализация локальных моделей
- Эмбеддинги: Переключился на nomic-embed-text через Ollama (274 МБ, работает на CPU). Качество было «достаточно близким для поиска, и я на практике действительно не чувствую разницы». Экономия составила около $40 в месяц.
- Фоновые задачи: Использует Qwen2.5 7B для парсинга логов, простой классификации и запланированных отчётов. Работает бесплатно на VPS для задач, не требующих творческого мышления.
Где локальные модели не справились
Пробовал Qwen2.5 14B и квантованную Llama 70B для сложных задач, таких как анализ, написание контента и ревью кода. Разрыв в качестве был настолько значительным, что «я тратил больше времени на проверку и исправление результатов, чем экономил на API-расходах». Разработчик подчёркивает, что «плохие результаты от локальных моделей не просто ничего не стоят — они стоят вам ВРЕМЕНИ».
Текущая стратегия гибридной маршрутизации
- Эмбеддинги: nomic-embed-text (локально) — $0
- Простые задачи: Claude Haiku ($0.25/М) — 85% вызовов
- Фоновые/запланированные: Qwen2.5 7B (локально) — 15% вызовов
- Анализ/написание: Claude Sonnet ($3/М)
- Критические решения: Claude Opus ($15/М) — <2% вызовов
Ключевой вывод
Разработчик заключает: «Мечта о „полностью локальном“ решении заманчива, но преждевременна для рабочих нагрузок в продакшене. Модели на 7B параметров невероятны для своего размера, но они пока не могут заменить API-модели во всём. Настоящая оптимизация — не в выборе „локально или API“, а в маршрутизации каждой задачи к самому дешёвому инструменту, который справляется с ней достаточно хорошо».
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Отладка BadUSB на Pi Zero 2W с помощью Claude Code: исправление «невозможной» ошибки
Разработчик пересобрал набор инструментов BadUSB для Pi Zero 2W с Claude Code, который диагностировал ошибку неверного сигнала, эмпирически подтвердил аппаратные ограничения и исправил молчаливую неработающую операцию на Python менее чем за 4 часа.

Разработчик создает полную ERP-систему с ИИ-ассистентом, используя Claude и Gemini
Разработчик создал полную ERP-платформу под названием AXIO с 9 модулями и AI-ассистентом, который выполняет голосовые команды с использованием Gemini 2.5 Flash с 16 инструментами вызова функций. Система была построена на Next.js 14, TypeScript и Supabase за 3 недели с помощью 'вайб-кодинга' с Claude.

Партнерская программа Claude: консалтинг из двух человек решает задачу для десяти с помощью сертифицированных независимых специалистов
Консалтинговая компания в сфере ИИ из двух человек использовала Claude, чтобы попасть в партнёрскую программу Anthropic, а затем привлекла сертифицированных независимых специалистов для соблюдения требования о 10 сотрудниках.

Создание корпоративной логистической платформы на $20 тыс./год с Claude и суперспособностями
TRMNL заменила ShipHero на Claude и Superpowers менее чем за месяц, создав собственную систему выполнения заказов с интеграциями UPS, FedEx, DHL и USPS за $100 на токены.