Настройка RouteLLM для экономичного маршрутизации AI-задач

Конфигурация Docker Compose для гибридной настройки ИИ
Пользователь Reddit опубликовал подробную конфигурацию Docker Compose, реализующую то, что он называет "Суперинтеллектом для бедных" — гибридную систему ИИ, которая маршрутизирует задачи между локальными и облачными моделями в зависимости от сложности.
Основные компоненты
Система использует четыре основных сервиса:
- vscode-openwire: Использует образ
sendmeticket/vscode-openwire:1.0.0с открытыми портами 3000 и 3030. Это обеспечивает доступ к GitHub Copilot через OpenWire, хотя в источнике отмечается, что это может нарушать условия использования, и предлагается использовать доступный API-ключ. - ollama: Запускает
ollama/ollama:latestс открытым портом 11434. Он автоматически загружает и обслуживает модельqwen3.5:4bв качестве локальной "слабой" модели. - openroutellm: Использует образ
sendmeticket/openroutellm:1.0.0на порту 6060. Это сервис маршрутизации, который решает, какая модель обрабатывает каждый запрос. - openclaw: Запускает
ghcr.io/openclaw/openclaw:latestс открытыми портами 18789 и 18790, выступая в качестве основного интерфейса.
Конфигурация RouteLLM
Сервис openroutellm настроен с определёнными параметрами:
python -m routellm.openai_server --routers bert --default-router-threshold 0.75 --port 6060 --openwire-base-url http://vscode-openwire:3030/v1 --ollama-base-url http://ollama:11434/v1 --strong-model gpt-4o --weak-model qwen3.5:4bЭта настройка использует маршрутизацию на основе BERT с порогом 0.75 для определения, когда отправлять задачи к "сильной" модели (GPT-4o), а когда к локальной "слабой" модели (Qwen3.5:4b).
Как это работает
Система направляет сложные задачи к платной модели GPT-4o через OpenWire/Copilot, в то время как более простые задачи обрабатываются локальной моделью Qwen3.5:4b, работающей в Ollama. Это создаёт то, что автор описывает как "отказоустойчивую, локально-ориентированную модель ИИ с низким базовым интеллектом, но очень высоким максимальным интеллектом".
Все сервисы соединены через пользовательскую сеть Docker (openclaw_net с подсетью 172.10.10.0/24) и включают проверки работоспособности для обеспечения доступности сервисов.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

AI Token Monitor: Инструмент для macOS отслеживает локальное использование Claude и расходы
Разработчик создал AI Token Monitor — приложение для строки меню macOS, которое читает локальные файлы сессий Claude для отслеживания использования токенов, распределения моделей и эквивалентов стоимости без API-ключей. Инструмент с открытым исходным кодом показал 6,5 млн токенов (4 924 доллара по ценам API) за 35 дней в случае одного пользователя.

ClawWatcher достиг отметки в 200 пользователей, сообщив о совокупной экономии более $28K на API OpenClaw.
ClawWatcher, инструмент для отслеживания затрат на API OpenClaw в реальном времени, достиг 200 пользователей. По словам его создателя, пользователи в совокупности сэкономили более 28 000 долларов на затратах на API, со средним снижением расходов на 45%.

Открытая система постоянной памяти для Claude Code решает проблему потери контекста между сессиями.
Разработчик создал файловую систему памяти для Claude Code, которая автоматически захватывает контекст проекта без плагинов или API-ключей. Она использует транскрипты разговоров, файл входящих сообщений и ночные задания cron для поддержания постоянной памяти между сессиями.

Представляем Swarmhook: бесплатные и с открытым исходным кодом вебхуки для вашего бота.
Swarmhook.com предлагает бесплатные и открытые вебхуки для эффективного управления событиями ваших ботов, упрощая автоматизацию и реакцию.