Настройка RouteLLM для экономичного маршрутизации AI-задач

Конфигурация Docker Compose для гибридной настройки ИИ
Пользователь Reddit опубликовал подробную конфигурацию Docker Compose, реализующую то, что он называет "Суперинтеллектом для бедных" — гибридную систему ИИ, которая маршрутизирует задачи между локальными и облачными моделями в зависимости от сложности.
Основные компоненты
Система использует четыре основных сервиса:
- vscode-openwire: Использует образ
sendmeticket/vscode-openwire:1.0.0с открытыми портами 3000 и 3030. Это обеспечивает доступ к GitHub Copilot через OpenWire, хотя в источнике отмечается, что это может нарушать условия использования, и предлагается использовать доступный API-ключ. - ollama: Запускает
ollama/ollama:latestс открытым портом 11434. Он автоматически загружает и обслуживает модельqwen3.5:4bв качестве локальной "слабой" модели. - openroutellm: Использует образ
sendmeticket/openroutellm:1.0.0на порту 6060. Это сервис маршрутизации, который решает, какая модель обрабатывает каждый запрос. - openclaw: Запускает
ghcr.io/openclaw/openclaw:latestс открытыми портами 18789 и 18790, выступая в качестве основного интерфейса.
Конфигурация RouteLLM
Сервис openroutellm настроен с определёнными параметрами:
python -m routellm.openai_server --routers bert --default-router-threshold 0.75 --port 6060 --openwire-base-url http://vscode-openwire:3030/v1 --ollama-base-url http://ollama:11434/v1 --strong-model gpt-4o --weak-model qwen3.5:4bЭта настройка использует маршрутизацию на основе BERT с порогом 0.75 для определения, когда отправлять задачи к "сильной" модели (GPT-4o), а когда к локальной "слабой" модели (Qwen3.5:4b).
Как это работает
Система направляет сложные задачи к платной модели GPT-4o через OpenWire/Copilot, в то время как более простые задачи обрабатываются локальной моделью Qwen3.5:4b, работающей в Ollama. Это создаёт то, что автор описывает как "отказоустойчивую, локально-ориентированную модель ИИ с низким базовым интеллектом, но очень высоким максимальным интеллектом".
Все сервисы соединены через пользовательскую сеть Docker (openclaw_net с подсетью 172.10.10.0/24) и включают проверки работоспособности для обеспечения доступности сервисов.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Otterly: Маршрутизируйте OpenClaw через вашу подписку на Claude Code
Otterly — это небольшой npm-пакет, который превращает локальный Claude CLI в HTTP-сервер, совместимый с OpenAI, позволяя направлять запросы OpenClaw через подписку Claude Code вместо оплаты за токены.

Постоянная боковая панель для Claude Code с автономным управлением контентом
Разработчик создал TUI-панель, которая располагается в разделённой панели iTerm2 рядом с терминалом, с тремя фиксированными панелями, которыми Claude автономно управляет для отображения релевантного контента, такого как код, диаграммы и обновления статуса.

Tacit: язык программирования, ориентированный на LLM, созданный с помощью Claude Code и Opus 4.7
Tacit — это экспериментальный язык программирования, ориентированный на LLM, созданный и реализованный с помощью Claude Code и Opus 4.7. Он избавляется от человеческих удобств, чтобы минимизировать использование токенов, и поставляется с праймером, который обучает LLM среднего уровня (Sonnet и выше) писать код на Tacit.

SymDex: Открытый MCP-индексатор кода сокращает потребление токенов ИИ-агентами
SymDex — это инструмент с открытым исходным кодом для индексирования кода по протоколу MCP. Он предварительно индексирует базы кода, чтобы помочь AI-агентам для программирования находить функции и классы без чтения целых файлов, что, согласно тестам разработчика, сокращает использование токенов примерно на 97% за один поиск.