Настройка RouteLLM для экономичного маршрутизации AI-задач

✍️ OpenClawRadar📅 Опубликовано: 9 марта 2026 г.🔗 Source
Настройка RouteLLM для экономичного маршрутизации AI-задач
Ad

Конфигурация Docker Compose для гибридной настройки ИИ

Пользователь Reddit опубликовал подробную конфигурацию Docker Compose, реализующую то, что он называет "Суперинтеллектом для бедных" — гибридную систему ИИ, которая маршрутизирует задачи между локальными и облачными моделями в зависимости от сложности.

Основные компоненты

Система использует четыре основных сервиса:

  • vscode-openwire: Использует образ sendmeticket/vscode-openwire:1.0.0 с открытыми портами 3000 и 3030. Это обеспечивает доступ к GitHub Copilot через OpenWire, хотя в источнике отмечается, что это может нарушать условия использования, и предлагается использовать доступный API-ключ.
  • ollama: Запускает ollama/ollama:latest с открытым портом 11434. Он автоматически загружает и обслуживает модель qwen3.5:4b в качестве локальной "слабой" модели.
  • openroutellm: Использует образ sendmeticket/openroutellm:1.0.0 на порту 6060. Это сервис маршрутизации, который решает, какая модель обрабатывает каждый запрос.
  • openclaw: Запускает ghcr.io/openclaw/openclaw:latest с открытыми портами 18789 и 18790, выступая в качестве основного интерфейса.
Ad

Конфигурация RouteLLM

Сервис openroutellm настроен с определёнными параметрами:

python -m routellm.openai_server --routers bert --default-router-threshold 0.75 --port 6060 --openwire-base-url http://vscode-openwire:3030/v1 --ollama-base-url http://ollama:11434/v1 --strong-model gpt-4o --weak-model qwen3.5:4b

Эта настройка использует маршрутизацию на основе BERT с порогом 0.75 для определения, когда отправлять задачи к "сильной" модели (GPT-4o), а когда к локальной "слабой" модели (Qwen3.5:4b).

Как это работает

Система направляет сложные задачи к платной модели GPT-4o через OpenWire/Copilot, в то время как более простые задачи обрабатываются локальной моделью Qwen3.5:4b, работающей в Ollama. Это создаёт то, что автор описывает как "отказоустойчивую, локально-ориентированную модель ИИ с низким базовым интеллектом, но очень высоким максимальным интеллектом".

Все сервисы соединены через пользовательскую сеть Docker (openclaw_net с подсетью 172.10.10.0/24) и включают проверки работоспособности для обеспечения доступности сервисов.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Otterly: Маршрутизируйте OpenClaw через вашу подписку на Claude Code
Инструменты

Otterly: Маршрутизируйте OpenClaw через вашу подписку на Claude Code

Otterly — это небольшой npm-пакет, который превращает локальный Claude CLI в HTTP-сервер, совместимый с OpenAI, позволяя направлять запросы OpenClaw через подписку Claude Code вместо оплаты за токены.

OpenClawRadar
Постоянная боковая панель для Claude Code с автономным управлением контентом
Инструменты

Постоянная боковая панель для Claude Code с автономным управлением контентом

Разработчик создал TUI-панель, которая располагается в разделённой панели iTerm2 рядом с терминалом, с тремя фиксированными панелями, которыми Claude автономно управляет для отображения релевантного контента, такого как код, диаграммы и обновления статуса.

OpenClawRadar
Tacit: язык программирования, ориентированный на LLM, созданный с помощью Claude Code и Opus 4.7
Инструменты

Tacit: язык программирования, ориентированный на LLM, созданный с помощью Claude Code и Opus 4.7

Tacit — это экспериментальный язык программирования, ориентированный на LLM, созданный и реализованный с помощью Claude Code и Opus 4.7. Он избавляется от человеческих удобств, чтобы минимизировать использование токенов, и поставляется с праймером, который обучает LLM среднего уровня (Sonnet и выше) писать код на Tacit.

OpenClawRadar
SymDex: Открытый MCP-индексатор кода сокращает потребление токенов ИИ-агентами
Инструменты

SymDex: Открытый MCP-индексатор кода сокращает потребление токенов ИИ-агентами

SymDex — это инструмент с открытым исходным кодом для индексирования кода по протоколу MCP. Он предварительно индексирует базы кода, чтобы помочь AI-агентам для программирования находить функции и классы без чтения целых файлов, что, согласно тестам разработчика, сокращает использование токенов примерно на 97% за один поиск.

OpenClawRadar