Configuración de RouteLLM para el Enrutamiento Rentable de Tareas de IA

✍️ OpenClawRadar📅 Publicado: 9 de marzo de 2026🔗 Source
Configuración de RouteLLM para el Enrutamiento Rentable de Tareas de IA
Ad

Configuración de Docker Compose para una Configuración Híbrida de IA

Un usuario de Reddit publicó una configuración detallada de Docker Compose que implementa lo que ellos llaman "Superinteligencia del Hombre Pobre" - un sistema híbrido de IA que enruta tareas entre modelos locales y en la nube según su complejidad.

Componentes Principales

El sistema utiliza cuatro servicios principales:

  • vscode-openwire: Utiliza la imagen sendmeticket/vscode-openwire:1.0.0 con los puertos 3000 y 3030 expuestos. Esto proporciona acceso a GitHub Copilot a través de OpenWire, aunque la fuente señala que esto puede violar los TOS y sugiere usar una clave API disponible en su lugar.
  • ollama: Ejecuta ollama/ollama:latest con el puerto 11434 expuesto. Descarga y sirve automáticamente el modelo qwen3.5:4b como el modelo local "débil".
  • openroutellm: Utiliza la imagen sendmeticket/openroutellm:1.0.0 en el puerto 6060. Este es el servicio de enrutamiento que decide qué modelo maneja cada solicitud.
  • openclaw: Ejecuta ghcr.io/openclaw/openclaw:latest con los puertos 18789 y 18790 expuestos, sirviendo como la interfaz principal.
Ad

Configuración de RouteLLM

El servicio openroutellm está configurado con parámetros específicos:

python -m routellm.openai_server --routers bert --default-router-threshold 0.75 --port 6060 --openwire-base-url http://vscode-openwire:3030/v1 --ollama-base-url http://ollama:11434/v1 --strong-model gpt-4o --weak-model qwen3.5:4b

Esta configuración utiliza enrutamiento basado en BERT con un umbral de 0.75 para determinar cuándo enviar tareas al modelo "fuerte" (GPT-4o) versus el modelo local "débil" (Qwen3.5:4b).

Cómo Funciona

El sistema enruta tareas difíciles al modelo de pago GPT-4o a través de OpenWire/Copilot, mientras que las tareas más simples son manejadas por el modelo local Qwen3.5:4b ejecutándose en Ollama. Esto crea lo que el autor describe como "un modelo de IA a prueba de fallos, local primero, con baja inteligencia base pero una inteligencia máxima realmente alta".

Todos los servicios están conectados a través de una red personalizada de Docker (openclaw_net con subred 172.10.10.0/24) e incluyen verificaciones de salud para garantizar la disponibilidad del servicio.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

Modelo MoE 35B Local Reduce la Tasa de Fallos del Código de Agent OS al 0%
Herramientas

Modelo MoE 35B Local Reduce la Tasa de Fallos del Código de Agent OS al 0%

Un desarrollador informa que al cambiar el runtime de un sistema multiagente a Qwen 3.6 35B A3B (MoE, 3B parámetros activos) se eliminaron las fallas de código, logrando una tasa de éxito del 100% mediante una puerta de validación de 5 capas.

OpenClawRadar
El Panel de Control de SwarmClaw Agrega Capa de Orquestación a OpenClaw
Herramientas

El Panel de Control de SwarmClaw Agrega Capa de Orquestación a OpenClaw

SwarmClaw es un panel de control autohospedado que envuelve OpenClaw, proporcionando despliegue y gestión de múltiples instancias con controles de puerta de enlace, reparación de configuración, sincronización de historial remoto y aprobación de ejecución en vivo. Soporta complementos de OpenClaw y archivos SKILL.md, además de conectarse a otros 14 proveedores de IA.

OpenClawRadar
Dirac: Agente de código abierto lidera TerminalBench con un 65.2%, más barato y abierto
Herramientas

Dirac: Agente de código abierto lidera TerminalBench con un 65.2%, más barato y abierto

Dirac, un agente de codificación de código abierto, obtuvo una puntuación del 65,2% en TerminalBench 2.0 para gemini-3-flash-preview, superando la línea base de Google (47,6%) y el principal agente de código cerrado Junie CLI (64,3%). También reduce los costos de API en un 64,8% frente a sus competidores.

OpenClawRadar
El Servidor MCP de Detrix Agrega Depuración en Tiempo de Ejecución a los Agentes de Codificación con IA
Herramientas

El Servidor MCP de Detrix Agrega Depuración en Tiempo de Ejecución a los Agentes de Codificación con IA

Detrix es un servidor MCP gratuito y de código abierto que permite a los agentes compatibles con MCP observar variables en vivo en código en ejecución sin reinicios ni cambios en el código. Es compatible con aplicaciones en Python, Go y Rust que se ejecutan localmente o en Docker.

OpenClawRadar