Configuración de RouteLLM para el Enrutamiento Rentable de Tareas de IA

Configuración de Docker Compose para una Configuración Híbrida de IA
Un usuario de Reddit publicó una configuración detallada de Docker Compose que implementa lo que ellos llaman "Superinteligencia del Hombre Pobre" - un sistema híbrido de IA que enruta tareas entre modelos locales y en la nube según su complejidad.
Componentes Principales
El sistema utiliza cuatro servicios principales:
- vscode-openwire: Utiliza la imagen
sendmeticket/vscode-openwire:1.0.0con los puertos 3000 y 3030 expuestos. Esto proporciona acceso a GitHub Copilot a través de OpenWire, aunque la fuente señala que esto puede violar los TOS y sugiere usar una clave API disponible en su lugar. - ollama: Ejecuta
ollama/ollama:latestcon el puerto 11434 expuesto. Descarga y sirve automáticamente el modeloqwen3.5:4bcomo el modelo local "débil". - openroutellm: Utiliza la imagen
sendmeticket/openroutellm:1.0.0en el puerto 6060. Este es el servicio de enrutamiento que decide qué modelo maneja cada solicitud. - openclaw: Ejecuta
ghcr.io/openclaw/openclaw:latestcon los puertos 18789 y 18790 expuestos, sirviendo como la interfaz principal.
Configuración de RouteLLM
El servicio openroutellm está configurado con parámetros específicos:
python -m routellm.openai_server --routers bert --default-router-threshold 0.75 --port 6060 --openwire-base-url http://vscode-openwire:3030/v1 --ollama-base-url http://ollama:11434/v1 --strong-model gpt-4o --weak-model qwen3.5:4bEsta configuración utiliza enrutamiento basado en BERT con un umbral de 0.75 para determinar cuándo enviar tareas al modelo "fuerte" (GPT-4o) versus el modelo local "débil" (Qwen3.5:4b).
Cómo Funciona
El sistema enruta tareas difíciles al modelo de pago GPT-4o a través de OpenWire/Copilot, mientras que las tareas más simples son manejadas por el modelo local Qwen3.5:4b ejecutándose en Ollama. Esto crea lo que el autor describe como "un modelo de IA a prueba de fallos, local primero, con baja inteligencia base pero una inteligencia máxima realmente alta".
Todos los servicios están conectados a través de una red personalizada de Docker (openclaw_net con subred 172.10.10.0/24) e incluyen verificaciones de salud para garantizar la disponibilidad del servicio.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

Qwen 3.5 35B ejecutándose en 8GB de VRAM con configuración de llama.cpp
Un desarrollador comparte su configuración de llama.cpp para ejecutar Qwen 3.5 35B (Q4_K_M GGUF) en una RTX 4060m con 8 GB de VRAM, logrando 700 t/s de procesamiento de prompt y 42 t/s de generación, y comenta el uso de Cline en VSCode con los modos kat-coder-pro y qwen3.5.

Transmitido: Una Habilidad de Código Claude para Publicación Instantánea de HTML en URLs en Vivo
Aired es una herramienta de código abierto que publica HTML en una URL en vivo en 2 segundos mediante habilidades de Claude Code o servidores MCP. No requiere registro, configuración de despliegue ni instalación para herramientas de IA basadas en web, y funciona con Claude Code, Cursor, VS Code, Codex y Windsurf.

Agente Kanban de VS Code: Gestión de tareas basada en Markdown para agentes de codificación con IA
VS Code Agent Kanban es una extensión que crea un tablero kanban compatible con GitOps dentro de VS Code utilizando archivos markdown como registros de tareas. Aborda la degradación del contexto en los agentes de codificación con IA al preservar las conversaciones de planificación, las decisiones y los detalles de implementación en archivos .md controlados por versión.

oMLX presenta el almacenamiento en caché SSD KV para Apple Silicon, reduciendo los tiempos de respuesta de OpenClaw de 30-90 segundos a 5 segundos.
oMLX es un nuevo backend que persiste los bloques de caché KV en SSD en formato safetensors, evitando la invalidación de la caché cuando cambia el contexto. Esto reduce los tiempos de respuesta de OpenClaw de 30-90 segundos a solo 5 segundos en turnos posteriores.