Configuration de RouteLLM pour un Routage Économique des Tâches d'IA

✍️ OpenClawRadar📅 Publié: March 9, 2026🔗 Source
Configuration de RouteLLM pour un Routage Économique des Tâches d'IA
Ad

Configuration Docker Compose pour une Installation IA Hybride

Un utilisateur de Reddit a publié une configuration Docker Compose détaillée qui met en œuvre ce qu'ils appellent la "Superintelligence du Pauvre" - un système d'IA hybride qui route les tâches entre des modèles locaux et cloud en fonction de leur complexité.

Composants Principaux

Le système utilise quatre services principaux :

  • vscode-openwire : Utilise l'image sendmeticket/vscode-openwire:1.0.0 avec les ports 3000 et 3030 exposés. Cela permet d'accéder à GitHub Copilot via OpenWire, bien que la source note que cela pourrait violer les conditions d'utilisation et suggère d'utiliser une clé API disponible à la place.
  • ollama : Exécute ollama/ollama:latest avec le port 11434 exposé. Il télécharge et sert automatiquement le modèle qwen3.5:4b comme modèle local "faible".
  • openroutellm : Utilise l'image sendmeticket/openroutellm:1.0.0 sur le port 6060. C'est le service de routage qui décide quel modèle traite chaque requête.
  • openclaw : Exécute ghcr.io/openclaw/openclaw:latest avec les ports 18789 et 18790 exposés, servant d'interface principale.
Ad

Configuration RouteLLM

Le service openroutellm est configuré avec des paramètres spécifiques :

python -m routellm.openai_server --routers bert --default-router-threshold 0.75 --port 6060 --openwire-base-url http://vscode-openwire:3030/v1 --ollama-base-url http://ollama:11434/v1 --strong-model gpt-4o --weak-model qwen3.5:4b

Cette installation utilise un routage basé sur BERT avec un seuil de 0,75 pour déterminer quand envoyer les tâches au modèle "fort" (GPT-4o) par rapport au modèle local "faible" (Qwen3.5:4b).

Fonctionnement

Le système route les tâches difficiles vers le modèle payant GPT-4o via OpenWire/Copilot, tandis que les tâches plus simples sont gérées par le modèle local Qwen3.5:4b fonctionnant dans Ollama. Cela crée ce que l'auteur décrit comme un "modèle d'IA local-first avec sécurité intégrée, ayant une intelligence de base faible mais une intelligence maximale très élevée".

Tous les services sont connectés via un réseau Docker personnalisé (openclaw_net avec le sous-réseau 172.10.10.0/24) et incluent des vérifications de santé pour assurer la disponibilité des services.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Miasma : Un outil pour piéger les robots d'indexation d'IA avec des données empoisonnées
Tools

Miasma : Un outil pour piéger les robots d'indexation d'IA avec des données empoisonnées

Miasma est un outil serveur qui envoie des données d'entraînement empoisonnées et des liens autoréférentiels aux aspirateurs web d'IA, créant une boucle sans fin. Il fonctionne avec une empreinte mémoire minimale et peut être configuré via des options CLI incluant le port, l'hôte et le préfixe de lien.

OpenClawRadar
Exécution de Claude Code hors ligne sur un M3 Pro avec Qwen3.6 : 4 correctifs qui ont fonctionné
Tools

Exécution de Claude Code hors ligne sur un M3 Pro avec Qwen3.6 : 4 correctifs qui ont fonctionné

Quatre correctifs de variables d'environnement permettent à Claude Code de fonctionner entièrement hors ligne sur un M3 Pro avec Qwen3.6 (MoE, ~3B actifs), bouclant un cycle d'incident SRE de l'investigation à la PR sans que les données quittent la machine.

OpenClawRadar
fr: Le-gars-du-savoir : Transformez votre bibliothèque en tuteur avec les compétences de Claude Code
Tools

fr: Le-gars-du-savoir : Transformez votre bibliothèque en tuteur avec les compétences de Claude Code

Un ensemble de compétences Claude Code qui ingère vos livres PDF/EPUB localement et vous permet de poser des questions, d'apprendre sujet par sujet ou d'obtenir des antisèches — le tout avec des citations dans votre bibliothèque.

OpenClawRadar
Claude-Real-Video : Extraction d'images adaptée à la scène + transcription pour tout LLM
Tools

Claude-Real-Video : Extraction d'images adaptée à la scène + transcription pour tout LLM

Un outil open-source qui extrait des images clés et des transcriptions audio de vidéos, permettant à n'importe quel LLM de « regarder » une vidéo localement sans téléchargement. Détection des changements de scène, déduplication par fenêtre glissante et transcription Whisper.

OpenClawRadar