Configuration de RouteLLM pour un Routage Économique des Tâches d'IA

Configuration Docker Compose pour une Installation IA Hybride
Un utilisateur de Reddit a publié une configuration Docker Compose détaillée qui met en œuvre ce qu'ils appellent la "Superintelligence du Pauvre" - un système d'IA hybride qui route les tâches entre des modèles locaux et cloud en fonction de leur complexité.
Composants Principaux
Le système utilise quatre services principaux :
- vscode-openwire : Utilise l'image
sendmeticket/vscode-openwire:1.0.0avec les ports 3000 et 3030 exposés. Cela permet d'accéder à GitHub Copilot via OpenWire, bien que la source note que cela pourrait violer les conditions d'utilisation et suggère d'utiliser une clé API disponible à la place. - ollama : Exécute
ollama/ollama:latestavec le port 11434 exposé. Il télécharge et sert automatiquement le modèleqwen3.5:4bcomme modèle local "faible". - openroutellm : Utilise l'image
sendmeticket/openroutellm:1.0.0sur le port 6060. C'est le service de routage qui décide quel modèle traite chaque requête. - openclaw : Exécute
ghcr.io/openclaw/openclaw:latestavec les ports 18789 et 18790 exposés, servant d'interface principale.
Configuration RouteLLM
Le service openroutellm est configuré avec des paramètres spécifiques :
python -m routellm.openai_server --routers bert --default-router-threshold 0.75 --port 6060 --openwire-base-url http://vscode-openwire:3030/v1 --ollama-base-url http://ollama:11434/v1 --strong-model gpt-4o --weak-model qwen3.5:4bCette installation utilise un routage basé sur BERT avec un seuil de 0,75 pour déterminer quand envoyer les tâches au modèle "fort" (GPT-4o) par rapport au modèle local "faible" (Qwen3.5:4b).
Fonctionnement
Le système route les tâches difficiles vers le modèle payant GPT-4o via OpenWire/Copilot, tandis que les tâches plus simples sont gérées par le modèle local Qwen3.5:4b fonctionnant dans Ollama. Cela crée ce que l'auteur décrit comme un "modèle d'IA local-first avec sécurité intégrée, ayant une intelligence de base faible mais une intelligence maximale très élevée".
Tous les services sont connectés via un réseau Docker personnalisé (openclaw_net avec le sous-réseau 172.10.10.0/24) et incluent des vérifications de santé pour assurer la disponibilité des services.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Miasma : Un outil pour piéger les robots d'indexation d'IA avec des données empoisonnées
Miasma est un outil serveur qui envoie des données d'entraînement empoisonnées et des liens autoréférentiels aux aspirateurs web d'IA, créant une boucle sans fin. Il fonctionne avec une empreinte mémoire minimale et peut être configuré via des options CLI incluant le port, l'hôte et le préfixe de lien.

Exécution de Claude Code hors ligne sur un M3 Pro avec Qwen3.6 : 4 correctifs qui ont fonctionné
Quatre correctifs de variables d'environnement permettent à Claude Code de fonctionner entièrement hors ligne sur un M3 Pro avec Qwen3.6 (MoE, ~3B actifs), bouclant un cycle d'incident SRE de l'investigation à la PR sans que les données quittent la machine.

fr: Le-gars-du-savoir : Transformez votre bibliothèque en tuteur avec les compétences de Claude Code
Un ensemble de compétences Claude Code qui ingère vos livres PDF/EPUB localement et vous permet de poser des questions, d'apprendre sujet par sujet ou d'obtenir des antisèches — le tout avec des citations dans votre bibliothèque.

Claude-Real-Video : Extraction d'images adaptée à la scène + transcription pour tout LLM
Un outil open-source qui extrait des images clés et des transcriptions audio de vidéos, permettant à n'importe quel LLM de « regarder » une vidéo localement sans téléchargement. Détection des changements de scène, déduplication par fenêtre glissante et transcription Whisper.