Chaîne de secours LLM multi-fournisseurs avec prise en charge Ollama dans l'IDE IA de production

Resonant Genesis, une plateforme IDE IA de production, a intégré le support des LLM locaux en tant que fournisseur de premier plan dans son architecture. La plateforme s'exécute sur plus de 30 microservices et traite les modèles locaux sur un pied d'égalité avec les fournisseurs cloud comme Groq, OpenAI, Anthropic et Gemini.
Architecture et intégration
La plateforme utilise une bibliothèque partagée rg_llm appelée UnifiedLLMClient qui est montée en volume sur tous les services. Chaque microservice nécessitant des capacités LLM importe ce même client. La chaîne de repli est configurée comme suit : Groq → OpenAI → Anthropic → Gemini → Ollama/LM Studio.
L'extension client léger de l'IDE découvre automatiquement les modèles Ollama locaux et les ajoute à la liste des fournisseurs. Les utilisateurs peuvent configurer le système pour privilégier d'abord les modèles locaux s'ils le souhaitent.
Orchestration côté serveur
Toute l'orchestration se fait côté serveur, l'IDE agissant comme un client léger qui affiche l'interface utilisateur, exécute les outils locaux (opérations sur fichiers, terminal, git) et diffuse les résultats via Server-Sent Events (SSE). La boucle agentique, la sélection d'outils, les invites système et le routage LLM se produisent tous sur le serveur.
Lors de l'utilisation d'un modèle local, il passe toujours par le même pipeline d'exécution régulé :
- Application des politiques pré-exécution (bloque les actions avant leur exécution)
- Appel de fonctions natif via les API des fournisseurs (pas d'injection JSON dans les invites)
- Identité cryptographique (DSID sur Ethereum L2) pour chaque agent
- Les mêmes 59 outils locaux disponibles quel que soit le fournisseur LLM choisi
Avantages pour les utilisateurs de LLM locaux
Pour les utilisateurs exécutant Ollama localement, cette architecture offre :
- Confidentialité : L'architecture client léger signifie qu'aucune intelligence d'entreprise n'est dans le binaire, et avec les modèles locaux, les invites restent locales
- Utilisation d'outils : 59 outils locaux avec appel de fonctions natif, pas de schémas JSON injectés dans les invites
- Repli : Si un modèle local ne peut pas gérer une tâche complexe, il bascule automatiquement vers les fournisseurs cloud
Les développeurs sollicitent les retours des personnes utilisant des modèles locaux, notamment concernant les performances d'appel de fonctions avec des modèles plus petits et quels modèles fonctionnent bien pour l'utilisation agentique d'outils.
Le projet est open source sur GitHub, et un chat invité démontrant l'écosystème d'outils est en ligne sur dev-swat.com (utilise des modèles cloud).
📖 Read the full source: r/LocalLLaMA
👀 See Also

Comparaison d'OpenClaw et de Claude Cowork : Automatisation locale vs Flux de travail en bac à sable
OpenClaw est un agent local toujours actif qui s'exécute sur votre machine avec exécution de commandes shell et automatisation du navigateur, tandis que Claude Cowork fonctionne dans Claude Desktop dans un environnement sandboxé axé sur les tâches documentaires et de navigation.

Rival-Review : Une boucle d'évaluation croisée pour les plans d'agents IA
Rival-review est un outil sous licence MIT qui utilise un second modèle d'IA pour auditer les plans d'un agent d'IA de codage principal avant leur exécution, détectant des problèmes tels que des plans de retour arrière défectueux, des failles de sécurité et des décisions basées sur des états obsolètes.

Claude Code Plugin de Qualité Production v3.0 Lancé : Pipeline de Développement Logiciel Autonome
Le plugin Production Grade v3.0 pour Claude Code est désormais disponible en tant que logiciel libre et open-source sous licence MIT. Le plugin crée un pipeline de développement complet, des exigences au déploiement, avec 13 compétences IA agissant comme une équipe d'ingénierie.

RalphTerm : boucle de style ralph avec sessions de révision croisées de différents agents
RalphTerm est un CLI open-source en Rust qui exécute une boucle externe de style ralph autour de Claude Code : il prend un plan en markdown, exécute des tâches dans des sessions interactives fraîches, et effectue une relecture croisée avec un modèle différent (par exemple, Codex) dans des sessions séparées, en renvoyant les problèmes dans de nouvelles sessions d'implémentation.