Configuration Multi-Agent Locale avec vLLM, Claude Code et gpt-oss-120b sous Linux

✍️ OpenClawRadar📅 Publié: March 26, 2026🔗 Source
Configuration Multi-Agent Locale avec vLLM, Claude Code et gpt-oss-120b sous Linux
Ad

Un développeur a partagé son expérience de création d'une configuration multi-agent de codage entièrement locale et parallèle sous Linux après avoir quitté Windows. La configuration utilise vLLM pour l'inférence parallèle, Claude Code pour l'orchestration des agents et un grand modèle de langage pour les tâches de codage.

Composants de la configuration

  • Conteneur Docker vLLM : Utilisé pour un déploiement facile et une inférence parallèle
  • Claude Code : Gère le vibecoding et l'orchestration des équipes d'agents, configuré pour pointer vers le point de terminaison localhost de vLLM au lieu des fournisseurs cloud
  • gpt-oss:120b : Sert d'agent de codage
  • RTX Pro 6000 Blackwell MaxQ : GPU principal pour la charge de travail
  • Dual-boot Ubuntu : Configuration du système d'exploitation
Ad

Améliorations des performances et du flux de travail

Le développeur utilisait auparavant Ollama et LM Studio mais a constaté qu'ils traitaient les requêtes séquentiellement et subissaient des ralentissements après plusieurs tours de messages et appels d'outils. Avec vLLM, il a obtenu un traitement parallèle qui a "boosté" son expérience.

Lors des tests, la configuration a géré 4 agents collaborant simultanément comme le montre une démonstration vidéo, le GPU étant capable de supporter 8 agents en parallèle en continu. Le seul problème noté était une réduction du débit, qui varie selon l'agent.

Les tâches à l'échelle d'équipes d'agents qui prenaient auparavant des heures à réaliser séquentiellement peuvent maintenant être effectuées en environ 30 minutes, selon la portée du projet. Le développeur estime qu'ajouter un deuxième GPU MaxQ pourrait potentiellement faire évoluer le système pour gérer des dizaines d'agents simultanément.

Cette approche parallèle permet de faire du vibecoding sur plusieurs projets localement et simultanément, bien qu'elle puisse introduire une latence accrue dans certains scénarios. Le développeur a trouvé ce compromis préférable à la réalisation des projets un agent à la fois.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Claude AI utilisé comme cerveau de secours pour Alexa afin de gérer les commandes non prises en charge
Use Cases

Claude AI utilisé comme cerveau de secours pour Alexa afin de gérer les commandes non prises en charge

Un développeur a créé une couche légère où Claude AI traite chaque commande Alexa échouée, gérant la langue hindi, la diffusion CCTV et le contrôle des appareils non intelligents. Le système utilise WebSocket pour le contrôle de la télévision, DLNA pour les décodeurs et la conversion RTSP→HLS pour la CCTV.

OpenClawRadar
Le jeu de voyage dans le temps de Claude évolue d'une simple instruction à un système complet déployé.
Use Cases

Le jeu de voyage dans le temps de Claude évolue d'une simple instruction à un système complet déployé.

Un utilisateur de Reddit décrit comment il a transformé une amorce de jeu de rôle sur le voyage dans le temps dans Claude en un système complexe sur 40 jours, en ajoutant des fichiers d'état YAML, plus de 50 PNJ, des déclencheurs d'événements, et en le déployant finalement sur Fly avec une base de données et un serveur MCP personnalisé pour un accès multiplateforme.

OpenClawRadar
Intégrer l'orchestration multi-agent dans OpenClaw : l'expérience d'un développeur
Use Cases

Intégrer l'orchestration multi-agent dans OpenClaw : l'expérience d'un développeur

Un développeur a modifié le runtime principal d'OpenClaw pour implémenter une véritable orchestration multi-agents après avoir découvert que les agents simulaient la collaboration. Les modifications incluaient la création d'agents parents-enfants via sessions_spawn/sessions_yield et l'exécution parallèle sur des threads séparés.

OpenClawRadar
🦀
Use Cases

Comment les organisations utilisent l'IA : enseignements de ChatGPT — Principales conclusions de l'étude d'OpenAI

OpenAI a analysé 1,8 million de messages ChatGPT provenant de 8 198 organisations. 71 % des tâches étaient créatives contre 29 % analytiques. La rédaction et l'analyse de données dominent — 28 % et 20 % des messages.

OpenClawRadar