Configuration Multi-Agent Locale avec vLLM, Claude Code et gpt-oss-120b sous Linux

✍️ OpenClawRadar📅 Publié: March 26, 2026🔗 Source
Configuration Multi-Agent Locale avec vLLM, Claude Code et gpt-oss-120b sous Linux
Ad

Un développeur a partagé son expérience de création d'une configuration multi-agent de codage entièrement locale et parallèle sous Linux après avoir quitté Windows. La configuration utilise vLLM pour l'inférence parallèle, Claude Code pour l'orchestration des agents et un grand modèle de langage pour les tâches de codage.

Composants de la configuration

  • Conteneur Docker vLLM : Utilisé pour un déploiement facile et une inférence parallèle
  • Claude Code : Gère le vibecoding et l'orchestration des équipes d'agents, configuré pour pointer vers le point de terminaison localhost de vLLM au lieu des fournisseurs cloud
  • gpt-oss:120b : Sert d'agent de codage
  • RTX Pro 6000 Blackwell MaxQ : GPU principal pour la charge de travail
  • Dual-boot Ubuntu : Configuration du système d'exploitation
Ad

Améliorations des performances et du flux de travail

Le développeur utilisait auparavant Ollama et LM Studio mais a constaté qu'ils traitaient les requêtes séquentiellement et subissaient des ralentissements après plusieurs tours de messages et appels d'outils. Avec vLLM, il a obtenu un traitement parallèle qui a "boosté" son expérience.

Lors des tests, la configuration a géré 4 agents collaborant simultanément comme le montre une démonstration vidéo, le GPU étant capable de supporter 8 agents en parallèle en continu. Le seul problème noté était une réduction du débit, qui varie selon l'agent.

Les tâches à l'échelle d'équipes d'agents qui prenaient auparavant des heures à réaliser séquentiellement peuvent maintenant être effectuées en environ 30 minutes, selon la portée du projet. Le développeur estime qu'ajouter un deuxième GPU MaxQ pourrait potentiellement faire évoluer le système pour gérer des dizaines d'agents simultanément.

Cette approche parallèle permet de faire du vibecoding sur plusieurs projets localement et simultanément, bien qu'elle puisse introduire une latence accrue dans certains scénarios. Le développeur a trouvé ce compromis préférable à la réalisation des projets un agent à la fois.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Connexion de Claude à Canva via API pour la génération automatisée de designs
Use Cases

Connexion de Claude à Canva via API pour la génération automatisée de designs

Un utilisateur de Reddit décrit la connexion de Claude à Canva via l'API, permettant de générer des fichiers Canva modifiables à partir de descriptions en anglais simple, avec des polices, un espacement et une mise en page ajustés, ce qui permet d'économiser des heures par semaine.

OpenClawRadar
Utiliser Claude comme Mentor d'Apprentissage avec Contexte Documentaire
Use Cases

Utiliser Claude comme Mentor d'Apprentissage avec Contexte Documentaire

Un développeur partage une méthode pour utiliser Claude comme outil d'apprentissage en fournissant la documentation d'un outil dans son contexte et en utilisant un prompt spécifique pour créer un mentor basé sur des tâches. Cette approche évite les cours et tutoriels traditionnels au profit d'un apprentissage pratique avec un retour immédiat.

OpenClawRadar
Développeur partage les leçons tirées de la création d'une application sportive avec Base44 et Claude
Use Cases

Développeur partage les leçons tirées de la création d'une application sportive avec Base44 et Claude

Un développeur a créé une application sportive appelée glanceplay.com sur Base44 pour des résumés de matchs rapides et adaptés aux amateurs occasionnels, mais a trouvé les crédits Base44 coûteux pour les modifications itératives du code. Il recommande d'utiliser des plateformes comme Base44 pour l'échafaudage initial, puis de s'appuyer sur Claude pour les changements incrémentiels et le débogage.

OpenClawRadar
Utiliser Obsidian avec OpenClaw comme configuration de second cerveau
Use Cases

Utiliser Obsidian avec OpenClaw comme configuration de second cerveau

Un développeur partage sa configuration utilisant OpenClaw avec Obsidian comme système de second cerveau, mettant en œuvre QMD pour une recherche efficace de notes et un chargement de compétences à la demande, réduisant ainsi l'utilisation de tokens de 80 à 90 %.

OpenClawRadar