Exécution d'un pipeline de coaching comportemental à 6 agents sur Qwen3 235B auto-hébergé avec vLLM

✍️ OpenClawRadar📅 Publié: April 1, 2026🔗 Source
Exécution d'un pipeline de coaching comportemental à 6 agents sur Qwen3 235B auto-hébergé avec vLLM
Ad

Système de coaching comportemental multi-agents

Un développeur a mis en œuvre un pipeline cognitif à 6 agents pour le coaching comportemental qui fonctionne entièrement sur des modèles Qwen3 auto-hébergés via vLLM. Le système utilise des instances Claude Code comme agents appelant un point de terminaison vLLM, avec quatre agents spécialisés déclenchés simultanément sur chaque message utilisateur.

Matériel et configuration

  • Développement : Qwen3 30B sur 2x RTX 4090
  • Production : Qwen3 235B sur des pods RunPod A40
  • Les 6 agents sont des instances Claude Code appelant le point de terminaison vLLM

Architecture du pipeline

Chaque message utilisateur déclenche 6 agents en séquence :

  • Shadow - S'exécute en premier, écrit les schémas comportementaux trans-sessionnels sur un tableau noir partagé (objectifs déclarés vs priorités révélées, prédiction de suivi, classification des schémas)
  • Persona - Notation OCEAN, détection d'objectifs récurrents, pourcentages de prédiction de suivi, identification des marges de progression
  • Plasticity - Stratégie de coaching informée par la personnalité, cartographie des scores OCEAN vers les préférences de communication
  • Stability - Cadre de risque avec évaluations de gravité/détectabilité/réversibilité, identifie les actions bloquées que le coach ne devrait pas suggérer
  • Coach - Se déclenche tôt pour une réponse immédiate pendant que les autres agents traitent (~secondes)
  • Synth (Pineal) - Fusionne toutes les sorties des travailleurs, applique une calibration vocale, délivre la réponse complète
Ad

Caractéristiques de performance

L'utilisateur voit une réponse immédiate du Coach, puis la synthèse complète s'ajoute environ 40 secondes plus tard sur 2x RTX 4090. Sur la configuration A40, cela prend environ 108 secondes - contre-intuitivement plus lent en raison d'une architecture mémoire différente.

Principales observations d'implémentation

Ce qui a fonctionné :

  • La distribution parallèle est la clé pour la performance
  • Shadow doit écrire en premier car la synthèse a besoin du contenu du tableau noir pour s'agréger correctement
  • La logique de séquencement pour garantir que Shadow se termine avant que Synth ne récupère ajoute une complexité significative mais est non négociable
  • La gestion du contexte à l'échelle 235B est coûteuse - chaque agent reçoit un briefing contextuel complet plus l'historique de la session
  • La compaction agressive entre les sessions et des budgets contextuels serrés par agent ont été les principaux leviers de fiabilité

Ce qui est difficile :

  • Faire en sorte que les agents écrivent une sortie structurée de manière suffisamment fiable pour que la synthèse puisse agréger sans halluciner des artefacts de fusion
  • Mode d'échec principal : Synth voyant des signaux contradictoires de Persona et Stability sur la même session

Le développeur recherche des retours d'autres personnes exécutant des systèmes multi-agents sur de l'inférence auto-hébergée, en particulier concernant les stratégies de parallélisme à l'échelle 235B.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

OpenClaw s'intègre à l'API de Kroger pour des courses alimentaires automatisées via des agents IA.
Use Cases

OpenClaw s'intègre à l'API de Kroger pour des courses alimentaires automatisées via des agents IA.

Un développeur a utilisé OpenClaw avec l'API Kroger pour ajouter automatiquement les ingrédients d'une recette à un panier d'achat, en exploitant Qwen3.5 pour la génération de recettes et Gemini 3.1 Pro pour la configuration. L'intégration a nécessité 6 heures de travail et a consommé 359 000 tokens pour la génération d'un seul panier.

OpenClawRadar
Un utilisateur de Reddit partage une approche basée sur les spécifications pour réduire les hallucinations de code de Claude.
Use Cases

Un utilisateur de Reddit partage une approche basée sur les spécifications pour réduire les hallucinations de code de Claude.

Un développeur sur r/ClaudeAI décrit l'utilisation d'une méthode de spécification structurée pour réduire considérablement les hallucinations avec Claude Code. L'approche consiste à créer des fichiers REQUIREMENTS.md, IMPLEMENTATION_PLAN.md et CLAUDE.md pour maintenir le contexte à travers plusieurs compactions.

OpenClawRadar
Comment utiliser efficacement Claude Code : L'expérience d'un développeur pour créer une application SaaS complète
Use Cases

Comment utiliser efficacement Claude Code : L'expérience d'un développeur pour créer une application SaaS complète

Un développeur avec une expérience SaaS depuis 2021 a construit une application complète de répétition espacée appelée codefluent.app en utilisant Claude Code, soulignant que le succès dépend de la rédaction de spécifications techniques détaillées plutôt que de prompts vagues. Le projet a utilisé SvelteKit, PostgreSQL avec Drizzle ORM, Better Auth, OpenRouter, Stripe, CodeMirror 6, Tailwind v4 et Railway.

OpenClawRadar
Utilisateur d'OpenClaw partage l'architecture d'un système de production à 43 agents
Use Cases

Utilisateur d'OpenClaw partage l'architecture d'un système de production à 43 agents

Un cabinet de conseil en branding avec plus de 1 000 clients utilise depuis plusieurs mois un système OpenClaw de 43 agents en production, présentant une architecture en couches avec des agents spécialisés dans les fonctions de commande, renseignement, contenu, technologie et vente.

OpenClawRadar