自己ホスト型Qwen3 235BとvLLMを使用した6エージェント行動コーチングパイプラインの実行

✍️ OpenClawRadar📅 公開日: April 1, 2026🔗 Source
自己ホスト型Qwen3 235BとvLLMを使用した6エージェント行動コーチングパイプラインの実行
Ad

マルチエージェント行動コーチングシステム

ある開発者が、vLLMを介して完全にセルフホストされたQwen3モデル上で動作する、行動コーチングのための6エージェント認知パイプラインを実装しました。このシステムは、Claude CodeインスタンスをvLLMエンドポイントを呼び出すエージェントとして使用し、各ユーザーメッセージに対して4つの専門エージェントが同時に起動します。

ハードウェアとセットアップ

  • 開発環境:2x RTX 4090上のQwen3 30B
  • 本番環境:RunPod A40ポッド上のQwen3 235B
  • 全6エージェントはvLLMエンドポイントを呼び出すClaude Codeインスタンス

パイプラインアーキテクチャ

各ユーザーメッセージは6つのエージェントを順次起動します:

  • シャドウ - 最初に実行され、セッション間の行動パターンを共有ブラックボードに書き込む(表明された目標と実際の優先順位、実行予測、パターン分類)
  • ペルソナ - OCEANスコアリング、繰り返し目標の検出、実行予測パーセンテージ、成長の可能性の特定
  • プラスティシティ - 性格に基づいたコーチング戦略、OCEANスコアからコミュニケーション嗜好へのマッピング
  • スタビリティ - 深刻度/検出可能性/回復可能性の評価を含むリスクフレームワーク、コーチが提案すべきでないブロックされた行動を特定
  • コーチ - 即時応答のために早期に起動(他のエージェントの処理中、約数秒)
  • シンセ(松果体) - 全ワーカー出力を統合、声の調整を適用、完全な応答を提供
Ad

性能特性

ユーザーはまず即座にコーチの応答を受け取り、その後約40秒後に完全な統合応答が追加されます(2x RTX 4090環境)。A40構成では約108秒かかり、異なるメモリアーキテクチャのため直感的には遅くなっています。

主要な実装洞察

成功した点:

  • 並列ディスパッチが性能向上の鍵
  • 統合がブラックボードの内容を正しく集約するために、シャドウが最初に書き込む必要がある
  • シンセが処理を開始する前にシャドウが完了することを保証するシーケンスロジックは複雑だが必須
  • 235Bスケールでのコンテキスト管理は高コスト - 各エージェントは完全なコンテキスト概要とセッション履歴を受け取る
  • セッション間での積極的な圧縮とエージェントごとの厳密なコンテキスト予算が主要な信頼性向上手段

困難な点:

  • 統合がマージアーティファクトを幻覚することなく集約できるほど、エージェントに構造化出力を確実に書かせること
  • 主要な失敗モード:シンセが同じセッションでペルソナとスタビリティからの矛盾する信号を検出すること

開発者は、特に235Bスケールでの並列処理戦略に関して、セルフホスト推論でマルチエージェントシステムを実行している他のユーザーからの意見を求めています。

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

OpenClawセットアップは、ローカルモデル、OpenAI、n8nを組み合わせ、コスト効率の高いAI運用を実現します。
Use Cases

OpenClawセットアップは、ローカルモデル、OpenAI、n8nを組み合わせ、コスト効率の高いAI運用を実現します。

ある開発者が、高品質な推論にはOpenAIをOAuth経由で使用し、日常タスクにはローカルモデルを、自動化ワークフローにはn8nを活用するOpenClawの設定を共有しています。これにより月額コストを約20ドルに抑えています。

OpenClawRadar
OpenClawボットは、CRM自動化のためにn8n、WordPress、Airtable、およびGHLを連携します。
Use Cases

OpenClawボットは、CRM自動化のためにn8n、WordPress、Airtable、およびGHLを連携します。

非開発者がOpenClawボットを使用して、n8n、WordPress、Airtable、GoHighLevelの環境をTelegramチャット経由で接続し、1週間以内にCRMとワークフローシステムを構築しました。ボットは大量のトークンを消費しましたが、技術的な支援を雇うよりも安価であることが証明されました。

OpenClawRadar
消費者向けAIゲームがB2Bへ:Opus 4.7とHaiku 4.5によるClaude Codeワークフロー
Use Cases

消費者向けAIゲームがB2Bへ:Opus 4.7とHaiku 4.5によるClaude Codeワークフロー

ある開発者が、B2B営業トレーニングツールにおいて、バックエンドのリファクタリングにOpus 4.7を活用したClaude Code、ライブチャットにHaiku 4.5を使用した方法を詳述し、CLAUDE.md/SPLIT_NOTES.mdのワークフローを共有しています。

OpenClawRadar
ローカルでのLlama 3.2-1Bのシークレット検出用ファインチューニングがWizのモデルを上回る
Use Cases

ローカルでのLlama 3.2-1Bのシークレット検出用ファインチューニングがWizのモデルを上回る

ある開発者が、コード内のシークレット検出のためにLlama 3.2-1Bをローカルでファインチューニングすることに成功し、Wizの類似モデルの指標を上回ったことを文書化しました。このプロジェクトは、独自のAPIを一切使用せず、完全にローカルのAIツールで実施されました。

OpenClawRadar