Запуск 6-агентного конвейера поведенческого коучинга на локально размещенной модели Qwen3 235B с использованием vLLM.

✍️ OpenClawRadar📅 Опубликовано: 1 апреля 2026 г.🔗 Source
Запуск 6-агентного конвейера поведенческого коучинга на локально размещенной модели Qwen3 235B с использованием vLLM.
Ad

Мультиагентная система поведенческого коучинга

Разработчик реализовал 6-агентный когнитивный конвейер для поведенческого коучинга, который полностью работает на самостоятельно размещённых моделях Qwen3 через vLLM. Система использует инстансы Claude Code в качестве агентов, обращающихся к vLLM-эндпоинту, причём четыре специализированных агента запускаются одновременно на каждое пользовательское сообщение.

Аппаратное обеспечение и настройка

  • Разработка: Qwen3 30B на 2x RTX 4090
  • Продакшен: Qwen3 235B на инстансах RunPod A40
  • Все 6 агентов — это инстансы Claude Code, обращающиеся к vLLM-эндпоинту

Архитектура конвейера

Каждое пользовательское сообщение запускает 6 агентов последовательно:

  • Shadow (Тень) — Запускается первым, записывает межсессионные поведенческие паттерны на общую доску (заявленные цели vs выявленные приоритеты, прогноз выполнения, классификация паттернов)
  • Persona (Персона) — Оценка по OCEAN, обнаружение повторяющихся целей, процентные прогнозы выполнения, определение зон роста
  • Plasticity (Пластичность) — Стратегия коучинга с учётом личности, сопоставление оценок OCEAN с коммуникационными предпочтениями
  • Stability (Стабильность) — Структура оценки рисков с показателями серьёзности/обнаруживаемости/обратимости, выявляет блокирующие ходы, которые коучу не следует предлагать
  • Coach (Коуч) — Запускается рано для немедленного ответа, пока другие агенты обрабатывают данные (~секунды)
  • Synth (Pineal) (Синтезатор/Шишковидный) — Объединяет все выходные данные рабочих агентов, применяет калибровку голоса, выдаёт полный ответ
Ad

Характеристики производительности

Пользователь видит немедленный ответ от Coach, затем полный синтезированный ответ добавляется примерно через 40 секунд на конфигурации с 2x RTX 4090. На конфигурации A40 это занимает около 108 секунд — парадоксально медленнее из-за иной архитектуры памяти.

Ключевые инсайты реализации

Что сработало:

  • Параллельная диспетчеризация — ключевой фактор для производительности
  • Shadow должен записывать первым, потому что синтезу нужен контент с общей доски для корректной агрегации
  • Логика последовательности, гарантирующая завершение Shadow до того, как Synth начнёт работу, добавляет значительную сложность, но это обязательное условие
  • Управление контекстом в масштабе 235B дорого — каждый агент получает полный контекстный бриф плюс историю сессии
  • Агрессивное сжатие между сессиями и жёсткие бюджеты контекста на агента стали основными рычагами надёжности

Что сложно:

  • Добиться, чтобы агенты стабильно выдавали структурированный вывод, достаточный для агрегации синтезом без галлюцинаций артефактов слияния
  • Основной режим отказа: Synth видит конфликтующие сигналы от Persona и Stability в одной сессии

Разработчик ищет мнения других, кто запускает мультиагентные системы на собственном инференсе, особенно касательно стратегий параллелизма в масштабе 235B.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Разработчик создает иконку приложения с помощью Claude AI без использования дизайнерских инструментов.
Кейсы

Разработчик создает иконку приложения с помощью Claude AI без использования дизайнерских инструментов.

Разработчик создал менеджер процессов для macOS под названием PIDKill и разработал его иконку приложения, используя исключительно Claude AI, в частности Claude Code и Claude web. Финальный дизайн использует шрифт SF Mono с эффектом глитча и красным зачёркиванием, символизирующим завершение процесса.

OpenClawRadar
OpenClaw автоматизирует бронирование столиков в ресторанах с помощью навыка OpenTable.
Кейсы

OpenClaw автоматизирует бронирование столиков в ресторанах с помощью навыка OpenTable.

Разработчик настроил своего ИИ-агента OpenClaw для автоматического бронирования ресторанов с помощью пользовательского навыка OpenTable. Агент считывает предпочтения из файла food.md и бронирует рестораны, такие как Bocconcino, OITA и Trishna.

OpenClawRadar
Claude Opus 4.6 проводит обратную разработку системы аутентификации игры за 7 минут с использованием Ghidra MCP.
Кейсы

Claude Opus 4.6 проводит обратную разработку системы аутентификации игры за 7 минут с использованием Ghidra MCP.

Разработчик использовал Claude Opus 4.6 с плагином MCP-сервера Ghidra для реверс-инжиниринга метода проверки аутентификации для Command & Conquer: Kane's Wrath. ИИ проанализировал чистый бинарный файл, определил функцию проверки, создал патч и переименовал все функции и структуры данных примерно за 7 минут.

OpenClawRadar
Claude для инженерного соответствия: разбор 6-месячного рабочего процесса
Кейсы

Claude для инженерного соответствия: разбор 6-месячного рабочего процесса

Техническая фирма рассказывает, как они используют Projects, Artifacts и соблюдение ограничений в Claude, чтобы избежать галлюцинаций в спецификациях для клиентов.

OpenClawRadar