Ejecutando una canalización de coaching conductual con 6 agentes en Qwen3 235B autoalojado con vLLM

Sistema de coaching conductual multiagente
Un desarrollador ha implementado una canalización cognitiva de 6 agentes para coaching conductual que funciona completamente en modelos Qwen3 autoalojados a través de vLLM. El sistema utiliza instancias de Claude Code como agentes que llaman a un endpoint vLLM, con cuatro agentes especialistas activándose simultáneamente en cada mensaje del usuario.
Hardware y configuración
- Desarrollo: Qwen3 30B en 2x RTX 4090
- Producción: Qwen3 235B en pods RunPod A40
- Todos los 6 agentes son instancias de Claude Code que llaman al endpoint vLLM
Arquitectura de la canalización
Cada mensaje del usuario activa 6 agentes en secuencia:
- Sombra - Se ejecuta primero, escribe patrones conductuales entre sesiones en una pizarra compartida (objetivos declarados vs prioridades reveladas, predicción de seguimiento, clasificación de patrones)
- Persona - Puntuación OCEAN, detección de objetivos recurrentes, porcentajes de predicción de seguimiento, identificación de áreas de crecimiento
- Plasticidad - Estrategia de coaching informada por personalidad, mapea puntuaciones OCEAN a preferencias de comunicación
- Estabilidad - Marco de riesgo con calificaciones de severidad/detectabilidad/reversibilidad, identifica movimientos bloqueados que el coach no debería sugerir
- Coach - Se activa temprano para una respuesta inmediata mientras los otros agentes procesan (~segundos)
- Síntesis (Pineal) - Fusiona todas las salidas de los trabajadores, aplica calibración de voz, entrega la respuesta completa
Características de rendimiento
El usuario ve una respuesta inmediata del Coach, luego la síntesis completa se añade aproximadamente 40 segundos después en 2x RTX 4090. En la configuración A40, esto toma alrededor de 108 segundos - curiosamente más lento debido a la diferente arquitectura de memoria.
Perspectivas clave de implementación
Lo que funcionó:
- El despacho paralelo es la clave para el rendimiento
- Sombra debe escribir primero porque la síntesis necesita el contenido de la pizarra para agregar correctamente
- La lógica de secuenciación para garantizar que Sombra se complete antes de que Síntesis recoja añade complejidad significativa pero es no negociable
- La gestión de contexto a escala 235B es costosa - cada agente recibe un resumen de contexto completo más el historial de sesiones
- La compactación agresiva entre sesiones y presupuestos de contexto ajustados por agente han sido las principales palancas de confiabilidad
Lo que es difícil:
- Lograr que los agentes escriban salidas estructuradas de manera suficientemente confiable para que la síntesis pueda agregar sin alucinar artefactos de fusión
- Modo principal de falla: Síntesis viendo señales conflictivas de Persona y Estabilidad en la misma sesión
El desarrollador está buscando aportes de otros que ejecutan sistemas multiagente en inferencia autoalojada, particularmente respecto a estrategias de paralelismo a escala 235B.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

BinktermPHP: Una Plataforma Completa de BBS/FidoNet Construida Principalmente con Claude
BinktermPHP es un BBS basado en web de código abierto escrito en PHP 8 con PostgreSQL, que incluye un sistema de correo binkp de FidoNet integrado, echomail/netmail, áreas de archivos, juegos de puerta, empuje del servidor en tiempo real y un servidor MCP que expone echomail a asistentes de IA. El desarrollador informa haberlo construido casi en su totalidad usando Claude para la implementación, mientras manejaba la arquitectura y las pruebas.

Agente OpenClaw Quemó $20 en Tokens de API Debido a la Inflación de Contexto por Web Scraping
Un desarrollador que construía un agente OpenClaw para monitorear sitios financieros consumió accidentalmente $20 en tokens de API en unas pocas horas al obtener páginas de Yahoo Finance que incluían 609,000 tokens de HTML superfluo como barras de navegación y banners de cookies en la ventana de contexto.

Automatización de la Verificación Empresarial con OpenClaw: Un Estudio de Caso
Un desarrollador automatizó su proceso de verificación empresarial utilizando OpenClaw, creando un sistema que analiza perfiles enviados, los verifica según las políticas y genera decisiones con razonamiento y puntuaciones de confianza.

El Modelo Qwen 27B Demuestra un Fuerte Rendimiento en el Análisis de Lore de Contexto Largo
Un usuario reporta que Qwen 27B analiza eficazmente documentos de historias densas de 80K tokens, superando a otros modelos locales como Gemma 3 27B y Reka Flash en tareas detalladas de construcción de mundos de fantasía. La cuantización Q4-K-XL ofrece el mejor equilibrio velocidad/calidad para contextos largos.