Configuración Local Multi-Agente con vLLM, Claude Code y gpt-oss-120b en Linux

✍️ OpenClawRadar📅 Publicado: 26 de marzo de 2026🔗 Source
Configuración Local Multi-Agente con vLLM, Claude Code y gpt-oss-120b en Linux
Ad

Un desarrollador compartió su experiencia creando una configuración de codificación multiagente paralela completamente local en Linux después de cambiar desde Windows. La configuración utiliza vLLM para inferencia paralela, Claude Code para orquestación de agentes, y un modelo de lenguaje grande para tareas de codificación.

Componentes de la Configuración

  • Contenedor Docker de vLLM: Utilizado para despliegue fácil e inferencia paralela
  • Claude Code: Maneja la vibecodificación y la orquestación de Equipos de Agentes, configurado para apuntar al endpoint localhost de vLLM en lugar de proveedores en la nube
  • gpt-oss:120b: Sirve como el agente de codificación
  • RTX Pro 6000 Blackwell MaxQ: GPU principal para la carga de trabajo
  • Ubuntu de arranque dual: Configuración del sistema operativo
Ad

Mejoras de Rendimiento y Flujo de Trabajo

El desarrollador anteriormente utilizaba Ollama y LM Studio pero encontró que procesaban solicitudes secuencialmente y experimentaban ralentizaciones después de múltiples turnos de mensajes y llamadas a herramientas. Con vLLM, lograron procesamiento paralelo que "turboalimentó" su experiencia.

En pruebas, la configuración manejó 4 agentes colaborando simultáneamente como se muestra en una demostración en video, con la GPU capaz de soportar 8 agentes en paralelo continuamente. El único problema observado fue la reducción del rendimiento, que varía dependiendo del agente.

Tareas a escala de Equipo de Agentes que anteriormente tomaban horas para completarse secuencialmente ahora pueden hacerse en aproximadamente 30 minutos, dependiendo del alcance del proyecto. El desarrollador estima que agregar una segunda GPU MaxQ podría potencialmente escalar el sistema para manejar decenas de agentes concurrentemente.

Este enfoque paralelo permite vibecodificar múltiples proyectos local y concurrentemente, aunque puede introducir cierta latencia aumentada en ciertos escenarios. El desarrollador encontró esta compensación preferible a completar proyectos un agente a la vez.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

Desarrollador Cambia de Especificaciones a Propuestas para Sesiones de Código Paralelas de Claude
Casos de uso

Desarrollador Cambia de Especificaciones a Propuestas para Sesiones de Código Paralelas de Claude

Un desarrollador comparte un flujo de trabajo utilizando propuestas en lugar de especificaciones al ejecutar 5-10 sesiones de Claude Code en paralelo, abordando el problema de que la IA genere código técnicamente correcto pero contextualmente erróneo a partir de especificaciones detalladas.

OpenClawRadar
Cómo un asistente personal de IA transformó la gestión de mi cuenta de Twitter.
Casos de uso

Cómo un asistente personal de IA transformó la gestión de mi cuenta de Twitter.

Descubre cómo un asistente personal de IA revolucionó la gestión de una cuenta de Twitter con un mayor compromiso y eficiencia. Aprende de esta historia real de éxito proveniente de la comunidad de OpenClaw.

OpenClawRadar
Desarrollador crea un servicio simplificado de alojamiento de agentes de IA para usuarios no técnicos.
Casos de uso

Desarrollador crea un servicio simplificado de alojamiento de agentes de IA para usuarios no técnicos.

Un desarrollador creó una herramienta que maneja automáticamente el alojamiento de agentes de IA con instancias de nube privada, permitiendo a usuarios no técnicos conectarse a través de Telegram usando sus propias claves API. La solución se construyó después de intentos fallidos de guiar a un usuario no técnico a través de configuraciones estándar basadas en Docker.

OpenClawRadar
Habilidad de Código Claude de Código Abierto para la Coordinación Logística Familiar
Casos de uso

Habilidad de Código Claude de Código Abierto para la Coordinación Logística Familiar

Un desarrollador creó Parent Helper, una habilidad de Claude Code que coordina horarios familiares, planificación de comidas y optimización de compras usando un único archivo markdown e integraciones MCP. La herramienta proyecta ahorros de $4.3K/año en compras dividiendo listas entre tiendas según precios.

OpenClawRadar