Configuração Local de Múltiplos Agentes com vLLM, Claude Code e gpt-oss-120b no Linux

✍️ OpenClawRadar📅 Publicado: March 26, 2026🔗 Source
Configuração Local de Múltiplos Agentes com vLLM, Claude Code e gpt-oss-120b no Linux
Ad

Um desenvolvedor compartilhou sua experiência criando uma configuração de multiagente de codificação totalmente local e paralela no Linux após mudar do Windows. A configuração usa vLLM para inferência paralela, Claude Code para orquestração de agentes e um modelo de linguagem grande para tarefas de codificação.

Componentes da Configuração

  • Contêiner Docker vLLM: Usado para implantação fácil e inferência paralela
  • Claude Code: Lida com vibecoding e orquestração de Equipes de Agentes, configurado para apontar para o endpoint localhost do vLLM em vez de provedores de nuvem
  • gpt-oss:120b: Serve como o agente de codificação
  • RTX Pro 6000 Blackwell MaxQ: GPU principal para a carga de trabalho
  • Dual-boot Ubuntu: Configuração do sistema operacional
Ad

Melhorias de Desempenho e Fluxo de Trabalho

O desenvolvedor anteriormente usava Ollama e LM Studio, mas descobriu que eles processavam solicitações sequencialmente e experimentavam desacelerações após múltiplos turnos de mensagens e chamadas de ferramentas. Com vLLM, eles alcançaram processamento paralelo que "turboalimentou" sua experiência.

Nos testes, a configuração lidou com 4 agentes colaborando simultaneamente, como mostrado em uma demonstração em vídeo, com a GPU capaz de suportar 8 agentes em paralelo continuamente. O único problema observado foi a redução da taxa de transferência, que varia dependendo do agente.

Tarefas em escala de Equipe de Agentes que anteriormente levavam horas para serem concluídas sequencialmente agora podem ser feitas em aproximadamente 30 minutos, dependendo do escopo do projeto. O desenvolvedor estima que adicionar uma segunda GPU MaxQ poderia potencialmente escalar o sistema para lidar com dezenas de agentes simultaneamente.

Esta abordagem paralela permite vibecoding de múltiplos projetos localmente e simultaneamente, embora possa introduzir alguma latência aumentada em certos cenários. O desenvolvedor considerou esta compensação preferível a completar projetos um agente por vez.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Agentes de IA Claude Constroem Simulador, Otimizam Algoritmo do Jogo para Superar Pontuação Humana
Use Cases

Agentes de IA Claude Constroem Simulador, Otimizam Algoritmo do Jogo para Superar Pontuação Humana

Um desenvolvedor testou agentes de IA Claude no jogo de programação The Farmer Was Replaced, fazendo com que eles construíssem um simulador Python do jogo e, em seguida, desenvolvessem iterativamente um algoritmo de colheita de girassóis. A IA alcançou um tempo de 5:21, superando o recorde pessoal do desenvolvedor e alcançando a posição 30 no ranking global.

OpenClawRadar
Usando IA para Desembaraçar 10.000 Títulos de Propriedade Brasileiros: Um Estudo de Caso Técnico
Use Cases

Usando IA para Desembaraçar 10.000 Títulos de Propriedade Brasileiros: Um Estudo de Caso Técnico

Uma empresa brasileira de imóveis está usando Claude, Gemini 3.1 Pro e ferramentas de OCR para analisar 10.000 títulos de propriedade com décadas de inconsistências, incluindo vendas duplicadas, contratos fraudulentos e 500 processos ativos.

OpenClawRadar
Configuração local de LLM no Mac Studio: GLM 5.1, Kimi K2.6 e o que está funcionando para codificação com Claude Code
Use Cases

Configuração local de LLM no Mac Studio: GLM 5.1, Kimi K2.6 e o que está funcionando para codificação com Claude Code

Um desenvolvedor compartilha sua configuração do Mac Studio (M3 Ultra) de maio de 2026 com GLM 5.1 quantizado (380GB, 17 tps decode), Kimi K2.6 (460GB, 21 tps decode), e observações sobre Minimax 2.7, Gemma 4 31B, Qwen 3.5 9B, e suporte pendente para Deepseek/Mimo.

OpenClawRadar
Plataforma de Role-Play B2B Usa Opus 4.7 para Backend e Haiku 4.5 para Chat ao Vivo
Use Cases

Plataforma de Role-Play B2B Usa Opus 4.7 para Backend e Haiku 4.5 para Chat ao Vivo

A Socratize (socratize.io) usa o Opus 4.7 para orquestração e avaliação de vitórias/derrotas, e o Haiku 4.5 para chat em tempo real devido à sua maior amabilidade e menor custo.

OpenClawRadar