Configuração Local de Múltiplos Agentes com vLLM, Claude Code e gpt-oss-120b no Linux

Um desenvolvedor compartilhou sua experiência criando uma configuração de multiagente de codificação totalmente local e paralela no Linux após mudar do Windows. A configuração usa vLLM para inferência paralela, Claude Code para orquestração de agentes e um modelo de linguagem grande para tarefas de codificação.
Componentes da Configuração
- Contêiner Docker vLLM: Usado para implantação fácil e inferência paralela
- Claude Code: Lida com vibecoding e orquestração de Equipes de Agentes, configurado para apontar para o endpoint localhost do vLLM em vez de provedores de nuvem
- gpt-oss:120b: Serve como o agente de codificação
- RTX Pro 6000 Blackwell MaxQ: GPU principal para a carga de trabalho
- Dual-boot Ubuntu: Configuração do sistema operacional
Melhorias de Desempenho e Fluxo de Trabalho
O desenvolvedor anteriormente usava Ollama e LM Studio, mas descobriu que eles processavam solicitações sequencialmente e experimentavam desacelerações após múltiplos turnos de mensagens e chamadas de ferramentas. Com vLLM, eles alcançaram processamento paralelo que "turboalimentou" sua experiência.
Nos testes, a configuração lidou com 4 agentes colaborando simultaneamente, como mostrado em uma demonstração em vídeo, com a GPU capaz de suportar 8 agentes em paralelo continuamente. O único problema observado foi a redução da taxa de transferência, que varia dependendo do agente.
Tarefas em escala de Equipe de Agentes que anteriormente levavam horas para serem concluídas sequencialmente agora podem ser feitas em aproximadamente 30 minutos, dependendo do escopo do projeto. O desenvolvedor estima que adicionar uma segunda GPU MaxQ poderia potencialmente escalar o sistema para lidar com dezenas de agentes simultaneamente.
Esta abordagem paralela permite vibecoding de múltiplos projetos localmente e simultaneamente, embora possa introduzir alguma latência aumentada em certos cenários. O desenvolvedor considerou esta compensação preferível a completar projetos um agente por vez.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

O agente de IA OpenClaw identifica bugs de forma autônoma, cria e envia um PR no GitHub.
Um desenvolvedor relata que seu agente de IA OpenClaw diagnosticou um problema recorrente, rastreou-o até um pacote de terceiros, então criou autonomamente um branch no GitHub, fez múltiplos commits, revisou seu próprio código e enviou um pull request para o repositório do pacote.

Criador de IA no YouTube Relata Ganhos com Monetização e Mudança no Fluxo de Trabalho
Um desenvolvedor que usa o Claude Opus 4.6 para roteirização relatou ganhar US$ 12,20 com 28.400 visualizações em seu canal do YouTube gerado por IA, o que levou a uma mudança para a criação de conteúdo freelance para empresas.
Novato constrói 'segundo cérebro' local em Intel Arc Pro B60: Qwen 3.8 27B a 38 tok/s, contexto de 128K
Um não-desenvolvedor roda o OpenClaw como agente pessoal em um Dell antigo e depois monta um servidor de IA dedicado em torno de uma Intel Arc Pro B60, servindo o Qwen 3.8 27B a ~38 tok/s com janela de contexto de 128K.

Agente de Codificação Pi + Qwen 3.6 27B: Configuração mãos-livres do Arch Linux via Linguagem Natural
Um usuário executando Qwen 3.6 27B através do pi coding agent em um miniPC conseguiu configurar Bluetooth, escalonamento de tela e mais no Arch Linux usando comandos em inglês simples — sem tocar em configurações do Wayland.