Novato constrói 'segundo cérebro' local em Intel Arc Pro B60: Qwen 3.8 27B a 38 tok/s, contexto de 128K
Um não-desenvolvedor sem formação em programação montou um agente de IA pessoal quase totalmente local (OpenClaw) em um velho Dell OptiPlex e depois construiu um servidor de IA dedicado em torno de uma GPU Intel Arc Pro B60. A fonte é um relato detalhado do hardware exato, dos custos e dos resultados — incluindo rodar o Qwen 3.8 27B a ~38 tok/s com uma janela de contexto de 128K.
Como começou
O autor era um usuário médio de chatbot — só para pesquisa e escrita — até que um vídeo no YouTube sobre o OpenClaw (um agente de IA que de fato faz as coisas, não apenas conversa) o motivou a construir. A configuração levou cerca de 2 dias usando uma conta gratuita do Claude em um antigo Dell OptiPlex 3431, inicialmente rodando com uma assinatura do ChatGPT de US$ 20/mês.
O Dell (plano de controle do agente)
- CPU: Intel Core i9-9900 (atualizado do i5 original)
- RAM: 32GB DDR4-2666 (era 64GB, metade foi para o servidor de IA)
- GPU: NVIDIA Quadro P620, 2GB (original, inútil para IA)
- Disco do SO: 512GB NVMe (adicionado)
- Armazenamento: SSD SATA de 2TB (original)
- SO: Windows 11 Pro
Roda o OpenClaw (a estrutura do agente), memória, agendamento, Telegram (a interface de chat), backups e armazena modelos locais que podem ser enviados ao servidor de IA a qualquer momento.
Problemas de estabilidade foram rastreados até pentes de memória baratos do "mercado cinza" que a Dell enviava com a máquina via Amazon — o autor suspeita que RAM defeituosa corrompeu arquivos do Windows. O upgrade para o i9 foi apontado como o único gasto ruim até agora (US$ 200 no eBay), com o agente literalmente implorando para não comprá-lo.
A BlackBox (BB) — servidor de IA dedicado
Enquanto rodava o agente, o autor encomendou e depois cancelou um Mac Studio de US$ 2.000 após perceber que ele não conseguiria rodar um modelo capaz de fazer o que era necessário. Ele passou brevemente para o modelo todo-nuvem: US$ 20/mês de Claude mais um plano ChatGPT de US$ 100 = US$ 120/mês só para rodar o agente, o que parecia uma armadilha.
O ponto de virada foram os pequenos modelos abertos — Qwen, GPT-OSS 20B, Mistral, Gemma. Quando o Qwen 3.8 27B foi lançado, ele se comprometeu a construir uma máquina separada que não faz nada além de servir IA para o agente. Essa separação é descrita como a melhor decisão do projeto.
A regra que guia tudo
Tudo deve ser genérico e intercambiável — nunca casado com um modelo, uma peça de hardware ou até mesmo com a própria estrutura do agente. Isso permite que a máquina hospedeira do agente mude enquanto a inferência local permanece no lugar.
Números relatados
Qwen 3.8 27B a aproximadamente 38 tok/s com uma janela de contexto de 128K na Intel Arc Pro B60 — agora o modelo padrão, com modelos na nuvem como backup em vez do contrário. Especificações completas, configuração e números estão no post original.
📖 Leia a fonte completa: r/openclaw
👀 See Also

Claude para Conformidade em Engenharia: Análise de Fluxo de Trabalho de 6 Meses
Uma empresa técnica compartilha como usa Projetos, Artefatos e a capacidade de seguir restrições do Claude para evitar alucinações em especificações voltadas para clientes.

Desenvolvedor Concede Acesso Root ao Código do Claude, Revoluciona Fluxo de Trabalho de Desenvolvimento
Um desenvolvedor concedeu acesso root ao Claude Code em seu servidor, monitorou todos os comandos e descobriu que ele fez alterações calmas e metódicas que abordaram as causas raiz, não apenas os sintomas. Isso levou a uma mudança em seu fluxo de trabalho para desenvolver diretamente em um ambiente clonado da produção.

Um prompt que encontra, envia e-mails e registra 200 contatos de investidores via Claude Code
Um único prompt para o Claude Code ou qualquer agente de IA vasculha investidores, verifica duplicatas no Gmail/Notion, envia e-mails frios personalizados via SMTP e registra tudo no Notion — tudo de forma autônoma.

Configuração Local de Múltiplos Agentes com vLLM, Claude Code e gpt-oss-120b no Linux
Um desenvolvedor criou uma configuração de multiagente paralela 100% local usando vLLM no Docker, Claude Code para orquestração apontando para localhost, e gpt-oss-120b como agente de codificação em uma GPU RTX Pro 6000 Blackwell MaxQ com dual-boot Ubuntu, alcançando 8 agentes trabalhando simultaneamente.