Skippy's LLM Privado: Como Resolvi o Timeout do Subagente Ollama do OpenClaw Chamando o Ollama Diretamente

O sistema de subagentes do OpenClaw tem um problema persistente de timeout ao usar modelos Ollama. O loop de eventos do Node.js bloqueia durante a geração, os subagentes travam por mais de 60 segundos e produzem zero tokens. Múltiplos problemas no GitHub confirmam isso: #23827, #27883, #41871, #79032, #63736 — todos relatam o mesmo padrão: curl direto funciona, subagentes não.
A correção descrita por Skippy, assistente de IA de um COO da OpenClaw, é pular o sistema de subagentes completamente. Em vez disso, execute uma segunda instância do Ollama na porta 11435, desacoplada da instância principal de chat na porta 11434. A instância principal lida com chat normal e ferramentas; a segunda instância é um worker dedicado para análises pesadas (como revisar um classificador Python de 432 linhas). A IA a chama via um curl bruto ou um wrapper Python — sem envolvimento do gateway, sem bloqueio do loop de eventos, sem contenção de GPU.
python3 analyze.py \
--file /tmp/review_prompt.txt \
--out /tmp/review.md \
--system "You are a deep code reviewer." \
--timeout 1200 \
--max-tokens 32768 \
--temperature 0.3Fluxo de trabalho: escreva o prompt de revisão + o código-fonte completo em um arquivo temporário e depois execute o script Python. O modelo de 27B roda na porta 11435, usando ~17,7 GB de VRAM em um Mac Studio M2 Ultra, enquanto o chat principal usa o modelo de 35B na porta 11434 (~19,8 GB de VRAM). Skippy relata que a correção funciona de forma confiável — sem mais timeouts.
Esta é uma solução pragmática para qualquer pessoa que esteja enfrentando o bug de timeout do subagente Ollama no OpenClaw, especialmente se você tiver VRAM suficiente para executar duas instâncias de modelo.
📖 Leia a fonte completa: r/openclaw
👀 See Also

Automação Econômica do OpenClaw: Usando LLMs Apenas Quando Necessário
Um desenvolvedor compartilha uma abordagem prática para usar o OpenClaw em tarefas determinísticas sem chamadas constantes a LLM, criando scripts Python para cron jobs e invocando o LLM apenas quando erros exigem análise e correções.

Comunidade Discute Soluções para Consumo de Tokens OpenClaw
Usuários compartilham estratégias para gerenciar alto consumo de tokens ao executar agentes de IA 24 horas por dia.

Agentes de Navegador Consumiram Meu Orçamento de API: O Custo Oculto dos Loops de Observação
Executando agentes de IA em tarefas web reais? Um usuário do Reddit relata que os loops de observação no navegador — e não o modelo — são o principal custo. Cada clique, espera e observação gera uma ida e volta, e a baixa qualidade dos snapshots cria um espiral de falhas que infla o uso de tokens. Ambientes isolados de navegador e execução mais rápida do agente são medidas-chave de redução de custos.

8 Meses de Uso Diário: 9 Dicas Práticas com Claude (Não Codificação)
Um usuário do Reddit compartilha 9 lições aprendidas em 8 meses de uso diário do Claude para escrita e pesquisa—não código—abordando edição, gerenciamento de contexto, configuração de estilo e uso do Claude como parceiro de pensamento.