Qwen 35B-A3B como agente sempre ativo em M4 Mac de 16GB: falha de I/O de disco antes da RAM

✍️ OpenClawRadar📅 Publicado: April 28, 2026🔗 Source
Qwen 35B-A3B como agente sempre ativo em M4 Mac de 16GB: falha de I/O de disco antes da RAM
Ad

Executar um modelo MoE Qwen 35B-A3B como um agente sempre ativo em um Mac Mini M4 de 16GB (configuração básica) parecia plausível no papel: com --mmap e --flash-attn do llama.cpp, o quant IQ3_XXS (12GB em disco) mantém-se residente na RAM entre 4 e 6GB via paginação por especialista, entregando ~17 tok/s com --threads 8 --ctx-size 4096. Como ferramenta de lote, funciona nesta máquina. Mas ao escalar para um loop agentivo contínuo, rodando junto com Claude Code (Opus/Sonnet) e Codex CLI, o sistema colapsou — e o gargalo foi o disco, não a RAM.

A configuração que quebrou

  • Daemon Ollama servindo qwen3.5:9b + qwen3.5:4b (config: OLLAMA_MAX_LOADED_MODELS=2, OLLAMA_KEEP_ALIVE=10m, OLLAMA_FLASH_ATTENTION=1, OLLAMA_KV_CACHE_TYPE=q8_0)
  • llama-server para o 35B em sua própria porta
  • Bridge LiteLLM proxyando tudo como um endpoint compatível com Claude na porta :4000
  • Uma ou duas sessões do Claude Code
  • Sessão do Codex CLI
  • Servidor doméstico usual com cron, watchers, fila de e-mail

O que falhou

Paginação contínua mmap do 35B + observador/indexador de arquivos do Claude Code + contexto mantido pelo Codex = contenção constante de SSD. O Mac começou a reiniciar espontaneamente (sem logs de crash em log show --predicate 'eventMessage CONTAINS "panic"'), tarefas cron de fundo perderam janelas por 5+ minutos e depois falharam silenciosamente. Problemas conhecidos: Claude Code e Codex CLI têm bugs abertos para crescimento de memória em sessões longas (#22968), uso contínuo de CPU ociosa (#19393) e acúmulo de processos (#11122). Com uma ferramenta é imperceptível; com duas mais um 35B paginado fazendo loops reais, o disco morre primeiro.

Ad

Solução estável

  • LaunchDaemon do 35B llama-server desabilitado (plist renomeado para .disabled)
  • 24GB recuperados deletando o GGUF do 35B e um Gemma 26B antigo
  • Todas as rotas para Anthropic agora vão para Ollama: qwen3.5:9b para opus/sonnet, qwen3.5:4b para haiku
  • Ambos residentes via Metal no Ollama (~3GB GPU + 0.5GB CPU cada), removem-se limpos em idle
  • LiteLLM movido para um LaunchAgent de usuário adequado (KeepAlive=true, ThrottleInterval=30) — estava rodando como um simples processo python -m litellm há 7 dias

A conclusão

O sonho do agente em loop com 35B-A3B está vivo em uma classe diferente de máquina. Em 16GB unificados, é uma ferramenta de lote para propósito único, não uma camada sempre ativa. O autor estima mínimo de 32GB de memória unificada para inferência sustentada de agente MoE sem sofrimento com swap ou contenção de daemons.

Se você tem um truque para rodá-lo de forma sustentável em 16GB sem contenção de disco, o tópico no r/LocalLLaMA ainda está ativo.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

CEOs que pensam que a IA substitui seus funcionários são apenas maus CEOs
News

CEOs que pensam que a IA substitui seus funcionários são apenas maus CEOs

CEO Aaron Levie explica 'psicose de IA' — quando líderes, distantes do trabalho real, veem demonstrações de caminho feliz e superestimam ferramentas agênticas como Claude Code, ignorando a última milha da produção.

OpenClawRadar
Dois novos modelos aparecem no OpenRouter, possivelmente variantes do DeepSeek V4
News

Dois novos modelos aparecem no OpenRouter, possivelmente variantes do DeepSeek V4

Dois novos modelos chamados healer-alpha e hunter-alpha apareceram no OpenRouter, com especificações correspondentes aos detalhes vazados sobre o DeepSeek V4. Testes iniciais mostram que ambos os modelos têm bom desempenho em cenários de roleplay, sem filtragem de mensagens e com geração de tokens mais rápida do que o GLM 5.0.

OpenClawRadar
Claude Opus 4.7 Lançado com Raciocínio Híbrido e Janela de Contexto de 1 Milhão
News

Claude Opus 4.7 Lançado com Raciocínio Híbrido e Janela de Contexto de 1 Milhão

A Anthropic lançou o Claude Opus 4.7, um modelo de raciocínio híbrido com janela de contexto de 1 milhão que oferece desempenho superior em tarefas de codificação, visão e tarefas complexas de múltiplas etapas. Os preços começam em US$ 5 por milhão de tokens de entrada e US$ 25 por milhão de tokens de saída.

OpenClawRadar
Claude supera Gemini, ChatGPT e Grok em desafio de codificação Python em tempo real
News

Claude supera Gemini, ChatGPT e Grok em desafio de codificação Python em tempo real

Um desenvolvedor testou Claude, Gemini, ChatGPT e Grok em um torneio de programação Python em tempo real, onde bots gerados por IA competiram para encontrar palavras em uma grade de letras 15×15. Claude venceu de forma decisiva.

OpenClawRadar