Executando o Claude Code Offline em um M3 Pro com Qwen3.6: 4 Correções Que Fizeram Funcionar

O Claude Code se conecta a um modelo local em um Apple M3 Pro (18 núcleos GPU, 36 GiB de memória unificada, ~150 GB/s de largura de banda) executando qwen3.6:35b-a3b-coding-nvfp4 — um modelo MoE de 35,1B parâmetros com ~3B ativos por token, quantizado NVFP4, ~21GB em disco e ~20GiB residentes. A configuração levou um incidente Kubernetes da investigação ao PR: encontrou a causa raiz, escreveu o patch, enviou o branch e registrou o PR via gh — tudo em ambiente air-gapped. Quatro correções transformaram um modelo que timeoutava em 10 minutos em um que fecha o ciclo. A velocidade é limitada pelo hardware; a capacidade não.
Stack e Ambiente
- Hardware: Apple M3 Pro, 18 núcleos GPU, 36 GiB de memória unificada, ~150 GB/s de largura de banda
- Modelo:
qwen3.6:35b-a3b-coding-nvfp4 - Runtime: Ollama 0.24.0, MLX runner (nativo Apple Silicon)
- Cliente: Claude Code v2.1.84 apontando para endpoint local do Ollama
Variáveis de ambiente principais (definidas em um plist do launchd para persistência):
OLLAMA_MLX=1
OLLAMA_CONTEXT_LENGTH=32768
OLLAMA_FLASH_ATTENTION=1
OLLAMA_MULTIUSER_CACHE=1
OLLAMA_KEEP_ALIVE=24h
OLLAMA_NO_CLOUD=1
Passos de Configuração
- Instale o Ollama 0.24.0+
ollama pull qwen3.6:35b-a3b-coding-nvfp4(~21GB uma vez)- Inicie o servidor com as variáveis de ambiente acima
- Inicie o Claude Code:
ANTHROPIC_BASE_URL=http://localhost:11434 MAX_THINKING_TOKENS=0 claude --model qwen3.6:35b-a3b-coding-nvfp4 - Teste rápido:
Execute kubectl get pods -A e me diga se algo parece não saudável
Notas de Desempenho
Primeira chamada de ferramenta: segundos (thinking desabilitado). Preenchimento (carregando ~25K tokens) leva ~60s. As iterações seguintes são mais rápidas devido ao prefix caching (OLLAMA_MULTIUSER_CACHE). O modelo permanece carregado via OLLAMA_KEEP_ALIVE=24h. Rajada de 404s no log do Ollama durante o preenchimento é normal (correção #4).
A arquitetura MoE é fundamental: apenas ~3B ativos por token, então o custo de execução se assemelha a um modelo denso de 14B, enquanto as respostas se aproximam de um de 35B. Um modelo denso de 35B não cabe em 36GiB.
📖 Leia a fonte completa: HN LLM Tools
👀 See Also

PromoClock: Rastreador de Fuso Horário para os Horários Fora de Pico 2x do Claude Desenvolvido com Claude 4.6
Um desenvolvedor criou o PromoClock.co, uma ferramenta gratuita que converte automaticamente os horários promocionais de 2x fora do pico do Claude "5-11am PT / 12-6pm GMT" para o horário local, usando o Claude 4.6 para lidar com a lógica de fuso horário, configuração do Next.js 15 e design da interface.

DocMason: Base de Conhecimento de Agente Local para Arquivos de Escritório Complexos
DocMason é um aplicativo agente nativo de repositório que constrói bases de conhecimento locais a partir de documentos de escritório complexos como PPTX, DOCX, Excel e PDFs. Ele roda inteiramente dentro do Codex ou Claude Code, mantendo a estrutura do documento e fornecendo respostas rastreáveis com proveniência.

Werld: Simulação de Vida Artificial de Mundo Aberto com Redes Neurais Evolutivas
Werld é uma simulação de vida artificial em tempo real onde agentes com redes neurais NEAT evoluem sua própria arquitetura neural, processamento sensorial e comportamentos sem regras pré-programadas ou funções de recompensa. A simulação começa com 30 agentes em um grafo de mundo pequeno Watts-Strogatz com 64 canais sensoriais, 7 funções motoras contínuas e 29 traços genômicos hereditários.

Inferência de LLM Soberano do Reino Unido: Relax.ai Lança Documentos Públicos
Relax.ai publicou documentação para inferência de LLM soberano do Reino Unido, redirecionando para /docs/getting-started/introduction. O serviço foi compartilhado no HN com 104 pontos.