Executando o Claude Code Offline em um M3 Pro com Qwen3.6: 4 Correções Que Fizeram Funcionar

✍️ OpenClawRadar📅 Publicado: June 26, 2026🔗 Source
Executando o Claude Code Offline em um M3 Pro com Qwen3.6: 4 Correções Que Fizeram Funcionar
Ad

O Claude Code se conecta a um modelo local em um Apple M3 Pro (18 núcleos GPU, 36 GiB de memória unificada, ~150 GB/s de largura de banda) executando qwen3.6:35b-a3b-coding-nvfp4 — um modelo MoE de 35,1B parâmetros com ~3B ativos por token, quantizado NVFP4, ~21GB em disco e ~20GiB residentes. A configuração levou um incidente Kubernetes da investigação ao PR: encontrou a causa raiz, escreveu o patch, enviou o branch e registrou o PR via gh — tudo em ambiente air-gapped. Quatro correções transformaram um modelo que timeoutava em 10 minutos em um que fecha o ciclo. A velocidade é limitada pelo hardware; a capacidade não.

Stack e Ambiente

  • Hardware: Apple M3 Pro, 18 núcleos GPU, 36 GiB de memória unificada, ~150 GB/s de largura de banda
  • Modelo: qwen3.6:35b-a3b-coding-nvfp4
  • Runtime: Ollama 0.24.0, MLX runner (nativo Apple Silicon)
  • Cliente: Claude Code v2.1.84 apontando para endpoint local do Ollama

Variáveis de ambiente principais (definidas em um plist do launchd para persistência):

OLLAMA_MLX=1
OLLAMA_CONTEXT_LENGTH=32768
OLLAMA_FLASH_ATTENTION=1
OLLAMA_MULTIUSER_CACHE=1
OLLAMA_KEEP_ALIVE=24h
OLLAMA_NO_CLOUD=1
Ad

Passos de Configuração

  1. Instale o Ollama 0.24.0+
  2. ollama pull qwen3.6:35b-a3b-coding-nvfp4 (~21GB uma vez)
  3. Inicie o servidor com as variáveis de ambiente acima
  4. Inicie o Claude Code:
    ANTHROPIC_BASE_URL=http://localhost:11434 MAX_THINKING_TOKENS=0 claude --model qwen3.6:35b-a3b-coding-nvfp4
  5. Teste rápido: Execute kubectl get pods -A e me diga se algo parece não saudável

Notas de Desempenho

Primeira chamada de ferramenta: segundos (thinking desabilitado). Preenchimento (carregando ~25K tokens) leva ~60s. As iterações seguintes são mais rápidas devido ao prefix caching (OLLAMA_MULTIUSER_CACHE). O modelo permanece carregado via OLLAMA_KEEP_ALIVE=24h. Rajada de 404s no log do Ollama durante o preenchimento é normal (correção #4).

A arquitetura MoE é fundamental: apenas ~3B ativos por token, então o custo de execução se assemelha a um modelo denso de 14B, enquanto as respostas se aproximam de um de 35B. Um modelo denso de 35B não cabe em 36GiB.

📖 Leia a fonte completa: HN LLM Tools

Ad

👀 See Also

PromoClock: Rastreador de Fuso Horário para os Horários Fora de Pico 2x do Claude Desenvolvido com Claude 4.6
Tools

PromoClock: Rastreador de Fuso Horário para os Horários Fora de Pico 2x do Claude Desenvolvido com Claude 4.6

Um desenvolvedor criou o PromoClock.co, uma ferramenta gratuita que converte automaticamente os horários promocionais de 2x fora do pico do Claude "5-11am PT / 12-6pm GMT" para o horário local, usando o Claude 4.6 para lidar com a lógica de fuso horário, configuração do Next.js 15 e design da interface.

OpenClawRadar
DocMason: Base de Conhecimento de Agente Local para Arquivos de Escritório Complexos
Tools

DocMason: Base de Conhecimento de Agente Local para Arquivos de Escritório Complexos

DocMason é um aplicativo agente nativo de repositório que constrói bases de conhecimento locais a partir de documentos de escritório complexos como PPTX, DOCX, Excel e PDFs. Ele roda inteiramente dentro do Codex ou Claude Code, mantendo a estrutura do documento e fornecendo respostas rastreáveis com proveniência.

OpenClawRadar
Werld: Simulação de Vida Artificial de Mundo Aberto com Redes Neurais Evolutivas
Tools

Werld: Simulação de Vida Artificial de Mundo Aberto com Redes Neurais Evolutivas

Werld é uma simulação de vida artificial em tempo real onde agentes com redes neurais NEAT evoluem sua própria arquitetura neural, processamento sensorial e comportamentos sem regras pré-programadas ou funções de recompensa. A simulação começa com 30 agentes em um grafo de mundo pequeno Watts-Strogatz com 64 canais sensoriais, 7 funções motoras contínuas e 29 traços genômicos hereditários.

OpenClawRadar
Inferência de LLM Soberano do Reino Unido: Relax.ai Lança Documentos Públicos
Tools

Inferência de LLM Soberano do Reino Unido: Relax.ai Lança Documentos Públicos

Relax.ai publicou documentação para inferência de LLM soberano do Reino Unido, redirecionando para /docs/getting-started/introduction. O serviço foi compartilhado no HN com 104 pontos.

OpenClawRadar