Configuração local de LLM no Mac Studio: GLM 5.1, Kimi K2.6 e o que está funcionando para codificação com Claude Code

✍️ OpenClawRadar📅 Publicado: May 7, 2026🔗 Source
Configuração local de LLM no Mac Studio: GLM 5.1, Kimi K2.6 e o que está funcionando para codificação com Claude Code
Ad

No r/LocalLLaMA, o usuário ezyz postou sua configuração local de LLM no Mac Studio em maio de 2026, rodando em um M3 Ultra com 512GB de memória unificada. O post é uma avaliação do dia a dia, não benchmarks rigorosos, mas cheio de observações práticas para quem executa modelos grandes localmente para codificação com Claude Code.

Modelos ativos atuais e desempenho

GLM 5.1 é o maior vencedor. Quantizado, cabe em ~380GB com contexto máximo, deixando espaço para outras tarefas. Velocidade de decodificação é ~17 t/s, prefill ~190 t/s. O autor confia nele até um 6/10 em complexidade de tarefa (10 sendo 'código legado brownfield + especificação vaga') para codificação via Claude Code. Ele lida consistentemente com problemas autocontidos e semiescopo, com ajuda ocasional da API Claude para planejamento ou limpeza.

Kimi K2.6 está no mesmo nível — não é obviamente melhor ou pior — mas é maior. Mesmo quantizado agressivamente, usa ~460GB, deixando pouco para outros experimentos. É mais rápido: prefill ~220 t/s, decode ~21 t/s. A dificuldade é precisar descarregá-lo para experimentos que exigem muita memória.

Minimax 2.7 é impressionante pelo seu tamanho e velocidade, mas o autor o avalia apenas 3-4/10 para trabalho de desenvolvimento. É um tamanho estranho — GLM e Kimi vencem no envio de código utilizável, enquanto modelos menores vencem em tarefas assistentes como 'resumir esta pesquisa na web'. Ele rapidamente desiste de raciocinar para solicitações simples.

Gemma 4 31B decepcionou: o suporte MLX ainda é bagunçado um mês após o lançamento. O denso 31B não é muito mais rápido que os grandes MoEs, o template oficial de chat tem vários bugs não resolvidos, e correções ainda estão chegando aos poucos. O autor planeja revisitar quando o suporte a MTP/draft se estabilizar.

Qwen 3.6 35B foi substituído pelo Qwen 3.5 9B para tarefas multimodais como traduzir capturas de tela — é bom o suficiente e rápido, e lida com tarefas de fundo do Haiku do Claude Code sem diferença perceptível, enquanto economiza ~14GB de memória.

Ad

Suporte pendente e futuro

Nem Deepseek 4 Flash nem Mimo 2.5 chegaram oficialmente ao llama.cpp ou mlx-lm ainda. O autor tentará os PRs quando o tempo permitir. Ele acha que as versões pro de ambos serão grandes e lentas demais para o M3 Ultra — os 40B de parâmetros ativos do GLM é aproximadamente seu limite de paciência.

Projetos acompanhados com expectativa:

  • Exo e tinygrad para clustering Mac + NVIDIA e prefill desagregado
  • Suporte estável Dflash / DDtree / MTP
  • Novos formatos de quantização (paroquant, JANGTQ) — veja llama.cpp PR #21038
  • Geração de música local — Ace Step 1.5 está 'quase bom', mas vozes ainda não estão lá.

📖 Leia a fonte original: r/LocalLLaMA

Ad

👀 See Also

Vice-Presidente de Engenharia Constrói Quatro Aplicativos em Uma Semana Usando Claude AI
Use Cases

Vice-Presidente de Engenharia Constrói Quatro Aplicativos em Uma Semana Usando Claude AI

Um VP de Engenharia usou a Claude AI para construir um aplicativo VPN, um app nativo para iOS com backend em Go, um site de apresentação em Next.js e um painel administrativo em React em uma semana sem escrever código diretamente. O usuário havia tentado anteriormente uma alternativa ao Jira com a Claude há um ano, mas encontrou limitações com aplicativos complexos.

OpenClawRadar
Experimento ALMA: Dois Meses de Agente de IA Autônomo com US$ 100 e Sem Instruções
Use Cases

Experimento ALMA: Dois Meses de Agente de IA Autônomo com US$ 100 e Sem Instruções

Um desenvolvedor executou um agente de IA chamado ALMA por dois meses com US$ 100 em criptomoedas, acesso à internet e zero instruções. O agente escreveu autonomamente 135 peças originais, doou para instituições de caridade e desenvolveu padrões consistentes sem intervenção humana.

OpenClawRadar
Usando o Claude como Mentor de Aprendizado com Contexto de Documentação
Use Cases

Usando o Claude como Mentor de Aprendizado com Contexto de Documentação

Um desenvolvedor compartilha um método para usar o Claude como ferramenta de aprendizado, alimentando a documentação da ferramenta em seu contexto e usando um prompt específico para criar um mentor baseado em tarefas. A abordagem ignora cursos e tutoriais tradicionais em favor do aprendizado prático com feedback imediato.

OpenClawRadar
Configuração Prática do OpenClaw: Configuração do Mac Mini, Gestão de Custos e Automação Diária
Use Cases

Configuração Prática do OpenClaw: Configuração do Mac Mini, Gestão de Custos e Automação Diária

Um desenvolvedor compartilha sua configuração básica do assistente OpenClaw rodando em um Mac Mini, detalhando medidas de segurança, otimização de custos de US$ 60-70 em taxas iniciais de API para US$ 0,60-2,60 diários, e integrações práticas incluindo Telegram, Dropbox e Google Workspace via Composio.

OpenClawRadar