Configuração local de LLM no Mac Studio: GLM 5.1, Kimi K2.6 e o que está funcionando para codificação com Claude Code

✍️ OpenClawRadar📅 Publicado: May 7, 2026🔗 Source
Configuração local de LLM no Mac Studio: GLM 5.1, Kimi K2.6 e o que está funcionando para codificação com Claude Code
Ad

No r/LocalLLaMA, o usuário ezyz postou sua configuração local de LLM no Mac Studio em maio de 2026, rodando em um M3 Ultra com 512GB de memória unificada. O post é uma avaliação do dia a dia, não benchmarks rigorosos, mas cheio de observações práticas para quem executa modelos grandes localmente para codificação com Claude Code.

Modelos ativos atuais e desempenho

GLM 5.1 é o maior vencedor. Quantizado, cabe em ~380GB com contexto máximo, deixando espaço para outras tarefas. Velocidade de decodificação é ~17 t/s, prefill ~190 t/s. O autor confia nele até um 6/10 em complexidade de tarefa (10 sendo 'código legado brownfield + especificação vaga') para codificação via Claude Code. Ele lida consistentemente com problemas autocontidos e semiescopo, com ajuda ocasional da API Claude para planejamento ou limpeza.

Kimi K2.6 está no mesmo nível — não é obviamente melhor ou pior — mas é maior. Mesmo quantizado agressivamente, usa ~460GB, deixando pouco para outros experimentos. É mais rápido: prefill ~220 t/s, decode ~21 t/s. A dificuldade é precisar descarregá-lo para experimentos que exigem muita memória.

Minimax 2.7 é impressionante pelo seu tamanho e velocidade, mas o autor o avalia apenas 3-4/10 para trabalho de desenvolvimento. É um tamanho estranho — GLM e Kimi vencem no envio de código utilizável, enquanto modelos menores vencem em tarefas assistentes como 'resumir esta pesquisa na web'. Ele rapidamente desiste de raciocinar para solicitações simples.

Gemma 4 31B decepcionou: o suporte MLX ainda é bagunçado um mês após o lançamento. O denso 31B não é muito mais rápido que os grandes MoEs, o template oficial de chat tem vários bugs não resolvidos, e correções ainda estão chegando aos poucos. O autor planeja revisitar quando o suporte a MTP/draft se estabilizar.

Qwen 3.6 35B foi substituído pelo Qwen 3.5 9B para tarefas multimodais como traduzir capturas de tela — é bom o suficiente e rápido, e lida com tarefas de fundo do Haiku do Claude Code sem diferença perceptível, enquanto economiza ~14GB de memória.

Ad

Suporte pendente e futuro

Nem Deepseek 4 Flash nem Mimo 2.5 chegaram oficialmente ao llama.cpp ou mlx-lm ainda. O autor tentará os PRs quando o tempo permitir. Ele acha que as versões pro de ambos serão grandes e lentas demais para o M3 Ultra — os 40B de parâmetros ativos do GLM é aproximadamente seu limite de paciência.

Projetos acompanhados com expectativa:

  • Exo e tinygrad para clustering Mac + NVIDIA e prefill desagregado
  • Suporte estável Dflash / DDtree / MTP
  • Novos formatos de quantização (paroquant, JANGTQ) — veja llama.cpp PR #21038
  • Geração de música local — Ace Step 1.5 está 'quase bom', mas vozes ainda não estão lá.

📖 Leia a fonte original: r/LocalLLaMA

Ad

👀 See Also

Tese de Mestrado Escrita Maioritariamente com Claude: Estudante de Economia Passa com Nota Máxima
Use Cases

Tese de Mestrado Escrita Maioritariamente com Claude: Estudante de Economia Passa com Nota Máxima

Um estudante de economia usou Claude para revisão de literatura, análise de dados com scripts Python e Excel, e apresentação — passou com nota máxima, quase nível de doutorado. O apêndice revelou o uso de IA, sem questionamentos.

OpenClawRadar
Usando o OpenClaw para Separar Finanças Pessoais e Empresariais: Abordagem de um Profissional Autônomo
Use Cases

Usando o OpenClaw para Separar Finanças Pessoais e Empresariais: Abordagem de um Profissional Autônomo

Um dentista proprietário de consultório individual descreve como conseguiu que o OpenClaw parasse de mesclar transações comerciais e pessoais, sinalizando divergências em vez de forçar a reconciliação.

OpenClawRadar
Teste do Pipeline RAG Mostra que o Custo por Token Não é a Métrica Correta para Seleção de Modelos
Use Cases

Teste do Pipeline RAG Mostra que o Custo por Token Não é a Métrica Correta para Seleção de Modelos

Um desenvolvedor testou o Claude Haiku 4.5, Amazon Nova Pro e Amazon Nova Lite em pipelines RAG idênticos com consultas reais e descobriu que o modelo mais barato por token produziu as respostas menos úteis, custando mais por resposta útil.

OpenClawRadar
Lições Práticas da Construção de uma Base de Código de 350 Mil Linhas em Solitário com Agentes de IA
Use Cases

Lições Práticas da Construção de uma Base de Código de 350 Mil Linhas em Solitário com Agentes de IA

Um desenvolvedor compartilha insights concretos de engenharia da construção de uma base de código de produção com 356 mil linhas em 52 dias usando agentes de IA, incluindo como a estrutura da base de código afeta a saída dos agentes e por que a tipagem forte é essencial.

OpenClawRadar