Qwen3.5-122B-A10B-MINT-MLX funciona perfeitamente no M5 Pro com 64 GB de RAM.

Desempenho de LLM Local no Apple Silicon
Um usuário do Reddit compartilhou sua experiência executando o modelo Qwen3.5-122B-A10B-MINT-MLX localmente em um M5 Pro com 64GB de RAM. A configuração demonstra que grandes modelos de linguagem podem rodar efetivamente em hardware de consumo com configuração adequada.
Detalhes da Configuração
O usuário alcançou desempenho suave usando comandos específicos no terminal para alocação de VRAM:
sysctl iogpu.unified_memory_limit_percentage
sudo sysctl iogpu.wired_limit_mb=61440
No LM Studio, eles definiram a janela de contexto para 16384 tokens. Com essa configuração, o sistema manteve desempenho estável enquanto rodava Safari com múltiplas abas, Mensagens e Activity Monitor simultaneamente.
Benchmarks de Desempenho
O modelo Qwen3.5-122B-A10B-MINT-MLX entregou:
- Tempo para o Primeiro Token: 0,86 segundos
- Velocidade de Geração de Tokens: 39,58 tokens/segundo
O usuário observou que o modelo "resolveu vários enigmas corretamente e fez um pouco de programação por intuição" sem reclamações sobre a quantização MINT de 3 bits. O único problema ocorreu quando a janela de contexto encheu perto de 59GB de uso de VRAM, causando travamento do sistema.
Comparação com Outros Modelos
O usuário também testou "Qwen3.5 40B Claude 4.6 Opus Deckard Heretic Uncensored Thinking Mxfp8", que considerou mais preciso que o modelo de 122B, mas significativamente mais lento:
- Velocidade de Geração de Tokens: 6,93 tokens/segundo
- O processamento de prompts permaneceu rápido apesar da geração mais lenta
Isso demonstra a troca entre tamanho do modelo, quantização e velocidade de inferência que os desenvolvedores enfrentam ao escolher configurações de LLM local.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

OpenClaw v2026.6.10: Modo Rápido Automático, Correções de Roteamento de Modelo e Políticas de Ferramentas Confiáveis
OpenClaw v2026.6.10 adiciona modo rápido automático, corrige roteamento de modelo para Z.ai GLM-5, melhora a identidade de sessão entre canais e torna as políticas de ferramentas confiáveis mais robustas.

Claude AI sofre falha generalizada: interface web fora do ar, erros de API elevados
O Claude.ai está indisponível e a API está retornando taxas de erro elevadas desde 28 de abril de 2025, 19:15 UTC. A página de status oficial confirma um incidente em andamento.

"Magnifica Humanitas" do Papa Leão XIV: Uma Encíclica de 40.000 Palavras sobre o Desarmamento da IA
O Papa Leão XIV divulga Magnifica Humanitas, uma encíclica de 40.000 palavras que pede o desarmamento da IA, criticando armas autônomas, colonialismo de dados e monopólios de tecnologia. Cofundador da Anthropic presente no lançamento.

Problema de UX do Claude Cowork: Caixa de Entrada Persistente Cria Expectativas Falsas de Continuidade
Um usuário identifica um problema de UX no Claude Cowork onde a caixa de entrada de texto persistente mantém o texto rascunhado ao alternar entre tarefas, mas redefine o contexto e perde os anexos, criando sinais contraditórios sobre a continuidade.