Qwen3.5-122B-A10B-MINT-MLX funciona perfeitamente no M5 Pro com 64 GB de RAM.

✍️ OpenClawRadar📅 Publicado: April 20, 2026🔗 Source
Qwen3.5-122B-A10B-MINT-MLX funciona perfeitamente no M5 Pro com 64 GB de RAM.
Ad

Desempenho de LLM Local no Apple Silicon

Um usuário do Reddit compartilhou sua experiência executando o modelo Qwen3.5-122B-A10B-MINT-MLX localmente em um M5 Pro com 64GB de RAM. A configuração demonstra que grandes modelos de linguagem podem rodar efetivamente em hardware de consumo com configuração adequada.

Detalhes da Configuração

O usuário alcançou desempenho suave usando comandos específicos no terminal para alocação de VRAM:

sysctl iogpu.unified_memory_limit_percentage
sudo sysctl iogpu.wired_limit_mb=61440

No LM Studio, eles definiram a janela de contexto para 16384 tokens. Com essa configuração, o sistema manteve desempenho estável enquanto rodava Safari com múltiplas abas, Mensagens e Activity Monitor simultaneamente.

Ad

Benchmarks de Desempenho

O modelo Qwen3.5-122B-A10B-MINT-MLX entregou:

  • Tempo para o Primeiro Token: 0,86 segundos
  • Velocidade de Geração de Tokens: 39,58 tokens/segundo

O usuário observou que o modelo "resolveu vários enigmas corretamente e fez um pouco de programação por intuição" sem reclamações sobre a quantização MINT de 3 bits. O único problema ocorreu quando a janela de contexto encheu perto de 59GB de uso de VRAM, causando travamento do sistema.

Comparação com Outros Modelos

O usuário também testou "Qwen3.5 40B Claude 4.6 Opus Deckard Heretic Uncensored Thinking Mxfp8", que considerou mais preciso que o modelo de 122B, mas significativamente mais lento:

  • Velocidade de Geração de Tokens: 6,93 tokens/segundo
  • O processamento de prompts permaneceu rápido apesar da geração mais lenta

Isso demonstra a troca entre tamanho do modelo, quantização e velocidade de inferência que os desenvolvedores enfrentam ao escolher configurações de LLM local.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Claude Code v2.1.199 Corrige Mais de 20 Bugs: SSL, Subagentes, Falhas do Daemon Corrigidas
News

Claude Code v2.1.199 Corrige Mais de 20 Bugs: SSL, Subagentes, Falhas do Daemon Corrigidas

Claude Code v2.1.199 corrige erros de certificado SSL, falhas silenciosas de subagentes, um loop de travamento do daemon Linux e mais de 20 outros bugs. As principais correções incluem dicas imediatas de erro SSL, retenção parcial de stream e propagação de erros de subagentes.

OpenClawRadar
Colapso nos Preços de Assinaturas de IA: Por Que Sua Conta Corporativa Está Prestes a Aumentar 10x
News

Colapso nos Preços de Assinaturas de IA: Por Que Sua Conta Corporativa Está Prestes a Aumentar 10x

Laboratórios de IA como OpenAI, Anthropic e Microsoft estão perdendo dinheiro em cada assinatura. Cargas de trabalho baseadas em agentes quebraram o modelo de taxa fixa — GitHub Copilot migra para cobrança por uso em 1º de junho de 2026. Empresas que construíram com base em preços subsidiados enfrentam uma correção.

OpenClawRadar
Atualização do PostmarketOS de fevereiro de 2026: Kernels Genéricos e Política de IA
News

Atualização do PostmarketOS de fevereiro de 2026: Kernels Genéricos e Política de IA

O PostmarketOS agora oferece pacotes de kernel genéricos (linux-postmarketos-mainline, -stable, -lts) e atualizou sua política de IA para proibir explicitamente a IA generativa. O projeto também teve mudanças de colaboradores e melhorias no CI de hardware.

OpenClawRadar
🦀
News

Gates sobre IA: Era Turbulenta Exige Escolhas Críticas

Bill Gates argumenta que estamos em uma era turbulenta de IA, e as escolhas que fazemos agora são críticas. Destaca decisões importantes sobre segurança, equidade e regulamentação da IA.

OpenClawRadar