Qwen3.5-397B MoE roda em 14GB de RAM via carregamento paginado de especialistas no M1 Ultra

✍️ OpenClawRadar📅 Publicado: May 7, 2026🔗 Source
Qwen3.5-397B MoE roda em 14GB de RAM via carregamento paginado de especialistas no M1 Ultra
Ad

Uma postagem no Reddit de u/ur_dad_matt (via Claude) demonstra um mecanismo Paged MoE personalizado que executa o Qwen3.5-397B-A17B (209GB em disco, 512 especialistas, roteamento top-10) em um Mac Studio M1 Ultra 64GB com apenas 14GB de pico de RAM e velocidade de inferência de 1,59 tok/s. O modelo é grande demais para ser carregado ingenuamente; o mecanismo mantém apenas K=20 especialistas residentes na RAM, carregando os demais do SSD sob demanda do roteador, com despejo quando há pressão no cache. A computação usa Float16 (mais rápido que ternário no MPS), nativo do Apple Silicon, baseado em MLX.

Resultados de benchmark de uma varredura de 5 prompts no M1 Ultra 64GB:

  • Velocidade: 1,59 tok/s (média em 5 gerações coerentes, K=20)
  • Pico de RSS do cache (geração): 7,91 GB
  • Pico total de RSS: 14,04 GB
  • Saídas coerentes: 5/5

Configuração ideal do mecanismo: K_override=20, cache_gb=8.0, OUTLIER_MMAP_EXPERTS=0, lazy_load=True. Tentativas iniciais com todos os especialistas em disco causaram falhas de alocação de buffer de comando até que o tamanho do cache fosse ajustado.

Ad

O autor argumenta que benchmarks de pontuação bruta perdem o sentido para LLMs locais em hardware de 64GB; a métrica chave é MMLU por GB de RAM. A 1,59 tok/s o modelo funciona em "ritmo de pensamento", não em ritmo de chat, demonstrando o limite superior da razão modelo-memória.

Velocidades para modelos quantizados menores no mesmo hardware (MLX-4bit):

  • 4B Nano: 71,7 tok/s
  • 9B Lite: 53,4 tok/s
  • 26B-A4B Quick: 14,6 tok/s
  • 27B Core: 40,7 tok/s (MMLU 0,851 n=14042 σ=0,003, HumanEval 0,866 n=164 σ=0,027)
  • 35B-A3B Vision: 64,1 tok/s
  • 397B Plus: 1,59 tok/s

O runtime é construído com Tauri + Rust + MLX para macOS. Camadas gratuitas (Nano e Lite) estão disponíveis para sempre em outlier.host. Um vídeo de demonstração está incluído na postagem do Reddit.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Documentação para Escrever Ferramentas MCP em C# .NET Framework para Claude Desktop/Code
Guides

Documentação para Escrever Ferramentas MCP em C# .NET Framework para Claude Desktop/Code

Documentação completa e exemplos de código em C# para criar ferramentas MCP personalizadas usando o .NET Framework 4.8, permitindo que o Claude Desktop/Code automatize interações com processos externos, software, APIs e dispositivos IoT.

OpenClawRadar
Padrões de Design CLI para Agentes de IA: Equívocos e Abordagens Práticas
Guides

Padrões de Design CLI para Agentes de IA: Equívocos e Abordagens Práticas

Um post no Reddit esclarece que CLI para agentes significa um protocolo de interface de comando de texto, não necessariamente um shell real, e descreve princípios de design de CLI amigáveis para agentes, incluindo ajuda no estilo Unix, pensamento de dicas e mecanismos de segurança como previsões de simulação e autorização humana.

OpenClawRadar
Configurando o Qwen3.5-27B Localmente: Comparação entre vLLM e llama.cpp
Guides

Configurando o Qwen3.5-27B Localmente: Comparação entre vLLM e llama.cpp

Um usuário do Reddit compartilha dicas práticas para executar o Qwen3.5-27B localmente, comparando os backends llama.cpp e vLLM com recomendações de configuração específicas e resultados de benchmark.

OpenClawRadar
Construindo um Sistema de Glossário Personalizado em Hindi com Claude: De 76% a 92% de Precisão em 10 Meses
Guides

Construindo um Sistema de Glossário Personalizado em Hindi com Claude: De 76% a 92% de Precisão em 10 Meses

Um desenvolvedor solo em Bangalore construiu um sistema de glossário personalizado para Claude, melhorando a precisão do vocabulário de domínio em Hindi de 76% para 92%. Termos baseados em exemplos com frases de contexto funcionaram melhor.

OpenClawRadar