Qwen3.5-397B MoE roda em 14GB de RAM via carregamento paginado de especialistas no M1 Ultra

Uma postagem no Reddit de u/ur_dad_matt (via Claude) demonstra um mecanismo Paged MoE personalizado que executa o Qwen3.5-397B-A17B (209GB em disco, 512 especialistas, roteamento top-10) em um Mac Studio M1 Ultra 64GB com apenas 14GB de pico de RAM e velocidade de inferência de 1,59 tok/s. O modelo é grande demais para ser carregado ingenuamente; o mecanismo mantém apenas K=20 especialistas residentes na RAM, carregando os demais do SSD sob demanda do roteador, com despejo quando há pressão no cache. A computação usa Float16 (mais rápido que ternário no MPS), nativo do Apple Silicon, baseado em MLX.
Resultados de benchmark de uma varredura de 5 prompts no M1 Ultra 64GB:
- Velocidade: 1,59 tok/s (média em 5 gerações coerentes, K=20)
- Pico de RSS do cache (geração): 7,91 GB
- Pico total de RSS: 14,04 GB
- Saídas coerentes: 5/5
Configuração ideal do mecanismo: K_override=20, cache_gb=8.0, OUTLIER_MMAP_EXPERTS=0, lazy_load=True. Tentativas iniciais com todos os especialistas em disco causaram falhas de alocação de buffer de comando até que o tamanho do cache fosse ajustado.
O autor argumenta que benchmarks de pontuação bruta perdem o sentido para LLMs locais em hardware de 64GB; a métrica chave é MMLU por GB de RAM. A 1,59 tok/s o modelo funciona em "ritmo de pensamento", não em ritmo de chat, demonstrando o limite superior da razão modelo-memória.
Velocidades para modelos quantizados menores no mesmo hardware (MLX-4bit):
- 4B Nano: 71,7 tok/s
- 9B Lite: 53,4 tok/s
- 26B-A4B Quick: 14,6 tok/s
- 27B Core: 40,7 tok/s (MMLU 0,851 n=14042 σ=0,003, HumanEval 0,866 n=164 σ=0,027)
- 35B-A3B Vision: 64,1 tok/s
- 397B Plus: 1,59 tok/s
O runtime é construído com Tauri + Rust + MLX para macOS. Camadas gratuitas (Nano e Lite) estão disponíveis para sempre em outlier.host. Um vídeo de demonstração está incluído na postagem do Reddit.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Documentação para Escrever Ferramentas MCP em C# .NET Framework para Claude Desktop/Code
Documentação completa e exemplos de código em C# para criar ferramentas MCP personalizadas usando o .NET Framework 4.8, permitindo que o Claude Desktop/Code automatize interações com processos externos, software, APIs e dispositivos IoT.

Padrões de Design CLI para Agentes de IA: Equívocos e Abordagens Práticas
Um post no Reddit esclarece que CLI para agentes significa um protocolo de interface de comando de texto, não necessariamente um shell real, e descreve princípios de design de CLI amigáveis para agentes, incluindo ajuda no estilo Unix, pensamento de dicas e mecanismos de segurança como previsões de simulação e autorização humana.

Configurando o Qwen3.5-27B Localmente: Comparação entre vLLM e llama.cpp
Um usuário do Reddit compartilha dicas práticas para executar o Qwen3.5-27B localmente, comparando os backends llama.cpp e vLLM com recomendações de configuração específicas e resultados de benchmark.

Construindo um Sistema de Glossário Personalizado em Hindi com Claude: De 76% a 92% de Precisão em 10 Meses
Um desenvolvedor solo em Bangalore construiu um sistema de glossário personalizado para Claude, melhorando a precisão do vocabulário de domínio em Hindi de 76% para 92%. Termos baseados em exemplos com frases de contexto funcionaram melhor.