Qwen3.5-397B MoE se ejecuta con 14 GB de RAM mediante carga experta paginada en M1 Ultra

Una publicación en Reddit de u/ur_dad_matt (vía Claude) demuestra un motor MoE paginado personalizado que ejecuta Qwen3.5-397B-A17B (209GB en disco, 512 expertos, enrutamiento top-10) en un Mac Studio M1 Ultra de 64GB con solo 14GB de RAM pico y una velocidad de inferencia de 1.59 tok/s. El modelo es demasiado grande para cargarlo de forma ingenua; el motor mantiene solo K=20 expertos residentes en RAM, paginando el resto desde SSD bajo demanda del enrutador y desalojando bajo presión de caché. El cómputo usa Float16 (más rápido que ternario en MPS), nativo de Apple Silicon, basado en MLX.
Resultados de benchmark de un barrido de 5 prompts en M1 Ultra 64GB:
- Velocidad: 1.59 tok/s (media en 5 generaciones coherentes, K=20)
- Pico de RSS de caché (generación): 7.91 GB
- Pico de RSS total: 14.04 GB
- Salidas coherentes: 5/5
Configuración óptima del motor: K_override=20, cache_gb=8.0, OUTLIER_MMAP_EXPERTS=0, lazy_load=True. Los intentos iniciales con todos los expertos en disco causaron fallos de asignación de buffer de comando hasta que se ajustó el tamaño de caché.
El autor argumenta que los benchmarks de puntuación bruta no son relevantes para LLMs locales en hardware de 64GB; la métrica clave es MMLU por GB de RAM. A 1.59 tok/s, el modelo funciona a "ritmo de pensamiento", no a ritmo de chat, demostrando el límite superior de la relación modelo-memoria.
Velocidades para modelos cuantizados más pequeños en el mismo hardware (MLX-4bit):
- 4B Nano: 71.7 tok/s
- 9B Lite: 53.4 tok/s
- 26B-A4B Quick: 14.6 tok/s
- 27B Core: 40.7 tok/s (MMLU 0.851 n=14042 σ=0.003, HumanEval 0.866 n=164 σ=0.027)
- 35B-A3B Vision: 64.1 tok/s
- 397B Plus: 1.59 tok/s
El runtime está construido con Tauri + Rust + MLX para macOS. Los niveles gratuitos (Nano y Lite) están disponibles para siempre en outlier.host. Se incluye una demostración en video en la publicación de Reddit.
📖 Lee la fuente completa: r/LocalLLaMA
👀 Ver también

Dominando las Copias de Seguridad: Protegiendo su Agente OpenClaw
En una era dominada por la automatización y la IA, garantizar la seguridad de tu agente OpenClaw a través de estrategias de respaldo sólidas es primordial. Aprende los pasos esenciales para asegurar tu asistente digital.
Artesanía de código: deja que la IA revise, no escriba, tu código
Peter Bloem argumenta que la codificación por vibraciones es un callejón sin salida. En su lugar, haz que la IA revise tu código mientras tú escribes. Esto mantiene las habilidades afiladas y evita la trampa de la salida de IA sin verificar.

Optimización de la Configuración de OpenClaw: Patrones e Ideas Prácticas
Los usuarios de OpenClaw comparten patrones de configuración efectivos, como el uso de cron para tareas programadas y la creación de subagentes especializados, para mejorar la funcionalidad y la eficiencia de costos.

Reglas de Vibe Coding: Crea proyectos paralelos desde tu teléfono usando Claude Code sin leer código
Un ingeniero experimentado comparte sus reglas para construir proyectos paralelos completamente desde el teléfono usando Claude Code sin leer código: empezar en modo plan, hacer commits en git, escribir pruebas, usar subagentes para revisiones y el modo automático.