Qwen3.5-122B-A10B-MINT-MLX se ejecuta sin problemas en M5 Pro con 64 GB de RAM.

✍️ OpenClawRadar📅 Publicado: 20 de abril de 2026🔗 Source
Qwen3.5-122B-A10B-MINT-MLX se ejecuta sin problemas en M5 Pro con 64 GB de RAM.
Ad

Rendimiento de LLM Local en Apple Silicon

Un usuario de Reddit ha compartido su experiencia ejecutando el modelo Qwen3.5-122B-A10B-MINT-MLX localmente en un M5 Pro con 64 GB de RAM. La configuración demuestra que los modelos de lenguaje grandes pueden ejecutarse eficazmente en hardware de consumo con la configuración adecuada.

Detalles de Configuración

El usuario logró un rendimiento fluido utilizando comandos específicos de terminal para la asignación de VRAM:

sysctl iogpu.unified_memory_limit_percentage
sudo sysctl iogpu.wired_limit_mb=61440

En LM Studio, configuraron la ventana de contexto a 16384 tokens. Con esta configuración, el sistema mantuvo un rendimiento estable mientras ejecutaba Safari con múltiples pestañas, Mensajes y el Monitor de Actividad simultáneamente.

Ad

Puntos de Referencia de Rendimiento

El modelo Qwen3.5-122B-A10B-MINT-MLX entregó:

  • Tiempo para el Primer Token: 0.86 segundos
  • Velocidad de Generación de Tokens: 39.58 tokens/segundo

El usuario señaló que el modelo "resolvió un montón de acertijos correctamente e hizo un poco de programación de ambiente" sin quejas sobre la cuantización MINT de 3 bits. El único problema ocurrió cuando la ventana de contexto se llenó cerca del uso de 59 GB de VRAM, causando un bloqueo del sistema.

Comparación con Otros Modelos

El usuario también probó "Qwen3.5 40B Claude 4.6 Opus Deckard Heretic Uncensored Thinking Mxfp8", que encontró más preciso que el modelo de 122B pero significativamente más lento:

  • Velocidad de Generación de Tokens: 6.93 tokens/segundo
  • El procesamiento de indicaciones se mantuvo rápido a pesar de la generación más lenta

Esto demuestra la compensación entre el tamaño del modelo, la cuantización y la velocidad de inferencia que los desarrolladores enfrentan al elegir configuraciones de LLM locales.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

No uses IA para escribir cosas que presentes como trabajo propio.
Noticias

No uses IA para escribir cosas que presentes como trabajo propio.

James Bach argumenta en contra de usar IA para redactar cualquier contenido que presentes como propio. Advierte que admitir ayuda de IA devalúa tu reputación y trata todo ese trabajo como basura.

OpenClawRadar
Grokipedia se estanca: sin ediciones aceptadas desde abril, la Wikipedia con IA de Musk muere silenciosamente
Noticias

Grokipedia se estanca: sin ediciones aceptadas desde abril, la Wikipedia con IA de Musk muere silenciosamente

Grokipedia de xAI, el rival de Wikipedia generado por IA, no ha aceptado ni rechazado ninguna de las 225.496 ediciones sugeridas en más de tres meses. ¿Está muerto?

OpenClawRadar
Mantenedor del kernel de Linux informa sobre un cambio repentino en la calidad de los informes de errores generados por IA.
Noticias

Mantenedor del kernel de Linux informa sobre un cambio repentino en la calidad de los informes de errores generados por IA.

Greg Kroah-Hartman dice que los informes de errores generados por IA para el kernel de Linux pasaron de ser 'basura de IA' a informes legítimos hace aproximadamente un mes, con equipos de seguridad de código abierto en diferentes proyectos observando el mismo cambio. El equipo del kernel está manejando el aumento con herramientas como Sashiko para la automatización de revisiones.

OpenClawRadar
Alibaba prohíbe Claude Code en el lugar de trabajo por supuestos riesgos de puerta trasera
Noticias

Alibaba prohíbe Claude Code en el lugar de trabajo por supuestos riesgos de puerta trasera

Alibaba prohíbe Claude Code en su entorno laboral por supuestos riesgos de puerta trasera, según una fuente. La decisión destaca las crecientes preocupaciones de seguridad en torno a los agentes de codificación de IA en entornos empresariales.

OpenClawRadar