El Método de Cuantización JANG Mejora el Rendimiento de MLX para Modelos Grandes

✍️ OpenClawRadar📅 Publicado: 18 de abril de 2026🔗 Source
El Método de Cuantización JANG Mejora el Rendimiento de MLX para Modelos Grandes
Ad

Brecha de Rendimiento Entre las Cuantizaciones MLX y GGUF

La fuente discute un problema de rendimiento significativo con los métodos de cuantización estándar de MLX para modelos de lenguaje grandes. En el benchmark MMLU (200 preguntas), MiniMax-M2.5 cuantizado a 4 bits para MLX obtuvo solo un 26.5% (53/200), mientras que el mismo modelo cuantizado con el método JANG_2S obtuvo un 74% (148/200). El método JANG superó a todos los niveles de cuantización de MLX (2 bits, 3 bits y 4 bits), que todos obtuvieron puntuaciones cercanas al azar, aproximadamente del 25%.

Resultados Específicos del Benchmark

El desglose detallado por materias del MMLU muestra que JANG_2L supera consistentemente a las cuantizaciones MLX:

  • Álgebra Abstracta: JANG_2L 10/20 vs MLX 4 bits 3/20
  • Astronomía: JANG_2L 20/20 vs MLX 4 bits 7/20
  • Informática Universitaria: JANG_2L 13/20 vs MLX 4 bits 4/20
  • Biología de Secundaria: JANG_2L 18/20 vs MLX 4 bits 4/20

La causa raíz identificada para el pobre rendimiento de MLX es que "MLX genera metanarración en lugar de respuestas directas en este modelo".

Ad

Comparaciones de Tamaño del Modelo y Rendimiento

Para el modelo Qwen 3.5 122B:

  • JANG_4K: 86% puntuación MMLU, 69 GB de tamaño
  • MLX 4 bits: 85% puntuación MMLU, 64 GB de tamaño
  • JANG_2S: 79% puntuación MMLU, 38 GB de tamaño
  • MLX 2 bits: 56.5% puntuación MMLU, 36 GB de tamaño

El autor señala que "La gente intercambia la velocidad del chip M por coherencia, sin un equivalente GGUF en MLX" y que "Qwen 3.5 en Macs cuando se usa GGUF también es 1/3 más lento que MLX".

Problema de Generación de Código de MiniMax-M2.5

De los benchmarks referenciados: "MiniMax-M2.5 no puede programar — 10% en HumanEval+ a pesar de un 87% en llamadas a herramientas y un 80% en razonamiento. Algo no funciona con su formato de generación de código. Sin embargo, es excelente para razonamiento."

Disponibilidad e Implementación

Actualmente disponible a través de:

  • MLX Studio: https://mlx.studio/ - tiene el motor de inferencia JANG_Q nativo
  • Repositorio: Para autoinstalación y cuantización de modelos

El método permite ejecutar modelos como MiniMax-M2.5 con un "equivalente de 2 bits de MLX mientras se obtienen resultados de prueba que simplemente no eran posibles antes en MLX".

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

AlterSpec v1.0: Aplicación de Políticas en Tiempo de Ejecución para Agentes de IA
Herramientas

AlterSpec v1.0: Aplicación de Políticas en Tiempo de Ejecución para Agentes de IA

AlterSpec v1.0 es un motor de ejecución de cumplimiento de políticas de código abierto que se sitúa entre los agentes de IA y sus herramientas, evaluando las acciones frente a políticas definidas en YAML antes de su ejecución. Proporciona decisiones de permitir/denegar/revisar, firma criptográfica de políticas y registro de auditoría.

OpenClawRadar
MLJAR Studio: Analista de Datos de IA Local que Genera Notebooks Reproducibles
Herramientas

MLJAR Studio: Analista de Datos de IA Local que Genera Notebooks Reproducibles

MLJAR Studio es una aplicación de escritorio que convierte preguntas en lenguaje natural en notebooks de Python ejecutados localmente, con AutoML para datos tabulares y soporte para LLM locales a través de Ollama.

OpenClawRadar
Explorando las Interacciones de API a API: Una Mirada más Cercana a la Automatización
Herramientas

Explorando las Interacciones de API a API: Una Mirada más Cercana a la Automatización

Una reciente discusión en Reddit profundiza en las complejidades de las llamadas telefónicas de API a API, centrándose en la implementación práctica y los posibles desafíos al usar herramientas como Postman y Twilio.

OpenClawRadar
Orchino: Sistema Local de Orquestación Multi-Agente para Windows con Automatización Paralela de Navegador e Interfaz de Usuario
Herramientas

Orchino: Sistema Local de Orquestación Multi-Agente para Windows con Automatización Paralela de Navegador e Interfaz de Usuario

Orchino es un sistema local de orquestación multiagente para Windows que ejecuta tareas paralelas en el navegador y en Windows sin secuestrar la interfaz de usuario. Una demostración muestra a 4 agentes completando 'Buscar auriculares Sony en Flipkart y Amazon, enviar los resultados por correo electrónico, guardar en el Bloc de notas' en 29.5 segundos utilizando ejecución verdaderamente paralela.

OpenClawRadar