O Método de Quantização JANG Melhora o Desempenho do MLX para Modelos Grandes

✍️ OpenClawRadar📅 Publicado: April 18, 2026🔗 Source
O Método de Quantização JANG Melhora o Desempenho do MLX para Modelos Grandes
Ad

Diferença de Desempenho Entre Quantizações MLX e GGUF

A fonte discute um problema significativo de desempenho com os métodos padrão de quantização MLX para modelos de linguagem grandes. No benchmark MMLU (200 perguntas), o MiniMax-M2.5 quantizado para 4 bits no MLX obteve apenas 26,5% (53/200), enquanto o mesmo modelo quantizado com o método JANG_2S obteve 74% (148/200). O método JANG superou todos os níveis de quantização MLX (2 bits, 3 bits e 4 bits), que todos pontuaram perto do acaso aleatório, aproximadamente 25%.

Resultados Específicos de Benchmark

O detalhamento por assunto do MMLU mostra que o JANG_2L supera consistentemente as quantizações MLX:

  • Álgebra Abstrata: JANG_2L 10/20 vs MLX 4 bits 3/20
  • Astronomia: JANG_2L 20/20 vs MLX 4 bits 7/20
  • Ciência da Computação Universitária: JANG_2L 13/20 vs MLX 4 bits 4/20
  • Biologia do Ensino Médio: JANG_2L 18/20 vs MLX 4 bits 4/20

A causa raiz identificada para o fraco desempenho do MLX é que "o MLX gera metacomentários em vez de respostas diretas neste modelo".

Ad

Comparações de Tamanho e Desempenho do Modelo

Para o modelo Qwen 3.5 122B:

  • JANG_4K: 86% pontuação MMLU, 69 GB de tamanho
  • MLX 4 bits: 85% pontuação MMLU, 64 GB de tamanho
  • JANG_2S: 79% pontuação MMLU, 38 GB de tamanho
  • MLX 2 bits: 56,5% pontuação MMLU, 36 GB de tamanho

O autor observa que "As pessoas trocam a velocidade do chip M por coerência, sem equivalente GGUF no MLX" e que "O Qwen 3.5 em Macs ao usar GGUF também é 1/3 mais lento do que o MLX".

Problema de Geração de Código do MiniMax-M2.5

Dos benchmarks referenciados: "O MiniMax-M2.5 não consegue programar — 10% no HumanEval+ apesar de 87% de chamada de ferramentas e 80% de raciocínio. Algo está errado com seu formato de geração de código. Ótimo para raciocínio, porém."

Disponibilidade e Implementação

Atualmente disponível através de:

  • MLX Studio: https://mlx.studio/ - possui o motor de inferência JANG_Q nativo
  • Repositório: Para autoinstalação e quantização de modelos

O método permite executar modelos como o MiniMax-M2.5 com "equivalente a 2 bits MLX enquanto obtém resultados de teste que simplesmente não eram possíveis antes no MLX".

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

RUNE Protocol: Salve a Memória da Sessão de IA em Todas as Plataformas
Tools

RUNE Protocol: Salve a Memória da Sessão de IA em Todas as Plataformas

RUNE (Notação Relacional do Usuário para Entidades) é um protocolo de código aberto que salva seu relacionamento com IA em um arquivo .rune criptografado, resolvendo o problema de inicialização a frio, onde assistentes de IA esquecem você entre sessões. Criado com Claude Opus 4.6, funciona nas plataformas Claude e GPT.

OpenClawRadar
🦀
Tools

Integração xAI TTS para Home Assistant construída com Claude — Repositório Completo

Um desenvolvedor usou Claude para criar uma integração personalizada para Home Assistant com a API TTS da xAI (voz Eve), incluindo configuração completa por interface, cinco vozes e tags de fala.

OpenClawRadar
O aplicativo Focusmo para macOS adiciona servidor MCP local para integração com Claude AI
Tools

O aplicativo Focusmo para macOS adiciona servidor MCP local para integração com Claude AI

Focusmo, um aplicativo de foco para macOS, agora inclui um servidor MCP local que permite ao Claude AI acessar dados reais de foco para revisões semanais e planejamento. O servidor é executado localmente no Mac sem a necessidade de servidores externos, mantendo todos os dados no dispositivo.

OpenClawRadar
Resumo de reuniões em uma GPU de 6 GB: qwen3.5:0.8B funciona em 57s, Granite 4 350M alucina
Tools

Resumo de reuniões em uma GPU de 6 GB: qwen3.5:0.8B funciona em 57s, Granite 4 350M alucina

O VoiceFlow v1.6.0 adiciona gravação e sumarização local de reuniões. Testando modelos sub-1B em uma RTX 3060 de 6GB: qwen3.5:0.8B produz resumos estruturados em 57s usando 2,2GB de VRAM, enquanto Granite 4 350M alucina muito.

OpenClawRadar