Benchmark Flash-MOE no M5 Max: 12.99 tok/s com Qwen3.5-397B

✍️ OpenClawRadar📅 Publicado: March 31, 2026🔗 Source
Benchmark Flash-MOE no M5 Max: 12.99 tok/s com Qwen3.5-397B
Ad

Resultados de Desempenho

Um usuário testou a implementação flash-moe em um MacBook Pro M5 Max com 128GB de memória unificada, executando o modelo mlx-community/Qwen3.5-397B-A17B-4bit. O benchmark original de Dan Woods em um M3 Max com 48GB de RAM alcançou 4,36 tokens por segundo. No M5 Max, a configuração padrão com quantização de 4 bits e sem cache-io-split atingiu 12,48 tok/s. Com a configuração ideal --cache-io-split 4, o desempenho aumentou para 12,99 tok/s, tornando-o três vezes mais rápido que o benchmark original.

Análise do Cache-IO-Split

O usuário realizou uma varredura completa dos valores de cache-io-split usando o fork Anemll do flash-moe, que adiciona suporte Metal 4 NAX para chips M5+. Os resultados mostram que as divisões 2 e 3 degradam o desempenho, enquanto a divisão 4 fornece a melhor otimização:

  • cache-io-split 1 (nenhum): 12,48 tok/s, 28,4ms de I/O por token
  • cache-io-split 2: 9,94 tok/s, 28,2ms de I/O por token
  • cache-io-split 3: 9,99 tok/s, 36,1ms de I/O por token
  • cache-io-split 4: 12,99 tok/s, 25,9ms de I/O por token
  • cache-io-split 5: 12,64 tok/s, 27,5ms de I/O por token
  • cache-io-split 8: 12,90 tok/s, 26,4ms de I/O por token

A análise sugere que a divisão 4 se alinha com o paralelismo interno do controlador SSD do M5 Max, enquanto valores mais altos adicionam sobrecarga de agendamento. A recomendação é usar --cache-io-split 4 ou nenhuma divisão, evitando as divisões 2 e 3.

Ad

Comparação de Quantização

Testes de quantização de 2 bits versus 4 bits revelaram que 2 bits não oferece vantagem de velocidade no M5 Max, com a velocidade do SSD tornando arquivos menores desnecessários e a sobrecarga de desquantização cancelando quaisquer ganhos. A qualidade sofre significativamente com 2 bits:

  • 4 bits: 12,99 tok/s, 3,64 perplexidade no WikiText-2
  • 2 bits: ~12,65 tok/s, 5,71 perplexidade no WikiText-2 (57% pior)

A conclusão é usar quantização de 4 bits para melhor qualidade sem sacrificar velocidade.

Detalhes Técnicos

O benchmark usou o fork Anemll disponível em https://github.com/Anemll/flash-moe. O desempenho sustentado permaneceu estável em 11,23 tok/s ao longo de 1000 tokens sem degradação. O usuário observou que processos em segundo plano usando Metal/GPU, como o LM Studio, podem impactar significativamente o desempenho e devem ser fechados durante os testes.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

O Framework SIDJUA Adiciona Camada de Governança a Agentes de IA Autônomos
Tools

O Framework SIDJUA Adiciona Camada de Governança a Agentes de IA Autônomos

SIDJUA é uma estrutura com governança integrada, regras de autoridade baseadas em funções e trilhas de auditoria completas que fica sobre qualquer modelo de IA com uma API. A demonstração mostra uma hierarquia de três níveis que escala para 7+1 níveis, com cada decisão registrada e custos rastreados em tempo real.

OpenClawRadar
Camada de Identidade e Reputação para Agentes OpenClaw
Tools

Camada de Identidade e Reputação para Agentes OpenClaw

Uma equipe de desenvolvedores criou o MCP-I e o IdentiClaw para resolver a perda de identidade em fluxos de trabalho de agentes com múltiplas etapas, além do knowthat.ai como um registro de reputação. Eles doaram a especificação do MCP-I para a Decentralized Identity Foundation.

OpenClawRadar
Utilyze: Monitor de GPU Open-Source que Mede a Taxa de Transferência de Computação Real, Não Apenas Atividade do Kernel
Tools

Utilyze: Monitor de GPU Open-Source que Mede a Taxa de Transferência de Computação Real, Não Apenas Atividade do Kernel

Utilyze faz amostragem de contadores de desempenho de hardware para relatar a taxa de transferência de computação e memória em relação aos limites teóricos, revelando que painéis mostrando 100% de utilização podem ter apenas 1-10% de taxa real.

OpenClawRadar
🦀
Tools

Usando um chat adversarial Claude para capturar ambiguidades de kickoff antes que elas te custem

Um desenvolvedor adicionou um segundo chat Claude cuja única função é revisar adversariamente os kickoffs em busca de especificações ambíguas e falhas silenciosas, economizando entre US$ 150 e US$ 400 em retrabalho do Claude Code em uma fase do projeto.

OpenClawRadar