MTPLX: Tokens 2,24x Mais Rápidos no Apple Silicon Usando Cabeças MTP Nativas

✍️ OpenClawRadar📅 Publicado: May 5, 2026🔗 Source
MTPLX: Tokens 2,24x Mais Rápidos no Apple Silicon Usando Cabeças MTP Nativas
Ad

MTPLX é um motor de inferência para Apple Silicon que aproveita as heads nativas de Predição Multi-Token (MTP) do modelo como rascunhadores especulativos. O resultado principal: Qwen 3.6 27B 4-bit MLX passa de 28 tok/s para 63 tok/s (2,24× mais rápido) em um MacBook Pro M5 Max com temperatura 0,6, top_p 0,95, top_k 20 — as configurações exatas que a Qwen recomenda para programação.

Como Funciona

Diferente do DFlash ou DDTree (que exigem um modelo rascunhador externo e são apenas greedy), o MTPLX usa as próprias heads MTP do modelo. Cada head MTP rascunha sequencialmente, produzindo distribuições de probabilidade por token. Isso permite amostragem exata de rejeição com temperatura e correção residual. Sem rascunhador externo significa sem uso extra de memória.

Para o Qwen 3.6 27B (que vem com heads MTP até profundidade 5), a profundidade ótima encontrada foi D3 após varredura de D2 a D5. Profundidades maiores (D4/D5) tiveram boa aceitação inicial, mas posições mais profundas custaram mais tempo de verificação do que tokens economizados.

Status vs. DFlash / DDTree

O DFlash MLX atinge maior velocidade bruta, mas é restrito à amostragem greedy (temperatura 0), limitando severamente o uso no mundo real. O DDTree herda as mesmas limitações. Ambos exigem um rascunhador externo. O MTPLX funciona com qualquer modelo que mantenha suas heads MTP e suporte inferência completa com amostragem por temperatura.

Ad

Instalação e Uso

O MTPLX é distribuído como um CLI completo com os seguintes comandos:

  • mtplx start wizard — configuração guiada
  • Download e inspeção de modelos com detecção de compatibilidade MTP em quatro níveis
  • Profundidade configurável de 2 a 7+
  • Servidor de API compatível com OpenAI/Anthropic, interface de chat no navegador, chat no terminal
  • Suite de benchmarks, diagnóstico de saúde, controle de ventoinha com segurança contra falhas e restauração automática com detecção de inatividade
  • Uma suíte de 562 testes incluída

O motor é construído sobre um fork modificado do MLX com kernels Metal personalizados, gráficos de verificação compilados, rollback GDN com fita de inovação e uma cabeça LM requantizada apenas para rascunho.

Para Quem É

Desenvolvedores que executam LLMs locais em Apple Silicon e precisam de inferência de alta taxa, com amostragem por temperatura para programação ou escrita criativa, sem sacrificar a qualidade da saída.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Integração do WordPress.com MCP Adiciona Capacidades de Escrita para Claude
Tools

Integração do WordPress.com MCP Adiciona Capacidades de Escrita para Claude

A integração do MCP do WordPress.com agora suporta operações de escrita, permitindo que o Claude crie rascunhos de posts, construa páginas, gerencie comentários, corrija textos alternativos de imagens e reorganize categorias de conteúdo diretamente em sites do WordPress.com. Antes de gerar conteúdo, o Claude lê o tema do site para entender elementos de design como cores, fontes e padrões de blocos.

OpenClawRadar
Claude Code Limiter: Limitador de Taxa Auto-Hospedado para Assinaturas Compartilhadas do Claude Code
Tools

Claude Code Limiter: Limitador de Taxa Auto-Hospedado para Assinaturas Compartilhadas do Claude Code

claude-code-limiter é uma ferramenta auto-hospedável que adiciona limites de taxa por usuário a assinaturas compartilhadas do Claude Code, com recursos como cotas por modelo, orçamentos de crédito, janelas deslizantes de 24h, regras por horário do dia e um painel em tempo real.

OpenClawRadar
Bit-Chat: Agentes de IA Podem Enviar Bitcoin via Lightning Através de Plataformas de Mensagens
Tools

Bit-Chat: Agentes de IA Podem Enviar Bitcoin via Lightning Através de Plataformas de Mensagens

Uma configuração chamada Bit-Chat permite que agentes de IA enviem pagamentos em Bitcoin pela rede Lightning através de e-mail, WhatsApp, Telegram ou Signal. Os agentes podem gerar endereços dedicados como [email protected] e os pagamentos funcionam mesmo que o destinatário não esteja registrado.

OpenClawRadar
🦀
Tools

Modo de Brainstorming do ClaudeAI Ganha Companheiro Visual para Aprovação de Mockups e UI

Um usuário descobre um novo recurso 'Companheiro Visual' no modo de brainstorming do ClaudeAI que serve mockups em um servidor web local, permitindo ajustes de UI antes da construção.

OpenClawRadar