MTPLX: Tokens 2,24x Mais Rápidos no Apple Silicon Usando Cabeças MTP Nativas

MTPLX é um motor de inferência para Apple Silicon que aproveita as heads nativas de Predição Multi-Token (MTP) do modelo como rascunhadores especulativos. O resultado principal: Qwen 3.6 27B 4-bit MLX passa de 28 tok/s para 63 tok/s (2,24× mais rápido) em um MacBook Pro M5 Max com temperatura 0,6, top_p 0,95, top_k 20 — as configurações exatas que a Qwen recomenda para programação.
Como Funciona
Diferente do DFlash ou DDTree (que exigem um modelo rascunhador externo e são apenas greedy), o MTPLX usa as próprias heads MTP do modelo. Cada head MTP rascunha sequencialmente, produzindo distribuições de probabilidade por token. Isso permite amostragem exata de rejeição com temperatura e correção residual. Sem rascunhador externo significa sem uso extra de memória.
Para o Qwen 3.6 27B (que vem com heads MTP até profundidade 5), a profundidade ótima encontrada foi D3 após varredura de D2 a D5. Profundidades maiores (D4/D5) tiveram boa aceitação inicial, mas posições mais profundas custaram mais tempo de verificação do que tokens economizados.
Status vs. DFlash / DDTree
O DFlash MLX atinge maior velocidade bruta, mas é restrito à amostragem greedy (temperatura 0), limitando severamente o uso no mundo real. O DDTree herda as mesmas limitações. Ambos exigem um rascunhador externo. O MTPLX funciona com qualquer modelo que mantenha suas heads MTP e suporte inferência completa com amostragem por temperatura.
Instalação e Uso
O MTPLX é distribuído como um CLI completo com os seguintes comandos:
mtplx start wizard— configuração guiada- Download e inspeção de modelos com detecção de compatibilidade MTP em quatro níveis
- Profundidade configurável de 2 a 7+
- Servidor de API compatível com OpenAI/Anthropic, interface de chat no navegador, chat no terminal
- Suite de benchmarks, diagnóstico de saúde, controle de ventoinha com segurança contra falhas e restauração automática com detecção de inatividade
- Uma suíte de 562 testes incluída
O motor é construído sobre um fork modificado do MLX com kernels Metal personalizados, gráficos de verificação compilados, rollback GDN com fita de inovação e uma cabeça LM requantizada apenas para rascunho.
Para Quem É
Desenvolvedores que executam LLMs locais em Apple Silicon e precisam de inferência de alta taxa, com amostragem por temperatura para programação ou escrita criativa, sem sacrificar a qualidade da saída.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Integração do WordPress.com MCP Adiciona Capacidades de Escrita para Claude
A integração do MCP do WordPress.com agora suporta operações de escrita, permitindo que o Claude crie rascunhos de posts, construa páginas, gerencie comentários, corrija textos alternativos de imagens e reorganize categorias de conteúdo diretamente em sites do WordPress.com. Antes de gerar conteúdo, o Claude lê o tema do site para entender elementos de design como cores, fontes e padrões de blocos.

Claude Code Limiter: Limitador de Taxa Auto-Hospedado para Assinaturas Compartilhadas do Claude Code
claude-code-limiter é uma ferramenta auto-hospedável que adiciona limites de taxa por usuário a assinaturas compartilhadas do Claude Code, com recursos como cotas por modelo, orçamentos de crédito, janelas deslizantes de 24h, regras por horário do dia e um painel em tempo real.

Bit-Chat: Agentes de IA Podem Enviar Bitcoin via Lightning Através de Plataformas de Mensagens
Uma configuração chamada Bit-Chat permite que agentes de IA enviem pagamentos em Bitcoin pela rede Lightning através de e-mail, WhatsApp, Telegram ou Signal. Os agentes podem gerar endereços dedicados como [email protected] e os pagamentos funcionam mesmo que o destinatário não esteja registrado.
Modo de Brainstorming do ClaudeAI Ganha Companheiro Visual para Aprovação de Mockups e UI
Um usuário descobre um novo recurso 'Companheiro Visual' no modo de brainstorming do ClaudeAI que serve mockups em um servidor web local, permitindo ajustes de UI antes da construção.