MTPLX: Tokens 2,24x Mais Rápidos no Apple Silicon Usando Cabeças MTP Nativas

MTPLX é um motor de inferência para Apple Silicon que aproveita as heads nativas de Predição Multi-Token (MTP) do modelo como rascunhadores especulativos. O resultado principal: Qwen 3.6 27B 4-bit MLX passa de 28 tok/s para 63 tok/s (2,24× mais rápido) em um MacBook Pro M5 Max com temperatura 0,6, top_p 0,95, top_k 20 — as configurações exatas que a Qwen recomenda para programação.
Como Funciona
Diferente do DFlash ou DDTree (que exigem um modelo rascunhador externo e são apenas greedy), o MTPLX usa as próprias heads MTP do modelo. Cada head MTP rascunha sequencialmente, produzindo distribuições de probabilidade por token. Isso permite amostragem exata de rejeição com temperatura e correção residual. Sem rascunhador externo significa sem uso extra de memória.
Para o Qwen 3.6 27B (que vem com heads MTP até profundidade 5), a profundidade ótima encontrada foi D3 após varredura de D2 a D5. Profundidades maiores (D4/D5) tiveram boa aceitação inicial, mas posições mais profundas custaram mais tempo de verificação do que tokens economizados.
Status vs. DFlash / DDTree
O DFlash MLX atinge maior velocidade bruta, mas é restrito à amostragem greedy (temperatura 0), limitando severamente o uso no mundo real. O DDTree herda as mesmas limitações. Ambos exigem um rascunhador externo. O MTPLX funciona com qualquer modelo que mantenha suas heads MTP e suporte inferência completa com amostragem por temperatura.
Instalação e Uso
O MTPLX é distribuído como um CLI completo com os seguintes comandos:
mtplx start wizard— configuração guiada- Download e inspeção de modelos com detecção de compatibilidade MTP em quatro níveis
- Profundidade configurável de 2 a 7+
- Servidor de API compatível com OpenAI/Anthropic, interface de chat no navegador, chat no terminal
- Suite de benchmarks, diagnóstico de saúde, controle de ventoinha com segurança contra falhas e restauração automática com detecção de inatividade
- Uma suíte de 562 testes incluída
O motor é construído sobre um fork modificado do MLX com kernels Metal personalizados, gráficos de verificação compilados, rollback GDN com fita de inovação e uma cabeça LM requantizada apenas para rascunho.
Para Quem É
Desenvolvedores que executam LLMs locais em Apple Silicon e precisam de inferência de alta taxa, com amostragem por temperatura para programação ou escrita criativa, sem sacrificar a qualidade da saída.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Proposta Claude: Memória de Escopo e Isolamento Hermético de Instância
Uma proposta formal à Anthropic de um usuário avançado: escopo de memória global/local e isolamento hermético de instância para Claude, permitindo sessões determinísticas e auditáveis.

Painel de Código Aberto Revela Custos Reais de Computação do Claude Code
Um desenvolvedor engenhou reversamente a fórmula de limite de taxa do Claude Code para construir um painel local que mostra a porcentagem de uso em tempo real, custos reais em dólares, taxa de consumo, horários de pico e quais habilidades/hooks estão sendo acionados. A ferramenta revelou que um plano de US$ 100/mês consumiu US$ 13.286 em computação de API equivalente em um mês.

Terrarium: Sandbox Open-Source para Ambientes Agênticos com Retrocesso de Máquina do Tempo
Uma solução versátil de sandbox para executar múltiplos agentes de IA com segurança em qualquer VPS ou nuvem. Recursos incluem mundos isolados, gerenciamento de proxy reverso, GUIs e uma máquina do tempo para reverter o estado do contêiner.

Observador de Tarefas: Uma Meta-Habilidade que Automatiza o Aprimoramento de Habilidades para Agentes de Codificação de IA
Task-observer é uma meta-habilidade que auto-melhora todas as habilidades do seu agente de IA, incluindo a si mesma. Ela registrou 600 melhorias em 40 habilidades em 3 meses e automatiza a criação de habilidades a partir de lacunas de trabalho.