Taxa de Aceitação MTP: Limiar de 50% Determina o Benefício da Decodificação Especulativa

Um usuário do Reddit testou MTP (Multi-Token Prediction) usando mlx-vlm no Gemma-4 (26B, 4-bit) e descobriu que o desempenho depende totalmente da taxa de aceitação dos tokens candidatos. Medições em um M4 Max Studio mostram limites concretos.
Resultados das cargas de trabalho
- Geração de código: 75 tok/s → 114,8 tok/s (1,53× mais rápido) — taxa de aceitação: 66% das posições
- Texto longo: 75 tok/s → 71,1 tok/s (0,95×, essencialmente neutro) — taxa de aceitação: 31% das posições
- Saída JSON: 51,3 tok/s → 25,6 tok/s (0,50× mais lento) — taxa de aceitação: 8% das posições
O limite parece ser de ~50% de aceitação. Abaixo disso, a sobrecarga da decodificação especulativa supera os ganhos.
Detalhes do teste: o código foi "escreva algumas funções Python para fazer X"; o texto longo foi "escreva um ensaio de 800 palavras sobre papel-moeda na Dinastia Tang"; a saída JSON envolveu agrupar itens por similaridade em saída estruturada.
Dica bônus: O usuário observa que o Gemma segue razoavelmente bem instruções de estrutura JSON, mas ativar a saída estruturada (json_schema) adiciona ~20% de sobrecarga. Eles recomendam aceitar JSON levemente impreciso e corrigi-lo em tempo de execução. O mlx-vlm não suporta json_schema para decodificação especulativa de qualquer forma.
Conclusão: MTP é ótimo para codificação local, mas pode degradar o desempenho em tarefas estruturadas ou de texto com baixas taxas de aceitação.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Construindo uma Camada de Processo sobre o Claude Code para Gerenciar Contexto e Coordenação
Uma equipe compartilha como construiu uma camada de processo sobre o Claude Code que declara entradas/saídas por etapa de engenharia, reduzindo a perda de contexto durante as transições e possibilitando ganhos de produtividade compostos sem depender de disciplina individual.

Como Executar o OpenClaw Sem Gastar Muito
O usuário do Reddit digitalknk compartilhou um guia prático sobre como executar o OpenClaw de forma eficiente. Uma configuração testada em batalha focada em estabilidade e controle de custos.

Ocultar linhas de execução do OpenClaw no chat do Telegram: correção com um comando
Impeça o OpenClaw de enviar comandos executáveis brutos para o chat do Telegram, definindo streaming.preview.toolProgress e streaming.progress.toolProgress como false. Um único comando Python faz backup da configuração, adiciona as chaves e uma reinicialização rápida aplica a correção.

Usando ntfy para notificações do agente OpenClaw
Um desenvolvedor compartilha sua experiência usando a versão auto-hospedada do ntfy.sh para notificações push de agentes OpenClaw, evitando bots do Discord/Telegram ao executar o ntfy serve no mesmo VPS e usar requisições HTTP POST.