Previsão Multi-Token MTP: Geração de Tokens 2x Mais Rápida no AMD Strix Halo & Radeon 9700 AI Pro

A Predição Multitoken (MTP) promete até 2x mais rapidez na geração de tokens para LLMs locais. Um novo vídeo de demonstração mostra o MTP rodando em hardware AMD Strix Halo e Dual Radeon 9700 AI Pro, visando modelos da classe Qwen 3.6.
Detalhes Principais
- Desempenho: MTP acelera a inferência de LLMs em até 2x, sendo especialmente benéfico para agentes de codificação.
- Hardware testado: AMD Strix Halo (provavelmente Ryzen AI 300 series) e Dual Radeon 9700 AI Pro (RDNA 4).
- Modelo: Qwen 3.6 (presumivelmente Qwen2.5-7B ou similar, variante exata não especificada).
- Formato da demo: Vídeo do YouTube abordando como o MTP funciona e as melhorias medidas.
O MTP funciona prevendo múltiplos tokens futuros em paralelo a partir de uma única passagem direta, reduzindo o número de etapas autorregressivas necessárias. A técnica é especialmente eficaz para saídas estruturadas, como código, onde os padrões de token são mais previsíveis.
Para contexto, o stack de computação GPU recente da AMD (ROCm) vem alcançando o CUDA da NVIDIA para inferência de LLMs, e implementações de MTP via llama.cpp ou vLLM podem reduzir ainda mais a diferença. Desenvolvedores que executam agentes de codificação locais (ex.: CodeLlama, DeepSeek-Coder) devem esperar ganhos significativos de velocidade no hardware compatível.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Mergulho Profundo na Quantização do Cache KV do Qwen: PPL, Divergência KL e Resultados Assimétricos de K/V
Segunda rodada de benchmarks no Qwen 3.6-35B-A3B com quantização do cache KV: perplexidade, divergência KL, combinações assimétricas K/V e profundidade de contexto de 64K no Apple M5 Max.
OpenAI compra mais de 10 mil Macs para treinamento de agentes: Apple como infraestrutura de IA
A OpenAI comprou dezenas de milhares de Mac minis e Mac Studios para treinar agentes de uso de computador, segundo o The Information. A arquitetura de memória unificada da Apple se encaixa na IA agêntica, impulsionando a receita de Mac em 29%.

Acordo da CBP com a Clearview AI: Reconhecimento Facial para Direcionamento Tático
A Alfândega e Proteção de Fronteiras dos EUA contratou a Clearview AI para direcionamento tático, usando tecnologia de reconhecimento facial em bilhões de imagens extraídas da internet.

Subsistema de Som do Linux Inundado com Correções Assistidas por IA: IRQ, UAF e Peculiaridades
O mais recente pull request de Takashi Iwai para o Linux 7.1 mostra muitos patches 'assisted-by' do Claude Code e GPT-5.5, corrigindo manipulação de IRQ HD-audio, bugs UAF e quirks de dispositivos.