Qwen 3.6 27B com MTP em V100 32GB: 54 t/s via ramo llama.cpp

Um usuário no r/LocalLLaMA relata resultados impressionantes ao executar Qwen 3.6 27B com Multi-Token Prediction (MTP) em um módulo V100 32GB SXM usando um adaptador PCIe. A configuração utiliza o branch MTP do am17an do llama.cpp e a respectiva quantização MTP GGUF. Principais especificações: cache KV Q8_0 com limite de 200k, executando como backend do VS Code Copilot via llama-server.
Números de Desempenho
- Sem MTP: 29-30 tokens/segundo
- Com MTP: 54-55 tokens/segundo (com limite de potência de 150W)
- Após 50k tokens de contexto: cai para 40-45 t/s
Branch: fork MTP do am17an. A construção e execução foram diretas — 'puxado e construído de uma vez' com o llama-server rodando sem problemas. A configuração lida bem com chamadas de ferramentas e subagentes, e forneceu 'revisões de código e refatorações muito perspicazes' apesar da limitação de VRAM (32GB).
Isso é particularmente relevante para desenvolvedores executando LLMs em hardware de datacenter mais antigo, como V100s. O MTP efetivamente dobra a taxa de transferência para este modelo, demonstrando ganhos práticos para cargas de trabalho de assistente de codificação.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Análise da Arquitetura do Código do Claude a partir de Mapas de Origem Vazados
A análise do código-fonte TypeScript de 512.000 linhas do Claude Code revela um runtime baseado em Bun com CLI React/Ink, mais de 100 comandos, 38+ ferramentas e coordenação multiagente. O sistema utiliza Zod para validação, OpenTelemetry para telemetria e inclui mecanismos de compressão de contexto.

Rails é Feito para IA: Convenções, Eficiência de Tokens e Resultados de Benchmark
As convenções do Rails dão um mapa para agentes de IA, reduzindo tokens e aumentando a precisão. Benchmark mostra OPUS-5 com 92,1% de precisão, 47k tokens por execução.

Nyx: Plataforma Autônoma de Testes para Agentes de IA
Nyx é uma estrutura de teste de caixa preta que investiga agentes de IA em busca de modos de falha, como bugs lógicos, falhas de raciocínio e vulnerabilidades de segurança, por meio de conversas adaptativas de múltiplos turnos. Ele testa em menos de 10 minutos o que auditorias manuais levam horas para revelar.

Sociality.io lança servidor MCP para Claude: Inteligência de Mídias Sociais em Tempo Real via OAuth
Sociality.io lançou um servidor MCP HTTP remoto que permite ao Claude acessar dados ao vivo de relatórios e concorrentes no Instagram, TikTok, Facebook, YouTube, X e LinkedIn. Grátis para testar.