Qwen 3.6 27B F16 passa no teste de codificação Pacman, mas quantizações de 8 bits falham — Lições-chave sobre templates e decodificação especulativa MTP

✍️ OpenClawRadar📅 Publicado: May 19, 2026🔗 Source
Qwen 3.6 27B F16 passa no teste de codificação Pacman, mas quantizações de 8 bits falham — Lições-chave sobre templates e decodificação especulativa MTP
Ad

Um desenvolvedor no r/LocalLLaMA compartilhou um benchmark prático de código: criar um clone do Pacman em uma única página a partir de um bom prompt, três tentativas, ficar com o melhor. O Qwen 3.6 27B F16 produziu dois jogos quase perfeitos — o primeiro modelo local a ter sucesso. No entanto, reduzir para quantização de 8 bits tornou os bons resultados irreproduzíveis mesmo após cinco tentativas, reforçando a afirmação de que quant de 8 bits não é sem perdas para tarefas generativas complexas.

Principais descobertas técnicas do post:

  • O template de chat é crítico: O template de chat oficial do Qwen é ajustado para vLLM e contém erros no llama.cpp e outros runners. O autor corrigiu bugs iterativamente e, após o ajuste fino, o modelo parecia "um novo nível de inteligência".
  • A decodificação especulativa MTP varia de acordo com a tarefa: Para tarefas determinísticas como codificação, os tok/s generativos variaram de 8 a 18 tok/s (linha de base sem MTP: 6,6 tok/s). Tarefas criativas têm menos aceleração.
  • A escolha do harness afeta mais a velocidade do que a qualidade do código: O Qwen CLI teve um desempenho surpreendentemente bom — comparável ao Claude Code em qualidade de saída, mas muito mais rápido porque os prompts extras do Claude Code tornam os modelos locais lentos. Com um modelo lento como o Qwen 3.6 27B a ~6 tok/s, cada prompt extra adiciona latência dolorosa.
  • Não interfira no gerenciamento de contexto: O cache de contexto nativo e a compactação do modelo funcionam bem. Plugins ou ferramentas que manipulam cache ou contexto confundem o modelo e degradam o desempenho.
  • Chamadas de ferramenta e subagentes funcionam perfeitamente após correções adequadas no template de chat. Compactação de contexto, uso de shell e subagentes paralelos funcionam como esperado.

O autor alerta que sua experiência depende muito da configuração do runner: use pesos F16, um template de chat corrigido e evite harnesses pesados, a menos que você tenha inferência rápida. O resultado completo do Pacman jogável está disponível em guigand.com/pacman.

Ad

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Paseo: Interface de Código Aberto para Claude Code, Codex, Copilot, OpenCode e Agentes Pi
Tools

Paseo: Interface de Código Aberto para Claude Code, Codex, Copilot, OpenCode e Agentes Pi

Paseo é uma interface auto-hospedada que executa Claude Code, Codex, Copilot, OpenCode e Pi em paralelo. Oferece controle por voz, acesso entre dispositivos e CLI. Sem telemetria, sem login forçado.

OpenClawRadar
Layerkit: Editor de Imagens com IA com Camadas Editáveis Criado com Claude Code
Tools

Layerkit: Editor de Imagens com IA com Camadas Editáveis Criado com Claude Code

Um desenvolvedor criou o Layerkit, um editor de imagens baseado em IA que roda no navegador e gera cenas com camadas editáveis para evitar a necessidade de re-prompt constante. A ferramenta usa um pipeline de IA em múltiplos estágios, onde um LLM planeja a composição, um modelo de imagem gera a cena e outro LLM analisa a imagem real para posicionar texto legível.

OpenClawRadar
Construindo syntaqlite: Um Projeto DevTools SQLite Criado com Assistência de IA
Tools

Construindo syntaqlite: Um Projeto DevTools SQLite Criado com Assistência de IA

Lalit Maganti construiu o syntaqlite, um conjunto de ferramentas para desenvolvedores para SQLite, ao longo de três meses usando agentes de IA de codificação, após desejar isso por oito anos. O projeto exigiu analisar SQL exatamente como o SQLite, o que envolveu adaptar a densa base de código C do SQLite com mais de 400 regras gramaticais.

OpenClawRadar
Freestyle Lança Sandboxes para Agentes de Codificação de IA com Forking em Tempo Real
Tools

Freestyle Lança Sandboxes para Agentes de Codificação de IA com Forking em Tempo Real

O Freestyle oferece sandboxes em nuvem para agentes de codificação com IA que iniciam em ~500ms e apresentam bifurcação ao vivo com pausa <400ms, permitindo clones completos de VM incluindo estado da memória. Eles executam Debian completo com virtualização de hardware em infraestrutura bare metal.

OpenClawRadar