Qwen 3.6 27B F16 passa no teste de codificação Pacman, mas quantizações de 8 bits falham — Lições-chave sobre templates e decodificação especulativa MTP

Um desenvolvedor no r/LocalLLaMA compartilhou um benchmark prático de código: criar um clone do Pacman em uma única página a partir de um bom prompt, três tentativas, ficar com o melhor. O Qwen 3.6 27B F16 produziu dois jogos quase perfeitos — o primeiro modelo local a ter sucesso. No entanto, reduzir para quantização de 8 bits tornou os bons resultados irreproduzíveis mesmo após cinco tentativas, reforçando a afirmação de que quant de 8 bits não é sem perdas para tarefas generativas complexas.
Principais descobertas técnicas do post:
- O template de chat é crítico: O template de chat oficial do Qwen é ajustado para vLLM e contém erros no llama.cpp e outros runners. O autor corrigiu bugs iterativamente e, após o ajuste fino, o modelo parecia "um novo nível de inteligência".
- A decodificação especulativa MTP varia de acordo com a tarefa: Para tarefas determinísticas como codificação, os tok/s generativos variaram de 8 a 18 tok/s (linha de base sem MTP: 6,6 tok/s). Tarefas criativas têm menos aceleração.
- A escolha do harness afeta mais a velocidade do que a qualidade do código: O Qwen CLI teve um desempenho surpreendentemente bom — comparável ao Claude Code em qualidade de saída, mas muito mais rápido porque os prompts extras do Claude Code tornam os modelos locais lentos. Com um modelo lento como o Qwen 3.6 27B a ~6 tok/s, cada prompt extra adiciona latência dolorosa.
- Não interfira no gerenciamento de contexto: O cache de contexto nativo e a compactação do modelo funcionam bem. Plugins ou ferramentas que manipulam cache ou contexto confundem o modelo e degradam o desempenho.
- Chamadas de ferramenta e subagentes funcionam perfeitamente após correções adequadas no template de chat. Compactação de contexto, uso de shell e subagentes paralelos funcionam como esperado.
O autor alerta que sua experiência depende muito da configuração do runner: use pesos F16, um template de chat corrigido e evite harnesses pesados, a menos que você tenha inferência rápida. O resultado completo do Pacman jogável está disponível em guigand.com/pacman.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Executando o OpenClaw em uma Micro-VM Isolada com Void-Box
O OpenClaw pode ser executado como um serviço dentro de uma micro-VM isolada usando o Void-Box, um runtime com limites de capacidade que executa fluxos de trabalho em micro-VMs KVM, fornecendo um limite de execução limpo sem envolvimento de runtime de contêiner.

Mneme: Um Cliente de Chat Claude Gratuito, Local e com Memória Persistente
Mneme é um cliente de chat gratuito, de código aberto e focado em privacidade local para Claude, com memória em camadas, rastreamento de entidades, resumos diários e suporte ao Sonnet 4.5 via API da Anthropic.

Habilidade de Agente de Código Aberto para Padrões de TypeScript, React e Next.js
Um desenvolvedor lançou uma referência estruturada em markdown com 4.000 linhas e 17 arquivos, projetada para agentes de IA como o Claude Code seguirem ao gerar ou revisar código TypeScript, React e Next.js. Ela aborda problemas comuns como validação inadequada de respostas de API e uso incorreto de diretivas 'use client'.

Brunnfeld Agentic World: Simulação de Economia Medieval Multiagente Sem Prompts Comportamentais
Uma simulação em TypeScript onde 20 agentes de LLM negociam autonomamente em uma economia de vila medieval sem instruções comportamentais, objetivos ou estratégias de negociação. Os agentes recebem percepções de ~200 tokens a cada ciclo e interagem por meio de um mecanismo determinístico que lida com física, receitas e mecânicas de mercado.