Qwen 3.6 27B F16 passa no teste de codificação Pacman, mas quantizações de 8 bits falham — Lições-chave sobre templates e decodificação especulativa MTP

✍️ OpenClawRadar📅 Publicado: May 19, 2026🔗 Source
Qwen 3.6 27B F16 passa no teste de codificação Pacman, mas quantizações de 8 bits falham — Lições-chave sobre templates e decodificação especulativa MTP
Ad

Um desenvolvedor no r/LocalLLaMA compartilhou um benchmark prático de código: criar um clone do Pacman em uma única página a partir de um bom prompt, três tentativas, ficar com o melhor. O Qwen 3.6 27B F16 produziu dois jogos quase perfeitos — o primeiro modelo local a ter sucesso. No entanto, reduzir para quantização de 8 bits tornou os bons resultados irreproduzíveis mesmo após cinco tentativas, reforçando a afirmação de que quant de 8 bits não é sem perdas para tarefas generativas complexas.

Principais descobertas técnicas do post:

  • O template de chat é crítico: O template de chat oficial do Qwen é ajustado para vLLM e contém erros no llama.cpp e outros runners. O autor corrigiu bugs iterativamente e, após o ajuste fino, o modelo parecia "um novo nível de inteligência".
  • A decodificação especulativa MTP varia de acordo com a tarefa: Para tarefas determinísticas como codificação, os tok/s generativos variaram de 8 a 18 tok/s (linha de base sem MTP: 6,6 tok/s). Tarefas criativas têm menos aceleração.
  • A escolha do harness afeta mais a velocidade do que a qualidade do código: O Qwen CLI teve um desempenho surpreendentemente bom — comparável ao Claude Code em qualidade de saída, mas muito mais rápido porque os prompts extras do Claude Code tornam os modelos locais lentos. Com um modelo lento como o Qwen 3.6 27B a ~6 tok/s, cada prompt extra adiciona latência dolorosa.
  • Não interfira no gerenciamento de contexto: O cache de contexto nativo e a compactação do modelo funcionam bem. Plugins ou ferramentas que manipulam cache ou contexto confundem o modelo e degradam o desempenho.
  • Chamadas de ferramenta e subagentes funcionam perfeitamente após correções adequadas no template de chat. Compactação de contexto, uso de shell e subagentes paralelos funcionam como esperado.

O autor alerta que sua experiência depende muito da configuração do runner: use pesos F16, um template de chat corrigido e evite harnesses pesados, a menos que você tenha inferência rápida. O resultado completo do Pacman jogável está disponível em guigand.com/pacman.

Ad

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Executando o OpenClaw em uma Micro-VM Isolada com Void-Box
Tools

Executando o OpenClaw em uma Micro-VM Isolada com Void-Box

O OpenClaw pode ser executado como um serviço dentro de uma micro-VM isolada usando o Void-Box, um runtime com limites de capacidade que executa fluxos de trabalho em micro-VMs KVM, fornecendo um limite de execução limpo sem envolvimento de runtime de contêiner.

OpenClawRadar
Mneme: Um Cliente de Chat Claude Gratuito, Local e com Memória Persistente
Tools

Mneme: Um Cliente de Chat Claude Gratuito, Local e com Memória Persistente

Mneme é um cliente de chat gratuito, de código aberto e focado em privacidade local para Claude, com memória em camadas, rastreamento de entidades, resumos diários e suporte ao Sonnet 4.5 via API da Anthropic.

OpenClawRadar
Habilidade de Agente de Código Aberto para Padrões de TypeScript, React e Next.js
Tools

Habilidade de Agente de Código Aberto para Padrões de TypeScript, React e Next.js

Um desenvolvedor lançou uma referência estruturada em markdown com 4.000 linhas e 17 arquivos, projetada para agentes de IA como o Claude Code seguirem ao gerar ou revisar código TypeScript, React e Next.js. Ela aborda problemas comuns como validação inadequada de respostas de API e uso incorreto de diretivas 'use client'.

OpenClawRadar
Brunnfeld Agentic World: Simulação de Economia Medieval Multiagente Sem Prompts Comportamentais
Tools

Brunnfeld Agentic World: Simulação de Economia Medieval Multiagente Sem Prompts Comportamentais

Uma simulação em TypeScript onde 20 agentes de LLM negociam autonomamente em uma economia de vila medieval sem instruções comportamentais, objetivos ou estratégias de negociação. Os agentes recebem percepções de ~200 tokens a cada ciclo e interagem por meio de um mecanismo determinístico que lida com física, receitas e mecânicas de mercado.

OpenClawRadar