Avaliando localmente Qwen 3.6 27B como co-agente validador de Codex

Um desenvolvedor no r/LocalLLaMA tem executado um modelo Qwen local junto com o Codex da OpenAI como validador e desafiante, e construiu um pequeno conjunto de avaliação reproduzível para quantificar quais perfis de quantização GGUF funcionam melhor nesse papel. O fluxo de trabalho: Codex cuida do trabalho principal no repositório; Qwen local desafia o plano, verifica construção excessiva, diretivas difíceis perdidas, problemas de UI/design, suposições ruins e falhas de contexto longo. O autor revisa cada interação antes de prosseguir.
Configuração do conjunto de avaliação
O conjunto testa perfis GGUF do Qwen 3.6 27B através do llama.cpp, incluindo variantes Bartowski e Unsloth em diferentes tamanhos de contexto e formatos de cache KV (q8, f16). O foco está em falhas do mundo real: diretivas perdidas, mau comportamento de desafio, construção excessiva, julgamento de UI e falhas de contexto longo.
Principais descobertas
- Os perfis com melhor desempenho neste conjunto foram:
bartowski-128k-f16,bartowski-128k-q8eunsloth-128k-q8. Todos os três empataram em precisão. - O cache KV q8 não mostrou perda de precisão mensurável neste conjunto específico.
- O tamanho do contexto foi mais importante que KV f16 vs q8 para este fluxo de trabalho. Perfis de 65k falharam quando o conjunto exigia >65k tokens.
unsloth-128k-f16carregou, mas enfrentou pressão de memória/throughput em casos de contexto longo em uma RTX 5090.
Observações práticas
O autor relata que Qwen é extremamente bom em capturar bypasses silenciosos, construção excessiva e atalhos de codificação até a conclusão no Codex. Para tarefas relacionadas a UI, Qwen assume a liderança no design enquanto Codex implementa. Os papéis se invertem: Qwen desafia o plano, e o humano revisa antes de cada etapa.
Recursos
- Página do projeto: https://robert896r1.github.io/qwen-realworld-accuracy-evals/
- Repositório: https://github.com/robert896r1/qwen-realworld-accuracy-evals
📖 Leia a fonte original: r/LocalLLaMA
👀 See Also

Claude Code vs OpenCode: Principais Diferenças Técnicas que um Desenvolvedor Encontrou
Um desenvolvedor compara Claude Code e OpenCode em contexto, memória, uso de ferramentas, subagentes, permissões, segurança e flexibilidade de modelos, concluindo que o Claude Code ainda vence para repositórios de produção.

Painel Grafana Open Source para Rastrear Custos e Uso do Claude Code com OpenTelemetry
Um SRE desenvolveu um painel Grafana gratuito para visualizar gastos do Claude Code, uso de tokens, taxas de acerto de cache e decisões de edição, extraindo métricas OpenTelemetry para backends compatíveis com Prometheus.

Uma Camada de Governança de 7 Arquivos para Prevenir o Desvio de Sessão de LLM
Um desenvolvedor criou uma camada de governança com sete arquivos para impedir que o Claude desfaça silenciosamente decisões arquiteturais entre sessões. O sistema inclui os arquivos active_context.md, contracts.md e decisions.md com um loop de execução estrito.

agente-recall: MCP SQLite Local para Memória de Código Persistente do Claude
agent-recall é um servidor MCP que dá ao Claude Code memória persistente entre sessões usando um arquivo SQLite local. Ele fornece 9 ferramentas MCP para salvar entidades, relacionamentos e observações, com resumos gerados por LLM no início da sessão em vez de despejos de dados brutos.