Avaliando localmente Qwen 3.6 27B como co-agente validador de Codex

✍️ OpenClawRadar📅 Publicado: May 4, 2026🔗 Source
Avaliando localmente Qwen 3.6 27B como co-agente validador de Codex
Ad

Um desenvolvedor no r/LocalLLaMA tem executado um modelo Qwen local junto com o Codex da OpenAI como validador e desafiante, e construiu um pequeno conjunto de avaliação reproduzível para quantificar quais perfis de quantização GGUF funcionam melhor nesse papel. O fluxo de trabalho: Codex cuida do trabalho principal no repositório; Qwen local desafia o plano, verifica construção excessiva, diretivas difíceis perdidas, problemas de UI/design, suposições ruins e falhas de contexto longo. O autor revisa cada interação antes de prosseguir.

Configuração do conjunto de avaliação

O conjunto testa perfis GGUF do Qwen 3.6 27B através do llama.cpp, incluindo variantes Bartowski e Unsloth em diferentes tamanhos de contexto e formatos de cache KV (q8, f16). O foco está em falhas do mundo real: diretivas perdidas, mau comportamento de desafio, construção excessiva, julgamento de UI e falhas de contexto longo.

Principais descobertas

  • Os perfis com melhor desempenho neste conjunto foram: bartowski-128k-f16, bartowski-128k-q8 e unsloth-128k-q8. Todos os três empataram em precisão.
  • O cache KV q8 não mostrou perda de precisão mensurável neste conjunto específico.
  • O tamanho do contexto foi mais importante que KV f16 vs q8 para este fluxo de trabalho. Perfis de 65k falharam quando o conjunto exigia >65k tokens.
  • unsloth-128k-f16 carregou, mas enfrentou pressão de memória/throughput em casos de contexto longo em uma RTX 5090.
Ad

Observações práticas

O autor relata que Qwen é extremamente bom em capturar bypasses silenciosos, construção excessiva e atalhos de codificação até a conclusão no Codex. Para tarefas relacionadas a UI, Qwen assume a liderança no design enquanto Codex implementa. Os papéis se invertem: Qwen desafia o plano, e o humano revisa antes de cada etapa.

Recursos

📖 Leia a fonte original: r/LocalLLaMA

Ad

👀 See Also

Claude Code vs OpenCode: Principais Diferenças Técnicas que um Desenvolvedor Encontrou
Tools

Claude Code vs OpenCode: Principais Diferenças Técnicas que um Desenvolvedor Encontrou

Um desenvolvedor compara Claude Code e OpenCode em contexto, memória, uso de ferramentas, subagentes, permissões, segurança e flexibilidade de modelos, concluindo que o Claude Code ainda vence para repositórios de produção.

OpenClawRadar
Painel Grafana Open Source para Rastrear Custos e Uso do Claude Code com OpenTelemetry
Tools

Painel Grafana Open Source para Rastrear Custos e Uso do Claude Code com OpenTelemetry

Um SRE desenvolveu um painel Grafana gratuito para visualizar gastos do Claude Code, uso de tokens, taxas de acerto de cache e decisões de edição, extraindo métricas OpenTelemetry para backends compatíveis com Prometheus.

OpenClawRadar
Uma Camada de Governança de 7 Arquivos para Prevenir o Desvio de Sessão de LLM
Tools

Uma Camada de Governança de 7 Arquivos para Prevenir o Desvio de Sessão de LLM

Um desenvolvedor criou uma camada de governança com sete arquivos para impedir que o Claude desfaça silenciosamente decisões arquiteturais entre sessões. O sistema inclui os arquivos active_context.md, contracts.md e decisions.md com um loop de execução estrito.

OpenClawRadar
agente-recall: MCP SQLite Local para Memória de Código Persistente do Claude
Tools

agente-recall: MCP SQLite Local para Memória de Código Persistente do Claude

agent-recall é um servidor MCP que dá ao Claude Code memória persistente entre sessões usando um arquivo SQLite local. Ele fornece 9 ferramentas MCP para salvar entidades, relacionamentos e observações, com resumos gerados por LLM no início da sessão em vez de despejos de dados brutos.

OpenClawRadar