Avaliando localmente Qwen 3.6 27B como co-agente validador de Codex

Um desenvolvedor no r/LocalLLaMA tem executado um modelo Qwen local junto com o Codex da OpenAI como validador e desafiante, e construiu um pequeno conjunto de avaliação reproduzível para quantificar quais perfis de quantização GGUF funcionam melhor nesse papel. O fluxo de trabalho: Codex cuida do trabalho principal no repositório; Qwen local desafia o plano, verifica construção excessiva, diretivas difíceis perdidas, problemas de UI/design, suposições ruins e falhas de contexto longo. O autor revisa cada interação antes de prosseguir.
Configuração do conjunto de avaliação
O conjunto testa perfis GGUF do Qwen 3.6 27B através do llama.cpp, incluindo variantes Bartowski e Unsloth em diferentes tamanhos de contexto e formatos de cache KV (q8, f16). O foco está em falhas do mundo real: diretivas perdidas, mau comportamento de desafio, construção excessiva, julgamento de UI e falhas de contexto longo.
Principais descobertas
- Os perfis com melhor desempenho neste conjunto foram:
bartowski-128k-f16,bartowski-128k-q8eunsloth-128k-q8. Todos os três empataram em precisão. - O cache KV q8 não mostrou perda de precisão mensurável neste conjunto específico.
- O tamanho do contexto foi mais importante que KV f16 vs q8 para este fluxo de trabalho. Perfis de 65k falharam quando o conjunto exigia >65k tokens.
unsloth-128k-f16carregou, mas enfrentou pressão de memória/throughput em casos de contexto longo em uma RTX 5090.
Observações práticas
O autor relata que Qwen é extremamente bom em capturar bypasses silenciosos, construção excessiva e atalhos de codificação até a conclusão no Codex. Para tarefas relacionadas a UI, Qwen assume a liderança no design enquanto Codex implementa. Os papéis se invertem: Qwen desafia o plano, e o humano revisa antes de cada etapa.
Recursos
- Página do projeto: https://robert896r1.github.io/qwen-realworld-accuracy-evals/
- Repositório: https://github.com/robert896r1/qwen-realworld-accuracy-evals
📖 Leia a fonte original: r/LocalLLaMA
👀 See Also

CodeVibe: Notificações por Push para Agentes de IA de Codificação Quando Bloqueados em Entrada
O CodeVibe envia notificações push para o seu telefone quando agentes de codificação de IA, como o Claude Code, ficam presos aguardando aprovação em operações de edição. Você pode revisar as diferenças entre arquivos e responder com opções numeradas para manter o agente em movimento.

Sistema ACO: Pipeline Multiagente de Código Aberto da Issue do GitHub ao PR Mesclado
O Sistema ACO é um framework multiagente open-source que executa autonomamente um pipeline completo de software — da Issue do GitHub ao PR mesclado — usando seis agentes de IA especializados. Possui um portão Arquiteto determinístico que bloqueia alucinações.

PgAdmin 4 9.13 Adiciona Painel de Assistente de IA à Ferramenta de Consulta
A versão 9.13 do PgAdmin 4 introduz um painel de Assistente de IA na Ferramenta de Consulta que pode gerar SQL a partir de linguagem natural quando a IA está configurada. A atualização também inclui um layout de Espaço de Trabalho para edição de consultas sem distrações e conexões de servidor ad hoc.

Confronto de Agentes: Uma Arena de MMA para Testar o Comportamento de Agentes de IA Autônomos
Clash of Agents é um experimento onde agentes de IA autônomos competem em uma arena de luta MMA com combate baseado em turnos, análise pós-luta e interações sociais. Os agentes se registram, escolhem disciplinas de luta, treinam estatísticas e lutam com 21 movimentos reais de MMA e um sistema de combos.