Avaliando localmente Qwen 3.6 27B como co-agente validador de Codex

Um desenvolvedor no r/LocalLLaMA tem executado um modelo Qwen local junto com o Codex da OpenAI como validador e desafiante, e construiu um pequeno conjunto de avaliação reproduzível para quantificar quais perfis de quantização GGUF funcionam melhor nesse papel. O fluxo de trabalho: Codex cuida do trabalho principal no repositório; Qwen local desafia o plano, verifica construção excessiva, diretivas difíceis perdidas, problemas de UI/design, suposições ruins e falhas de contexto longo. O autor revisa cada interação antes de prosseguir.
Configuração do conjunto de avaliação
O conjunto testa perfis GGUF do Qwen 3.6 27B através do llama.cpp, incluindo variantes Bartowski e Unsloth em diferentes tamanhos de contexto e formatos de cache KV (q8, f16). O foco está em falhas do mundo real: diretivas perdidas, mau comportamento de desafio, construção excessiva, julgamento de UI e falhas de contexto longo.
Principais descobertas
- Os perfis com melhor desempenho neste conjunto foram:
bartowski-128k-f16,bartowski-128k-q8eunsloth-128k-q8. Todos os três empataram em precisão. - O cache KV q8 não mostrou perda de precisão mensurável neste conjunto específico.
- O tamanho do contexto foi mais importante que KV f16 vs q8 para este fluxo de trabalho. Perfis de 65k falharam quando o conjunto exigia >65k tokens.
unsloth-128k-f16carregou, mas enfrentou pressão de memória/throughput em casos de contexto longo em uma RTX 5090.
Observações práticas
O autor relata que Qwen é extremamente bom em capturar bypasses silenciosos, construção excessiva e atalhos de codificação até a conclusão no Codex. Para tarefas relacionadas a UI, Qwen assume a liderança no design enquanto Codex implementa. Os papéis se invertem: Qwen desafia o plano, e o humano revisa antes de cada etapa.
Recursos
- Página do projeto: https://robert896r1.github.io/qwen-realworld-accuracy-evals/
- Repositório: https://github.com/robert896r1/qwen-realworld-accuracy-evals
📖 Leia a fonte original: r/LocalLLaMA
👀 See Also

Tokens do Repositório: Ação do GitHub Adiciona Emblema de Contagem de Tokens para Consciência da Janela de Contexto de LLM
Repo Tokens é uma GitHub Action que conta o tamanho da sua base de código em tokens usando tiktoken e exibe um emblema no seu README mostrando qual porcentagem da janela de contexto de um LLM ela preenche. O emblema usa verde para menos de 30%, amarelo para 50-70% e vermelho para 70%+.

Bot do Telegram para Gerenciar Canais Headless do Claude Code via tmux
Um bot Telegram sem dependências externas que inicia, para e monitora sessões do Claude Code Channels no tmux em um servidor headless, com reinicialização automática via watchdog.

Claudlytics: Painel Autohospedado para Monitorar o Uso de Tokens e Custos do Código Claude
Claudlytics é um servidor web Node.js que lê os arquivos de sessão locais .jsonl do Claude Code para fornecer rastreamento em tempo real do uso de tokens e custos. Ele é executado localmente em 127.0.0.1 e pode ser acessado via túnel SSH para servidores remotos.

PocketBot: aplicativo iOS usa Claude para gerar automações JavaScript determinísticas a partir de linguagem natural
PocketBot é um aplicativo de automação móvel para iOS que usa o Claude (via AWS Bedrock) para converter solicitações em linguagem simples em scripts JavaScript autossuficientes. O LLM escreve o código uma vez, e então os scripts determinísticos são executados conforme agendamento em um ambiente de execução isolado, sem envolvimento de IA.