Avaliando localmente Qwen 3.6 27B como co-agente validador de Codex

✍️ OpenClawRadar📅 Publicado: May 4, 2026🔗 Source
Avaliando localmente Qwen 3.6 27B como co-agente validador de Codex
Ad

Um desenvolvedor no r/LocalLLaMA tem executado um modelo Qwen local junto com o Codex da OpenAI como validador e desafiante, e construiu um pequeno conjunto de avaliação reproduzível para quantificar quais perfis de quantização GGUF funcionam melhor nesse papel. O fluxo de trabalho: Codex cuida do trabalho principal no repositório; Qwen local desafia o plano, verifica construção excessiva, diretivas difíceis perdidas, problemas de UI/design, suposições ruins e falhas de contexto longo. O autor revisa cada interação antes de prosseguir.

Configuração do conjunto de avaliação

O conjunto testa perfis GGUF do Qwen 3.6 27B através do llama.cpp, incluindo variantes Bartowski e Unsloth em diferentes tamanhos de contexto e formatos de cache KV (q8, f16). O foco está em falhas do mundo real: diretivas perdidas, mau comportamento de desafio, construção excessiva, julgamento de UI e falhas de contexto longo.

Principais descobertas

  • Os perfis com melhor desempenho neste conjunto foram: bartowski-128k-f16, bartowski-128k-q8 e unsloth-128k-q8. Todos os três empataram em precisão.
  • O cache KV q8 não mostrou perda de precisão mensurável neste conjunto específico.
  • O tamanho do contexto foi mais importante que KV f16 vs q8 para este fluxo de trabalho. Perfis de 65k falharam quando o conjunto exigia >65k tokens.
  • unsloth-128k-f16 carregou, mas enfrentou pressão de memória/throughput em casos de contexto longo em uma RTX 5090.
Ad

Observações práticas

O autor relata que Qwen é extremamente bom em capturar bypasses silenciosos, construção excessiva e atalhos de codificação até a conclusão no Codex. Para tarefas relacionadas a UI, Qwen assume a liderança no design enquanto Codex implementa. Os papéis se invertem: Qwen desafia o plano, e o humano revisa antes de cada etapa.

Recursos

📖 Leia a fonte original: r/LocalLLaMA

Ad

👀 See Also

Tokens do Repositório: Ação do GitHub Adiciona Emblema de Contagem de Tokens para Consciência da Janela de Contexto de LLM
Tools

Tokens do Repositório: Ação do GitHub Adiciona Emblema de Contagem de Tokens para Consciência da Janela de Contexto de LLM

Repo Tokens é uma GitHub Action que conta o tamanho da sua base de código em tokens usando tiktoken e exibe um emblema no seu README mostrando qual porcentagem da janela de contexto de um LLM ela preenche. O emblema usa verde para menos de 30%, amarelo para 50-70% e vermelho para 70%+.

OpenClawRadar
Bot do Telegram para Gerenciar Canais Headless do Claude Code via tmux
Tools

Bot do Telegram para Gerenciar Canais Headless do Claude Code via tmux

Um bot Telegram sem dependências externas que inicia, para e monitora sessões do Claude Code Channels no tmux em um servidor headless, com reinicialização automática via watchdog.

OpenClawRadar
Claudlytics: Painel Autohospedado para Monitorar o Uso de Tokens e Custos do Código Claude
Tools

Claudlytics: Painel Autohospedado para Monitorar o Uso de Tokens e Custos do Código Claude

Claudlytics é um servidor web Node.js que lê os arquivos de sessão locais .jsonl do Claude Code para fornecer rastreamento em tempo real do uso de tokens e custos. Ele é executado localmente em 127.0.0.1 e pode ser acessado via túnel SSH para servidores remotos.

OpenClawRadar
PocketBot: aplicativo iOS usa Claude para gerar automações JavaScript determinísticas a partir de linguagem natural
Tools

PocketBot: aplicativo iOS usa Claude para gerar automações JavaScript determinísticas a partir de linguagem natural

PocketBot é um aplicativo de automação móvel para iOS que usa o Claude (via AWS Bedrock) para converter solicitações em linguagem simples em scripts JavaScript autossuficientes. O LLM escreve o código uma vez, e então os scripts determinísticos são executados conforme agendamento em um ambiente de execução isolado, sem envolvimento de IA.

OpenClawRadar