Avaliando localmente Qwen 3.6 27B como co-agente validador de Codex

Um desenvolvedor no r/LocalLLaMA tem executado um modelo Qwen local junto com o Codex da OpenAI como validador e desafiante, e construiu um pequeno conjunto de avaliação reproduzível para quantificar quais perfis de quantização GGUF funcionam melhor nesse papel. O fluxo de trabalho: Codex cuida do trabalho principal no repositório; Qwen local desafia o plano, verifica construção excessiva, diretivas difíceis perdidas, problemas de UI/design, suposições ruins e falhas de contexto longo. O autor revisa cada interação antes de prosseguir.
Configuração do conjunto de avaliação
O conjunto testa perfis GGUF do Qwen 3.6 27B através do llama.cpp, incluindo variantes Bartowski e Unsloth em diferentes tamanhos de contexto e formatos de cache KV (q8, f16). O foco está em falhas do mundo real: diretivas perdidas, mau comportamento de desafio, construção excessiva, julgamento de UI e falhas de contexto longo.
Principais descobertas
- Os perfis com melhor desempenho neste conjunto foram:
bartowski-128k-f16,bartowski-128k-q8eunsloth-128k-q8. Todos os três empataram em precisão. - O cache KV q8 não mostrou perda de precisão mensurável neste conjunto específico.
- O tamanho do contexto foi mais importante que KV f16 vs q8 para este fluxo de trabalho. Perfis de 65k falharam quando o conjunto exigia >65k tokens.
unsloth-128k-f16carregou, mas enfrentou pressão de memória/throughput em casos de contexto longo em uma RTX 5090.
Observações práticas
O autor relata que Qwen é extremamente bom em capturar bypasses silenciosos, construção excessiva e atalhos de codificação até a conclusão no Codex. Para tarefas relacionadas a UI, Qwen assume a liderança no design enquanto Codex implementa. Os papéis se invertem: Qwen desafia o plano, e o humano revisa antes de cada etapa.
Recursos
- Página do projeto: https://robert896r1.github.io/qwen-realworld-accuracy-evals/
- Repositório: https://github.com/robert896r1/qwen-realworld-accuracy-evals
📖 Leia a fonte original: r/LocalLLaMA
👀 See Also

SDK de Memória Engram: Memória Baseada em Grafos para Agentes de IA com Modelos Locais
Engram Memory SDK é um sistema de memória em grafo de código aberto para agentes de IA que funciona com modelos locais via LiteLLM. Requer apenas uma chamada de LLM para ingestão, depois usa busca vetorial e travessia de grafo para recuperação com custo zero contínuo de LLM.

Pneuma: Um Ambiente de Desktop Gerado por IA Onde o Software Se Materializa a Partir de Descrições
Pneuma é um ambiente de computação desktop onde você descreve o que deseja—um monitor de CPU, jogo, aplicativo de notas ou visualizador de dados—e um programa funcional se materializa em segundos. O sistema gera módulos autônomos em Rust, os compila para WebAssembly e os executa em instâncias sandboxed do Wasmtime com renderização GPU via wgpu.

Benchmarks de Desempenho de LLM Local no Mac Mini com OpenClaw e LM Studio
Um usuário do Reddit postou números de desempenho para executar o modelo Unsloth gpt-oss-20b-Q4_K_S.gguf localmente em um Mac Mini com 32GB de RAM, alcançando 34 tokens/segundo com um tempo de 0,7 segundo para o primeiro token usando OpenClaw 2026.3.8 e LM Studio 0.4.6+1.

skill-depot: Um Sistema de Memória e Habilidades Local-First para Agentes de IA Compatíveis com MCP
skill-depot é um sistema de recuperação que armazena o conhecimento do agente em arquivos Markdown e usa embeddings vetoriais para buscar semanticamente e carregar seletivamente apenas o conteúdo relevante. Ele funciona 100% localmente sem chaves de API, é compatível com qualquer agente MCP e pode ser configurado com npx skill-depot init.