Qwen3.5-35B-A3B-UD-Q6_K_XL Testado em Fluxos de Trabalho de Desenvolvimento de Produção

Um desenvolvedor no r/LocalLLaMA compartilhou resultados detalhados de testes do modelo Qwen3.5-35B-A3B-UD-Q6_K_XL em cenários de desenvolvimento de produção. O usuário conduziu tanto testes de benchmark quanto aplicação prática em projetos reais de clientes.
Benchmarks de Desempenho
O modelo alcançou pontuações de benchmark de 1504pp2048 e 47.71 tg256. A velocidade de geração de tokens foi sólida quando distribuída entre duas GPUs, e aumentou para 80 tokens por segundo (tps) quando executado em uma única GPU.
Metodologia de Testes em Produção
O desenvolvedor testou o modelo em cinco projetos diferentes usando Git Worktrees para reverter para especificações e recursos conhecidos. As especificações para esses testes foram geradas pelo Claude, com o desenvolvedor usando um plano Max Pro no último ano.
- Testado em projetos JavaScript, Go e Rust
- Usou Git Worktrees para controle de versão durante os testes
- A maioria dos "bugs" exigiu apenas ajustes de 5 minutos ou pôde ser corrigida com um segundo prompt
- Comparou a experiência com o uso do Sonnet 4
Resultados Práticos e Implicações de Negócios
O desenvolvedor relatou que o Qwen3.5 "acertou em cheio" para o trabalho que realiza, observando especialmente o forte desempenho em projetos Go e Rust. Isso levou a uma consideração séria de mudar de modelos baseados em API para uma abordagem híbrida: usar modelos SOTA via API para geração de especificações e revisões, enquanto usa modelos locais para trabalho de desenvolvimento.
Os testes levantaram questões sobre investimento em hardware versus custos de assinatura. O desenvolvedor já gastou US$ 2.000 no Claude Pro Max desde junho de 2025, com custos potenciais chegando a US$ 6.800 até 2027 se as assinaturas continuarem. Isso levou à consideração de comprar um RTX 6000 Pro como investimento de negócios.
O desenvolvedor vinha usando o Qwen Coder para conclusão de tabulação anteriormente, mas descobriu que o Qwen3.5 eleva as capacidades dos modelos locais a um novo nível para uso em produção.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

NaNMesh MCP verifica problemas no GitHub antes que Claude recomende bibliotecas
NaNMesh MCP é um servidor de Model Context Protocol de código aberto que rastreia Issues do GitHub, Stack Overflow e Reddit em busca de bugs conhecidos em ferramentas de desenvolvimento. Quando o Claude recomenda uma biblioteca, ele pode verificar problemas reais antes da integração.

Tokenmeter: Aplicativo gratuito para Windows para rastrear o uso de tokens do Claude Code offline
Tokenmeter é um aplicativo gratuito e de código aberto para Windows que lê arquivos .jsonl locais do Claude Code para mostrar uso de tokens, custos estimados, economia de cache e um mapa de calor de 90 dias de atividade — tudo offline.

Referência: MLX vs Ollama Executando Qwen3-Coder-Next 8-Bit no MacBook Pro M5 Max
Um benchmark comparando os backends MLX e Ollama executando a quantização de 8 bits do Qwen3-Coder-Next em um MacBook Pro M5 Max com 128 GB de RAM mostrou que o MLX atingiu aproximadamente 72 tokens por segundo, cerca do dobro da taxa de transferência do Ollama em várias tarefas de programação.

Canopy: Painel de Terminal para Gerenciar Múltiplos Agentes de Código Claude
Canopy é uma interface de usuário de terminal de código aberto que fornece uma visão única de painel para rastrear múltiplos agentes de codificação de IA em execução em worktrees do git. Ele mostra os estados dos agentes (executando, ocioso, aguardando entrada, concluído, com erro) e permite que você entre nas sessões ou envie entrada sem alternar completamente.