Desenvolvedor Testa Qwen3.5 27B em Comparação com Modelos Maiores para Tarefas Locais de Programação

Um desenvolvedor testou vários modelos de linguagem grandes para tarefas de programação local, comparando desempenho e requisitos de hardware. O teste focou em variantes do Qwen3.5 e modelos Nemotron, com comparações ao GPT-5.4 High.
Resultados e Descobertas dos Testes
O desenvolvedor testou estes modelos específicos:
- unsloth/Qwen3.5-27B-GGUF:UD-Q4_K_XL
- unsloth/Qwen3.5-35B-A3B-GGUF:UD-Q4_K_XL
- unsloth/Qwen3.5-122B-A10B-GGUF
- unsloth/Qwen3.5-27B-GGUF:UD-Q6_K_XL
- unsloth/Qwen3.5-27B-GGUF:UD-Q8_K_XL
- unsloth/NVIDIA-Nemotron-3-Super-120B-A12B-GGUF:UD-IQ4_XS
- unsloth/gpt-oss-120b-GGUF:F16
Principais descobertas dos testes:
- Nemotron-3-Super-120B teve desempenho "muito, muito bom", equivalente ao GPT-5.4 High
- Qwen3.5-27B teve bom desempenho para tarefas de desenvolvimento
- GPT-OSS-120B e Qwen3.5-122B tiveram desempenho inferior aos outros dois modelos
- Nemotron-3-Super-120B respondeu consistentemente em espanhol (idioma nativo do testador) enquanto os outros responderam em inglês
Métricas de Desempenho
O desenvolvedor forneceu números específicos de desempenho:
- Nemotron-3-Super-120B: 80 tokens por segundo (tg/s), ~2000 processamento de prompt (pp), contexto de 100k no vast.ai com 4x RTX 3090
- Qwen3.5-27B Q6: 803 pp, 25 tg/s, contexto de 256k no vast.ai
Requisitos de Hardware
O desenvolvedor observou limitações de hardware:
- Qwen3.5-122B exigiria uma nova placa-mãe e mais 1-2 placas RTX 3090, tornando-o muito caro
- Qwen3.5-27B roda no hardware existente de 2x RTX 3090 sem investimento adicional
- Se tivessem o hardware para Nemotron-3-Super-120B, usariam ele em vez disso
Detalhes de Implementação
O desenvolvedor planeja usar Qwen3.5-27B-GGUF:UD-Q6_K_XL para tarefas reais de desenvolvimento localmente e forneceu o comando llama.cpp usado para testes:
./llama.cpp/llama-server -hf unsloth/Qwen3.5-27B-GGUF:UD-Q6_K_XL --ctx-size 262144 --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.00 -ngl 999
O desenvolvedor mencionou que continuará usando CODEX para tarefas complexas, mas pode substituir assinaturas de API para tarefas diárias pela configuração local.
📖 Read the full source: r/LocalLLaMA
👀 See Also

EmoBar: Visualizando os Vetores Internos de Emoção do Claude do Artigo da Anthropic
Um desenvolvedor criou o EmoBar, uma ferramenta de código aberto que visualiza as 171 representações internas de emoção no Claude identificadas no artigo recente da Anthropic. A ferramenta utiliza uma abordagem de canal duplo para revelar esses vetores mensuráveis que causam o comportamento do modelo.

Controle iPhones reais a partir de agentes OpenClaw — Mão na massa com a configuração de AvaBerry43
Um desenvolvedor criou uma configuração de iPhones controlados por API para agentes de IA, testando funcionalidades como rascunho de iMessages, Atalhos e QA móvel. 70 iPhones estão disponíveis para outros experimentarem.

TideSurf: Ferramenta de compressão DOM reduz uso de tokens de agentes web em 30 vezes, acelera TTFT em 12 vezes
O TideSurf v0.3 converte o DOM renderizado para um formato compactado semelhante a markdown, reduzindo o consumo de tokens em 32x em páginas do GitHub em comparação com o DOM bruto, enquanto adiciona 18 ferramentas interativas para agentes de LLM.

Padrão de Handoffs em Fluxos de Trabalho do Claude: Divisão em Dois Arquivos vs. Resumo em Um Documento
Sessões longas no Claude sofrem com degradação de contexto. Handoffs comprimem o que importa e recomeçam. Duas abordagens: skill de handoff de Matt Pocock vs divisão em dois arquivos com narrativa persistente e prompt efêmero.