Desenvolvedor Testa Qwen3.5 27B em Comparação com Modelos Maiores para Tarefas Locais de Programação

Um desenvolvedor testou vários modelos de linguagem grandes para tarefas de programação local, comparando desempenho e requisitos de hardware. O teste focou em variantes do Qwen3.5 e modelos Nemotron, com comparações ao GPT-5.4 High.
Resultados e Descobertas dos Testes
O desenvolvedor testou estes modelos específicos:
- unsloth/Qwen3.5-27B-GGUF:UD-Q4_K_XL
- unsloth/Qwen3.5-35B-A3B-GGUF:UD-Q4_K_XL
- unsloth/Qwen3.5-122B-A10B-GGUF
- unsloth/Qwen3.5-27B-GGUF:UD-Q6_K_XL
- unsloth/Qwen3.5-27B-GGUF:UD-Q8_K_XL
- unsloth/NVIDIA-Nemotron-3-Super-120B-A12B-GGUF:UD-IQ4_XS
- unsloth/gpt-oss-120b-GGUF:F16
Principais descobertas dos testes:
- Nemotron-3-Super-120B teve desempenho "muito, muito bom", equivalente ao GPT-5.4 High
- Qwen3.5-27B teve bom desempenho para tarefas de desenvolvimento
- GPT-OSS-120B e Qwen3.5-122B tiveram desempenho inferior aos outros dois modelos
- Nemotron-3-Super-120B respondeu consistentemente em espanhol (idioma nativo do testador) enquanto os outros responderam em inglês
Métricas de Desempenho
O desenvolvedor forneceu números específicos de desempenho:
- Nemotron-3-Super-120B: 80 tokens por segundo (tg/s), ~2000 processamento de prompt (pp), contexto de 100k no vast.ai com 4x RTX 3090
- Qwen3.5-27B Q6: 803 pp, 25 tg/s, contexto de 256k no vast.ai
Requisitos de Hardware
O desenvolvedor observou limitações de hardware:
- Qwen3.5-122B exigiria uma nova placa-mãe e mais 1-2 placas RTX 3090, tornando-o muito caro
- Qwen3.5-27B roda no hardware existente de 2x RTX 3090 sem investimento adicional
- Se tivessem o hardware para Nemotron-3-Super-120B, usariam ele em vez disso
Detalhes de Implementação
O desenvolvedor planeja usar Qwen3.5-27B-GGUF:UD-Q6_K_XL para tarefas reais de desenvolvimento localmente e forneceu o comando llama.cpp usado para testes:
./llama.cpp/llama-server -hf unsloth/Qwen3.5-27B-GGUF:UD-Q6_K_XL --ctx-size 262144 --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.00 -ngl 999
O desenvolvedor mencionou que continuará usando CODEX para tarefas complexas, mas pode substituir assinaturas de API para tarefas diárias pela configuração local.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Ponte IDE Claude de Código Aberto Conecta Dispatch, Aplicativo Desktop e Claude Code
O claude-ide-bridge é uma ferramenta de código aberto licenciada pelo MIT que conecta o Claude Code ao seu IDE, fornecendo acesso a LSP, depurador, terminais, git e GitHub através de 124 ferramentas. Ele permite um fluxo de trabalho onde tarefas enviadas via Dispatch de um telefone são tratadas pelo aplicativo de desktop Claude, que usa o Claude Code para escrever código e executar testes enquanto interage com o IDE.

Usuário do Reddit Testa Recurso de Autoaprendizado do Agente de IA Hermes, Encontra Falhas Críticas
Um usuário do Reddit testou o recurso de autoaprendizagem do agente de IA Hermes, que cria habilidades automaticamente a partir de arquivos markdown. O usuário descobriu que ele sempre avalia seus próprios resultados como bem-sucedidos, mesmo quando a saída está incorreta, e sobrescreve edições manuais.

Claude Code UltraPlan: Alterações no Fluxo de Trabalho e Observações de Desempenho
O Claude Code UltraPlan apresenta um fluxo de trabalho de planejamento baseado em nuvem com lançamento via terminal, interface de revisão no navegador e opções de execução. Os testes mostraram execuções repetidas aproximadamente 2x mais rápidas do que o planejamento local, com melhorias de qualidade variáveis.

Plugin OKed: OpenClaw pede permissão ao seu telefone antes de ações destrutivas
Um novo plugin chamado OKed se conecta ao gancho before_tool_call do OpenClaw para interceptar comandos destrutivos (e-mails, exclusões, pagamentos) e enviar solicitações de aprovação para seu telefone ou Telegram.