Otimizando Qwen 3.6 27B/35B em RTX 3090: Flags, Quantização e Roteamento Automático

✍️ OpenClawRadar📅 Publicado: May 5, 2026🔗 Source
Otimizando Qwen 3.6 27B/35B em RTX 3090: Flags, Quantização e Roteamento Automático
Ad

Um desenvolvedor executando modelos Qwen 3.6 localmente em uma RTX 3090 (24GB VRAM), Ryzen 5700X, 64GB RAM, Windows 11, está enfrentando problemas de desempenho e confiabilidade. Eles estão usando o llama-server com flags personalizadas e buscando conselhos sobre escolha de quant, throughput e roteamento automático de modelos.

Comandos e Quantizações

35B (UD Q4_K_M):

llama-server.exe -m "path\Qwen3.6-35B-A3B-UD-Q4_K_M.gguf" -ngl 99 -c 131072 -np 2 -fa on -ctk f16 -ctv f16 -b 2048 -ub 512 -t 8 --mlock -rea on --reasoning-budget 2048 --reasoning-format deepseek --jinja --metrics --slots --port 8081 --host 0.0.0.0

27B (UD Q4_K_XL):

llama-server.exe -m "path\Qwen3.6-27B-UD-Q4_K_XL.gguf" -ngl 99 -c 196608 -np 1 -fa on -ctk q8_0 -ctv q8_0 -b 2048 -ub 512 -t 8 --no-mmap -rea on --reasoning-budget -1 --reasoning-format deepseek --jinja --metrics --slots --port 8081 --host 0.0.0.0
Ad

Problemas Relatados

  • 35B muito lento – até tarefas iterativas simples parecem inutilizáveis.
  • 27B mais rápido, mas não confiável – a saída de código quebra; tarefas simples podem levar de 20 a 30 minutos.
  • Troca manual de modelo – precisa matar o servidor, colar novo comando, recarregar o modelo.

Perguntas Específicas

  • As flags são subótimas? (ex.: tamanho do contexto, tamanho do lote, tipo de cache)
  • Qual quant/modelo oferece o melhor equilíbrio entre velocidade e precisão de codificação em 24GB VRAM?
  • Como alternar automaticamente os modelos por requisição, ou manter vários modelos aquecidos e rotear?

Contexto

O usuário executa o agente Hermes em um Raspberry Pi 5 para scraping e automação, e codificação local com OpenCode/QwenCode. Eles querem uma configuração que não exija reinicializações manuais do servidor.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Padrões de Falhas do OpenClaw: 42 Incidentes Reais em 28 Dias
Guides

Padrões de Falhas do OpenClaw: 42 Incidentes Reais em 28 Dias

Um desenvolvedor que executou o OpenClaw diariamente documentou 42 falhas específicas em oito categorias, incluindo alucinações de IA, falhas de autenticação e automações que custam mais tempo do que economizam. A fonte fornece exemplos concretos como a expiração de tokens OAuth do Google em 7 dias e o Opus 4.6 adicionando metadados indesejados aos arquivos.

OpenClawRadar
Otimizando o GLM-4.7-Flash no Mac Mini M4 com 24 GB de RAM
Guides

Otimizando o GLM-4.7-Flash no Mac Mini M4 com 24 GB de RAM

Um desenvolvedor compartilha detalhes específicos de configuração para executar o GLM-4.7-Flash em um Mac Mini M4 com 24GB de RAM, incluindo quantização Q3_K_XL, tamanho de contexto de 32k com MLA e realidades de alocação de memória para Metal.

OpenClawRadar
Proprietários de Repositórios GitHub: Use a Flag --author do Git para Bloquear Spam de Bots de IA
Guides

Proprietários de Repositórios GitHub: Use a Flag --author do Git para Bloquear Spam de Bots de IA

Archestra combateu spam de comentários/PR de IA explorando a configuração 'contribuidores anteriores' do GitHub e a flag --author do Git para incluir humanos reais na lista de permissões via um fluxo de integração com captcha.

OpenClawRadar
Cadeias de fallback do OpenClaw preservam o tempo de atividade, mas podem reduzir silenciosamente a confiabilidade
Guides

Cadeias de fallback do OpenClaw preservam o tempo de atividade, mas podem reduzir silenciosamente a confiabilidade

O mecanismo de fallback de modelos do OpenClaw pode mascarar problemas de confiabilidade. Um modelo de fallback menor pode passar em tarefas simples, mas falhar em tarefas complexas, custando mais em novas tentativas e revisão.

OpenClawRadar