Otimizando Qwen 3.6 27B/35B em RTX 3090: Flags, Quantização e Roteamento Automático

✍️ OpenClawRadar📅 Publicado: May 5, 2026🔗 Source
Otimizando Qwen 3.6 27B/35B em RTX 3090: Flags, Quantização e Roteamento Automático
Ad

Um desenvolvedor executando modelos Qwen 3.6 localmente em uma RTX 3090 (24GB VRAM), Ryzen 5700X, 64GB RAM, Windows 11, está enfrentando problemas de desempenho e confiabilidade. Eles estão usando o llama-server com flags personalizadas e buscando conselhos sobre escolha de quant, throughput e roteamento automático de modelos.

Comandos e Quantizações

35B (UD Q4_K_M):

llama-server.exe -m "path\Qwen3.6-35B-A3B-UD-Q4_K_M.gguf" -ngl 99 -c 131072 -np 2 -fa on -ctk f16 -ctv f16 -b 2048 -ub 512 -t 8 --mlock -rea on --reasoning-budget 2048 --reasoning-format deepseek --jinja --metrics --slots --port 8081 --host 0.0.0.0

27B (UD Q4_K_XL):

llama-server.exe -m "path\Qwen3.6-27B-UD-Q4_K_XL.gguf" -ngl 99 -c 196608 -np 1 -fa on -ctk q8_0 -ctv q8_0 -b 2048 -ub 512 -t 8 --no-mmap -rea on --reasoning-budget -1 --reasoning-format deepseek --jinja --metrics --slots --port 8081 --host 0.0.0.0
Ad

Problemas Relatados

  • 35B muito lento – até tarefas iterativas simples parecem inutilizáveis.
  • 27B mais rápido, mas não confiável – a saída de código quebra; tarefas simples podem levar de 20 a 30 minutos.
  • Troca manual de modelo – precisa matar o servidor, colar novo comando, recarregar o modelo.

Perguntas Específicas

  • As flags são subótimas? (ex.: tamanho do contexto, tamanho do lote, tipo de cache)
  • Qual quant/modelo oferece o melhor equilíbrio entre velocidade e precisão de codificação em 24GB VRAM?
  • Como alternar automaticamente os modelos por requisição, ou manter vários modelos aquecidos e rotear?

Contexto

O usuário executa o agente Hermes em um Raspberry Pi 5 para scraping e automação, e codificação local com OpenCode/QwenCode. Eles querem uma configuração que não exija reinicializações manuais do servidor.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Claude para Motion Graphics: Padrões de Prompt que Produzem Visuais HTML Animados que Você Pode Capturar como Vídeo
Guides

Claude para Motion Graphics: Padrões de Prompt que Produzem Visuais HTML Animados que Você Pode Capturar como Vídeo

Um usuário do r/ClaudeAI compartilha uma estrutura de prompt confiável para gerar gráficos animados e infográficos interativos como widgets HTML a partir do Claude, e então capturá-los como MP4 com Playwright + ffmpeg.

OpenClawRadar
Reduza os custos de token em 95% com as sete técnicas de otimização da OpenClaw
Guides

Reduza os custos de token em 95% com as sete técnicas de otimização da OpenClaw

Um guia completo detalhando sete técnicas para reduzir o consumo de tokens de agentes de IA em mais de 95%, incluindo arquivos de inicialização em estrutura de árvore, autocompressão de IA, offloading de modelo local e tarefas de CPU baseadas em cron.

OpenClawRadar
Usando o Padrão Dispatcher para Reduzir os Custos da API Claude em 95%
Guides

Usando o Padrão Dispatcher para Reduzir os Custos da API Claude em 95%

Um desenvolvedor reduziu seus custos com a API Claude de US$ 800 a US$ 2.000/mês para cerca de US$ 215/mês implementando um padrão dispatcher que delega trabalho pesado para o Claude Code CLI em uma assinatura Claude Max, enquanto usa tokens mínimos da API para orquestração.

OpenClawRadar
Fluxo de Trabalho Prático com Claude Code para Equipes de Desenvolvimento
Guides

Fluxo de Trabalho Prático com Claude Code para Equipes de Desenvolvimento

Um usuário do Reddit compartilha sua apresentação interna sobre as melhores práticas do Claude Code, incluindo seleção de modelo, fluxos de trabalho estruturados e técnicas específicas de prompt para melhorar a qualidade da saída.

OpenClawRadar