Rodando Qwen3.6 27B e 35B em 6GB de VRAM com ik_llama: Configurações Práticas e Benchmarks

✍️ OpenClawRadar📅 Publicado: May 17, 2026🔗 Source
Rodando Qwen3.6 27B e 35B em 6GB de VRAM com ik_llama: Configurações Práticas e Benchmarks
Ad

Um usuário do Reddit relata que conseguiu executar com sucesso os modelos Qwen3.6 27B e 35B A3B em um notebook gamer antigo com uma RTX 2060 Mobile (6 GB de VRAM) e 32 GB de RAM usando ik_llama e llama.cpp. As principais otimizações incluem decodificação especulativa dupla com MTP e ngram, --fit e --mtp-requantize-output-tensor, além de repacotamento do tensor de saída. Abaixo estão as configurações exatas e as velocidades observadas.

Configuração para Qwen3.6 27B (Q3_K_XL)

export GGML_CUDA_GRAPHS=1
./llama-server \
  -m /mnt/second-ssd/lib/llama.cpp/models/Qwen3.6-27B-MTP-UD-Q3_K_XL.gguf \
  -c 16000 \
  -b 512 -ub 512 \
  --fit --fit-margin 3076 \
  -fa on \
  -np 1 \
  -ctk q4_0 -ctv q4_0 \
  --mtp-requantize-output-tensor q4_0 \
  -khad -vhad -rtr \
  --threads 6 --threads-batch 8 \
  --slot-save-path ./slots \
  --prompt-cache "prompt.cache" \
  --port 8888 --host 0.0.0.0 \
  --spec-stage ngram-mod:n_max=64,n_min=2,spec-ngram-size-n=16 \
  --spec-stage mtp:n_max=1,draft-p-min=0.0 \
  --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.0 \
  --jinja \
  --chat-template-kwargs '{"preserve_thinking": true}' \
  --reasoning on
Ad

Configuração para Qwen3.6 35B A3B (IQ4_XS, Claude Opus Distill)

export GGML_CUDA_GRAPHS=1
./llama-server \
  -m /mnt/second-ssd/lib/llama.cpp/models/lordx64-Claude-4.7-Opus-Reasoning-Distilled-Qwen3.6-35B-A3B-MTP-IQ4_XS.gguf \
  -c 80000 \
  -b 1024 -ub 1024 \
  --fit --fit-margin 2048 \
  -fa on \
  -np 1 \
  -ctk q8_0 -ctv q4_0 \
  --mtp-requantize-output-tensor q4_0 \
  -khad -vhad -rtr \
  --threads 6 --threads-batch 8 \
  --slot-save-path ./slots \
  --prompt-cache "prompt.cache" \
  --mlock --no-mmap \
  --port 8888 --host 0.0.0.0 \
  --spec-stage ngram-mod:n_max=64,n_min=2,spec-ngram-size-n=16 \
  --spec-stage mtp:n_max=3,draft-p-min=0.0 \
  --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.0 \
  --jinja \
  --chat-template-kwargs '{"preserve_thinking": true}' \
  --reasoning on

Números de Desempenho

  • 27B: preenchimento ~100 t/s, primeiro token até 4 t/s, ~1 t/s com contexto de 10k
  • 35B A3B: preenchimento ~40 t/s, primeiro token até 15 t/s, constante ~11 t/s com contexto de 10k

O usuário observa que o 27B se tornou utilizável para raciocínio sobre arquivos de até 1000 linhas (levando minutos, mas útil), e o 35B Opus distill roda com saída estável de 11 t/s. Ele o utiliza para gerar gráficos mermaid, imagens, markdown e PDFs com fluxos de trabalho de codificação little-coder ou agentes.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Claude vs GPT para Escrita Acadêmica de Doutorado: Preservando o Significado Técnico em Seções de Métodos
Guides

Claude vs GPT para Escrita Acadêmica de Doutorado: Preservando o Significado Técnico em Seções de Métodos

Um candidato a PhD compara Claude e GPT para polir artigos de co-design de visão computacional / hardware, descobrindo que Claude é mais confiável para preservar o significado técnico e a estrutura argumentativa, enquanto GPT às vezes simplifica demais as afirmações.

OpenClawRadar
Correções de Chamada de Ferramentas do Qwen 3.5 para Uso Agente: Status do Servidor e Soluções Alternativas no Lado do Cliente
Guides

Correções de Chamada de Ferramentas do Qwen 3.5 para Uso Agente: Status do Servidor e Soluções Alternativas no Lado do Cliente

Uma análise detalhada identifica quatro bugs que quebram a chamada de ferramentas do Qwen 3.5 em configurações agentes, acompanha correções de servidor até abril de 2026 e fornece uma função Python do lado do cliente para analisar chamadas de ferramentas XML quando os servidores falham.

OpenClawRadar
Qwen 3.5 122B MoE a 35 t/s em uma única 3090 com ik_llama.cpp MTP
Guides

Qwen 3.5 122B MoE a 35 t/s em uma única 3090 com ik_llama.cpp MTP

Uma stack local rodando Qwen 3.5 122B MoE em uma única 3090 a 35 t/s usando operações MoE fundidas do ik_llama.cpp para MTP. O llama.cpp padrão mostrou apenas +4% de melhoria; o fork ik resulta em +20%.

OpenClawRadar
Criando um Servidor MCP para se Autoinstalar: Três Hosts, Três Mecanismos, Armadilhas
Guides

Criando um Servidor MCP para se Autoinstalar: Três Hosts, Três Mecanismos, Armadilhas

Um mergulho profundo na instalação programática de servidores MCP no VS Code, Cursor e Claude Code — cobrindo APIs, gravações de arquivos e casos extremos como JSON malformado, gravações atômicas e atualizações idempotentes.

OpenClawRadar