Benchmarks de 12GB VRAM: Executando Modelos Qwen 3.6 e Gemma 4 em uma RTX 4070 Super

✍️ OpenClawRadar📅 Publicado: April 30, 2026🔗 Source
Benchmarks de 12GB VRAM: Executando Modelos Qwen 3.6 e Gemma 4 em uma RTX 4070 Super
Ad

Um usuário do Reddit publicou benchmarks de velocidade para executar vários modelos MoE grandes em uma RTX 4070 Super de 12 GB (com +10% de overclock), emparelhada com uma CPU AMD 9800X3D e 64 GB de RAM DDR5-6000. O usuário desloca a exibição para a iGPU para economizar VRAM, notando uma penalidade de desempenho de ~10% caso contrário. A configuração usa CUDA 13.1 e a versão mais recente do llama.cpp com a seguinte configuração de hardware:

n-gpu-layers = 999
threads = 8
threads-batch = 16
batch-size = 4096
ubatch-size = 4096
ctx-size = 65536
flash-attn = true

Resultados do Benchmark

O usuário testou quatro modelos via Unsloth GGUF quants no VS Code com Cline e KiloCode (sem problemas de chamada de ferramenta). Todas as medidas estão em tokens por segundo (tgs) e processamento por segundo (pps).

  • Qwen3.6-35B-A3B-GGUF Q6_K_XL: 40 tgs, 2100 pps
  • Qwen3.6-27B-IQ3_XXS: 16 tgs, 1000 pps
  • Gemma 4 26B-A4B-it-UD-Q8: 26 tgs, 2150 pps
  • Gemma-4-31B-it-IQ3_XXS: 13-16 tgs, 650 pps
Ad

Detalhes da Configuração Notáveis

O usuário compartilhou configurações individuais de cada modelo com ajustes específicos. Principais destaques:

  • Para Qwen3.6-35B-A3B: n-cpu-moe = 35 (descarrega 35 especialistas MoE para a CPU), cache-type-k = q8_0, cache-type-v = q8_0, swa-full = true, cache-reuse = 512, tamanho de contexto 131072, raciocínio habilitado com orçamento 8096.
  • Para Gemma 4 26B: n-cpu-moe = 27, contexto 102400, fit = on com fit-target = 256 e fit-ctx = 32768.
  • Para Gemma 4 31B: usa decodificação especulativa com ngram-mod (spec-type = ngram-mod), n-gpu-layers = 58 (descarregamento parcial da GPU), cache-type-k = q4_0, no-kv-offload = true.
  • Todos os modelos usam flash-attn = true e no-mmproj-offload = true.

O modelo preferido do usuário para desenvolvimento web é o Qwen3.6-35B-A3B, elogiando sua qualidade sem problemas de chamada de ferramenta nas extensões do VS Code.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Servidor Custom 4x RTX PRO 6000 vs Dell GB300: Decisão para 30 Pipelines Ajustados
Guides

Servidor Custom 4x RTX PRO 6000 vs Dell GB300: Decisão para 30 Pipelines Ajustados

Uma análise aprofundada de duas arquiteturas locais para executar cerca de 30 pipelines de produção ajustados: um servidor customizado 4U com 4-8x RTX PRO 6000 Blackwell (96 GB cada) vs o appliance NVIDIA GB300 Grace Blackwell com 252 GB HBM3e + 496 GB de memória unificada.

OpenClawRadar
Correção para o Erro da Extensão Claude VS Code: 'comando claude-vscode.editor.openLast não encontrado'
Guides

Correção para o Erro da Extensão Claude VS Code: 'comando claude-vscode.editor.openLast não encontrado'

A extensão Claude para VS Code versão 2.1.51 contém um bug crítico que causa o erro 'comando claude-vscode.editor.openLast não encontrado'. A solução alternativa é fazer o downgrade para a versão 2.1.49.

OpenClawRadar
Subagentes OpenClaw: Não Trate uma Resposta como Confirmação de Conclusão
Guides

Subagentes OpenClaw: Não Trate uma Resposta como Confirmação de Conclusão

O sessions_spawn do OpenClaw é não bloqueante — ele retorna um runId quando o trabalho é aceito, não concluído. Um pai pode reportar sucesso prematuramente enquanto um filho ainda está em execução, falhou ou se perdeu.

OpenClawRadar
Lista de configuração do OpenClaw: seis etapas críticas para novos usuários
Guides

Lista de configuração do OpenClaw: seis etapas críticas para novos usuários

Uma postagem no Reddit descreve seis passos essenciais de configuração para usuários do OpenClaw: mudar o modelo padrão de Opus para Sonnet para reduzir custos, bloquear o host do gateway para 127.0.0.1 por segurança, criar SOUL.md para personalidade do agente, evitar instalar habilidades inicialmente, não criar múltiplos agentes e usar o comando /new para gerenciar o contexto da conversa.

OpenClawRadar