Benchmarks de 12GB VRAM: Executando Modelos Qwen 3.6 e Gemma 4 em uma RTX 4070 Super

Um usuário do Reddit publicou benchmarks de velocidade para executar vários modelos MoE grandes em uma RTX 4070 Super de 12 GB (com +10% de overclock), emparelhada com uma CPU AMD 9800X3D e 64 GB de RAM DDR5-6000. O usuário desloca a exibição para a iGPU para economizar VRAM, notando uma penalidade de desempenho de ~10% caso contrário. A configuração usa CUDA 13.1 e a versão mais recente do llama.cpp com a seguinte configuração de hardware:
n-gpu-layers = 999
threads = 8
threads-batch = 16
batch-size = 4096
ubatch-size = 4096
ctx-size = 65536
flash-attn = true
Resultados do Benchmark
O usuário testou quatro modelos via Unsloth GGUF quants no VS Code com Cline e KiloCode (sem problemas de chamada de ferramenta). Todas as medidas estão em tokens por segundo (tgs) e processamento por segundo (pps).
- Qwen3.6-35B-A3B-GGUF Q6_K_XL: 40 tgs, 2100 pps
- Qwen3.6-27B-IQ3_XXS: 16 tgs, 1000 pps
- Gemma 4 26B-A4B-it-UD-Q8: 26 tgs, 2150 pps
- Gemma-4-31B-it-IQ3_XXS: 13-16 tgs, 650 pps
Detalhes da Configuração Notáveis
O usuário compartilhou configurações individuais de cada modelo com ajustes específicos. Principais destaques:
- Para Qwen3.6-35B-A3B:
n-cpu-moe = 35(descarrega 35 especialistas MoE para a CPU),cache-type-k = q8_0,cache-type-v = q8_0,swa-full = true,cache-reuse = 512, tamanho de contexto 131072, raciocínio habilitado com orçamento 8096. - Para Gemma 4 26B:
n-cpu-moe = 27, contexto 102400,fit = oncomfit-target = 256efit-ctx = 32768. - Para Gemma 4 31B: usa decodificação especulativa com
ngram-mod(spec-type = ngram-mod),n-gpu-layers = 58(descarregamento parcial da GPU),cache-type-k = q4_0,no-kv-offload = true. - Todos os modelos usam
flash-attn = trueeno-mmproj-offload = true.
O modelo preferido do usuário para desenvolvimento web é o Qwen3.6-35B-A3B, elogiando sua qualidade sem problemas de chamada de ferramenta nas extensões do VS Code.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Servidor Custom 4x RTX PRO 6000 vs Dell GB300: Decisão para 30 Pipelines Ajustados
Uma análise aprofundada de duas arquiteturas locais para executar cerca de 30 pipelines de produção ajustados: um servidor customizado 4U com 4-8x RTX PRO 6000 Blackwell (96 GB cada) vs o appliance NVIDIA GB300 Grace Blackwell com 252 GB HBM3e + 496 GB de memória unificada.

Correção para o Erro da Extensão Claude VS Code: 'comando claude-vscode.editor.openLast não encontrado'
A extensão Claude para VS Code versão 2.1.51 contém um bug crítico que causa o erro 'comando claude-vscode.editor.openLast não encontrado'. A solução alternativa é fazer o downgrade para a versão 2.1.49.

Subagentes OpenClaw: Não Trate uma Resposta como Confirmação de Conclusão
O sessions_spawn do OpenClaw é não bloqueante — ele retorna um runId quando o trabalho é aceito, não concluído. Um pai pode reportar sucesso prematuramente enquanto um filho ainda está em execução, falhou ou se perdeu.

Lista de configuração do OpenClaw: seis etapas críticas para novos usuários
Uma postagem no Reddit descreve seis passos essenciais de configuração para usuários do OpenClaw: mudar o modelo padrão de Opus para Sonnet para reduzir custos, bloquear o host do gateway para 127.0.0.1 por segurança, criar SOUL.md para personalidade do agente, evitar instalar habilidades inicialmente, não criar múltiplos agentes e usar o comando /new para gerenciar o contexto da conversa.