Benchmarks de 12GB VRAM: Executando Modelos Qwen 3.6 e Gemma 4 em uma RTX 4070 Super

Um usuário do Reddit publicou benchmarks de velocidade para executar vários modelos MoE grandes em uma RTX 4070 Super de 12 GB (com +10% de overclock), emparelhada com uma CPU AMD 9800X3D e 64 GB de RAM DDR5-6000. O usuário desloca a exibição para a iGPU para economizar VRAM, notando uma penalidade de desempenho de ~10% caso contrário. A configuração usa CUDA 13.1 e a versão mais recente do llama.cpp com a seguinte configuração de hardware:
n-gpu-layers = 999
threads = 8
threads-batch = 16
batch-size = 4096
ubatch-size = 4096
ctx-size = 65536
flash-attn = true
Resultados do Benchmark
O usuário testou quatro modelos via Unsloth GGUF quants no VS Code com Cline e KiloCode (sem problemas de chamada de ferramenta). Todas as medidas estão em tokens por segundo (tgs) e processamento por segundo (pps).
- Qwen3.6-35B-A3B-GGUF Q6_K_XL: 40 tgs, 2100 pps
- Qwen3.6-27B-IQ3_XXS: 16 tgs, 1000 pps
- Gemma 4 26B-A4B-it-UD-Q8: 26 tgs, 2150 pps
- Gemma-4-31B-it-IQ3_XXS: 13-16 tgs, 650 pps
Detalhes da Configuração Notáveis
O usuário compartilhou configurações individuais de cada modelo com ajustes específicos. Principais destaques:
- Para Qwen3.6-35B-A3B:
n-cpu-moe = 35(descarrega 35 especialistas MoE para a CPU),cache-type-k = q8_0,cache-type-v = q8_0,swa-full = true,cache-reuse = 512, tamanho de contexto 131072, raciocínio habilitado com orçamento 8096. - Para Gemma 4 26B:
n-cpu-moe = 27, contexto 102400,fit = oncomfit-target = 256efit-ctx = 32768. - Para Gemma 4 31B: usa decodificação especulativa com
ngram-mod(spec-type = ngram-mod),n-gpu-layers = 58(descarregamento parcial da GPU),cache-type-k = q4_0,no-kv-offload = true. - Todos os modelos usam
flash-attn = trueeno-mmproj-offload = true.
O modelo preferido do usuário para desenvolvimento web é o Qwen3.6-35B-A3B, elogiando sua qualidade sem problemas de chamada de ferramenta nas extensões do VS Code.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Os modelos Qwen3.x falham silenciosamente no OpenClaw devido a incompatibilidade no formato de saída de streaming.
Os modelos Qwen3.x no modo de streaming enviam a saída para o campo 'reasoning' em vez de 'content', fazendo com que o OpenClaw silenciosamente recorra aos modelos de fallback. Um proxy que traduz os formatos de API e injeta 'think: false' corrige o problema, permitindo a avaliação completa de chamadas de ferramentas.

Use task runners for common coding tasks
Ham Vocke explica como usar scripts bash simples ou Makefiles como executores de tarefas para padronizar comandos comuns como build, test e format entre repositórios.

Análise do Plugin de Memória OpenClaw: Claw Sem Perdas + LanceDB Recomendado
Um desenvolvedor testou os plugins de memória do OpenClaw e descobriu que a configuração padrão causa inchaço de tokens, enquanto o Lossless Claw combinado com LanceDB oferece desempenho ideal para manter o contexto do agente sem custos elevados.

Padrões práticos de fluxo de trabalho para codificação de IA confiável em projetos com múltiplos arquivos
Um usuário do Reddit compartilha quatro melhorias específicas de fluxo de trabalho que aumentaram a confiabilidade da codificação com IA em projetos com múltiplos arquivos: início com especificação, decomposição de tarefas com pontos de verificação, loops operacionais estáveis e revisão apenas de sinais.