Qwen 3.5 35B em execução com 8 GB de VRAM usando a configuração llama.cpp

✍️ OpenClawRadar📅 Publicado: March 27, 2026🔗 Source
Qwen 3.5 35B em execução com 8 GB de VRAM usando a configuração llama.cpp
Ad

Configuração Local do Qwen 3.5 35B com VRAM Limitada

Um desenvolvedor no r/LocalLLaMA detalhou sua configuração para executar o modelo Qwen 3.5 35B localmente em hardware com 8GB de VRAM. Eles migraram do uso do Antigravity (com um plano Google AI Pro) para LLMs locais após atingir limites com o serviço em nuvem.

Especificações de Hardware e Modelo

A configuração usa um laptop Lenovo Legion com CPU i9-14900HX (com núcleos E desativados na BIOS, 32GB de RAM DDR5) e uma GPU RTX 4060m com 8GB de VRAM. O modelo específico é Qwen 3.5 35B A3B Heretic Opus (Q4_K_M GGUF).

Desempenho e Configuração do llama.cpp

O desenvolvedor relata obter aproximadamente 700 tokens por segundo no processamento de prompts e 42 tokens por segundo na geração de tokens com esta configuração. Eles forneceram seus argumentos de linha de comando do llama.cpp após testes:

-ngl 99 ^
--n-cpu-moe 40 ^
-c 192000 ^
-t 12 ^
-tb 16 ^
-b 4096 ^
--ubatch-size 2048 ^
--flash-attn on ^
--cache-type-k q8_0 ^
--cache-type-v q8_0 ^
--mlock
Ad

Integração no Fluxo de Trabalho

Para seu fluxo de trabalho com agentes, eles consideraram o Cline no VSCode como a alternativa mais próxima ao Antigravity. Eles usam kat-coder-pro para o modo Plan e qwen3.5 para o modo Act nesta configuração. O desenvolvedor está buscando feedback sobre se esta configuração local é melhor do que continuar com o Google Gemini 3 Flash no Antigravity, observando que priorizam um fluxo de trabalho suave em vez de preocupações com privacidade.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Explorando o Sinal de Agência Oculta (Â) de LLMs para Melhor Chamada de Ferramentas
Tools

Explorando o Sinal de Agência Oculta (Â) de LLMs para Melhor Chamada de Ferramentas

Um desenvolvedor descobriu que os LLMs têm uma direção de estado oculto linearmente separável chamada  que prevê chamadas de ferramentas com AUC > 0,94. Usar esse sinal para forçar chamadas de ferramentas melhorou o desempenho do Qwen3-1.7B de 26,7% para 85% (+58% de ganho) e reduziu as falhas sem ferramentas de 43% para 2,6%.

OpenClawRadar
Habilidade OpenClaw Janitor para Gerenciamento Automatizado de Sistemas e Fortalecimento de Segurança
Tools

Habilidade OpenClaw Janitor para Gerenciamento Automatizado de Sistemas e Fortalecimento de Segurança

Um desenvolvedor criou uma habilidade que usa o Claude Code para acessar via SSH máquinas OpenClaw e fortalcer configurações, incluindo sandboxing, higiene do sistema operacional e segurança de canais, mantendo uma pasta de projeto com instruções de auditoria em CLAUDE.md.

OpenClawRadar
Ferramenta de Backup Databasus PostgreSQL Ganha Suporte de Código Aberto da Anthropic
Tools

Ferramenta de Backup Databasus PostgreSQL Ganha Suporte de Código Aberto da Anthropic

A Anthropic reconheceu a ferramenta de backup de banco de dados de código aberto Databasus por meio de seu programa Claude para Código Aberto, fornecendo aos mantenedores acesso gratuito ao Claude Max. A ferramenta oferece suporte a PostgreSQL, MySQL, MariaDB e MongoDB com backups agendados, mais de 70 destinos de armazenamento e criptografia AES-256-GCM.

OpenClawRadar
Servidor MCP do Pepper para Interação e Depuração do Simulador iOS
Tools

Servidor MCP do Pepper para Interação e Depuração do Simulador iOS

Pepper é um servidor MCP que injeta uma dylib em aplicativos do simulador iOS via DYLD_INSERT_LIBRARIES, permitindo interação em tempo real, leitura de tela, toque em botões, inspeção de variáveis e monitoramento de tráfego de rede através de uma ponte WebSocket.

OpenClawRadar