Qwen 3.5 35B ejecutándose en 8GB de VRAM con configuración de llama.cpp

Configuración local de Qwen 3.5 35B con VRAM limitada
Un desarrollador en r/LocalLLaMA detalló su configuración para ejecutar el modelo Qwen 3.5 35B localmente en hardware con 8 GB de VRAM. Pasaron de usar Antigravity (con un plan Google AI Pro) a LLMs locales tras alcanzar los límites del servicio en la nube.
Especificaciones de hardware y modelo
La configuración utiliza un portátil Lenovo Legion con un CPU i9-14900HX (con núcleos E desactivados en la BIOS, 32 GB de RAM DDR5) y una GPU RTX 4060m con 8 GB de VRAM. El modelo específico es Qwen 3.5 35B A3B Heretic Opus (Q4_K_M GGUF).
Rendimiento y configuración de llama.cpp
El desarrollador informa obtener aproximadamente 700 tokens por segundo para el procesamiento de prompts y 42 tokens por segundo para la generación de tokens con esta configuración. Proporcionaron sus argumentos de línea de comandos de llama.cpp tras las pruebas:
-ngl 99 ^ --n-cpu-moe 40 ^ -c 192000 ^ -t 12 ^ -tb 16 ^ -b 4096 ^ --ubatch-size 2048 ^ --flash-attn on ^ --cache-type-k q8_0 ^ --cache-type-v q8_0 ^ --mlock
Integración en el flujo de trabajo
Para su flujo de trabajo de agente, encontraron que Cline en VSCode es la alternativa más cercana a Antigravity. Usan kat-coder-pro para el modo Plan y qwen3.5 para el modo Act en esta configuración. El desarrollador busca comentarios sobre si esta configuración local es mejor que seguir con Google Gemini 3 Flash en Antigravity, señalando que priorizan un flujo de trabajo fluido sobre las preocupaciones de privacidad.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

Compactador de Garras: motor de compresión de tokens de 14 etapas para canalizaciones de LLM
Claw Compactor es un motor de compresión de tokens LLM de código abierto que utiliza una Tubería de Fusión de 14 etapas para lograr una compresión promedio del 54% con costo cero de inferencia LLM. Incluye compresores especializados para código, JSON, registros, diferencias y resultados de búsqueda con capacidades de compresión reversible.

El Servicio Gestionado de ClawCloud Simplifica la Implementación de OpenClaw para Equipos de Slack
ClawCloud ofrece un servicio de implementación gestionada para OpenClaw que se conecta a espacios de trabajo de Slack, maneja la infraestructura y reduce la latencia de respuesta a menos de 2 segundos. Un usuario reportó una configuración en 20 minutos frente a 3 días para el autoalojamiento, con costos alrededor de $30/mes para un equipo de 40 personas.

mindpm: Un Servidor MCP Gratuito para Memoria de Proyecto Persistente con Claude
mindpm es un servidor MCP gratuito y de código abierto que proporciona a Claude una base de datos SQLite local para realizar un seguimiento de tareas, decisiones, notas y resúmenes de sesión entre conversaciones. La configuración toma 30 segundos con el comando: claude mcp add mindpm -e MINDPM_DB_PATH=~/.mindpm/memory.db -- npx -y mindpm.

Gemma Gem: Agente de IA en el dispositivo para automatización de navegadores a través de WebGPU
Gemma Gem es una extensión de Chrome que ejecuta el modelo Gemma 4 de Google (2B o 4B) completamente en el dispositivo usando WebGPU, sin claves de API ni dependencias en la nube. Proporciona herramientas para leer contenido de páginas, tomar capturas de pantalla, hacer clic en elementos, escribir texto, desplazarse y ejecutar JavaScript a través de una interfaz de chat.