Qwen 3.5 35B ejecutándose en 8GB de VRAM con configuración de llama.cpp

✍️ OpenClawRadar📅 Publicado: 27 de marzo de 2026🔗 Source
Qwen 3.5 35B ejecutándose en 8GB de VRAM con configuración de llama.cpp
Ad

Configuración local de Qwen 3.5 35B con VRAM limitada

Un desarrollador en r/LocalLLaMA detalló su configuración para ejecutar el modelo Qwen 3.5 35B localmente en hardware con 8 GB de VRAM. Pasaron de usar Antigravity (con un plan Google AI Pro) a LLMs locales tras alcanzar los límites del servicio en la nube.

Especificaciones de hardware y modelo

La configuración utiliza un portátil Lenovo Legion con un CPU i9-14900HX (con núcleos E desactivados en la BIOS, 32 GB de RAM DDR5) y una GPU RTX 4060m con 8 GB de VRAM. El modelo específico es Qwen 3.5 35B A3B Heretic Opus (Q4_K_M GGUF).

Rendimiento y configuración de llama.cpp

El desarrollador informa obtener aproximadamente 700 tokens por segundo para el procesamiento de prompts y 42 tokens por segundo para la generación de tokens con esta configuración. Proporcionaron sus argumentos de línea de comandos de llama.cpp tras las pruebas:

-ngl 99 ^
--n-cpu-moe 40 ^
-c 192000 ^
-t 12 ^
-tb 16 ^
-b 4096 ^
--ubatch-size 2048 ^
--flash-attn on ^
--cache-type-k q8_0 ^
--cache-type-v q8_0 ^
--mlock
Ad

Integración en el flujo de trabajo

Para su flujo de trabajo de agente, encontraron que Cline en VSCode es la alternativa más cercana a Antigravity. Usan kat-coder-pro para el modo Plan y qwen3.5 para el modo Act en esta configuración. El desarrollador busca comentarios sobre si esta configuración local es mejor que seguir con Google Gemini 3 Flash en Antigravity, señalando que priorizan un flujo de trabajo fluido sobre las preocupaciones de privacidad.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

Validación del patrón de habilidades de autoevolución: resultados del experimento de 5 rondas.
Herramientas

Validación del patrón de habilidades de autoevolución: resultados del experimento de 5 rondas.

Un desarrollador probó el patrón de diseño de Habilidad Auto-Evolutiva para Claude Code con un experimento de 5 rondas en una base de datos MySQL con 29 tablas y 590MB de datos de gestión de edificios inteligentes. Los resultados clave incluyen una tasa de rechazo de Cinco Puertas del 63,6%, convergencia incremental y una precisión del 100% sin que sobreviviera ningún conocimiento incorrecto.

OpenClawRadar
Desarrollo de Lisp con Agentes de IA: Altos Costos y Desafíos Técnicos
Herramientas

Desarrollo de Lisp con Agentes de IA: Altos Costos y Desafíos Técnicos

Un ingeniero de DevOps descubrió que los agentes de IA tienen dificultades con el desarrollo en Lisp, costando $10-$20 en minutos por código mediocre, mientras que Python y Go funcionan eficientemente. Creó tmux-repl-mcp para mejorar la interacción con el REPL, pero aún enfrentó altos costos de tokens y problemas con las herramientas.

OpenClawRadar
W2A: un protocolo abierto para sensores de agentes, brindando percepción en tiempo real a agentes locales
Herramientas

W2A: un protocolo abierto para sensores de agentes, brindando percepción en tiempo real a agentes locales

W2A (World2Agent) es un protocolo abierto que estandariza la capa de percepción para agentes de IA — autoalojable, SDK TypeScript, Apache 2.0. Permite a los agentes recibir señales en tiempo real de sensores sin scripts puntuales.

OpenClawRadar
Agente de Trading con IA con Barreras de Riesgo para Inversión Educativa
Herramientas

Agente de Trading con IA con Barreras de Riesgo para Inversión Educativa

Un desarrollador construyó un asistente de trading impulsado por IA que conecta Claude a una cuenta de corretaje con un motor de riesgo entre la IA y el dinero. El sistema incluye controles de seguridad como bloquear operaciones que excedan el 50% de la asignación de cartera, apagado automático al 3% de pérdida diaria y un interruptor de emergencia al 20% de reducción.

OpenClawRadar