Qwen 3.5 35B Fonctionnant sur 8 Go de VRAM avec la configuration llama.cpp

Configuration locale de Qwen 3.5 35B avec VRAM limitée
Un développeur sur r/LocalLLaMA a détaillé sa configuration pour exécuter localement le modèle Qwen 3.5 35B sur du matériel avec 8 Go de VRAM. Il est passé d'Antigravity (avec un plan Google AI Pro) aux LLM locaux après avoir atteint les limites du service cloud.
Spécifications matérielles et du modèle
La configuration utilise un ordinateur portable Lenovo Legion avec un processeur i9-14900HX (avec les cœurs E désactivés dans le BIOS, 32 Go de RAM DDR5) et une carte graphique RTX 4060m avec 8 Go de VRAM. Le modèle spécifique est Qwen 3.5 35B A3B Heretic Opus (Q4_K_M GGUF).
Performances et configuration de llama.cpp
Le développeur rapporte obtenir environ 700 tokens par seconde pour le traitement des prompts et 42 tokens par seconde pour la génération de tokens avec cette configuration. Il a fourni ses arguments de ligne de commande llama.cpp après les tests :
-ngl 99 ^ --n-cpu-moe 40 ^ -c 192000 ^ -t 12 ^ -tb 16 ^ -b 4096 ^ --ubatch-size 2048 ^ --flash-attn on ^ --cache-type-k q8_0 ^ --cache-type-v q8_0 ^ --mlock
Intégration dans le flux de travail
Pour son flux de travail agentique, il a trouvé que Cline dans VSCode était l'alternative la plus proche d'Antigravity. Il utilise kat-coder-pro pour le mode Plan et qwen3.5 pour le mode Act dans cette configuration. Le développeur cherche des retours pour savoir si cette configuration locale est meilleure que de rester avec Google Gemini 3 Flash dans Antigravity, notant qu'il privilégie un flux de travail fluide plutôt que les préoccupations de confidentialité.
📖 Read the full source: r/LocalLLaMA
👀 See Also
Mergetrain : une file d'attente de fusion locale pour les sessions Claude Code parallèles qui empêche les poussées écrasées
Mergetrain est une file d'attente de fusion locale qui empêche les sessions Claude Code parallèles de se marcher sur les pieds lors des pushs. Elle utilise des worktrees, un hook pré-push et un exécuteur unique qui assemble les branches en train, exécute les tests, puis pousse atomiquement.

Automatisation des Notes de Version de Claude Desktop à partir d'Applications Electron Minifiées
Un développeur a créé un pipeline automatisé utilisant Claude Sonnet et Opus 4.6 pour générer des notes de version pour Claude Desktop sur Linux, comblant ainsi l'absence de notes de version officielles de la part d'Anthropic. Le système extrait, normalise et analyse le code minifié de l'application Electron dans le cadre d'un flux de travail CI/CD.

Werld : Simulation de vie artificielle ouverte avec réseaux de neurones évolutifs
Werld est une simulation de vie artificielle en temps réel où des agents dotés de réseaux neuronaux NEAT font évoluer leur propre architecture neuronale, leur traitement sensoriel et leurs comportements sans règles prédéfinies ni fonctions de récompense. La simulation commence avec 30 agents sur un graphe petit-monde de Watts-Strogatz avec 64 canaux sensoriels, 7 fonctions motrices continues et 29 traits génétiques héréditaires.

Fiche de Code Claude Imprimable avec Mises à Jour Automatiques Hebdomadaires
Un développeur a créé une feuille de triche imprimable pour Claude Code qui se met à jour automatiquement chaque semaine. La feuille a été générée en utilisant Claude lui-même après avoir étudié les fonctionnalités de la documentation et de GitHub.