Qwen 3.5 35B Fonctionnant sur 8 Go de VRAM avec la configuration llama.cpp

✍️ OpenClawRadar📅 Publié: March 27, 2026🔗 Source
Qwen 3.5 35B Fonctionnant sur 8 Go de VRAM avec la configuration llama.cpp
Ad

Configuration locale de Qwen 3.5 35B avec VRAM limitée

Un développeur sur r/LocalLLaMA a détaillé sa configuration pour exécuter localement le modèle Qwen 3.5 35B sur du matériel avec 8 Go de VRAM. Il est passé d'Antigravity (avec un plan Google AI Pro) aux LLM locaux après avoir atteint les limites du service cloud.

Spécifications matérielles et du modèle

La configuration utilise un ordinateur portable Lenovo Legion avec un processeur i9-14900HX (avec les cœurs E désactivés dans le BIOS, 32 Go de RAM DDR5) et une carte graphique RTX 4060m avec 8 Go de VRAM. Le modèle spécifique est Qwen 3.5 35B A3B Heretic Opus (Q4_K_M GGUF).

Performances et configuration de llama.cpp

Le développeur rapporte obtenir environ 700 tokens par seconde pour le traitement des prompts et 42 tokens par seconde pour la génération de tokens avec cette configuration. Il a fourni ses arguments de ligne de commande llama.cpp après les tests :

-ngl 99 ^
--n-cpu-moe 40 ^
-c 192000 ^
-t 12 ^
-tb 16 ^
-b 4096 ^
--ubatch-size 2048 ^
--flash-attn on ^
--cache-type-k q8_0 ^
--cache-type-v q8_0 ^
--mlock
Ad

Intégration dans le flux de travail

Pour son flux de travail agentique, il a trouvé que Cline dans VSCode était l'alternative la plus proche d'Antigravity. Il utilise kat-coder-pro pour le mode Plan et qwen3.5 pour le mode Act dans cette configuration. Le développeur cherche des retours pour savoir si cette configuration locale est meilleure que de rester avec Google Gemini 3 Flash dans Antigravity, notant qu'il privilégie un flux de travail fluide plutôt que les préoccupations de confidentialité.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

🦀
Tools

Mergetrain : une file d'attente de fusion locale pour les sessions Claude Code parallèles qui empêche les poussées écrasées

Mergetrain est une file d'attente de fusion locale qui empêche les sessions Claude Code parallèles de se marcher sur les pieds lors des pushs. Elle utilise des worktrees, un hook pré-push et un exécuteur unique qui assemble les branches en train, exécute les tests, puis pousse atomiquement.

OpenClawRadar
Automatisation des Notes de Version de Claude Desktop à partir d'Applications Electron Minifiées
Tools

Automatisation des Notes de Version de Claude Desktop à partir d'Applications Electron Minifiées

Un développeur a créé un pipeline automatisé utilisant Claude Sonnet et Opus 4.6 pour générer des notes de version pour Claude Desktop sur Linux, comblant ainsi l'absence de notes de version officielles de la part d'Anthropic. Le système extrait, normalise et analyse le code minifié de l'application Electron dans le cadre d'un flux de travail CI/CD.

OpenClawRadar
Werld : Simulation de vie artificielle ouverte avec réseaux de neurones évolutifs
Tools

Werld : Simulation de vie artificielle ouverte avec réseaux de neurones évolutifs

Werld est une simulation de vie artificielle en temps réel où des agents dotés de réseaux neuronaux NEAT font évoluer leur propre architecture neuronale, leur traitement sensoriel et leurs comportements sans règles prédéfinies ni fonctions de récompense. La simulation commence avec 30 agents sur un graphe petit-monde de Watts-Strogatz avec 64 canaux sensoriels, 7 fonctions motrices continues et 29 traits génétiques héréditaires.

OpenClawRadar
Fiche de Code Claude Imprimable avec Mises à Jour Automatiques Hebdomadaires
Tools

Fiche de Code Claude Imprimable avec Mises à Jour Automatiques Hebdomadaires

Un développeur a créé une feuille de triche imprimable pour Claude Code qui se met à jour automatiquement chaque semaine. La feuille a été générée en utilisant Claude lui-même après avoir étudié les fonctionnalités de la documentation et de GitHub.

OpenClawRadar