Exécution de Qwen3.6-35B-A3B-UD-Q5_K_XL en local avec VS Code Copilot sur AMD R9700

✍️ OpenClawRadar📅 Publié: May 7, 2026🔗 Source
Exécution de Qwen3.6-35B-A3B-UD-Q5_K_XL en local avec VS Code Copilot sur AMD R9700
Ad

Un utilisateur de Reddit rapporte d'excellents résultats en exécutant localement le modèle GGUF Qwen3.6-35B-A3B-UD-Q5_K_XL avec llama.cpp et Vulkan sur un seul GPU AMD R9700. Cette configuration a servi de remplacement direct à GitHub Copilot dans VS Code, générant un site web de test complet et une suite de tests Playwright avec une intervention minimale.

Commande de démarrage de llama.cpp

/app/llama-server -m /models/Qwen3.6-35B-A3B-UD-Q5_K_XL/Qwen3.6-35B-A3B-UD-Q5_K_XL.gguf \
  --ctx-size 262144 --threads 8 --threads-batch 8 \
  --gpu-layers 99 --parallel 1 --flash-attn on \
  --batch-size 2048 --ubatch-size 1024 \
  --cache-type-k q8_0 --cache-type-v q8_0 \
  --cache-ram 12000 --ctx-checkpoints 50 \
  --mmap --no-mmproj --kv-unified \
  --reasoning off --reasoning-budget 0 --jinja \
  --temp 0.6 --top-k 20 --top-p 0.95 --min-p 0.0 \
  --repeat-penalty 1.0 --presence-penalty 0.0

Paramètres clés : fenêtre de contexte de 256K, 99 couches GPU pour un déchargement complet, attention flash activée, et configuration d'échantillonnage tirée de la page Hugging Face de Qwen3.6-35B-A3B sous « precise coding ».

Intégration dans VS Code

L'utilisateur a configuré un modèle de chat personnalisé dans chatLanguageModels.json pointant vers le serveur llama.cpp local :

{
  "name": "Sean Llama.cpp",
  "vendor": "customoai",
  "apiKey": "${input:chat.lm.secret.3c0c0f21}",
  "models": [
    {
      "id": "Qwen3.6-35B-A3B-UD-Q5_K_XL.gguf",
      "name": "Qwen3.6-35B",
      "url": "https://llm.home.arpa/v1/chat/completions",
      "toolCalling": true,
      "vision": false,
      "maxInputTokens": 180000,
      "maxOutputTokens": 10000,
      "family": "Qwen3",
      "inputTokenCost": 0.0001,
      "outputTokenCost": 0.0001,
      "temperature": 0.6,
      "top_p": 0.95,
      "top_k": 20,
      "repeat_penalty": 1,
      "presence_penalty": 0,
      "frequency_penalty": 0,
      "systemMessage": "You are a precise coding assistant. Avoid repeating plans. Execute tasks directly. Do not restate intentions multiple times.",
      "timeout": 600000,
      "retry": { "enabled": true, "max_attempts": 2, "interval_ms": 1500 }
    }
  ]
}

Le modèle a correctement répondu aux requêtes d'appel d'outils, lui permettant d'agir comme un remplacement de Copilot.

Ad

Test réel : Génération d'une application complète

L'utilisateur a fourni une invite détaillée (provenant de ChatGPT) demandant au modèle de construire un « Bike Shop Service Tracker » — une application React + TypeScript locale utilisant localStorage. Les exigences comprenaient un modèle de données, des données de démonstration, du filtrage, du tri et une validation de formulaire. Le modèle a généré l'ensemble du site web entièrement fonctionnel dès le premier essai.

Ensuite, ils lui ont demandé de générer une suite de tests Playwright complète. Un seul test a nécessité une correction manuelle — sinon, la suite s'est exécutée sans erreur. La conclusion de l'utilisateur : « Je pense que j'ai fini de peaufiner et de tester les modèles (jusqu'à la prochaine grande version) et que je peux maintenant retourner coder. »

À qui cela s'adresse

Développeurs exécutant des LLM locaux pour l'aide au codage, en particulier ceux avec des GPU AMD (Vulkan) qui souhaitent une alternative à Copilot de qualité comparable.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Claude-Code v2.1.76 ajoute l'élicitation MCP, des optimisations de worktree et de nombreuses corrections.
Tools

Claude-Code v2.1.76 ajoute l'élicitation MCP, des optimisations de worktree et de nombreuses corrections.

Claude-Code v2.1.76 introduit la prise en charge de la sollicitation MCP pour les entrées structurées en cours de tâche, ajoute worktree.sparsePaths pour l'efficacité des monorepos, et corrige plus de 20 problèmes incluant la perte de schéma d'outils différés, les problèmes de commandes slash et la stabilité des sessions de Contrôle à Distance.

OpenClawRadar
Scrapling intégré comme colonne vertébrale de scraping d'OpenClaw
Tools

Scrapling intégré comme colonne vertébrale de scraping d'OpenClaw

Scrapling, une bibliothèque open-source qui apprend la structure des pages et s'adapte aux changements, a été intégrée à OpenClaw en tant que moteur de scraping principal. Elle est 774 fois plus rapide que BeautifulSoup avec Lxml et prend en charge plusieurs types de sélecteurs avec des sessions asynchrones.

OpenClawRadar
Dirac : un agent open-source domine TerminalBench avec 65,2 %, moins cher et ouvert
Tools

Dirac : un agent open-source domine TerminalBench avec 65,2 %, moins cher et ouvert

Dirac, un agent de codage open-source, a obtenu un score de 65,2 % sur TerminalBench 2.0 pour gemini-3-flash-preview, surpassant le socle de Google (47,6 %) et le meilleur agent propriétaire Junie CLI (64,3 %). Il réduit également les coûts API de 64,8 % par rapport à ses concurrents.

OpenClawRadar
Phantom : Un agent d'IA persistant construit avec le SDK Agent de Claude
Tools

Phantom : Un agent d'IA persistant construit avec le SDK Agent de Claude

Phantom est un processus open-source Bun/TypeScript qui encapsule le SDK Agent de Claude (Opus 4.6) avec une mémoire vectorielle persistante, un moteur d'auto-évolution et une interface serveur MCP. Il fonctionne en continu sur sa propre machine virtuelle ou via Docker Compose et communique via Slack.

OpenClawRadar