Ausführen von Qwen3.6-35B-A3B-UD-Q5_K_XL lokal mit VS Code Copilot auf AMD R9700

✍️ OpenClawRadar📅 Veröffentlicht: 7. Mai 2026🔗 Source
Ausführen von Qwen3.6-35B-A3B-UD-Q5_K_XL lokal mit VS Code Copilot auf AMD R9700
Ad

Ein Reddit-Benutzer berichtet von großartigen Ergebnissen beim lokalen Ausführen des Qwen3.6-35B-A3B-UD-Q5_K_XL GGUF-Modells mit llama.cpp und Vulkan auf einer einzelnen AMD R9700 GPU. Das Setup diente als direkter Ersatz für GitHub Copilot in VS Code und generierte mit minimalem Eingriff eine vollständige Test-Website sowie eine Playwright-Testsuite.

llama.cpp-Startbefehl

/app/llama-server -m /models/Qwen3.6-35B-A3B-UD-Q5_K_XL/Qwen3.6-35B-A3B-UD-Q5_K_XL.gguf \
  --ctx-size 262144 --threads 8 --threads-batch 8 \
  --gpu-layers 99 --parallel 1 --flash-attn on \
  --batch-size 2048 --ubatch-size 1024 \
  --cache-type-k q8_0 --cache-type-v q8_0 \
  --cache-ram 12000 --ctx-checkpoints 50 \
  --mmap --no-mmproj --kv-unified \
  --reasoning off --reasoning-budget 0 --jinja \
  --temp 0.6 --top-k 20 --top-p 0.95 --min-p 0.0 \
  --repeat-penalty 1.0 --presence-penalty 0.0

Wichtige Parameter: 256K Kontextfenster, 99 GPU-Layer für vollständiges Offloading, Flash Attention aktiviert und Sampling-Konfiguration von der Qwen3.6-35B-A3B Hugging Face-Seite unter "präzises Codieren" übernommen.

VS Code-Integration

Der Benutzer konfigurierte ein benutzerdefiniertes Chat-Modell in chatLanguageModels.json, das auf den lokalen llama.cpp-Server verweist:

{
  "name": "Sean Llama.cpp",
  "vendor": "customoai",
  "apiKey": "${input:chat.lm.secret.3c0c0f21}",
  "models": [
    {
      "id": "Qwen3.6-35B-A3B-UD-Q5_K_XL.gguf",
      "name": "Qwen3.6-35B",
      "url": "https://llm.home.arpa/v1/chat/completions",
      "toolCalling": true,
      "vision": false,
      "maxInputTokens": 180000,
      "maxOutputTokens": 10000,
      "family": "Qwen3",
      "inputTokenCost": 0.0001,
      "outputTokenCost": 0.0001,
      "temperature": 0.6,
      "top_p": 0.95,
      "top_k": 20,
      "repeat_penalty": 1,
      "presence_penalty": 0,
      "frequency_penalty": 0,
      "systemMessage": "Du bist ein präziser Code-Assistent. Vermeide es, Pläne zu wiederholen. Führe Aufgaben direkt aus. Wiederhole Absichten nicht mehrmals.",
      "timeout": 600000,
      "retry": { "enabled": true, "max_attempts": 2, "interval_ms": 1500 }
    }
  ]
}

Das Modell reagierte korrekt auf Tool-Calling-Anfragen und konnte somit als Copilot-Ersatz fungieren.

Ad

Realwelt-Test: Full-Stack-Generierung

Der Benutzer gab einen detaillierten Prompt (ursprünglich von ChatGPT) ein, der das Modell bat, einen "Bike Shop Service Tracker" zu erstellen – eine lokale React + TypeScript-App mit localStorage. Die Anforderungen umfassten ein Datenmodell, Seed-Daten, Filtern, Sortieren und Formularvalidierung. Das Modell generierte die gesamte Website beim ersten Durchlauf voll funktionsfähig.

Als Nächstes forderte es der Benutzer auf, eine vollständige Playwright-Testsuite zu generieren. Nur ein Test erforderte eine manuelle Korrektur – ansonsten lief die Suite fehlerfrei. Das Fazit des Benutzers: "Ich glaube, ich bin fertig mit dem Optimieren und Testen von Modellen (bis zum nächsten großen Release) und kann jetzt wieder programmieren."

Für wen es gedacht ist

Entwickler, die lokale LLMs zur Code-Unterstützung einsetzen, insbesondere solche mit AMD-GPUs (Vulkan), die eine Copilot-Alternative mit vergleichbarer Qualität suchen.

📖 Vollständige Quelle lesen: r/LocalLLaMA

Ad

👀 Siehe auch

Mia: Lokaler KI-Arbeitsbereich-Daemon mit nativer Android-App und P2P-Streaming
Werkzeuge

Mia: Lokaler KI-Arbeitsbereich-Daemon mit nativer Android-App und P2P-Streaming

Mia ist ein Daemon, der auf Ihrem Computer läuft und sich über P2P mit einer nativen Android-App verbindet, sodass Sie langlaufende KI-Codierungsaufgaben von Ihrem Handy aus starten und überwachen können. Er unterstützt OpenCode, Claude Code, Gemini CLI und Codex-Agenten und streamt die Ausgabe in Echtzeit direkt auf Ihr Gerät.

OpenClawRadar
Baton: Eine Desktop-Anwendung zur Verwaltung mehrerer KI-Codierungsagenten
Werkzeuge

Baton: Eine Desktop-Anwendung zur Verwaltung mehrerer KI-Codierungsagenten

Baton ist eine Desktop-Anwendung, die Entwicklern hilft, mehrere KI-Coding-Agenten über isolierte Arbeitsbereiche hinweg zu verwalten. Sie bietet echte Terminal-Sitzungen, Git-Worktree-Isolierung und Statusüberwachung für Agenten wie Claude Code, Codex CLI, OpenCode und Gemini CLI.

OpenClawRadar
Benchmark zeigt: CLI-Tool reduziert Claude-Code-Token-Kosten um 32 % durch strukturelle Navigation
Werkzeuge

Benchmark zeigt: CLI-Tool reduziert Claude-Code-Token-Kosten um 32 % durch strukturelle Navigation

Ein Entwickler hat ein Rust-CLI-Tool erstellt, das Claude-Code-Agenten strukturelle Navigationsbefehle wie 'zeige mir eine 180-Token-Zusammenfassung dieser 6.000-Token-Klasse' ermöglicht. Benchmarks mit Sonnet 4.6 über 54 automatisierte Durchläufe zeigten 32 % niedrigere Kosten pro Aufgabe und 67 % mehr Codeänderungen pro Sitzung.

OpenClawRadar
MCP-Server verbindet Claude mit Room EQ Wizard für Studioakustikanalyse
Werkzeuge

MCP-Server verbindet Claude mit Room EQ Wizard für Studioakustikanalyse

Ein Open-Source-MCP-Server gibt Claude AI die Kontrolle über Room EQ Wizard und ermöglicht so die automatisierte Kalibrierung von Studiomonitoren und die Analyse der Raumakustik. Das Tool umfasst 27 MCP-Tools für Messsteuerung, Signalgenerierung, Schalldruckpegelmessung und EQ-Verwaltung.

OpenClawRadar