Qwen3.6 27B und 35B auf 6GB VRAM mit ik_llama ausführen: Praktische Konfigurationen und Benchmarks

Ein Reddit-Nutzer berichtet, dass er die Modelle Qwen3.6 27B und 35B A3B erfolgreich auf einem alten Gaming-Laptop mit RTX 2060 Mobile (6 GB VRAM) und 32 GB RAM mit ik_llama und llama.cpp ausgeführt hat. Zu den wichtigsten Optimierungen gehören doppeltes spekulatives Decoding mit MTP und ngram, --fit und --mtp-requantize-output-tensor sowie das Neuverpacken des Ausgabetensors. Nachfolgend die genauen Konfigurationen und beobachteten Geschwindigkeiten.
Konfiguration für Qwen3.6 27B (Q3_K_XL)
export GGML_CUDA_GRAPHS=1
./llama-server \
-m /mnt/second-ssd/lib/llama.cpp/models/Qwen3.6-27B-MTP-UD-Q3_K_XL.gguf \
-c 16000 \
-b 512 -ub 512 \
--fit --fit-margin 3076 \
-fa on \
-np 1 \
-ctk q4_0 -ctv q4_0 \
--mtp-requantize-output-tensor q4_0 \
-khad -vhad -rtr \
--threads 6 --threads-batch 8 \
--slot-save-path ./slots \
--prompt-cache "prompt.cache" \
--port 8888 --host 0.0.0.0 \
--spec-stage ngram-mod:n_max=64,n_min=2,spec-ngram-size-n=16 \
--spec-stage mtp:n_max=1,draft-p-min=0.0 \
--temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.0 \
--jinja \
--chat-template-kwargs '{"preserve_thinking": true}' \
--reasoning on
Konfiguration für Qwen3.6 35B A3B (IQ4_XS, Claude Opus Distill)
export GGML_CUDA_GRAPHS=1
./llama-server \
-m /mnt/second-ssd/lib/llama.cpp/models/lordx64-Claude-4.7-Opus-Reasoning-Distilled-Qwen3.6-35B-A3B-MTP-IQ4_XS.gguf \
-c 80000 \
-b 1024 -ub 1024 \
--fit --fit-margin 2048 \
-fa on \
-np 1 \
-ctk q8_0 -ctv q4_0 \
--mtp-requantize-output-tensor q4_0 \
-khad -vhad -rtr \
--threads 6 --threads-batch 8 \
--slot-save-path ./slots \
--prompt-cache "prompt.cache" \
--mlock --no-mmap \
--port 8888 --host 0.0.0.0 \
--spec-stage ngram-mod:n_max=64,n_min=2,spec-ngram-size-n=16 \
--spec-stage mtp:n_max=3,draft-p-min=0.0 \
--temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.0 \
--jinja \
--chat-template-kwargs '{"preserve_thinking": true}' \
--reasoning on
Leistungszahlen
- 27B: Prefill ~100 t/s, erstes Token bis zu 4 t/s, ~1 t/s bei 10k Kontext
- 35B A3B: Prefill ~40 t/s, erstes Token bis zu 15 t/s, konstant ~11 t/s bei 10k Kontext
Der Nutzer merkt an, dass die 27B-Version für Überlegungen zu Dateien mit bis zu 1000 Zeilen nutzbar wurde (dauert Minuten, aber nützlich), und der 35B-Opus-Distill läuft mit einer stabilen Ausgabe von 11 t/s. Er verwendet es zur Generierung von Mermaid-Diagrammen, Bildern, Markdown und PDFs mit Little-Coder- oder agentischen Codierungs-Workflows.
📖 Vollständige Quelle lesen: r/LocalLLaMA
👀 Siehe auch

Anleitung: GitHub Copilot mit lokalem LLM unter Windows über Lemonade Server ausführen
Ein Entwickler hat eine Anleitung erstellt, um GitHub Copilot für die Verwendung eines lokalen großen Sprachmodells (LLM) auf einem Framework Desktop unter Windows einzurichten, da es keine einfachen Anweisungen für diese Konfiguration gab.

"CludeCode mit Webanwendungen für automatisierte Interaktion verbinden"
Erforschen Sie, wie CludeCode verwendet werden kann, um automatisch mit Webanwendungen zu interagieren, indem KI-Tools wie Browser und Scraping-Hilfsprogramme genutzt werden.

Gewährung von M365-Zugriff für Claude via Power Automate und einen FastMCP-Server
Ein Entwickler hat einen leichten MCP-Server erstellt, der Claude die Interaktion mit Microsoft 365 (Posteingang, Kalender, OneDrive, Planner, Excel, Word) über Power Automate Webhooks ermöglicht – ohne Admin-Graph-Berechtigungen.

Wie kleine Modellbewertungs-Prompts in die Irre führen können und wie man sie korrigiert
Ein Reddit-Beitrag erklärt, dass Evaluierungsaufforderungen für kleine Modelle oft irreführende Ergebnisse liefern, weil sie die falschen kognitiven Pfade in Transformern aktivieren. Dabei werden drei verschiedene Modi identifiziert: Faktenabruf, Anwendung/Befolgung von Anweisungen und emotionale/empathische Schlussfolgerung.