Qwen3.6 27B und 35B auf 6GB VRAM mit ik_llama ausführen: Praktische Konfigurationen und Benchmarks

✍️ OpenClawRadar📅 Veröffentlicht: 17. Mai 2026🔗 Source
Qwen3.6 27B und 35B auf 6GB VRAM mit ik_llama ausführen: Praktische Konfigurationen und Benchmarks
Ad

Ein Reddit-Nutzer berichtet, dass er die Modelle Qwen3.6 27B und 35B A3B erfolgreich auf einem alten Gaming-Laptop mit RTX 2060 Mobile (6 GB VRAM) und 32 GB RAM mit ik_llama und llama.cpp ausgeführt hat. Zu den wichtigsten Optimierungen gehören doppeltes spekulatives Decoding mit MTP und ngram, --fit und --mtp-requantize-output-tensor sowie das Neuverpacken des Ausgabetensors. Nachfolgend die genauen Konfigurationen und beobachteten Geschwindigkeiten.

Konfiguration für Qwen3.6 27B (Q3_K_XL)

export GGML_CUDA_GRAPHS=1
./llama-server \
  -m /mnt/second-ssd/lib/llama.cpp/models/Qwen3.6-27B-MTP-UD-Q3_K_XL.gguf \
  -c 16000 \
  -b 512 -ub 512 \
  --fit --fit-margin 3076 \
  -fa on \
  -np 1 \
  -ctk q4_0 -ctv q4_0 \
  --mtp-requantize-output-tensor q4_0 \
  -khad -vhad -rtr \
  --threads 6 --threads-batch 8 \
  --slot-save-path ./slots \
  --prompt-cache "prompt.cache" \
  --port 8888 --host 0.0.0.0 \
  --spec-stage ngram-mod:n_max=64,n_min=2,spec-ngram-size-n=16 \
  --spec-stage mtp:n_max=1,draft-p-min=0.0 \
  --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.0 \
  --jinja \
  --chat-template-kwargs '{"preserve_thinking": true}' \
  --reasoning on
Ad

Konfiguration für Qwen3.6 35B A3B (IQ4_XS, Claude Opus Distill)

export GGML_CUDA_GRAPHS=1
./llama-server \
  -m /mnt/second-ssd/lib/llama.cpp/models/lordx64-Claude-4.7-Opus-Reasoning-Distilled-Qwen3.6-35B-A3B-MTP-IQ4_XS.gguf \
  -c 80000 \
  -b 1024 -ub 1024 \
  --fit --fit-margin 2048 \
  -fa on \
  -np 1 \
  -ctk q8_0 -ctv q4_0 \
  --mtp-requantize-output-tensor q4_0 \
  -khad -vhad -rtr \
  --threads 6 --threads-batch 8 \
  --slot-save-path ./slots \
  --prompt-cache "prompt.cache" \
  --mlock --no-mmap \
  --port 8888 --host 0.0.0.0 \
  --spec-stage ngram-mod:n_max=64,n_min=2,spec-ngram-size-n=16 \
  --spec-stage mtp:n_max=3,draft-p-min=0.0 \
  --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.0 \
  --jinja \
  --chat-template-kwargs '{"preserve_thinking": true}' \
  --reasoning on

Leistungszahlen

  • 27B: Prefill ~100 t/s, erstes Token bis zu 4 t/s, ~1 t/s bei 10k Kontext
  • 35B A3B: Prefill ~40 t/s, erstes Token bis zu 15 t/s, konstant ~11 t/s bei 10k Kontext

Der Nutzer merkt an, dass die 27B-Version für Überlegungen zu Dateien mit bis zu 1000 Zeilen nutzbar wurde (dauert Minuten, aber nützlich), und der 35B-Opus-Distill läuft mit einer stabilen Ausgabe von 11 t/s. Er verwendet es zur Generierung von Mermaid-Diagrammen, Bildern, Markdown und PDFs mit Little-Coder- oder agentischen Codierungs-Workflows.

📖 Vollständige Quelle lesen: r/LocalLLaMA

Ad

👀 Siehe auch

Maximierung des Werts in Claude-Code-Sitzungen: Tipps zur Token-Effizienz
Anleitungen

Maximierung des Werts in Claude-Code-Sitzungen: Tipps zur Token-Effizienz

Lernen Sie praktische Strategien zur Token-Einsparung für Claude Code, einschließlich /clear und @-erwähnten Dateien, aus dem offiziellen Leitfaden von Anthropic.

OpenClawRadar
OpenClaw-Einrichtungscheckliste: Sechs entscheidende Schritte für neue Benutzer
Anleitungen

OpenClaw-Einrichtungscheckliste: Sechs entscheidende Schritte für neue Benutzer

Ein Reddit-Beitrag beschreibt sechs wesentliche Konfigurationsschritte für OpenClaw-Nutzer: Wechseln Sie das Standardmodell von Opus zu Sonnet, um Kosten zu senken, sperren Sie den Gateway-Host auf 127.0.0.1 für mehr Sicherheit, erstellen Sie eine SOUL.md für die Agenten-Persönlichkeit, vermeiden Sie zunächst die Installation von Skills, erstellen Sie nicht mehrere Agenten und verwenden Sie den /new-Befehl, um den Konversationskontext zu verwalten.

OpenClawRadar
So beheben Sie OpenClaw-Antwortzeiten durch Reduzierung von Kontextüberladung
Anleitungen

So beheben Sie OpenClaw-Antwortzeiten durch Reduzierung von Kontextüberladung

Ein Entwickler löste 10-minütige Antwortzeiten in OpenClaw, indem er die injizierten Workspace-Dateien durch Dateiumstrukturierung und Konfigurationsänderungen von 47.000 Zeichen auf 16.000 Zeichen reduzierte, einschließlich der Einstellung von bootstrapMaxChars auf 8000 und dem Hinzufügen von Komprimierungssicherungen.

OpenClawRadar
Behebung von OpenClaw-Prompt-Bloat und langsamen Antwortschleifen
Anleitungen

Behebung von OpenClaw-Prompt-Bloat und langsamen Antwortschleifen

Benutzer, die seit 2026.4.26 lange Verzögerungen erleben, können die Leistung durch Reduzierung von Kontextblähung wiederherstellen: Kürzen Sie stets eingefügte Dateien, beschränken Sie sichtbare Fähigkeiten und vermeiden Sie das Einfügen riesiger Tool-Ausgaben im Hauptchat.

OpenClawRadar