Optimierung von Qwen 3.6 27B/35B auf RTX 3090: Flags, Quantisierung und Auto-Routing

Ein Entwickler, der Qwen 3.6-Modelle lokal auf einer RTX 3090 (24 GB VRAM), Ryzen 5700X, 64 GB RAM, Windows 11 betreibt, stößt auf Leistungs- und Zuverlässigkeitsprobleme. Er verwendet llama-server mit benutzerdefinierten Flags und sucht Rat zu Quantisierungsauswahl, Durchsatz und automatischer Modellweiterleitung.
Befehle und Quantisierungen
35B (UD Q4_K_M):
llama-server.exe -m "path\Qwen3.6-35B-A3B-UD-Q4_K_M.gguf" -ngl 99 -c 131072 -np 2 -fa on -ctk f16 -ctv f16 -b 2048 -ub 512 -t 8 --mlock -rea on --reasoning-budget 2048 --reasoning-format deepseek --jinja --metrics --slots --port 8081 --host 0.0.0.027B (UD Q4_K_XL):
llama-server.exe -m "path\Qwen3.6-27B-UD-Q4_K_XL.gguf" -ngl 99 -c 196608 -np 1 -fa on -ctk q8_0 -ctv q8_0 -b 2048 -ub 512 -t 8 --no-mmap -rea on --reasoning-budget -1 --reasoning-format deepseek --jinja --metrics --slots --port 8081 --host 0.0.0.0Gemeldete Probleme
- 35B zu langsam – selbst einfache iterative Aufgaben fühlen sich unbenutzbar an.
- 27B schneller, aber unzuverlässig – Codeausgabe bricht ab; einfache Aufgaben können 20–30 Minuten dauern.
- Manuelles Modellwechseln – Server muss beendet, neuer Befehl eingefügt und Modell neu geladen werden.
Spezifische Fragen
- Sind die Flags suboptimal? (z. B. Kontextgröße, Batchgröße, Cache-Typ)
- Welche Quantisierung / welches Modell bietet die beste Balance zwischen Geschwindigkeit und Code-Genauigkeit bei 24 GB VRAM?
- Wie kann man Modelle pro Anfrage automatisch wechseln oder mehrere Modelle warm halten und weiterleiten?
Kontext
Der Benutzer betreibt den Hermes-Agenten auf einem Raspberry Pi 5 für Scraping und Automatisierung sowie lokales Coding mit OpenCode/QwenCode. Er möchte ein Setup, das keine manuellen Serverneustarts erfordert.
📖 Vollständige Quelle lesen: r/LocalLLaMA
👀 Siehe auch

12 GB VRAM Benchmarks: Ausführen von Qwen 3.6 und Gemma 4 Modellen auf einer RTX 4070 Super
Ein Reddit-Nutzer teilt detaillierte Geschwindigkeits-Benchmarks für Qwen3.6-35B-A3B, Qwen3.6-27B, Gemma 4 26B und Gemma 4 31B auf einer 12GB RTX 4070 Super mit llama.cpp und optimierten Einstellungen.

OpenClaw Workspace-Konfiguration: Erkenntnisse aus zwei Monaten Nutzung
Die Erfahrung eines Entwicklers mit OpenClaw zeigt, dass die Qualität des Arbeitsbereichs die Leistung des Agenten um das 5- bis 10-fache beeinflusst, mit spezifischen Anleitungen zu SOUL.md, AGENTS.md, MEMORY.md, USER.md und der Konfiguration von Fähigkeiten.

Mac Mini M4 Pro vs Mac Studio M4 Max für lokale LLM-Inferenz – Wichtige Überlegungen
Ein Entwickler vergleicht Mac Mini M4 Pro (12C CPU/16C GPU, 273 GB/s) mit Mac Studio M4 Max (16C CPU/40C GPU, 546 GB/s), beide 64GB/1TB, für lokale Inferenz mit Gemma 4 und Qwen. Kernfrage: Ist der Bandbreitensprung die 600 $ wert?

Zwei Telegram-Bots in einer Gruppe verbinden: Zustellungssemantik über HTTP
Ein Entwickler teilt einen praktischen Ansatz, um zwei unabhängige Telegram-Bots im selben Gruppenchat zu verbinden. Dabei werden die Lücken bei der Bot-zu-Bot-Zustellung von Telegram mit HTTP-Relays, ACKs, Deduplizierung und streng begrenzten Feeds überbrückt.