Qwen 3.5 35B läuft mit 8 GB VRAM und llama.cpp-Konfiguration

Lokales Qwen 3.5 35B-Setup mit begrenztem VRAM
Ein Entwickler auf r/LocalLLaMA beschrieb seine Konfiguration für den lokalen Betrieb des Qwen 3.5 35B-Modells auf Hardware mit 8 GB VRAM. Er wechselte von der Nutzung von Antigravity (mit einem Google AI Pro-Plan) zu lokalen LLMs, nachdem er an Grenzen des Cloud-Dienstes gestoßen war.
Hardware- und Modellspezifikationen
Das Setup verwendet einen Lenovo Legion-Laptop mit einem i9-14900HX-Prozessor (mit im BIOS deaktivierten E-Kernen, 32 GB DDR5-RAM) und einer RTX 4060m-Grafikkarte mit 8 GB VRAM. Das spezifische Modell ist Qwen 3.5 35B A3B Heretic Opus (Q4_K_M GGUF).
Leistung und llama.cpp-Konfiguration
Der Entwickler berichtet, mit diesem Setup etwa 700 Token pro Sekunde bei der Prompt-Verarbeitung und 42 Token pro Sekunde bei der Token-Generierung zu erreichen. Er teilte seine llama.cpp-Kommandozeilenargumente nach Tests mit:
-ngl 99 ^ --n-cpu-moe 40 ^ -c 192000 ^ -t 12 ^ -tb 16 ^ -b 4096 ^ --ubatch-size 2048 ^ --flash-attn on ^ --cache-type-k q8_0 ^ --cache-type-v q8_0 ^ --mlock
Workflow-Integration
Für seinen agentenbasierten Workflow fand er Cline in VSCode als die nächstgelegene Alternative zu Antigravity. Er verwendet kat-coder-pro für den Plan-Modus und qwen3.5 für den Act-Modus in diesem Setup. Der Entwickler sucht Feedback dazu, ob diese lokale Konfiguration besser ist als das Verbleiben bei Google Gemini 3 Flash in Antigravity, und merkt an, dass ihm ein reibungsloser Workflow wichtiger ist als Datenschutzbedenken.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Wissens-Rabe: Eine modellunabhängige Wissensbasis-Plattform, erstellt mit Claude Code
Knowledge Raven ist eine Wissensbasis-Plattform, die es jedem MCP-kompatiblen LLM ermöglicht, Unternehmensdokumente zu durchsuchen und zu zitieren. Die gesamte Plattform wurde von einem Einzelgründer mit Claude Code entwickelt und verfügt über ein Python/FastAPI-Backend, eine MCP-Tool-Schicht und eine agentenbasierte RAG-Pipeline.

Vier Claude-Code-Hooks sorgen für einheitliche Stimme und Tonalität in KI-geschriebenen Texten
Ein Entwickler hat ein System mit vier Claude Code Hooks implementiert, um zu verhindern, dass KI-generierte Texte vom Markenauftritt abweichen. Das System blockiert die Bearbeitung von Textdateien (.tsx, .md), bis ein Prüfungsagent den Inhalt anhand einer VOICE-AND-TONE.md-Anleitung validiert.

Claw Voice Feature fügt 11Labs API-Unterstützung mit CarPlay-Integration hinzu
Claw Voice integriert sich in CarPlay und ermöglicht benutzerdefinierte Stimmen über die 11Labs API, sodass Sie während der Fahrt natürliche, fließende Gespräche mit Ihrem Agenten führen können.

Google Research stellt TurboQuant zur Komprimierung von KI-Modellen vor
Google Research hat TurboQuant eingeführt, einen Komprimierungsalgorithmus, der die Größe von KI-Modellen ohne Genauigkeitsverlust reduziert. Er behebt den Speichermehraufwand bei der Vektorquantisierung und verbessert die Leistung des Key-Value-Caches.