Qwen 3.5 35B läuft mit 8 GB VRAM und llama.cpp-Konfiguration

Lokales Qwen 3.5 35B-Setup mit begrenztem VRAM
Ein Entwickler auf r/LocalLLaMA beschrieb seine Konfiguration für den lokalen Betrieb des Qwen 3.5 35B-Modells auf Hardware mit 8 GB VRAM. Er wechselte von der Nutzung von Antigravity (mit einem Google AI Pro-Plan) zu lokalen LLMs, nachdem er an Grenzen des Cloud-Dienstes gestoßen war.
Hardware- und Modellspezifikationen
Das Setup verwendet einen Lenovo Legion-Laptop mit einem i9-14900HX-Prozessor (mit im BIOS deaktivierten E-Kernen, 32 GB DDR5-RAM) und einer RTX 4060m-Grafikkarte mit 8 GB VRAM. Das spezifische Modell ist Qwen 3.5 35B A3B Heretic Opus (Q4_K_M GGUF).
Leistung und llama.cpp-Konfiguration
Der Entwickler berichtet, mit diesem Setup etwa 700 Token pro Sekunde bei der Prompt-Verarbeitung und 42 Token pro Sekunde bei der Token-Generierung zu erreichen. Er teilte seine llama.cpp-Kommandozeilenargumente nach Tests mit:
-ngl 99 ^ --n-cpu-moe 40 ^ -c 192000 ^ -t 12 ^ -tb 16 ^ -b 4096 ^ --ubatch-size 2048 ^ --flash-attn on ^ --cache-type-k q8_0 ^ --cache-type-v q8_0 ^ --mlock
Workflow-Integration
Für seinen agentenbasierten Workflow fand er Cline in VSCode als die nächstgelegene Alternative zu Antigravity. Er verwendet kat-coder-pro für den Plan-Modus und qwen3.5 für den Act-Modus in diesem Setup. Der Entwickler sucht Feedback dazu, ob diese lokale Konfiguration besser ist als das Verbleiben bei Google Gemini 3 Flash in Antigravity, und merkt an, dass ihm ein reibungsloser Workflow wichtiger ist als Datenschutzbedenken.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

TEMM1E v3.1.0: KI-Agent, der sich selbst durch Benutzerinteraktionen feinabstimmt
TEMM1E v3.1.0 führt Eigen-Tune ein, ein System, das LLM-Interaktionen als Trainingsdaten erfasst, die Qualität aus Nutzerverhalten bewertet und lokale Modelle via LoRA feinabstimmt – ohne zusätzliche LLM-Kosten. Getestet auf Apple M2 korrigierte es Temperaturumrechnungen von 72°F = '150°C' auf '21,2°C' nach 10 Konversationen.

ETL-D MCP-Server: Deterministisches CSV-Parsing für Claude zur Vermeidung finanzieller Halluzinationen
Ein Entwickler hat ETL-D erstellt, einen Open-Source-MCP-Server für Claude Desktop, der CSVs in drei deterministischen Schichten verarbeitet, um Halluzinationen von Dezimalpunkten in Finanzdaten zu verhindern. Er verwendet Python-Parser für bekannte Formate, erreicht ~70ms Antwortzeiten mit 0 LLM-Aufrufen für 200 parallele Anfragen und nutzt LLMs nur als Fallback für hochgradig unvorhersehbaren Text.

Portables Ingenieursystem für Claude Code mit Hooks, spezialisierten Agenten und Selbstverbesserung
Ein Entwickler baute ein portables Engineering-System, das in ~/.claude/ lebt und automatisch auf jedes Projekt angewendet wird. Es umfasst eine 650-zeilige Verfassung, deterministische Hooks, die gefährliche Befehle blockieren, drei spezialisierte Agenten und einen sich selbst verbessernden Compound-Engineering-Ansatz.

Open-Source Claude IDE Bridge verbindet Dispatch, Desktop-App und Claude Code
Die claude-ide-bridge ist ein unter der MIT-Lizenz stehendes Open-Source-Tool, das Claude Code mit Ihrer IDE verbindet und Zugriff auf LSP, Debugger, Terminals, Git und GitHub über 124 Tools bietet. Es ermöglicht einen Workflow, bei dem Aufgaben, die per Dispatch von einem Telefon gesendet werden, von der Claude-Desktop-App verarbeitet werden, die Claude Code zum Schreiben von Code und Ausführen von Tests verwendet, während sie mit der IDE interagiert.