Qwen 3.5 35B läuft mit 8 GB VRAM und llama.cpp-Konfiguration

✍️ OpenClawRadar📅 Veröffentlicht: 27. März 2026🔗 Source
Qwen 3.5 35B läuft mit 8 GB VRAM und llama.cpp-Konfiguration
Ad

Lokales Qwen 3.5 35B-Setup mit begrenztem VRAM

Ein Entwickler auf r/LocalLLaMA beschrieb seine Konfiguration für den lokalen Betrieb des Qwen 3.5 35B-Modells auf Hardware mit 8 GB VRAM. Er wechselte von der Nutzung von Antigravity (mit einem Google AI Pro-Plan) zu lokalen LLMs, nachdem er an Grenzen des Cloud-Dienstes gestoßen war.

Hardware- und Modellspezifikationen

Das Setup verwendet einen Lenovo Legion-Laptop mit einem i9-14900HX-Prozessor (mit im BIOS deaktivierten E-Kernen, 32 GB DDR5-RAM) und einer RTX 4060m-Grafikkarte mit 8 GB VRAM. Das spezifische Modell ist Qwen 3.5 35B A3B Heretic Opus (Q4_K_M GGUF).

Leistung und llama.cpp-Konfiguration

Der Entwickler berichtet, mit diesem Setup etwa 700 Token pro Sekunde bei der Prompt-Verarbeitung und 42 Token pro Sekunde bei der Token-Generierung zu erreichen. Er teilte seine llama.cpp-Kommandozeilenargumente nach Tests mit:

-ngl 99 ^
--n-cpu-moe 40 ^
-c 192000 ^
-t 12 ^
-tb 16 ^
-b 4096 ^
--ubatch-size 2048 ^
--flash-attn on ^
--cache-type-k q8_0 ^
--cache-type-v q8_0 ^
--mlock
Ad

Workflow-Integration

Für seinen agentenbasierten Workflow fand er Cline in VSCode als die nächstgelegene Alternative zu Antigravity. Er verwendet kat-coder-pro für den Plan-Modus und qwen3.5 für den Act-Modus in diesem Setup. Der Entwickler sucht Feedback dazu, ob diese lokale Konfiguration besser ist als das Verbleiben bei Google Gemini 3 Flash in Antigravity, und merkt an, dass ihm ein reibungsloser Workflow wichtiger ist als Datenschutzbedenken.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Wissens-Rabe: Eine modellunabhängige Wissensbasis-Plattform, erstellt mit Claude Code
Werkzeuge

Wissens-Rabe: Eine modellunabhängige Wissensbasis-Plattform, erstellt mit Claude Code

Knowledge Raven ist eine Wissensbasis-Plattform, die es jedem MCP-kompatiblen LLM ermöglicht, Unternehmensdokumente zu durchsuchen und zu zitieren. Die gesamte Plattform wurde von einem Einzelgründer mit Claude Code entwickelt und verfügt über ein Python/FastAPI-Backend, eine MCP-Tool-Schicht und eine agentenbasierte RAG-Pipeline.

OpenClawRadar
Vier Claude-Code-Hooks sorgen für einheitliche Stimme und Tonalität in KI-geschriebenen Texten
Werkzeuge

Vier Claude-Code-Hooks sorgen für einheitliche Stimme und Tonalität in KI-geschriebenen Texten

Ein Entwickler hat ein System mit vier Claude Code Hooks implementiert, um zu verhindern, dass KI-generierte Texte vom Markenauftritt abweichen. Das System blockiert die Bearbeitung von Textdateien (.tsx, .md), bis ein Prüfungsagent den Inhalt anhand einer VOICE-AND-TONE.md-Anleitung validiert.

OpenClawRadar
Claw Voice Feature fügt 11Labs API-Unterstützung mit CarPlay-Integration hinzu
Werkzeuge

Claw Voice Feature fügt 11Labs API-Unterstützung mit CarPlay-Integration hinzu

Claw Voice integriert sich in CarPlay und ermöglicht benutzerdefinierte Stimmen über die 11Labs API, sodass Sie während der Fahrt natürliche, fließende Gespräche mit Ihrem Agenten führen können.

OpenClawRadar
Google Research stellt TurboQuant zur Komprimierung von KI-Modellen vor
Werkzeuge

Google Research stellt TurboQuant zur Komprimierung von KI-Modellen vor

Google Research hat TurboQuant eingeführt, einen Komprimierungsalgorithmus, der die Größe von KI-Modellen ohne Genauigkeitsverlust reduziert. Er behebt den Speichermehraufwand bei der Vektorquantisierung und verbessert die Leistung des Key-Value-Caches.

OpenClawRadar