Qwen 3.5 122B MoE mit 35 t/s auf einer einzelnen 3090 mit ik_llama.cpp MTP

Ein Entwickler, der einen vollständig lokalen Inferenz-Stack auf einem einzelnen Desktop betreibt, berichtet von 35 Tokens/s auf Qwen 3.5 122B MoE mit nur einer 3090 – der Schlüssel ist ein Fork von llama.cpp, der MTP (Multi-Token Prediction) für ausgelagerte Experten repariert.
Hardware-Konfiguration
- AMD 9900X CPU
- 192 GB DDR5-5200 RAM („die Geheimwaffe“)
- Zwei 3090er (Ti + Standard), ohne NVLink
Karte 1 betreibt den Worker: Qwen3.5-122B-A10B mit Unsloth IQ3_S MTP GGUF und 204K Kontext. 75 % der Expertenlayer werden über chirurgische -ot-Flags zur CPU ausgelagert. Karte 2 betreibt den Reasoner: Qwen3.6-35B-A3B Q4_K_XL mit MTP bei 135 t/s und 262K Kontext.
Zusätzliche CPU-Instanzen übernehmen Hintergrundprozesse: Dialectic (35B heretic Q8), Scribe-Logos (Gemma4 19B), Moonshot (Gemma4 2B) – insgesamt ~19 GB RAM.
Die ik_llama.cpp-Erkenntnis
Standard-llama.cpps MTP evaluiert die Experten jedes spekulierten Tokens sequenziell über DDR5, was bei Reasoning-Inhalten die Leistung sogar verschlechtert – der Overhead der Vorhersage überwiegt die Beschleunigung durch Akzeptanz. Der ik-Fork implementiert fusionierte MoE-Operationen, die Experten-Lesevorgänge für spekulierte Tokens bündeln und MTP von einer +4%-Steigerung auf +20% heben. Der Entwickler berichtet von 35 t/s Dekodierung auf einem 122B-Modell mit einer einzigen 3090 unter Verwendung dieses Forks.
Wenn Sie Experten auf einem beliebigen MoE-Modell in den RAM auslagern, probieren Sie ik_llama.cpp, bevor Sie MTP aufgeben.
Gesamtkosten des Builds
- ~1600 $ für RAM
- ~1600 $ für zwei 3090er
- ~400 $ für alles andere
- Laufende Kosten: nur Strom
📖 Lesen Sie die vollständige Quelle: r/openclaw
👀 Siehe auch

Behebung von Autonomieproblemen des OpenClaw-Agenten: Skill-Dateien, Tool-Auswahl und Cron-Einrichtung
Ein Entwickler teilt Lösungen für OpenClaw-Agenten, die nach der Erstkonfiguration nicht mehr autonom arbeiten. Wichtige Korrekturen umfassen die Verwendung externer Skill-Dateien anstatt Chat-Anweisungen, den Ersatz von Browser-Tools durch API-basierte Tools oder Puppeteer-Skripte sowie die korrekte Konfiguration von Cron-Jobs.

Fehlerjagd: WireGuard-Abstürze und MTU-Konflikt in GKE
Lovable-Ingenieure haben Benutzerfehler auf anetd-Abstürze aufgrund einer Concurrent-Map-Access-Panik in Googles WireGuard-Integration zurückgeführt und anschließend nach Deaktivierung der Verschlüsselung einen sekundären MTU-Konflikt entdeckt.

Lokales Ausführen von OmniCoder-9B mit llama.cpp-Konfigurationsdetails
Ein Entwickler erzielte einen durchschnittlichen HumanEval-Score von 96,7 % mit OmniCoder-9B auf Mittelklasse-Hardware unter Verwendung spezifischer llama.cpp-Flags, einschließlich --reasoning-budget 0, um die Kettenfolge-Ausgabe zu deaktivieren. Das Setup verwendete ein Q6_K-quantisiertes Modell, das auf einer RTX 3080 mit 10 GB VRAM lief.

Zwei erforderliche Korrekturen für "write_file nicht gefunden" in Gemini CLI in OpenClaw
OpenClaw-Agenten, die google-gemini-cli verwenden, können keine Dateien schreiben (write_file / default_api_write_file fehlt) aufgrund eines falschen tools.profile und fehlendem --approval-mode auto_edit-Flag im Unterprozess. Fix: Setzen Sie das Profil auf full und injizieren Sie das Flag über die cliBackends-Konfiguration.