Qwen 3.5 122B MoE mit 35 t/s auf einer einzelnen 3090 mit ik_llama.cpp MTP

Ein Entwickler, der einen vollständig lokalen Inferenz-Stack auf einem einzelnen Desktop betreibt, berichtet von 35 Tokens/s auf Qwen 3.5 122B MoE mit nur einer 3090 – der Schlüssel ist ein Fork von llama.cpp, der MTP (Multi-Token Prediction) für ausgelagerte Experten repariert.
Hardware-Konfiguration
- AMD 9900X CPU
- 192 GB DDR5-5200 RAM („die Geheimwaffe“)
- Zwei 3090er (Ti + Standard), ohne NVLink
Karte 1 betreibt den Worker: Qwen3.5-122B-A10B mit Unsloth IQ3_S MTP GGUF und 204K Kontext. 75 % der Expertenlayer werden über chirurgische -ot-Flags zur CPU ausgelagert. Karte 2 betreibt den Reasoner: Qwen3.6-35B-A3B Q4_K_XL mit MTP bei 135 t/s und 262K Kontext.
Zusätzliche CPU-Instanzen übernehmen Hintergrundprozesse: Dialectic (35B heretic Q8), Scribe-Logos (Gemma4 19B), Moonshot (Gemma4 2B) – insgesamt ~19 GB RAM.
Die ik_llama.cpp-Erkenntnis
Standard-llama.cpps MTP evaluiert die Experten jedes spekulierten Tokens sequenziell über DDR5, was bei Reasoning-Inhalten die Leistung sogar verschlechtert – der Overhead der Vorhersage überwiegt die Beschleunigung durch Akzeptanz. Der ik-Fork implementiert fusionierte MoE-Operationen, die Experten-Lesevorgänge für spekulierte Tokens bündeln und MTP von einer +4%-Steigerung auf +20% heben. Der Entwickler berichtet von 35 t/s Dekodierung auf einem 122B-Modell mit einer einzigen 3090 unter Verwendung dieses Forks.
Wenn Sie Experten auf einem beliebigen MoE-Modell in den RAM auslagern, probieren Sie ik_llama.cpp, bevor Sie MTP aufgeben.
Gesamtkosten des Builds
- ~1600 $ für RAM
- ~1600 $ für zwei 3090er
- ~400 $ für alles andere
- Laufende Kosten: nur Strom
📖 Lesen Sie die vollständige Quelle: r/openclaw
👀 Siehe auch

Praktische Ratschläge zur Multi-Agenten-Systemarchitektur aus Erfahrung
Ein Entwickler teilt fünf spezifische Muster für den Aufbau von Multi-Agenten-KI-Systemen basierend auf Erfahrungen mit einem täglich laufenden 7-Agenten-System: mit einem Agenten beginnen, das Orchestrator-Muster verwenden, gemeinsamen Speicher mit JSON-Dateien implementieren, Modelle nach Aufgabe routen und Bestätigungsschleifen hinzufügen.

Aufbau eines lokalen Finanzdaten- und persönlichen KI-Systems auf dem Mac Studio
Ein Entwickler berichtet über den Bau einer vollständig lokalisierten Finanzdatenverarbeitung und persönlichen KI-Assistenten auf einem Mac Studio, einschließlich Architekturentscheidungen, Speicheraufteilung, Cron-Orchestrierung und Ersteinrichtungsoptimierungen.

Systemarchitektur für Vibe-Coder: Ein Leitfaden für Senior Engineer
Ein 10-jähriger Ingenieur zeigt, wie man App-Entwicklung mit Claude Code angeht: Start auf Systemebene, nicht auf Code-Ebene. Behandelt die vier Komponenten – Frontend, Backend, Datenbank, Infrastruktur – mit einem tiefen Einblick in die Infrastruktur: APIs, Hosting, Deployment, Secrets und Sicherheit.

Open-Source-Launch-Playbook für OSS-LLM- und lokale KI-Projekte
Ein Open-Source-Playbook befasst sich mit Auffindbarkeitsproblemen für LLM- und lokale KI-Projekte, indem es strukturierte Anleitungen für die Vorbereitung vor dem Start, die Umsetzung am Starttag und die Nachbereitung nach dem Start bietet. Es enthält Vorlagen und Strategien für Community-Verteilung, Kontaktaufnahme mit Erstellern und SEO-Optimierung.