Qwen 3.5 122B MoE mit 35 t/s auf einer einzelnen 3090 mit ik_llama.cpp MTP

✍️ OpenClawRadar📅 Veröffentlicht: 6. Juni 2026🔗 Source
Qwen 3.5 122B MoE mit 35 t/s auf einer einzelnen 3090 mit ik_llama.cpp MTP
Ad

Ein Entwickler, der einen vollständig lokalen Inferenz-Stack auf einem einzelnen Desktop betreibt, berichtet von 35 Tokens/s auf Qwen 3.5 122B MoE mit nur einer 3090 – der Schlüssel ist ein Fork von llama.cpp, der MTP (Multi-Token Prediction) für ausgelagerte Experten repariert.

Hardware-Konfiguration

  • AMD 9900X CPU
  • 192 GB DDR5-5200 RAM („die Geheimwaffe“)
  • Zwei 3090er (Ti + Standard), ohne NVLink

Karte 1 betreibt den Worker: Qwen3.5-122B-A10B mit Unsloth IQ3_S MTP GGUF und 204K Kontext. 75 % der Expertenlayer werden über chirurgische -ot-Flags zur CPU ausgelagert. Karte 2 betreibt den Reasoner: Qwen3.6-35B-A3B Q4_K_XL mit MTP bei 135 t/s und 262K Kontext.

Zusätzliche CPU-Instanzen übernehmen Hintergrundprozesse: Dialectic (35B heretic Q8), Scribe-Logos (Gemma4 19B), Moonshot (Gemma4 2B) – insgesamt ~19 GB RAM.

Ad

Die ik_llama.cpp-Erkenntnis

Standard-llama.cpps MTP evaluiert die Experten jedes spekulierten Tokens sequenziell über DDR5, was bei Reasoning-Inhalten die Leistung sogar verschlechtert – der Overhead der Vorhersage überwiegt die Beschleunigung durch Akzeptanz. Der ik-Fork implementiert fusionierte MoE-Operationen, die Experten-Lesevorgänge für spekulierte Tokens bündeln und MTP von einer +4%-Steigerung auf +20% heben. Der Entwickler berichtet von 35 t/s Dekodierung auf einem 122B-Modell mit einer einzigen 3090 unter Verwendung dieses Forks.

Wenn Sie Experten auf einem beliebigen MoE-Modell in den RAM auslagern, probieren Sie ik_llama.cpp, bevor Sie MTP aufgeben.

Gesamtkosten des Builds

  • ~1600 $ für RAM
  • ~1600 $ für zwei 3090er
  • ~400 $ für alles andere
  • Laufende Kosten: nur Strom

📖 Lesen Sie die vollständige Quelle: r/openclaw

Ad

👀 Siehe auch

Praktische Ratschläge zur Multi-Agenten-Systemarchitektur aus Erfahrung
Anleitungen

Praktische Ratschläge zur Multi-Agenten-Systemarchitektur aus Erfahrung

Ein Entwickler teilt fünf spezifische Muster für den Aufbau von Multi-Agenten-KI-Systemen basierend auf Erfahrungen mit einem täglich laufenden 7-Agenten-System: mit einem Agenten beginnen, das Orchestrator-Muster verwenden, gemeinsamen Speicher mit JSON-Dateien implementieren, Modelle nach Aufgabe routen und Bestätigungsschleifen hinzufügen.

OpenClawRadar
Aufbau eines lokalen Finanzdaten- und persönlichen KI-Systems auf dem Mac Studio
Anleitungen

Aufbau eines lokalen Finanzdaten- und persönlichen KI-Systems auf dem Mac Studio

Ein Entwickler berichtet über den Bau einer vollständig lokalisierten Finanzdatenverarbeitung und persönlichen KI-Assistenten auf einem Mac Studio, einschließlich Architekturentscheidungen, Speicheraufteilung, Cron-Orchestrierung und Ersteinrichtungsoptimierungen.

OpenClawRadar
Systemarchitektur für Vibe-Coder: Ein Leitfaden für Senior Engineer
Anleitungen

Systemarchitektur für Vibe-Coder: Ein Leitfaden für Senior Engineer

Ein 10-jähriger Ingenieur zeigt, wie man App-Entwicklung mit Claude Code angeht: Start auf Systemebene, nicht auf Code-Ebene. Behandelt die vier Komponenten – Frontend, Backend, Datenbank, Infrastruktur – mit einem tiefen Einblick in die Infrastruktur: APIs, Hosting, Deployment, Secrets und Sicherheit.

OpenClawRadar
Open-Source-Launch-Playbook für OSS-LLM- und lokale KI-Projekte
Anleitungen

Open-Source-Launch-Playbook für OSS-LLM- und lokale KI-Projekte

Ein Open-Source-Playbook befasst sich mit Auffindbarkeitsproblemen für LLM- und lokale KI-Projekte, indem es strukturierte Anleitungen für die Vorbereitung vor dem Start, die Umsetzung am Starttag und die Nachbereitung nach dem Start bietet. Es enthält Vorlagen und Strategien für Community-Verteilung, Kontaktaufnahme mit Erstellern und SEO-Optimierung.

OpenClawRadar