FOMOE ermöglicht die Inferenz des 397B Qwen3.5-Modells auf Desktop-Hardware für 2.100 US-Dollar

✍️ OpenClawRadar📅 Veröffentlicht: 29. März 2026🔗 Source
FOMOE ermöglicht die Inferenz des 397B Qwen3.5-Modells auf Desktop-Hardware für 2.100 US-Dollar
Ad

Was FOMOE löst

Große Mixture-of-Experts-Modelle (MoE) benötigen Hunderte von Gigabyte an Gewichtsspeicher, typischerweise in Flash-Speicher wie NVMe. Während der Inferenz wird nur ein kleiner Teil der Gewichte benötigt, aber man kann nicht vorhersagen, welche dies im Voraus sein werden. Zufällige Zugriffsmuster machen Flash-Latenzen für praktische Inferenz auf Consumer-Hardware zu hoch.

Wie FOMOE funktioniert

Das System macht die meisten Expertengewicht-Lesevorgänge durch mehrere Techniken unnötig:

  • Speichert die häufigsten Experten im GPU-Speicher (VRAM) mit einem aktuellen rollierenden Experten-Cache
  • Erreicht eine VRAM-Trefferquote von 60 % mit Warmstart, wodurch NVMe-Lesevorgänge auf 28 % reduziert werden (12 % werden aus dem DRAM bedient)
  • Verwendet eine Dual-GPU-Ping-Pong-Architektur, um Gewichtsladen und Berechnung zu überlappen
  • Implementiert Cache-Aware Routing (CAR) – wenn zwei Experten ähnlich gut bewertet werden, wählt das Modell den nächstbesten bewerteten Experten, der sich bereits im VRAM- oder DRAM-Cache innerhalb eines akzeptablen Schwellenwerts befindet
Ad

Leistungsergebnisse

  • 5-9 Tokens/Sekunde Inferenzgeschwindigkeit für Qwen3.5s 397B-Parameter-Modell
  • NVMe-Lesevorgänge auf 7 % mit aktiviertem CAR reduziert
  • Nur 3,5 % Abfall der Perplexität, gemessen auf Wikitext
  • Hardwareanforderungen: zwei 500-Dollar-GPUs, 32 GB RAM, ein NVMe-Laufwerk
  • Verwendet Q4_K_M-Quantisierung

Die Implementierung besteht aus ungefähr 15.000 Zeilen von Claude-gesteuertem C/HIP-Code mit starker menschlicher Anleitung.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

AgentRoom: Desktop-App visualisiert KI-Codierungsagenten als Pixelcharaktere mit Sitzungssuche
Werkzeuge

AgentRoom: Desktop-App visualisiert KI-Codierungsagenten als Pixelcharaktere mit Sitzungssuche

AgentRoom ist eine Desktop-App, die Claude Code-, Codex- und Gemini-Sitzungen in animierte Pixel-Charaktere in einem virtuellen Büro verwandelt, mit Volltext-Semantiksuche über alle Sitzungen. Das Repo enthält eine eigenständige Claude Code-Skill zum Durchsuchen vergangener Sitzungen aus jeder Konversation.

OpenClawRadar
Open-Source-Fähigkeit für parallele KI-Codierungsagenten mit menschlichem Gate
Werkzeuge

Open-Source-Fähigkeit für parallele KI-Codierungsagenten mit menschlichem Gate

Eine Markdown-Skill-Definition zum gleichzeitigen Ausführen mehrerer Claude Code-Agenten in separaten Git-Worktrees, mit Validierung über einen Integrationsbranch, Smoke-Tests und einer harten menschlichen Kontrollinstanz vor dem Merge in den Hauptzweig.

OpenClawRadar
OpenClaw .NET: NativeAOT-Portierung mit JSON-RPC-Brücke für bestehende Plugins
Werkzeuge

OpenClaw .NET: NativeAOT-Portierung mit JSON-RPC-Brücke für bestehende Plugins

OpenClaw .NET ist ein C#-Port von OpenClaw, der zu einer ~23 MB NativeAOT-Binärdatei kompiliert. Dadurch entfallen JIT-Aufwärmzeit und Node.js-Laufzeit-Overhead, während die Kompatibilität mit bestehenden TypeScript/JavaScript-Plugins über eine integrierte JSON-RPC-Brücke erhalten bleibt.

OpenClawRadar
PocketBot: Ein lokaler KI-Autopilot für iOS mit App-Intents und On-Device-Inferenz
Werkzeuge

PocketBot: Ein lokaler KI-Autopilot für iOS mit App-Intents und On-Device-Inferenz

PocketBot ist eine iOS-App, die ein quantisiertes 3B-Llama-Modell lokal auf dem Neural Engine des iPhones über Metal ausführt und dabei Apples AppIntents- und CoreLocation-Frameworks nutzt, um ereignisgesteuerte Automatisierungen ohne Cloud-Datenübertragung zu erstellen.

OpenClawRadar