FOMOE ermöglicht die Inferenz des 397B Qwen3.5-Modells auf Desktop-Hardware für 2.100 US-Dollar

Was FOMOE löst
Große Mixture-of-Experts-Modelle (MoE) benötigen Hunderte von Gigabyte an Gewichtsspeicher, typischerweise in Flash-Speicher wie NVMe. Während der Inferenz wird nur ein kleiner Teil der Gewichte benötigt, aber man kann nicht vorhersagen, welche dies im Voraus sein werden. Zufällige Zugriffsmuster machen Flash-Latenzen für praktische Inferenz auf Consumer-Hardware zu hoch.
Wie FOMOE funktioniert
Das System macht die meisten Expertengewicht-Lesevorgänge durch mehrere Techniken unnötig:
- Speichert die häufigsten Experten im GPU-Speicher (VRAM) mit einem aktuellen rollierenden Experten-Cache
- Erreicht eine VRAM-Trefferquote von 60 % mit Warmstart, wodurch NVMe-Lesevorgänge auf 28 % reduziert werden (12 % werden aus dem DRAM bedient)
- Verwendet eine Dual-GPU-Ping-Pong-Architektur, um Gewichtsladen und Berechnung zu überlappen
- Implementiert Cache-Aware Routing (CAR) – wenn zwei Experten ähnlich gut bewertet werden, wählt das Modell den nächstbesten bewerteten Experten, der sich bereits im VRAM- oder DRAM-Cache innerhalb eines akzeptablen Schwellenwerts befindet
Leistungsergebnisse
- 5-9 Tokens/Sekunde Inferenzgeschwindigkeit für Qwen3.5s 397B-Parameter-Modell
- NVMe-Lesevorgänge auf 7 % mit aktiviertem CAR reduziert
- Nur 3,5 % Abfall der Perplexität, gemessen auf Wikitext
- Hardwareanforderungen: zwei 500-Dollar-GPUs, 32 GB RAM, ein NVMe-Laufwerk
- Verwendet Q4_K_M-Quantisierung
Die Implementierung besteht aus ungefähr 15.000 Zeilen von Claude-gesteuertem C/HIP-Code mit starker menschlicher Anleitung.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Solo-Entwickler nutzt Claude + Blender MCP, um App-Store-Video in 90 Minuten zu erstellen
Reddit-Benutzer Positive_Camel2086 beschreibt detailliert, wie sie Claude mit dem Blender MCP-Server verwendet haben, um ein 10-sekündiges vertikales Startvideo zu generieren, wobei Kamerarigging, Materialien, Nebel und Partikelsysteme durch konversationelle Eingabeaufforderungen automatisiert wurden.

LLM-Kostenprofiler: Open-Source-Tool verfolgt API-Ausgaben, um den Einsatz lokaler Modelle zu rechtfertigen
LLM Cost Profiler ist ein Python-Tool, das jeden API-Aufruf an OpenAI/Anthropic verfolgt und genau zeigt, wofür Sie Geld ausgeben. Es deckt Aufgaben auf, die im Verhältnis zu ihrer Komplexität überteuert sind, und liefert konkrete Dollarbeträge, um den Umstieg auf lokale Modelle zu rechtfertigen.

Hollow AgentOS reduziert den Claude-Code-Token-Verbrauch um 68,5 % mit einem JSON-nativen Betriebssystem für KI-Agenten.
Hollow AgentOS ist ein JSON-natives Betriebssystem für KI-Agenten, das den Token-Verbrauch von Claude Code um 68,5 % reduziert, indem es ineffiziente Shell-Befehl-Overheads eliminiert. Es integriert sich über MCP in Claude Code, führt lokale Inferenz über Ollama aus und ist unter der MIT-Lizenz verfügbar.

Open-Source-Claude-Code-Fähigkeiten für personalisierte Social-Media-Inhalte
Ein Entwickler hat 13 Claude Code Skills als Open Source veröffentlicht, die Claude dabei helfen, Social-Media-Inhalte in Ihrer eigenen Stimme zu verfassen. Die Skills umfassen Kontextdefinition, Strategie, Erstellung und Analyse-Tools für LinkedIn, Twitter/X, Threads und Bluesky.