Savant Commander 48B: Ein benutzerdefiniertes Qwen 3 Mixture-of-Experts-Modell mit 12 destillierten Modellen

Savant Commander 48B ist ein benutzerdefiniertes Mixture-of-Experts (MOE)-Modell, das auf der Qwen 3-Architektur basiert und 12 destillierte Modelle von verschiedenen Anbietern wie Claude, Gemini, OpenAI und Deepseek kombiniert. Das Modell verwendet handkodiertes Routing, um jedes Destillat zu isolieren, während gleichzeitig Verbindungen zwischen ihnen aufrechterhalten werden.
Wichtige Merkmale und Architektur
- Basierend auf Qwen 3 mit 256K Kontextlänge
- 4x12B MOE-Struktur (48B Gesamtparameter)
- Benutzerdefiniertes Routing isoliert jedes destillierte Modell, während Verbindungen zwischen den Modellen erhalten bleiben
- Promptgesteuerte Aktivierung – Benutzer können auswählen, welches destillierte Modell(e) verwendet werden soll
- Ermöglicht direkte Vergleiche zwischen verschiedenen destillierten Modellen mit identischen Prompts
Modellvarianten und Verfügbarkeit
Das Projekt umfasst sowohl reguläre als auch unzensierte ("Heretic") Versionen. Die unzensierte Version wurde erstellt, indem der Heretic-Prozess auf jedes einzelne Modell angewendet wurde, bevor sie zur MOE-Struktur hinzugefügt wurden, anstatt ihn auf das gesamte MOE anzuwenden.
Verfügbare GGUF-Formate:
- Reguläre Version:
https://huggingface.co/DavidAU/Qwen3-48B-A4B-Savant-Commander-GATED-12x-Closed-Open-Source-Distill-GGUF - Unzensierte Version:
https://huggingface.co/DavidAU/Qwen3-48B-A4B-Savant-Commander-Distill-12X-Closed-Open-Heretic-Uncensored-GGUF
Source repositories:
- Regulär:
https://huggingface.co/DavidAU/Qwen3-48B-A4B-Savant-Commander-GATED-12x-Closed-Open-Source-Distill - Unzensiert:
https://huggingface.co/DavidAU/Qwen3-48B-A4B-Savant-Commander-Distill-12X-Closed-Open-Heretic-Uncensored
Praktische Anwendungen
Die promptgesteuerte Routing-Funktion des Modells ermöglicht es Entwicklern, Ausgaben verschiedener destillierter Modelle mit denselben Prompts zu testen und zu vergleichen. Befehls- und Steuerungsfunktionen sind in der Repository-Karte mit detaillierten Anweisungen dokumentiert.
Dieser Ansatz zur MOE-Architektur bietet eine praktische Möglichkeit, mehrere spezialisierte Modelle innerhalb eines einzigen Inferenz-Frameworks zu nutzen, was besonders nützlich ist, um Modellverhalten zu vergleichen oder spezifische Modelleigenschaften für verschiedene Aufgaben auszuwählen.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Obsidian-Integration für Persistent Memory in OpenClaw und Claude Code
Ein Reddit-Nutzer demonstriert, wie die Verbindung von OpenClaw und Claude Code mit einem Obsidian-Vault persistente Langzeiterinnerung über Sitzungen hinweg schafft. Das Setup verknüpft automatisch Erinnerungen, Kontext, Projektdateien und Notizen, wobei alle Instanzen bei Bedarf auf den gemeinsamen Speicher zugreifen können.

RunAnywhere RCLI: On-Device Voice AI-Pipeline für Apple Silicon
RunAnywhere hat RCLI veröffentlicht, eine Open-Source-Sprach-KI-Pipeline für macOS, die STT, LLM und TTS vollständig auf Apple Silicon Geräten ausführt. Das Tool nutzt ihre proprietäre MetalRT-Inferenz-Engine und verspricht deutliche Leistungsverbesserungen gegenüber bestehenden Lösungen.

V6rge AI Suite Update fügt NVIDIA GPU-Unterstützung und Beta-Coding-Agent hinzu
Die V6rge AI Suite hat ein Update veröffentlicht, das GPU-Erkennungsprobleme behebt, volle NVIDIA-GPU-Unterstützung für bessere Leistung hinzufügt und einen neuen Beta-Coding-Agent einführt, der Code direkt in der App generiert und unterstützt.

Soul MCP Server fügt lokalen LLMs persistente Speicher und Sicherheit hinzu
Soul ist ein Open-Source-MCP-Server, der lokalen LLMs persistente Speicherung über Sitzungen hinweg ermöglicht, und zwar mit zwei Befehlen: n2_boot zu Beginn und n2_work_end am Ende. Er enthält Ark-Sicherheitsfunktionen, die gefährliche Befehle wie rm -rf und DROP DATABASE ohne Token-Kosten blockieren, sowie eine Cloud-Speicherkonfiguration.