Savant Commander 48B: Ein benutzerdefiniertes Qwen 3 Mixture-of-Experts-Modell mit 12 destillierten Modellen

Savant Commander 48B ist ein benutzerdefiniertes Mixture-of-Experts (MOE)-Modell, das auf der Qwen 3-Architektur basiert und 12 destillierte Modelle von verschiedenen Anbietern wie Claude, Gemini, OpenAI und Deepseek kombiniert. Das Modell verwendet handkodiertes Routing, um jedes Destillat zu isolieren, während gleichzeitig Verbindungen zwischen ihnen aufrechterhalten werden.
Wichtige Merkmale und Architektur
- Basierend auf Qwen 3 mit 256K Kontextlänge
- 4x12B MOE-Struktur (48B Gesamtparameter)
- Benutzerdefiniertes Routing isoliert jedes destillierte Modell, während Verbindungen zwischen den Modellen erhalten bleiben
- Promptgesteuerte Aktivierung – Benutzer können auswählen, welches destillierte Modell(e) verwendet werden soll
- Ermöglicht direkte Vergleiche zwischen verschiedenen destillierten Modellen mit identischen Prompts
Modellvarianten und Verfügbarkeit
Das Projekt umfasst sowohl reguläre als auch unzensierte ("Heretic") Versionen. Die unzensierte Version wurde erstellt, indem der Heretic-Prozess auf jedes einzelne Modell angewendet wurde, bevor sie zur MOE-Struktur hinzugefügt wurden, anstatt ihn auf das gesamte MOE anzuwenden.
Verfügbare GGUF-Formate:
- Reguläre Version:
https://huggingface.co/DavidAU/Qwen3-48B-A4B-Savant-Commander-GATED-12x-Closed-Open-Source-Distill-GGUF - Unzensierte Version:
https://huggingface.co/DavidAU/Qwen3-48B-A4B-Savant-Commander-Distill-12X-Closed-Open-Heretic-Uncensored-GGUF
Source repositories:
- Regulär:
https://huggingface.co/DavidAU/Qwen3-48B-A4B-Savant-Commander-GATED-12x-Closed-Open-Source-Distill - Unzensiert:
https://huggingface.co/DavidAU/Qwen3-48B-A4B-Savant-Commander-Distill-12X-Closed-Open-Heretic-Uncensored
Praktische Anwendungen
Die promptgesteuerte Routing-Funktion des Modells ermöglicht es Entwicklern, Ausgaben verschiedener destillierter Modelle mit denselben Prompts zu testen und zu vergleichen. Befehls- und Steuerungsfunktionen sind in der Repository-Karte mit detaillierten Anweisungen dokumentiert.
Dieser Ansatz zur MOE-Architektur bietet eine praktische Möglichkeit, mehrere spezialisierte Modelle innerhalb eines einzigen Inferenz-Frameworks zu nutzen, was besonders nützlich ist, um Modellverhalten zu vergleichen oder spezifische Modelleigenschaften für verschiedene Aufgaben auszuwählen.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Antikörpersystem: Out-of-Band-Watchdog für OpenClaw-Agenten
Das Antikörper-System ist eine Open-Source-Wächterlösung, die auf einem separaten Rechner läuft und OpenClaw-Agenten über SSH überwacht. Es implementiert abgestufte Reaktionen von der Erkennung bis zur Dienstwiederherstellung und ist so konzipiert, dass es Ausfälle übersteht, die den primären Agenten lahmlegen.

Mehr-Agenten-Karriere-Mentor entwickelt mit Ollama und MCP für lokale KI
Ein Entwickler hat ein 5-Agenten-KI-System gebaut, das Lebensläufe analysiert und Karriere-Intelligenzberichte mit Ollama und llama3 lokal generiert. Das System verkettet Agentenausgaben, sodass jeder auf dem vorherigen Kontext aufbaut, wobei MCP die Tool-Integration übernimmt.

Entwickler teilt 10+ MCP-Server für KI-Agenten-Abrechnung, Reputation und Mikrozahlungen
Ein Entwickler hat BlindOracle auf Claude Code mit über 100 Agenten aufgebaut und 10+ MCP-Server für Abwicklung, Reputation und Mikrozahlungen erstellt. Die Architektur umfasst private Commit-Reveal-Prognosen, On-Chain-Bewertung, Mikrozahlungen pro Anfrage und verifizierbare Agenten-Attestierung.

Oodle.ai startet Agent Observability zu 10 $/Million Traces
Oodle.ai bietet Agenten-Tracing für 10 $ pro Million Spans mit subsekündlicher P99-Abfragelatenz und speichert 100 % der Traces ohne Sampling in einem S3-basierten Spaltenspeicher.