Savant Commander 48B: Un modelo personalizado Qwen 3 de Mezcla de Expertos con 12 modelos destilados

Savant Commander 48B es un modelo personalizado de Mezcla de Expertos (MOE) construido sobre la arquitectura Qwen 3 que combina 12 modelos destilados de varios proveedores, incluyendo Claude, Gemini, OpenAI y Deepseek. El modelo utiliza enrutamiento codificado manualmente para aislar cada destilado mientras permite conexiones entre ellos simultáneamente.
Características y Arquitectura Clave
- Basado en Qwen 3 con longitud de contexto de 256K
- Estructura MOE 4x12B (48B parámetros totales)
- Enrutamiento personalizado aísla cada modelo destilado mientras mantiene conexiones inter-modelo
- Activación controlada por prompt - los usuarios pueden seleccionar qué modelo(s) destilado(s) usar
- Permite comparación directa entre diferentes modelos destilados usando prompts idénticos
Variantes del Modelo y Disponibilidad
El proyecto incluye versiones regulares y sin censura ("Heretic"). La versión sin censura se creó aplicando el proceso Heretic a cada modelo individual antes de agregarlos a la estructura MOE, en lugar de aplicarlo a todo el MOE.
Formatos GGUF disponibles:
- Versión regular:
https://huggingface.co/DavidAU/Qwen3-48B-A4B-Savant-Commander-GATED-12x-Closed-Open-Source-Distill-GGUF - Versión sin censura:
https://huggingface.co/DavidAU/Qwen3-48B-A4B-Savant-Commander-Distill-12X-Closed-Open-Heretic-Uncensored-GGUF
Repositorios fuente:
- Regular:
https://huggingface.co/DavidAU/Qwen3-48B-A4B-Savant-Commander-GATED-12x-Closed-Open-Source-Distill - Sin censura:
https://huggingface.co/DavidAU/Qwen3-48B-A4B-Savant-Commander-Distill-12X-Closed-Open-Heretic-Uncensored
Aplicaciones Prácticas
El enrutamiento controlado por prompt del modelo permite a los desarrolladores probar y comparar salidas de diferentes modelos destilados usando los mismos prompts. Las funciones de comando y control están documentadas en la tarjeta del repositorio con instrucciones detalladas.
Este enfoque de arquitectura MOE proporciona una forma práctica de aprovechar múltiples modelos especializados dentro de un único marco de inferencia, particularmente útil para comparar comportamientos de modelos o seleccionar características específicas de modelos para diferentes tareas.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

Dual DGX Sparks vs Mac Studio M3 Ultra: Comparación Práctica para Ejecutar Qwen3.5 397B Localmente
Un desarrollador comparó ejecutar Qwen3.5 397B localmente en una Mac Studio M3 Ultra 512GB de $10K y una configuración dual DGX Spark de $10K. La Mac Studio logró 30-40 tok/s con un ancho de banda de 800 GB/s pero prefilling lento, mientras que las Sparks entregaron 27-28 tok/s con computación más rápida pero configuración compleja.

Relay permite que las sesiones de Claude Code se comuniquen entre sí sin cambiar de ventana
Un plugin llamado Relay utiliza la capacidad de canales de Claude Code para que sesiones paralelas se comuniquen directamente, eliminando la necesidad de copiar y pegar manualmente el contexto entre los repositorios de backend y frontend.

Gestión del contexto de IA con una tienda de conocimiento SQLite y herramientas MCP
Un desarrollador creó RunawayContext, un sistema con licencia MIT que almacena lecciones de proyectos en SQLite con FTS5 y sqlite-vec opcional, manteniendo el contexto por sesión por debajo de 3K tokens gracias a herramientas de consulta MCP y límites fijos en el código.

Claudetop: Monitoreo de Costos en Tiempo Real para Sesiones de Código Claude
Claudetop es una herramienta similar a htop que muestra el gasto en tiempo real, la eficiencia de la caché y comparaciones de modelos para sesiones de Claude Code. Ofrece comandos de barra como /claudetop:stats y alertas inteligentes para hitos de costo y problemas de eficiencia.