Echo-TTS Portado a Apple Silicon con MLX para TTS Nativo con Clonación de Voz

Echo-TTS, un modelo de transformador de difusión (DiT) de 2.4B parámetros para texto a voz con clonación de voz, ha sido adaptado de CUDA para ejecutarse nativamente en silicio Apple de la serie M utilizando MLX. La adaptación permite que el modelo genere voz en un tono objetivo cuando se le proporciona texto y un breve clip de audio de alguien hablando.
Rendimiento y Puntos de Referencia
En un Mac mini M4 base de 16GB, el modelo genera un clon de voz corto de 5 segundos en aproximadamente 10 segundos. Clones de hasta 30 segundos tardan aproximadamente 60 segundos en generarse.
Características Principales
- Cuantización de 8 bits: Reduce el uso de memoria de aproximadamente 6 GB a unos 4 GB, se ejecuta más rápido con pérdida de calidad insignificante.
- Generación por bloques: Permite transmisión en tiempo real y continuaciones de audio.
Detalles de Desarrollo
Esta fue una adaptación asistida por IA. Claude Opus 4.6 manejó la especificación y validación, GPT-5.3-Codex realizó la implementación, y el desarrollador dirigió el proyecto a través de OpenClaw.
El repositorio está disponible en github.com/mznoj/echo-tts-mlx.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

Ctxpact: Proxy de Compactación de Contexto para LLMs Locales
Ctxpact es un proxy compatible con OpenAI que comprime entradas de gran tamaño para LLMs locales con ventanas de contexto de 16k, utilizando una canalización de 3 etapas que incluye estrategias de DCP, resumen y extracción. Los benchmarks muestran 110k tokens comprimidos a 12k con una precisión de comprensión lectora de 8/8.
El pasante de física de Hugging Face: El marco multiagente duplica a Gemini en el benchmark CritPt
Hugging Face lanzó physics-intern, un marco multiagente para investigación en física teórica que duplica el rendimiento de los modelos Gemini en el benchmark CritPt y establece un nuevo SOTA frente a GPT-5.5 Pro a menor costo.

cq: Un sistema de intercambio de conocimientos de tipo local-first para agentes de codificación de IA
cq de Mozilla.ai es una herramienta de código abierto que permite a los agentes de programación con IA compartir 'unidades de conocimiento' sobre errores comunes mediante un almacén local SQLite, con opción de compartir en equipo a través de una API Docker. Se instala como complemento de Claude Code o servidor MCP de OpenCode.

Transloadit MCP Server Conecta Agentes de IA con la Tubería de Procesamiento de Medios
Transloadit construyó un servidor MCP que conecta a Claude y otros agentes de IA con su pipeline de procesamiento de medios mediante 86 Robots para procesamiento de video, audio, imágenes y documentos. La configuración en Claude Code requiere una línea: npx -y @transloadit/mcp-server stdio con las variables de entorno TRANSLOADIT_KEY y TRANSLOADIT_SECRET.