Echo-TTS Portado a Apple Silicon con MLX para TTS Nativo con Clonación de Voz

✍️ OpenClawRadar📅 Publicado: 7 de marzo de 2026🔗 Source
Echo-TTS Portado a Apple Silicon con MLX para TTS Nativo con Clonación de Voz
Ad

Echo-TTS, un modelo de transformador de difusión (DiT) de 2.4B parámetros para texto a voz con clonación de voz, ha sido adaptado de CUDA para ejecutarse nativamente en silicio Apple de la serie M utilizando MLX. La adaptación permite que el modelo genere voz en un tono objetivo cuando se le proporciona texto y un breve clip de audio de alguien hablando.

Rendimiento y Puntos de Referencia

En un Mac mini M4 base de 16GB, el modelo genera un clon de voz corto de 5 segundos en aproximadamente 10 segundos. Clones de hasta 30 segundos tardan aproximadamente 60 segundos en generarse.

Características Principales

  • Cuantización de 8 bits: Reduce el uso de memoria de aproximadamente 6 GB a unos 4 GB, se ejecuta más rápido con pérdida de calidad insignificante.
  • Generación por bloques: Permite transmisión en tiempo real y continuaciones de audio.

Detalles de Desarrollo

Esta fue una adaptación asistida por IA. Claude Opus 4.6 manejó la especificación y validación, GPT-5.3-Codex realizó la implementación, y el desarrollador dirigió el proyecto a través de OpenClaw.

El repositorio está disponible en github.com/mznoj/echo-tts-mlx.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

Ctxpact: Proxy de Compactación de Contexto para LLMs Locales
Herramientas

Ctxpact: Proxy de Compactación de Contexto para LLMs Locales

Ctxpact es un proxy compatible con OpenAI que comprime entradas de gran tamaño para LLMs locales con ventanas de contexto de 16k, utilizando una canalización de 3 etapas que incluye estrategias de DCP, resumen y extracción. Los benchmarks muestran 110k tokens comprimidos a 12k con una precisión de comprensión lectora de 8/8.

OpenClawRadar
🦀
Herramientas

El pasante de física de Hugging Face: El marco multiagente duplica a Gemini en el benchmark CritPt

Hugging Face lanzó physics-intern, un marco multiagente para investigación en física teórica que duplica el rendimiento de los modelos Gemini en el benchmark CritPt y establece un nuevo SOTA frente a GPT-5.5 Pro a menor costo.

OpenClawRadar
cq: Un sistema de intercambio de conocimientos de tipo local-first para agentes de codificación de IA
Herramientas

cq: Un sistema de intercambio de conocimientos de tipo local-first para agentes de codificación de IA

cq de Mozilla.ai es una herramienta de código abierto que permite a los agentes de programación con IA compartir 'unidades de conocimiento' sobre errores comunes mediante un almacén local SQLite, con opción de compartir en equipo a través de una API Docker. Se instala como complemento de Claude Code o servidor MCP de OpenCode.

OpenClawRadar
Transloadit MCP Server Conecta Agentes de IA con la Tubería de Procesamiento de Medios
Herramientas

Transloadit MCP Server Conecta Agentes de IA con la Tubería de Procesamiento de Medios

Transloadit construyó un servidor MCP que conecta a Claude y otros agentes de IA con su pipeline de procesamiento de medios mediante 86 Robots para procesamiento de video, audio, imágenes y documentos. La configuración en Claude Code requiere una línea: npx -y @transloadit/mcp-server stdio con las variables de entorno TRANSLOADIT_KEY y TRANSLOADIT_SECRET.

OpenClawRadar