Echo-TTS Porté sur Apple Silicon avec MLX pour une Synthèse Vocale Native avec Clonage de Voix

Echo-TTS, un modèle de transformateur par diffusion (DiT) de 2,4 milliards de paramètres pour la synthèse vocale avec clonage vocal, a été adapté de CUDA pour fonctionner nativement sur les puces Apple de série M en utilisant MLX. Cette adaptation permet au modèle de générer de la parole dans une voix cible à partir d'un texte et d'un court extrait audio d'une personne parlant.
Performances et Benchmarks
Sur un Mac mini M4 de base avec 16 Go de RAM, le modèle génère un court clonage vocal de 5 secondes en environ 10 secondes. Les clones allant jusqu'à 30 secondes prennent approximativement 60 secondes à générer.
Fonctionnalités Clés
- Quantification 8 bits : Réduit l'utilisation de mémoire d'environ 6 Go à environ 4 Go, fonctionne plus rapidement avec une perte de qualité négligeable.
- Génération par blocs : Permet le streaming et les continuations audio.
Détails du Développement
Il s'agit d'une adaptation assistée par IA. Claude Opus 4.6 a géré la spécification et la validation, GPT-5.3-Codex a réalisé l'implémentation, et le développeur a piloté le projet via OpenClaw.
Le dépôt est disponible sur github.com/mznoj/echo-tts-mlx.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Claude-Real-Video : Extraction d'images adaptée à la scène + transcription pour tout LLM
Un outil open-source qui extrait des images clés et des transcriptions audio de vidéos, permettant à n'importe quel LLM de « regarder » une vidéo localement sans téléchargement. Détection des changements de scène, déduplication par fenêtre glissante et transcription Whisper.

Lore : Un outil qui extrait un contexte structuré des conversations de codage avec l'IA
Lore est un outil basé sur navigateur construit avec Claude Code qui extrait un contexte structuré des conversations d'IA, capturant les décisions, les TODOs, les blocages et les listes de reprise. C'est une PWA React + TypeScript avec une extension Chrome pour la capture directe des conversations et l'injection de contexte.

La compétence OpenClaw réduit les jetons de l'arbre d'accessibilité de 600 000 à 1 300.
Un développeur a créé une compétence OpenClaw qui utilise un classement d'éléments basé sur l'apprentissage automatique pour élaguer les arbres d'accessibilité, réduisant slickdeals.com d'environ 598 000 tokens à environ 1 300 tokens en ne conservant que les ~50 éléments actionnables les plus pertinents.

Testreel : Génération de vidéos de démonstration programmatiques avec Claude Code
Testreel est un package npm qui génère des vidéos de démonstration de produits polies à partir de descriptions d'interactions JSON, YAML ou Playwright. Il crée des vidéos webm/mp4/gif avec des superpositions de curseur, des ondulations de clic et des arrière-plans dégradés.