Echo-TTS Porté sur Apple Silicon avec MLX pour une Synthèse Vocale Native avec Clonage de Voix

✍️ OpenClawRadar📅 Publié: March 7, 2026🔗 Source
Echo-TTS Porté sur Apple Silicon avec MLX pour une Synthèse Vocale Native avec Clonage de Voix
Ad

Echo-TTS, un modèle de transformateur par diffusion (DiT) de 2,4 milliards de paramètres pour la synthèse vocale avec clonage vocal, a été adapté de CUDA pour fonctionner nativement sur les puces Apple de série M en utilisant MLX. Cette adaptation permet au modèle de générer de la parole dans une voix cible à partir d'un texte et d'un court extrait audio d'une personne parlant.

Performances et Benchmarks

Sur un Mac mini M4 de base avec 16 Go de RAM, le modèle génère un court clonage vocal de 5 secondes en environ 10 secondes. Les clones allant jusqu'à 30 secondes prennent approximativement 60 secondes à générer.

Fonctionnalités Clés

  • Quantification 8 bits : Réduit l'utilisation de mémoire d'environ 6 Go à environ 4 Go, fonctionne plus rapidement avec une perte de qualité négligeable.
  • Génération par blocs : Permet le streaming et les continuations audio.

Détails du Développement

Il s'agit d'une adaptation assistée par IA. Claude Opus 4.6 a géré la spécification et la validation, GPT-5.3-Codex a réalisé l'implémentation, et le développeur a piloté le projet via OpenClaw.

Le dépôt est disponible sur github.com/mznoj/echo-tts-mlx.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Évaluation de l'acheteur : Compétence Claude pour l'évaluation de fournisseurs B2B via des conversations avec agents IA
Tools

Évaluation de l'acheteur : Compétence Claude pour l'évaluation de fournisseurs B2B via des conversations avec agents IA

Une compétence Claude qui évalue les fournisseurs de logiciels B2B en recherchant votre entreprise, posant des questions spécifiques au domaine et interrogeant directement les agents IA des fournisseurs via l'API Salespeak Frontdoor. Elle recoupe les affirmations avec des sources indépendantes et produit des fiches d'évaluation basées sur des preuves avec des niveaux de vérification transparents.

OpenClawRadar
Oh-My-Mermaid : Compétence Claude Code pour la génération automatique de diagrammes d'architecture
Tools

Oh-My-Mermaid : Compétence Claude Code pour la génération automatique de diagrammes d'architecture

Oh-My-Mermaid est une compétence Claude Code qui analyse les bases de code et génère automatiquement des diagrammes d'architecture Mermaid ainsi que de la documentation. Il est installé via npm et utilisé avec la commande /omm-scan dans Claude Code.

OpenClawRadar
AI Claw : Le pont sans serveur connecte Alexa à OpenClaw local avec livraison double.
Tools

AI Claw : Le pont sans serveur connecte Alexa à OpenClaw local avec livraison double.

AI Claw est un pipeline Python AWS Lambda qui connecte les enceintes Amazon Echo aux instances locales d'OpenClaw, contournant le délai d'attente de 8 secondes d'Amazon grâce à une architecture de type « fire-and-forget » avec double livraison vers Telegram et la sortie audio native de l'Echo.

OpenClawRadar
Demande de Fonctionnalité pour Claude Desktop : Crochet de Démarrage de Session pour l'Initialisation Automatique
Tools

Demande de Fonctionnalité pour Claude Desktop : Crochet de Démarrage de Session pour l'Initialisation Automatique

Un développeur créant des systèmes de contexte persistant pour Claude Desktop identifie un manque : le champ Préférences utilisateur n'injecte des instructions que lorsque l'utilisateur envoie le premier message, nécessitant des déclencheurs manuels pour l'initialisation. Il propose d'ajouter un champ d'exécution "Au démarrage de la session" qui s'exécute automatiquement à l'ouverture d'une nouvelle conversation.

OpenClawRadar