Microsoft VibeVoice : modèles ASR de 60 min et TTS de 90 min open-sourcés

Microsoft a rendu open-source VibeVoice, une famille de modèles de voix IA de pointe couvrant à la fois l'ASR et le TTS. Le modèle ASR (VibeVoice-ASR-7B) traite jusqu'à 60 minutes d'audio long dans un seul passage (fenêtre de 64K tokens), produisant des transcriptions structurées avec identification du locuteur, horodatage et texte — prenant en charge plus de 50 langues. Il prend également en charge des mots-clés personnalisés pour des termes spécifiques au domaine. Le modèle TTS (VibeVoice-TTS-1.5B) peut synthétiser jusqu'à 90 minutes de parole multi-locuteurs (jusqu'à 4 locuteurs). Une variante en temps réel (VibeVoice-Realtime-0.5B) prend en charge la saisie de texte en continu et la génération longue avec des voix multilingues (9 langues) et 11 voix de style anglais.
Détails techniques clés
- Innovation centrale : Tokenizers de parole continus (acoustique et sémantique) à une fréquence d'images ultra-basse de 7,5 Hz, préservant la fidélité audio tout en améliorant l'efficacité informatique pour les longues séquences.
- Architecture : Cadre de diffusion de prochain token — un LLM gère le contexte textuel et le flux de dialogue, une tête de diffusion génère des détails acoustiques de haute fidélité.
- Capacités ASR : Audio unique de 60 minutes, ASR + diarisation + horodatage conjoints (Qui, Quand, Quoi), mots-clés personnalisables.
- Capacités TTS : Synthèse longue de 90 minutes avec jusqu'à 4 locuteurs distincts ; streaming en temps réel via VibeVoice-Realtime-0.5B.
- Accélération d'inférence : Inférence vLLM prise en charge (voir
vllm-asr). - Finetuning : Le code de finetuning ASR est disponible.
- Intégration Hugging Face : VibeVoice-ASR fait désormais partie de la version Transformers (2026-03-06).
Liens rapides :
- Modèle ASR : Lien HF | Playground
- Modèle TTS : Lien HF (code désactivé)
- TTS en temps réel : Lien HF | Colab
Note : Le code VibeVoice-TTS a été retiré du dépôt (2025-09-05) en raison de problèmes d'utilisation abusive, mais les codes ASR et TTS en temps réel restent actifs.
📖 Lire la source complète : HN AI Agents
👀 See Also

Titre : Claude pour le travail créatif : Connecteurs MCP pour Blender, Adobe, Ableton et plus
Anthropic a publié un ensemble de connecteurs MCP permettant à Claude d'interfacer avec des outils créatifs, notamment Blender, Autodesk Fusion, Adobe Creative Cloud, Ableton Live et Splice, permettant le contrôle en langage naturel, le scripting et l'automatisation des pipelines.

Framework multi-agent open-source extrait de la fuite du code Claude
Un développeur a extrait le système d'orchestration multi-agents du code source divulgué de Claude Code et l'a reconstruit en tant que framework open-source indépendant des modèles sous licence MIT. Le framework TypeScript de 8 000 lignes comprend la planification des tâches, la messagerie inter-agents et des outils intégrés.

OpenClaw .NET : Portage NativeAOT avec Pont JSON-RPC pour les Plugins Existants
OpenClaw .NET est un portage C# d'OpenClaw qui compile en un binaire NativeAOT d'environ 23 Mo, éliminant le préchauffage JIT et la surcharge du runtime Node tout en maintenant la compatibilité avec les plugins TypeScript/JavaScript existants via un pont JSON-RPC intégré.

Clavis MCP Server : Gestion sécurisée des identifiants pour Claude Desktop
Clavis est un serveur MCP qui gère les clés API et les jetons OAuth pour Claude Desktop, stockant les identifiants avec un chiffrement AES-256 et offrant un rafraîchissement automatique des jetons pour éviter les erreurs d'expiration en milieu de conversation.