Microsoft VibeVoice: Open-Source-ASR-Modelle für 60 Minuten und TTS-Modelle für 90 Minuten

Microsoft hat VibeVoice als Open Source veröffentlicht, eine Familie von wegweisenden Sprach-KI-Modellen, die sowohl ASR als auch TTS abdeckt. Das ASR-Modell (VibeVoice-ASR-7B) verarbeitet bis zu 60 Minuten lange Audioaufnahmen in einem einzigen Durchlauf (64K-Token-Fenster) und gibt strukturierte Transkriptionen mit Sprecher-ID, Zeitstempeln und Text aus – unterstützt über 50 Sprachen. Es unterstützt auch benutzerdefinierte Hotwords für domänenspezifische Begriffe. Das TTS-Modell (VibeVoice-TTS-1.5B) kann bis zu 90 Minuten mehrsprachige Sprache (bis zu 4 Sprecher) synthetisieren. Eine Echtzeit-Variante (VibeVoice-Realtime-0.5B) unterstützt Streaming-Text-Eingabe und langformatige Generierung mit mehrsprachigen Stimmen (9 Sprachen) und 11 englischen Stil-Stimmen.
Wichtige technische Details
- Kerninnovation: Kontinuierliche Sprach-Tokenizer (Akustisch und Semantisch) mit einer extrem niedrigen Bildrate von 7,5 Hz, die die Audioqualität bewahren und gleichzeitig die Recheneffizienz für lange Sequenzen steigern.
- Architektur: Next-Token-Diffusion-Framework – ein LLM übernimmt den Textkontext und den Dialogfluss, ein Diffusionskopf generiert hochauflösende akustische Details.
- ASR-Fähigkeiten: Single-Pass 60-minütiges Audio, kombiniertes ASR + Diarisierung + Zeitstempel (Wer, Wann, Was), anpassbare Hotwords.
- TTS-Fähigkeiten: 90-minütige Langform-Synthese mit bis zu 4 verschiedenen Sprechern; Echtzeit-Streaming über VibeVoice-Realtime-0.5B.
- Inferenzbeschleunigung: vLLM-Inferenz wird unterstützt (siehe
vllm-asr). - Feinabstimmung: Code zur Feinabstimmung von ASR ist verfügbar.
- Hugging Face-Integration: VibeVoice-ASR ist jetzt Teil des Transformers-Releases (2026-03-06).
Schnelllinks:
- ASR-Modell: HF-Link | Playground
- TTS-Modell: HF-Link (Code deaktiviert)
- Echtzeit-TTS: HF-Link | Colab
Hinweis: Der VibeVoice-TTS-Code wurde aufgrund von Bedenken wegen Missbrauchs aus dem Repository entfernt (05.09.2025), aber ASR- und Echtzeit-TTS-Code bleiben aktiv.
📖 Lesen Sie die vollständige Quelle: HN AI Agents
👀 Siehe auch

Claude Code-Vorlagen-Repository für Spring Boot-Anwendungen
Ein GitHub-Repository bietet eine Claude Code-Vorlage zum Generieren von Spring Boot-Anwendungen mit Best Practices für Datenbankintegration, Kubernetes-Bereitstellung und Integrationstests mit Testcontainers.

DecisionNode: CLI und MCP-Server für semantische Entscheidungsspeicherung
DecisionNode ist ein rein lokaler CLI- und MCP-Server, der strukturierte Entscheidungen als JSON speichert, sie als Vektoren für semantische Suche einbettet und sie über MCP für KI-Tools zugänglich macht. Es ist unter der MIT-Lizenz verfügbar und wurde für die Zusammenarbeit mit Claude Code, Cursor, Windsurf, Antigravity und anderen MCP-Clients entwickelt.

Clawhub-Skill ermöglicht es OpenClaw, Apple Health-Daten über die API zu analysieren.
Eine neue Clawhub-Fähigkeit namens 'apple-health-export-analyzer' ermöglicht es OpenClaw, Apple Health-Daten zu lesen und zu analysieren, indem sie als API bereitgestellt werden. Dabei werden große XML-Dateien geparst, um relevante Metriken zu extrahieren und tägliche Gesundheitsupdates mit umsetzbaren Vorschlägen zu liefern.

OpenUtter: Fragen Sie Google Meet-Transkripte live über OpenClaw ab
OpenUtter ist eine Funktion, die Google Meet über einen Headless-Browser als Gast beitritt, Live-Untertitel erfasst und sie an Ihren OpenClaw-Ereignisbus streamt. Sie können das Live-Transkript während des Anrufs über Telegram, WhatsApp, Slack oder Discord abfragen.