Microsoft VibeVoice: Open-Source-ASR-Modelle für 60 Minuten und TTS-Modelle für 90 Minuten

Microsoft hat VibeVoice als Open Source veröffentlicht, eine Familie von wegweisenden Sprach-KI-Modellen, die sowohl ASR als auch TTS abdeckt. Das ASR-Modell (VibeVoice-ASR-7B) verarbeitet bis zu 60 Minuten lange Audioaufnahmen in einem einzigen Durchlauf (64K-Token-Fenster) und gibt strukturierte Transkriptionen mit Sprecher-ID, Zeitstempeln und Text aus – unterstützt über 50 Sprachen. Es unterstützt auch benutzerdefinierte Hotwords für domänenspezifische Begriffe. Das TTS-Modell (VibeVoice-TTS-1.5B) kann bis zu 90 Minuten mehrsprachige Sprache (bis zu 4 Sprecher) synthetisieren. Eine Echtzeit-Variante (VibeVoice-Realtime-0.5B) unterstützt Streaming-Text-Eingabe und langformatige Generierung mit mehrsprachigen Stimmen (9 Sprachen) und 11 englischen Stil-Stimmen.
Wichtige technische Details
- Kerninnovation: Kontinuierliche Sprach-Tokenizer (Akustisch und Semantisch) mit einer extrem niedrigen Bildrate von 7,5 Hz, die die Audioqualität bewahren und gleichzeitig die Recheneffizienz für lange Sequenzen steigern.
- Architektur: Next-Token-Diffusion-Framework – ein LLM übernimmt den Textkontext und den Dialogfluss, ein Diffusionskopf generiert hochauflösende akustische Details.
- ASR-Fähigkeiten: Single-Pass 60-minütiges Audio, kombiniertes ASR + Diarisierung + Zeitstempel (Wer, Wann, Was), anpassbare Hotwords.
- TTS-Fähigkeiten: 90-minütige Langform-Synthese mit bis zu 4 verschiedenen Sprechern; Echtzeit-Streaming über VibeVoice-Realtime-0.5B.
- Inferenzbeschleunigung: vLLM-Inferenz wird unterstützt (siehe
vllm-asr). - Feinabstimmung: Code zur Feinabstimmung von ASR ist verfügbar.
- Hugging Face-Integration: VibeVoice-ASR ist jetzt Teil des Transformers-Releases (2026-03-06).
Schnelllinks:
- ASR-Modell: HF-Link | Playground
- TTS-Modell: HF-Link (Code deaktiviert)
- Echtzeit-TTS: HF-Link | Colab
Hinweis: Der VibeVoice-TTS-Code wurde aufgrund von Bedenken wegen Missbrauchs aus dem Repository entfernt (05.09.2025), aber ASR- und Echtzeit-TTS-Code bleiben aktiv.
📖 Lesen Sie die vollständige Quelle: HN AI Agents
👀 Siehe auch
MTP + Unified Memory steigert llama.cpp Inferenz um 30% auf RTX 5090
Die Aktivierung von MTP-Spekulation zusammen mit GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 steigert Qwen3.6-27B Q8_0 von 49 auf 64 tok/s auf einer RTX 5090 mit 128 GB Arbeitsspeicher.

Claude Code's Tool-API-Details enthüllt
Ein Reddit-Nutzer hat Details über die Tool-API von Claude Code extrahiert, einschließlich Dateisystemoperationen, Bash-Ausführung, Websuche und wie Tool-Aufrufe mit XML-ähnlichen Blöcken strukturiert sind.

Workflow-Orchestrator mit KI-CLI-Integration für Sysadmin-Aufgaben
Ein Entwickler hat einen dateibasierten Workflow-Orchestrator namens 'workflow' erstellt, der sich mit Claude Code, Codex CLI und Gemini CLI integriert. Er generiert, aktualisiert, korrigiert und verfeinert YAML-Workflows aus natürlichen Sprachbeschreibungen für Sysadmin-Aufgaben.

read-once: Ein Claude-Code-Hook, der redundante Dateizugriffe verhindert
Ein Entwickler hat einen PreToolUse-Hook namens read-once erstellt, der verfolgt, welche Dateien Claude Code bereits in einer Sitzung gelesen hat. Er blockiert das erneute Lesen unveränderter Dateien und nutzt Diffs für geänderte Dateien. Das Tool spart tausende von Tokens pro Sitzung, indem es verhindert, dass Claude wiederholt denselben Dateiinhalt liest.