Microsoft VibeVoice: ASR модели на 60 минут и TTS модели на 90 минут с открытым исходным кодом

Microsoft открыла исходный код VibeVoice, семейства передовых голосовых AI-моделей, охватывающих как ASR, так и TTS. Модель ASR (VibeVoice-ASR-7B) обрабатывает до 60 минут длинного аудио за один проход (окно в 64K токенов), выводя структурированные транскрипции с идентификатором диктора, временными метками и текстом — поддерживается более 50 языков. Также поддерживаются пользовательские хотворды для терминов из конкретных доменов. Модель TTS (VibeVoice-TTS-1.5B) может синтезировать до 90 минут мультиспикерной речи (до 4 дикторов). Вариант для реального времени (VibeVoice-Realtime-0.5B) поддерживает потоковый ввод текста и генерацию длинных текстов с мультиязычными голосами (9 языков) и 11 английскими стилевыми голосами.
Ключевые технические детали
- Основное новшество: Непрерывные токенизаторы речи (акустический и семантический) с ультранизкой частотой кадров 7,5 Гц, сохраняющие точность аудио и повышающие вычислительную эффективность для длинных последовательностей.
- Архитектура: Фреймворк диффузии следующего токена — LLM обрабатывает текстовый контекст и диалоговый поток, а диффузионная голова генерирует высокоточные акустические детали.
- Возможности ASR: Однопроходная обработка аудио до 60 минут, совместный ASR + диаризация + временные метки (Кто, Когда, Что), настраиваемые хотворды.
- Возможности TTS: Синтез длинных текстов до 90 минут с до 4 различными дикторами; потоковый режим реального времени через VibeVoice-Realtime-0.5B.
- Ускорение инференса: Поддерживается инференс через vLLM (см.
vllm-asr). - Дообучение: Доступен код для дообучения ASR.
- Интеграция с Hugging Face: VibeVoice-ASR теперь часть релиза Transformers (2026-03-06).
Быстрые ссылки:
- Модель ASR: HF Link | Playground
- Модель TTS: HF Link (код отключен)
- Realtime TTS: HF Link | Colab
Примечание: Код VibeVoice-TTS был удалён из репозитория (2025-09-05) из-за опасений по поводу неправомерного использования, но код ASR и TTS реального времени остаются активными.
📖 Прочитайте полный источник: HN AI Agents
👀 Смотрите также

Claude Code теперь поддерживает 240+ моделей через шлюз NVIDIA NIM, включая Nemotron-3 120B для агентного кодирования
Claude Code может переключаться во время сеанса на более чем 240 моделей NVIDIA NIM с помощью команды /model. Вариант Nemotron-3 Super 120B с режимом мышления показывает отличные результаты при рефакторинге нескольких файлов и агентных задачах.

Настройка RouteLLM для экономичного маршрутизации AI-задач
Пользователь Reddit делится конфигурацией Docker Compose, которая объединяет локальную модель Qwen3.5:4b от Ollama с GitHub Copilot через OpenWire, используя RouteLLM для маршрутизации сложных задач к GPT-4o, в то время как более простые задачи обрабатываются локально.

Claude Code v2.1.206: /doctor сокращает CLAUDE.md, /commit-push-pr автоматически разрешает отправку в Git, обновление фонового агента
Claude Code v2.1.206 добавляет подсказки пути /cd, проверку /doctor для сокращения CLAUDE.md за счет удаления производного содержимого, /commit-push-pr автоматически разрешает git push для настроенных удаленных репозиториев, а также исправляет MCP request_timeout_ms, фоновые агенты и зависания при запуске Bedrock.

Проект автоисследований Карпати: ИИ-агенты проводят ночные эксперименты по обучению LLM.
Андрей Карпати выпустил минимальный проект автоисследований, в котором ИИ-агент редактирует train.py, запускает 5-минутные эксперименты по обучению nanochat, проверяет, улучшился ли val_bpb, и повторяет это в течение ночи на одном GPU.