마이크로소프트 VibeVoice: 60분 ASR 및 90분 TTS 모델 오픈소스화

✍️ OpenClawRadar📅 게시일: April 28, 2026🔗 Source
마이크로소프트 VibeVoice: 60분 ASR 및 90분 TTS 모델 오픈소스화
Ad

Microsoft가 VibeVoice를 오픈소스로 공개했습니다. VibeVoice는 ASR과 TTS를 모두 포함하는 최첨단 음성 AI 모델 제품군입니다. ASR 모델(VibeVoice-ASR-7B)은 최대 60분 길이의 오디오를 단일 패스(64K 토큰 윈도우)로 처리하며, 화자 ID, 타임스탬프, 텍스트가 포함된 구조화된 전사 결과를 출력합니다. 50개 이상의 언어를 지원하며, 사용자 지정 핫워드(hotword)를 통해 도메인 특화 용어도 인식할 수 있습니다. TTS 모델(VibeVoice-TTS-1.5B)은 최대 90분 분량의 다중 화자(최대 4명) 음성을 합성할 수 있습니다. 실시간 변형 모델인 VibeVoice-Realtime-0.5B는 스트리밍 텍스트 입력과 장문 생성, 9개 언어의 다국어 음성과 11개의 영어 스타일 음성을 지원합니다.

Ad

주요 기술 세부 사항

  • 핵심 혁신: 초저프레임률(7.5Hz)의 연속 음성 토크나이저(Acoustic 및 Semantic). 오디오 충실도를 유지하면서 긴 시퀀스의 계산 효율을 높입니다.
  • 아키텍처: Next-token diffusion 프레임워크 — LLM이 텍스트 맥락과 대화 흐름을 처리하고, diffusion 헤드가 고충실도 음향 세부 정보를 생성합니다.
  • ASR 기능: 단일 패스 60분 오디오, ASR + 화자 분리 + 타임스탬프 결합(누가, 언제, 무엇), 사용자 정의 핫워드 지원.
  • TTS 기능: 최대 4명의 서로 다른 화자로 90분 장문 합성; VibeVoice-Realtime-0.5B를 통한 실시간 스트리밍.
  • 추론 속도 향상: vLLM 추론 지원(vllm-asr 참조).
  • 파인튜닝: ASR 파인튜닝 코드 제공.
  • Hugging Face 통합: VibeVoice-ASR이 Transformers 릴리스(2026-03-06)에 포함되었습니다.

빠른 링크:

참고: VibeVoice-TTS 코드는 오용 우려로 인해 저장소에서 제거되었지만(2025-09-05), ASR 및 실시간 TTS 코드는 계속 활성 상태입니다.

📖 전체 소스 읽기: HN AI Agents

Ad

👀 See Also