마이크로소프트 VibeVoice: 60분 ASR 및 90분 TTS 모델 오픈소스화

Microsoft가 VibeVoice를 오픈소스로 공개했습니다. VibeVoice는 ASR과 TTS를 모두 포함하는 최첨단 음성 AI 모델 제품군입니다. ASR 모델(VibeVoice-ASR-7B)은 최대 60분 길이의 오디오를 단일 패스(64K 토큰 윈도우)로 처리하며, 화자 ID, 타임스탬프, 텍스트가 포함된 구조화된 전사 결과를 출력합니다. 50개 이상의 언어를 지원하며, 사용자 지정 핫워드(hotword)를 통해 도메인 특화 용어도 인식할 수 있습니다. TTS 모델(VibeVoice-TTS-1.5B)은 최대 90분 분량의 다중 화자(최대 4명) 음성을 합성할 수 있습니다. 실시간 변형 모델인 VibeVoice-Realtime-0.5B는 스트리밍 텍스트 입력과 장문 생성, 9개 언어의 다국어 음성과 11개의 영어 스타일 음성을 지원합니다.
주요 기술 세부 사항
- 핵심 혁신: 초저프레임률(7.5Hz)의 연속 음성 토크나이저(Acoustic 및 Semantic). 오디오 충실도를 유지하면서 긴 시퀀스의 계산 효율을 높입니다.
- 아키텍처: Next-token diffusion 프레임워크 — LLM이 텍스트 맥락과 대화 흐름을 처리하고, diffusion 헤드가 고충실도 음향 세부 정보를 생성합니다.
- ASR 기능: 단일 패스 60분 오디오, ASR + 화자 분리 + 타임스탬프 결합(누가, 언제, 무엇), 사용자 정의 핫워드 지원.
- TTS 기능: 최대 4명의 서로 다른 화자로 90분 장문 합성; VibeVoice-Realtime-0.5B를 통한 실시간 스트리밍.
- 추론 속도 향상: vLLM 추론 지원(
vllm-asr참조). - 파인튜닝: ASR 파인튜닝 코드 제공.
- Hugging Face 통합: VibeVoice-ASR이 Transformers 릴리스(2026-03-06)에 포함되었습니다.
빠른 링크:
- ASR 모델: HF Link | Playground
- TTS 모델: HF Link (코드 비활성화)
- 실시간 TTS: HF Link | Colab
참고: VibeVoice-TTS 코드는 오용 우려로 인해 저장소에서 제거되었지만(2025-09-05), ASR 및 실시간 TTS 코드는 계속 활성 상태입니다.
📖 전체 소스 읽기: HN AI Agents
👀 See Also

Atlarix v5.1은 로컬 AI 코딩 지원을 유지하면서 클라우드 계층을 추가합니다.
Atlarix v5.1.0은 Compass 클라우드 서비스 등급을 도입하여 즉시 사용 가능하게 하면서도 Ollama와 LM Studio에 대한 완전한 지원을 유지합니다. 이 IDE는 Blueprint라는 지속적인 SQLite 그래프를 사용하여 로컬 모델에 정확한 컨텍스트를 제공합니다.

쿨라: 의존성 없이 독립적으로 실행되는 리눅스 서버 모니터링
Kula는 외부 종속성이나 데이터베이스 없이 단일 바이너리로 실행되는 경량 Linux 서버 모니터링 도구입니다. /proc와 /sys에서 시스템 메트릭을 매초 수집하여 내장된 계층형 링 버퍼에 저장하며, 웹 대시보드와 터미널 TUI 인터페이스를 모두 제공합니다.

에이전트 시스템에서 결정론적 워크플로가 AI 기반 오케스트레이션보다 뛰어난 이유
에이전트 시스템을 1년간 구축한 경험을 가진 개발자가 AI 기반 오케스트레이션이 비결정적 라우팅, 오류 누적, 비용 폭발, 디버깅 불가능으로 인해 신뢰성 있게 실패했다고 밝혔습니다. 코드 기반 오케스트레이션을 사용한 결정적 워크플로우로 전환하여 오케스트레이션 실패를 제거했습니다.

스톡케이드: 채널 지원과 보안 레이어를 갖춘 클로드 코드를 위한 새로운 오케스트레이션 도구
Stockade는 Anthropic의 Agent SDK를 기반으로 구축된 오케스트레이션 도구로, 채널 기반 세션 관리, RBAC, AI 에이전트를 위한 세밀한 권한 관리를 제공합니다. OpenClaw와 NanoClaw의 한계를 해결하며, 컨테이너화와 자격 증명 프록시를 통해 보안을 유지하면서 더 많은 제어 기능을 제공합니다.