Microsoft VibeVoice: 60分ASRおよび90分TTSモデルがオープンソース化

マイクロソフトは、ASRとTTSの両方をカバーするフロンティア音声AIモデルファミリー、VibeVoiceをオープンソース化しました。ASRモデル(VibeVoice-ASR-7B)は、60分までの長尺音声をシングルパス(64Kトークンウィンドウ)で処理し、話者ID、タイムスタンプ、テキストを含む構造化された文字起こしを出力します。50以上の言語に対応し、ドメイン固有の用語向けにユーザーカスタマイズ可能なホットワードもサポートします。TTSモデル(VibeVoice-TTS-1.5B)は、最大4人の話者による最大90分のマルチスピーカー音声を合成できます。リアルタイムバリアント(VibeVoice-Realtime-0.5B)は、ストリーミングテキスト入力と長尺生成をサポートし、多言語音声(9言語)と11の英語スタイル音声を提供します。
主要な技術詳細
- 中核的革新: フレームレート7.5Hzという超低フレームレートの連続音声トークナイザー(音響および意味)により、オーディオの忠実度を保ちながら、長いシーケンスの計算効率を向上。
- アーキテクチャ: ネクストトークン拡散フレームワーク — LLMがテキストコンテキストと対話フローを処理し、拡散ヘッドが高忠実度の音響詳細を生成。
- ASR機能: シングルパス60分音声、ASR+ダイアリゼーション+タイムスタンプ(誰が、いつ、何を)の統合、カスタマイズ可能なホットワード。
- TTS機能: 最大4人の異なる話者による90分の長尺合成;VibeVoice-Realtime-0.5Bによるリアルタイムストリーミング。
- 推論高速化: vLLM推論対応(
vllm-asrを参照)。 - ファインチューニング: ASRファインチューニングコードが利用可能。
- Hugging Face統合: VibeVoice-ASRはTransformersリリース(2026-03-06)の一部になりました。
クイックリンク:
注: VibeVoice-TTSコードは、誤用の懸念からリポジトリから削除されました(2025-09-05)が、ASRおよびリアルタイムTTSコードは引き続き利用可能です。
📖 全文ソースを読む: HN AI Agents
👀 See Also

カスタムAI v0.8.1:コードとテキスト用のVS Code自動補完拡張機能
Bespoke AI v0.8.1は、コードとテキストの両方にオートコンプリート機能を提供するVS Code拡張機能です。AnthropicのAgent SDKを介してClaude Codeサブスクリプションを活用することで、API料金を発生させずに、Ollamaを含む複数のバックエンドをサポートしています。

オープンソースのローカルフックが自動的にClaudeモデルを切り替え、AIコストを削減します
開発者が、CursorとClaude Code用のローカルフックを作成し、プロンプトを分析してリクエスト送信前に適切なClaudeモデル(Haiku、Sonnet、Opus)を自動選択します。このツールはキーワードルールを使用してタスクを分類し、過剰な支払いシナリオをブロックし、遡及分析では50〜70%のコスト削減を示しています。

オープンソースおよびセルフホストに焦点を当てた260以上のAIエージェントとツールの厳選リスト
包括的なGitHubリポジトリには、260以上のAIエージェントとフレームワークがリストアップされており、Ollama、OpenClaw、DeerFlowなどのオープンソース、セルフホスト、ローカルファーストのオプションを重視しています。

Screenbox:音声のみで構築されたAIエージェント向けオープンソース仮想デスクトップ
Screenboxは、AIエージェント向けにDocker内で隔離されたLinuxデスクトップを提供し、複数のエージェントを並列実行する際の競合を解決します。このプロジェクトはClaude Codeを使用した音声コマンドのみで構築され、作成者はコードの一行も見たことがありません。