開発者がローカルのWhisperとCoqui-TTSサーバーでサブ秒のSTT/TTS遅延を達成

ある開発者が、ローカルAIエージェント向けに音声認識と音声合成で1秒未満のレイテンシを達成するオープンソースのサーバー実装を共有しました。これにより、クラウドベースのソリューションに典型的な会話の遅延が解消されます。
パフォーマンスベンチマーク
この実装は以下を達成しています:
- 音声認識(STT)で約0.2秒のレイテンシ
- 音声合成(TTS)で約250ミリ秒のレイテンシ
これは、以前のボトルネックとして言及されていた2〜3秒の待ち時間から大幅な改善を表しています。
技術的実装
STTサーバー
- Whisper large-v3-turboを使用して構築
- カスタムブリッジ実装
- VRAMの詰まりなしに並行処理を可能にするハイブリッドスレッド管理GPUアーキテクチャ
TTSサーバー
- ローカルサーバー上で動作するCoqui-TTSを使用
- OpenAI互換API
- 低レイテンシ合成に最適化
- ポール・ベタニー/ジャービスのクローン音声を含む
ハードウェア要件
- NVIDIA RTX GPU搭載の専用ノード
- この速度にはGPUアクセラレーションが必須
オープンソース化されたコンポーネント
開発者は2つのGitHubリポジトリを公開しました:
これらには、サーバー実装とローカルエージェント構築のためのOpenClaw統合スクリプトが含まれています。
結果
このエージェントは現在、真に会話的な振る舞いを示しています:
- 適切な割り込み処理
- ほぼ瞬時の応答
- 外部APIへの音声データ送信ゼロ
開発者は、サーバーセットアップ、VRAM管理、他のAIプロジェクトへの統合に関する質問に回答可能です。
📖 Read the full source: r/LocalLLaMA
👀 See Also

ミア:ネイティブAndroidアプリとP2Pストリーミングを備えたローカルAIワークスペースデーモン
Miaは、あなたのマシン上で動作するデーモンで、P2P接続によりネイティブAndroidアプリとペアリングし、スマートフォンから長時間実行されるAIコーディングタスクを開始・監視できるようにします。OpenCode、Claude Code、Gemini CLI、Codexエージェントをサポートし、出力をリアルタイムでデバイスに直接ストリーミングします。

6GB GPUでのミーティング要約: qwen3.5:0.8Bは57秒で動作、Granite 4 350Mは幻覚を起こす
VoiceFlow v1.6.0 は、ローカルの会議録音と要約機能を追加しました。6GBのRTX 3060でサブ10億パラメータモデルをベンチマーク: qwen3.5:0.8Bは2.2GB VRAMで57秒かけて構造化された要約を生成し、Granite 4 350Mはひどく幻覚を起こします。

claude-powerline v1.20は、TUIダッシュボードモード、コンテキストバーのスタイル、環境変数の表示機能を追加しました。
claude-powerline v1.20では、TUIダッシュボードモードが導入され、単一のステータスラインが、モデル情報、プログレスバー付きのコンテキスト使用量、コスト、Gitステータスなどを表示するフルパネルに置き換えられました。このアップデートでは、コンテキスト使用量のための9種類の視覚的なプログレスバースタイルと、環境変数表示機能が追加されています。
バックオフィスシミュレーター:手動データ入力へのWebGLオマージュ
ブラウザベースのゲームで、手動によるバックオフィスのデータ入力をシミュレートします。WebGL 2とJavaScriptで構築されており、AIが廃れさせつつあるタスクの種類に対する風刺的な作品です。