TranscriptionSuite v1.1.2は、WhisperX、NeMo、VibeVoiceモデルを追加しました。

✍️ OpenClawRadar📅 公開日: April 17, 2026🔗 Source
TranscriptionSuite v1.1.2は、WhisperX、NeMo、VibeVoiceモデルを追加しました。
Ad

TranscriptionSuite v1.1.2 リリース

完全ローカルでオープンソースの音声文字起こしアプリケーションであるTranscriptionSuiteは、コミュニティのフィードバックに基づいた重要な機能追加を含むバージョン1.1.2をリリースしました。

主な更新点

開発者は以前のfaster-whisper実装をWhisperXに置き換え、複数の新しいモデルファミリーのサポートを追加しました:

  • WhisperX - PyAnnoteによる話者分離機能を含む
  • NeMoモデル - ParakeetおよびCanaryモデルのサポート(PyAnnoteによる話者分離)
  • VibeVoiceモデル - メインモデルと4ビット量子化バージョンの両方をサポート(組み込みの話者分離機能付き)

新機能

  • モデルマネージャー - 異なる文字起こしモデルを管理するための一元化された制御
  • 並列処理モード - 文字起こしと話者分離の同時実行
  • ショートカットコントロール - ワークフロー改善のためのキーボードショートカット
  • カーソル位置への貼り付け - 直接テキスト挿入機能
  • 24kHz録音パイプライン - VibeVoiceモデルの機能を最大限に活用するために特別に追加(WhisperおよびNeMoモデルは16kHzを必要とします)

このアプリケーションは現在、選択したモデルファミリーに応じて異なる話者分離アプローチを持つ3つの異なる文字起こしパイプラインを提供しています。

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

AI機能:自動検証によるランタイムコード生成
Tools

AI機能:自動検証によるランタイムコード生成

AI Functionsは、実装コードの代わりに自然言語の仕様で関数を定義できるPythonライブラリです。実行時にLLMが生成したコードを実行し、失敗時に自動再試行をトリガーする事後条件で出力を検証します。

OpenClawRadar
DeepSeek V4 FlashがオンプレミスのローカルLLMにOpusに迫る品質を提供
Tools

DeepSeek V4 FlashがオンプレミスのローカルLLMにOpusに迫る品質を提供

Redditユーザーが、DeepSeek 4 Flashが機密データを扱うローカルAIエージェントでOpusに迫るパフォーマンスを達成し、AWSなしでのオンプレミス展開を可能にしたと報告。NVIDIA GPUでローカル実行中だが、100万トークンでまだ遅い。

OpenClawRadar
オープンソースのCLAUDE.mdにより、Claude Codeエージェントがループすることなく何時間も生産的に動作
Tools

オープンソースのCLAUDE.mdにより、Claude Codeエージェントがループすることなく何時間も生産的に動作

たった70行のCLAUDE.mdファイルが、Claude Codeエージェントの語りや修正ループへの逸脱を防ぎます。セッションが3時間の失敗から、完全な生産的ライフサイクルへと変わります。

OpenClawRadar
iai-mcp: セッションをまたいだ持続的なOpenClawメモリのためのローカルデーモン
Tools

iai-mcp: セッションをまたいだ持続的なOpenClawメモリのためのローカルデーモン

iai-mcpは、すべてのOpenClawの会話をキャプチャし、ローカルのニューラル埋め込みとAES-256暗号化を用いて3つのメモリ階層に保存し、新しいセッションで関連するコンテキストをフィードバックするオープンソースのデーモンです。逐語的再現率>99%、検索<100ms、セッション開始時のトークンコスト<3k。

OpenClawRadar