ローカルWhisperをMLX経由で利用するmacOS向けオフライン音声テキスト変換ツール

開発者がwhisper-dictateを作成しました。これはmacOS用ツールで、完全オフラインの音声からテキストへの書き起こしとリアルタイム翻訳機能を実現します。このツールはOpenAIのWhisperをApple Silicon上でMLXを介してローカルで実行し、データがマシンから流出することは一切ありません。
仕組み
ワークフローはシンプルです:fnキーを押しながら話し、離します。テキストは書き起こされ、入力中の場所に直接貼り付けられます。このツールはSlack、VS Code、ブラウザ、メール、その他のテキストフィールドで動作します。録音中は「Listening...」というフローティングオーバーレイが視覚的なフィードバックを提供します。
技術詳細
- 話し終わってから約500msで書き起こしが行われます
- Apple Silicon上でMLXを介してローカルで実行されるWhisperを使用
- 小規模モデルは日常使用に十分な性能
- large-v3-turboモデルはほぼ完璧な精度を提供
- 100%オフライン動作 - アカウント、トークン、データ流出なし
翻訳機能
Whisperは追加のモデルや翻訳APIなしでリアルタイム翻訳が可能です。翻訳はWhisperのデコードステップに組み込まれています。例えば、フランス語で話すと英語テキストが出力されます。出力言語を英語に設定すれば、ネイティブに翻訳を処理します。
セットアップと設定
起動時に、ツールは話す言語と出力したい言語を尋ね、純粋な書き起こしと翻訳の間で簡単に切り替えられるようにします。インストール後はインターネット接続を一切必要としません。
入手方法
このプロジェクトはGitHubでオープンソース化されており、他のユーザーが使用し、自分のワークフローに適応させることができます。
📖 Read the full source: r/LocalLLaMA
👀 See Also

LLMセッションのドリフトを防ぐ7ファイルガバナンスレイヤー
開発者が、Claudeがセッション間でアーキテクチャ上の決定を黙って元に戻すのを防ぐために、7つのファイルからなるガバナンスレイヤーを作成しました。このシステムには、厳格な実行ループを持つactive_context.md、contracts.md、decisions.mdファイルが含まれています。

OpenClaw Memos プラグイン、AIコーディングエージェントのメモリーハンドオフ問題に対応
Redditユーザーが、Claudeのコード流出がAIコーディングエージェントにおけるメモリハンドオフの問題を浮き彫りにしたと共有。膨張したトランスクリプトがモデル切り替え時に問題を引き起こす中、OpenClawでmemosプラグインを導入し、選択的回収戦略で最近の作業を圧縮し、古いツール呼び出しを削除した。

HF Viewer: あらゆるHugging Faceモデルのグラフを瞬時に可視化
HF Viewerは、ブラウザベースのツールで、あらゆるHugging Faceモデルのインタラクティブなアーキテクチャグラフをレンダリングします。URLやリポジトリ名を貼り付けるだけで、ローカル設定不要でグラフを確認できます。

VoidLLM:OllamaとvLLMのためのゼロ知識プロキシ、チームアクセス制御付き
VoidLLMは、OllamaやvLLMなどのローカルLLMサーバーとアプリケーションの間に位置するプロキシで、組織・チームのアクセス制御、APIキー管理、使用状況の追跡、レート制限を追加しますが、プロンプトを閲覧することはありません。プロキシのオーバーヘッドは2ミリ秒未満で、OpenAI互換のSDKで動作します。