Echo-TTSがApple Siliconに移植され、MLXを活用したネイティブTTSと音声クローニングを実現

Echo-TTSは、音声クローニング機能を備えた2.4Bパラメータの拡散型トランスフォーマー(DiT)テキスト読み上げモデルで、CUDAからMLXを使用してApple Mシリーズチップ上でネイティブに動作するように移植されました。この移植により、モデルはテキストと短い音声クリップを与えられると、対象の声で音声を生成できるようになりました。
性能とベンチマーク
ベースモデルの16GB M4 Mac miniでは、モデルは短い5秒の音声クローンを約10秒で生成します。最大30秒のクローンは、生成に約60秒かかります。
主な特徴
- 8ビット量子化: メモリ使用量を約6GBから約4GBに削減し、品質の低下をほとんど伴わずに高速に動作します。
- ブロック単位生成: ストリーミングと音声の継続を可能にします。
開発詳細
これはAI支援による移植でした。Claude Opus 4.6が仕様と検証を担当し、GPT-5.3-Codexが実装を実行し、開発者がOpenClawを通じてプロジェクトを主導しました。
リポジトリはgithub.com/mznoj/echo-tts-mlxで利用可能です。
📖 完全なソースを読む: r/LocalLLaMA
👀 See Also

「Show HN: WUPHF — カルパシー式のLLM Wiki。MarkdownとGitを真実の源泉として」
WUPHFは、Markdown + Gitによる永続化、bleve (BM25) + SQLiteによる検索、エンティティ事実ログ、ウィキリンク、日次lintクロンを備えた、AIエージェント向けのwiki層を提供します。ベクターDB依存なしでローカル実行可能です。

AIエージェントのメモリをClaudeのインポート機能でエクスポートする
Redditユーザーが、ChatGPTやClaudeなどのAIエージェントから保存された記憶を抽出し、OpenClawにインポートするためのプロンプトを共有しています。このプロンプトは、指示、個人情報、プロジェクト、ツール、設定など、保存されたすべてのコンテキストを要求します。

AIコーディングエージェントのためのマルチモデル評議会ワークフロー
開発者が、コーディングタスクをコーディングエージェントに渡す前に、複数のAIモデルを通してレビューするウェブベースのワークフローツールを作成しました。このツールは、エージェントに直接指示を出す代わりに、異なるモデルがまずタスクを分析する「評議会」アプローチを採用しています。

OpenHelm:自己修正リトライロジックを備えたClaude Code用ローカルバックグラウンドスケジューラー
OpenHelmは、Tauriベースのアプリケーションで、Claude Codeのタスクをスケジュールに従ってバックグラウンドで実行し、すべての状態をローカルのSQLiteに保存します。失敗後にプロンプトを調整する自己修正型リトライループも含まれています。