Claude-voice: Claudeコード用の単語ハイライト付きローカルTTS

claude-voiceの機能
Claude-voiceは、Claude Codeの/voiceモードにテキスト読み上げ機能を追加します。通常、/voiceモードは音声入力のみを受け付け、応答は無音のテキストで返されます。このツールは、Claudeが応答を音声で読み上げ、リアルタイムで単語をハイライト表示することで、このループを完成させます。
主な機能と実装
このツールは、開発者が既存のオプションに見つけた制限に対応しています:
- ElevenLabsの無料プランではAPI経由で音声を使用できない(即時402エラー)
- VoiceMode(GitHubで893スター)は、100以上のファイルを持つMCPサーバーで、DJモード、サウンドフォント、チーム接続機能を備えています - 必要以上に複雑
- OpenAI TTSは動作しますが、有料で全てをサーバーに送信します
- 既存のオプションには単語レベルのハイライト機能がありませんでした - 全てバックグラウンドで音声を再生するだけでした
Claude-voiceの具体的な機能:
- Claude CodeのStopフックとしてインストールされる単一のPythonファイル
- Kokoro TTS(8200万パラメータ、CPUで動作)を使用 - 完全ローカル、APIキー不要
- スライディングウィンドウとプログレスバーによるリアルタイムのカラオケ式単語ハイライト
- 読み上げ前にマークダウン、コードブロック、URLを除去
- 開発者用発音を修正(CLI、API、JSON、nginx、kubectlが全て正しく発音される)
- 任意のキーを押して音声を中断可能
- 12種類の音声を利用可能(アメリカ/イギリス英語、男性/女性)
- claude-voiceのセットアップでフックを自動追加 - 手動設定不要
パフォーマンスとセットアップ
初回音声までの時間は、ウォーム状態で約1秒、コールド状態(モデル読み込み)で約6秒です。最も難しい実装上の課題は、Claude Codeのレンダラーの下に書き込むための/dev/ttyのトリックを見つけることでした。
インストールコマンド:
pip install kokoro sounddevice numpy
git clone https://github.com/Null-Phnix/claude-voice
cd claude-voice
python speak.py setup
python speak.py demoデモ動画では、ボイスモードを使用して北欧神話におけるロキのトリックスターとしての役割についてClaudeに質問し、Claudeが応答し、TTSが完全な回答を読み上げながら、ターミナルの下部で単語ハイライトが実行される様子が示されています。
📖 Read the full source: r/ClaudeAI
👀 See Also

JANG量子化手法は、大規模モデルのMLXパフォーマンスを向上させます
JANGと呼ばれる新しい量子化手法により、MiniMax-M2.5やQwen 3.5などの大規模モデルをAppleのMLXフレームワーク上で、標準的なMLX量子化よりも大幅に優れた性能で実行できるようになりました。これは、より高ビットの量子化に匹敵する精度を維持しながら、ほぼネイティブの速度を実現します。

Google Research、AIモデル圧縮のためのTurboQuantを発表
Google Researchは、AIモデルのサイズを精度の損失なしに削減する圧縮アルゴリズム「TurboQuant」を発表しました。これはベクトル量子化におけるメモリオーバーヘッドに対処し、キーバリューキャッシュのパフォーマンスを向上させます。

Claude Code Routines、20以上のPRでCLIパフォーマンスを2.4倍に調整
Claude CodeのRoutines機能を2時間ごとのcronで使い、オープンソースCLI(Repomix)を自律的にチューニング。その結果、20以上の自動生成PRと2.4倍の実行時間改善を達成。

NaNMesh MCPは、Claudeがライブラリを推奨する前にGitHubの課題を確認します
NaNMesh MCPは、開発ツールにおける既知のバグをGitHub Issues、Stack Overflow、Redditから収集するオープンソースのModel Context Protocolサーバーです。Claudeがライブラリを推奨する際、統合前に実際の問題を確認できます。