Apple Silicon向けAIエージェントのローカル音声コントロール設定

このセットアップでは、Parakeet STTとKokoro TTSをApple Silicon(具体的にはMac Mini M4でテスト済み)で使用して、AIエージェントのローカル音声制御を実装する方法について詳しく説明します。目的は、クラウドサービスへの依存を排除し、完全にローカルで高速な音声対話レイヤーを実現することでした。
主な詳細
- ハードウェア: OpenClaw + ClaudeをAIエージェントとして実行するMac Mini M4。
- ソフトウェア設定: 音声入力を約240msで文字起こしする音声認識(STT)用のParakeetと、ほぼ瞬時に応答を提供する音声合成(TTS)用のKokoro。
- 利点: タイピングから音声コマンドへの移行により、ワークフローの柔軟性が大幅に向上し、バルコニーや犬の散歩中など、オフィスに依存しない操作が可能になります。
- 課題: 時折、STTがアクセントの認識に苦労し、ユーザーの発音をAIエージェントが修正するというユーモラスな状況が発生することがあります。
- 拡張機能: Mimoraという3Dアバターを組み込んだブラウザ拡張機能により、視覚的な対話が可能になり、エージェントの応答中に「聞いている」「考えている」「嬉しい」などの様々な表情を表示します。
この構成は、特にApple Siliconハードウェアを使用して、クラウドに依存しない高速な音声対話をAIエージェントと行いたい人に最適です。
📖 完全なソースを読む: r/LocalLLaMA
👀 See Also

Claudeセッショントラッカー:ClaudeコードセッションをGitHub Issuesに自動保存
claude-session-trackerという新しいツールは、Claude CodeセッションをGitHub Issuesに自動保存し、すべてのプロンプトと応答をタイムスタンプ付きのコメントとして記録します。セッションごとに1つのGitHub Issueを作成し、Projectsボードにリンクし、Claude Codeのネイティブフックシステムを通じて動作するため、コンテキストトークンを消費しません。

300ドルのラップトップでQwen 3.5 35Bを10.33 t/s:完全最適化ブレイクダウン
開発者がLenovo Ideapad Slim 3i(300ドル)でQwen 3.5 35B Q4_K_Sを10.33 t/sで実行。ik_llama.cpp、コア固定、MTP投機的デコード、BIOSパフォーマンスチューニングを採用。

LLMスカーミッシュ:AIコーディングエージェントのためのリアルタイムストラテジーゲームベンチマーク
LLM Skirmishは、AIエージェントがコードを書いて1対1のリアルタイムストラテジーゲームで対戦するベンチマークです。修正版Screeps APIを使用し、5つのトーナメントラウンドにわたるインコンテキスト学習をテストします。

ACOシステム:GitHub IssueからマージされたPRへのマルチエージェントAIパイプライン
ACO Systemは、6つの専門AIエージェントがGitHub IssueからマージPRまでの開発パイプラインを完全自律で実行するオープンソースのマルチエージェントフレームワークです。不適切なストーリーを開発者に渡す前に弾く決定論的アーキテクトゲートを備えています。