RunAnywhere RCLI:Apple Silicon向けオンデバイス音声AIパイプライン

RCLIの機能
RCLIは、Apple Silicon搭載Mac上で、音声認識、大規模言語モデルの推論、音声合成をすべてオンデバイスで実行する完全な音声AIパイプラインです。M1以降のチップでmacOS 13以上が必要で、クラウドサービスやAPIキーなしで動作します。
インストールとセットアップ
Homebrew経由でインストール:
brew tap RunanywhereAI/rcli https://github.com/RunanywhereAI/RCLI.git
brew install rcli
rcli setup # 約1 GBのモデルをダウンロード
またはcurlを使用:
curl -fsSL https://raw.githubusercontent.com/RunanywhereAI/RCLI/main/install.sh | bash
性能に関する主張
開発者は64GB RAM搭載のM4 Maxでベンチマークを実施し、以下の結果を報告しています:
- LLMデコード: llama.cppより1.67倍高速、Apple MLXより1.19倍高速
- Qwen3-0.6B: 658トークン/秒 (mlx-lm 552、llama.cpp 295と比較)
- Qwen3-4B: 186トークン/秒 (mlx-lm 170、llama.cpp 87と比較)
- 初回トークンまでの時間: 6.6ミリ秒
- STT: 70秒の音声を101ミリ秒で文字起こし (実時間の714倍、mlx-whisperより4.6倍高速)
- TTS: 178ミリ秒で合成 (mlx-audioおよびsherpa-onnxより2.8倍高速)
主な特徴
- ロックフリーのリングバッファを使用した3つの同時実行スレッド
- ダブルバッファリングTTS (現在の文を再生しながら次の文をレンダリング)
- 音声で制御可能な38のmacOSアクション
- 5,000以上の文書チャンクに対して約4ミリ秒で検索するローカルRAG
- 20のホットスワップ可能なモデル
- 操作ごとの遅延読み出しを表示するフルスクリーンTUI
- MetalRTがインストールされていない場合はllama.cppにフォールバック
音声パイプラインの構成要素
- VAD: Silero音声活動検出
- STT: Zipformerストリーミング + Whisper/Parakeetオフライン
- LLM: KVキャッシュ継続とFlash Attentionを備えたQwen3/LFM2/Qwen3.5
- TTS: ダブルバッファリングされた文レベルの合成
- ツール呼び出し: LLMネイティブのツールコール形式
- マルチターンメモリ: トークン予算トリミングを備えたスライディングウィンドウ会話履歴
使用コマンド
rcli # プッシュトゥトーク機能付きインタラクティブTUI
rcli listen # 連続音声モード
rcli ask "open Safari" # ワンショットコマンド
rcli rag ingest ~/Documents/notes # RAG用に文書をインデックス化
rcli ask --rag ~/Library/RCLI/index "summarize the project plan"
TUIコントロール
- SPACE: プッシュトゥトーク
- M: LLM/STT/TTSのダウンロードとホットスワップ用モデルブラウザ
- A: macOSアクションの有効化/無効化用アクションブラウザ
- B: STT、LLM、TTS、およびエンドツーエンドのベンチマーク実行
- R: RAG文書取り込み
- X: 会話のクリアとコンテキストのリセット
- T: ツールコールトレースの切り替え
- ESC: 停止/閉じる/終了
MetalRTエンジンの詳細
MetalRTはRunAnywhereの独自GPU推論エンジンで、M3、M3 Pro、M3 Max、M4以降のチップで利用可能なMetal 3.1機能を使用します。M1/M2のサポートは計画中です。このエンジンは、量子化された行列乗算、アテンション、活性化演算用のカスタムMetalコンピュートシェーダーを使用し、事前にコンパイルされ、推論中にゼロアロケーションでGPUに直接ディスパッチされます。
macOSアクション
RCLIには以下のカテゴリにまたがる43のmacOSアクションが含まれています:
- 生産性: create_note、create_reminder、run_shortcut
- コミュニケーション: send_message、facetime_call
- メディア: play_on_spotify、play_apple_music、play_pause、next_track、set_music_volume
- システム: open_app、quit_app、set_volume、toggle_dark_mode、screenshot、lock_screen
- ウェブ: search_web、search_youtube、open_url、open_maps
📖 Read the full source: HN AI Agents
👀 See Also

カーペイシーの自動研究を16GPUでスケーリング:結果と手法
SkyPilotチームは、Kubernetesクラスター上の16個のGPUにClaude Codeをアクセスさせ、KarpathyのAutoresearchプロジェクトを実行しました。8時間以上にわたり、エージェントは約910件の実験を提出し、検証ビット/バイトを1.003から0.974に改善(2.87%向上)し、逐次実行よりも9倍速く最高の検証損失に到達しました。

SwarmClawダッシュボードがOpenClawにオーケストレーション層を追加
SwarmClawは、OpenClawをラップするセルフホスト型ダッシュボードで、複数のインスタンスのデプロイと管理をゲートウェイ制御、設定修復、リモート履歴同期、ライブ実行承認機能と共に提供します。OpenClawプラグインとSKILL.mdファイルをサポートし、さらに14の他のAIプロバイダーにも接続します。

デトリックスMCPサーバーがAIコーディングエージェントにランタイムデバッグ機能を追加
Detrixは、MCP互換エージェントが再起動やコード変更なしで実行中のコードのライブ変数を観察できるようにする、無料のオープンソースMCPサーバーです。Python、Go、RustアプリケーションをローカルまたはDockerで実行する際にサポートします。

Claudeセッショントラッカー:ClaudeコードセッションをGitHub Issuesに自動保存
claude-session-trackerという新しいツールは、Claude CodeセッションをGitHub Issuesに自動保存し、すべてのプロンプトと応答をタイムスタンプ付きのコメントとして記録します。セッションごとに1つのGitHub Issueを作成し、Projectsボードにリンクし、Claude Codeのネイティブフックシステムを通じて動作するため、コンテキストトークンを消費しません。