Cue AI、Gemma 4を活用し音声ディクテーションを高速化:遅延44%削減、使用率30%向上

✍️ OpenClawRadar📅 公開日: July 21, 2026🔗 Source
Ad

Cue AIは、ホットキーで音声入力やエージェントタスクを実行する音声操作対応デスクトップエージェントで、クラウドベースのテキスト整形ステップをGoogle DeepMindのGemma 4 E4Bに置き換え、Ollama経由でローカル実行するようにしました。この変更により、整形の中央値レイテンシが876msから488msへと44%削減され、ラウンドトリップ(発話、整形、挿入)が500ms未満に収まり、タイピングより速いと感じられる知覚上の予算内に収まりました。

主要な成果

  • レイテンシ: 整形ステップの中央値が876msから488msに低下(Apple Silicon Mシリーズ上でOllama経由、227件の実音声サンプルで測定、多言語入力含む)。
  • 使用量: デフォルト切り替え後の4週間で、ユーザーあたりの音声入力が約30%増加。以前は短いメッセージしか入力していなかったユーザーが長い文章を入力するようになり、時間に敏感な作業での音声モード採用が増加。
  • コスト: Gemma 4 E4Bをデバイス上で実行することで、限界推論コストがゼロになり、無料プランで上限や有料化なしに無制限の音声入力が可能に。
Ad

仕組み

整形パイプラインは意図的にシンプルです。音声はクラウドSTTで書き起こされ、その後約400トークンのコンパクトなシステムプロンプトとともにGemma 4 E4Bに送信されます。このプロンプトは、句読点の復元、文の区切り、フィラーワードの削除、同音異義語の修正、アクティブな入力フィールドへの適応(例:短いコマンドでは末尾のピリオドを付けず、メールでは完全な句読点を使用)などの書式ルールを適用します。整形されたテキストは、ネイティブのOS APIを介して貼り付けられます。

Cueのデプロイメントでは、ベースモデルをプロンプトエンジニアリングのみで使用しています。アクティブなアプリのコンテキスト(アプリケーション名、フィールドタイプ、プレースホルダーテキスト)がプロンプトに注入され、ユーザーがSlackメッセージ、メール、ターミナルコマンドのどれを作成しているかをモデルが認識します。クラウドパスはフォールバックとして残されており、Ollamaが実行されていない場合、Cueは中断なくクラウドモデルにルーティングします。

Gemma 4が選ばれた理由

チームは当初、Gemmaをオフラインのフォールバックとしてのみ使用する予定で、大規模なクラウドモデルの方が精度が高いと想定していました。しかし、227件の実音声サンプルを用いたベンチマークでは、Gemma 4 E4Bが過剰な編集をせずに整形・修正する適切な能力を持ち、ユーザーの自然な発話をそのまま保持し、形式的な散文に平滑化しないことが示されました。この逆転——Gemmaローカルをデフォルト、クラウドをフォールバックに——が、現在のCueのすべての音声入力の運用基盤となっています。

📖 出典全文: HN AI Agents

Ad

👀 See Also

Savecraft MCPサーバーはClaudeに正確なマジック:ザ・ギャザリングデータを提供します
Tools

Savecraft MCPサーバーはClaudeに正確なマジック:ザ・ギャザリングデータを提供します

Savecraftは、MTG ArenaのPlayer.logをローカルで解析し、ゲーム状態を同期し、実際のMagic: The Gatheringデータに基づいて構築された12の専門家向け参照モジュールにClaudeがアクセスできるようにするオープンソースのMCPサーバーです。このツールは、実際のArenaデータ、17Landsからのドラフト推奨、完全なScryfallデータベースへのアクセスを提供することで、Claudeがカード名やルールを幻覚的に生成するのを防ぎます。

OpenClawRadar
FlowBoard v5: AIエージェントが実際に動作するプロジェクトワークスペース
Tools

FlowBoard v5: AIエージェントが実際に動作するプロジェクトワークスペース

FlowBoard v5は、AIエージェント向けのReactベースのプロジェクトワークスペースです。イベントソーシング型のタスクストア(SQLite)、マルチエージェント対応、アイデアから仕様へのループ、モジュール式の概要ウィジェットを備えています。

OpenClawRadar
AVPプロトコルは、トークン効率を高めるために、テキストの代わりにKVキャッシュを共有することでLLMエージェントを可能にします。
Tools

AVPプロトコルは、トークン効率を高めるために、テキストの代わりにKVキャッシュを共有することでLLMエージェントを可能にします。

AVP(エージェントベクトルプロトコル)は、LLMエージェント間でテキストの代わりにKVキャッシュを直接受け渡すことを可能にし、トークン処理を73-78%削減し、Qwen、Llama、DeepSeekモデル全体で2-4倍の高速化を実現します。このプロトコルはHuggingFaceおよびvLLMコネクタと連携し、Pythonパッケージとして利用可能です。

OpenClawRadar
OpenTrace:75以上のMCPツールを備えたセルフホスト型オブザーバビリティサーバー
Tools

OpenTrace:75以上のMCPツールを備えたセルフホスト型オブザーバビリティサーバー

OpenTraceは、75以上のMCPツールを通じてログ、ユーザー分析、データベース内省を提供するセルフホスト型オブザーバビリティサーバーで、SQLiteストレージと読み取り専用Postgres接続を備えた4ドルのVPS上で動作します。

OpenClawRadar