Cue AI, Gemma 4로 음성 받아쓰기 속도 향상: 지연 시간 44% 단축, 사용량 30% 증가

✍️ OpenClawRadar📅 게시일: July 21, 2026🔗 Source
Ad

Cue AI는 받아쓰기 및 에이전트 작업을 단축키로 수행하는 음성 기반 데스크톱 에이전트로, 클라우드 기반 텍스트 정리 단계를 Google DeepMind의 Gemma 4 E4B로 대체하여 Ollama를 통해 로컬에서 실행합니다. 이 전환으로 중간 정리 지연 시간이 876ms에서 488ms로 44% 감소했으며, 전체 처리 시간(말하기, 정리, 삽입)이 타이핑보다 빠르다고 느껴지는 인지 한계인 500ms 미만으로 개선되었습니다.

주요 결과

  • 지연 시간: 정리 단계 중간값이 876ms에서 488ms로 감소 (Apple Silicon M 시리즈, Ollama, 혼합 언어 입력 포함 227개 실제 음성 샘플 기준).
  • 사용량: 기본 설정 전환 후 4주 동안 사용자당 받아쓰기 사용량이 약 30% 증가했습니다. 이전에 짧은 메시지만 받아쓰던 사용자가 긴 내용을 받아쓰기 시작했으며, 시간에 민감한 작업에서 음성 모드 채택이 늘어났습니다.
  • 비용: Gemma 4 E4B를 기기에서 실행함으로써 추론 비용이 거의 0에 가까워져, 무료 티어에서 제한이나 페이월 없이 무제한 받아쓰기가 가능해졌습니다.
Ad

작동 방식

정리 파이프라인은 의도적으로 단순합니다. 오디오는 클라우드 STT를 통해 텍스트로 변환된 후, 약 400토큰의 간결한 시스템 프롬프트와 함께 Gemma 4 E4B로 전송됩니다. 이 프롬프트는 구두점 복원, 문장 분리, 불필요한 단어 제거, 동음이의어 교정, 활성 입력 필드에 맞춘 형식 적용(예: 짧은 명령어에는 마침표 없음, 이메일에는 전체 문장 부호) 등의 서식 규칙을 적용합니다. 정리된 텍스트는 네이티브 OS API를 통해 붙여넣기 됩니다.

Cue의 배포는 프롬프트 엔지니어링만으로 기본 모델을 사용합니다. 활성 앱 컨텍스트(앱 이름, 필드 유형, 플레이스홀더 텍스트)가 프롬프트에 포함되어 모델이 사용자가 Slack 메시지, 이메일 또는 터미널 명령어 중 무엇을 작성 중인지 알 수 있습니다. 클라우드 경로는 여전히 대체 수단으로 유지되며, Ollama가 실행 중이 아닐 경우 중단 없이 클라우드 모델로 라우팅됩니다.

Gemma 4가 선택된 이유

팀은 원래 Gemma를 오프라인 대체 수단으로만 사용할 계획이었으며, 더 큰 클라우드 모델이 더 나은 정확도를 제공할 것이라고 가정했습니다. 그러나 227개의 실제 음성 샘플에 대한 벤치마크에서 Gemma 4 E4B가 과도한 편집 없이 형식을 지정하고 교정할 수 있는 적절한 용량을 가지고 있음을 보여주었습니다. 즉, 사용자의 자연스러운 발화를 formal한 산문으로 다듬지 않고 보존합니다. 이러한 역전—Gemma 로컬을 기본, 클라우드를 대체 수단으로—은 현재 Cue의 모든 받아쓰기 작업의 운영 기반이 되었습니다.

📖 전체 소스 읽기: HN AI Agents

Ad

👀 See Also