Cue AI, Gemma 4로 음성 받아쓰기 속도 향상: 지연 시간 44% 단축, 사용량 30% 증가

✍️ OpenClawRadar📅 게시일: July 21, 2026🔗 Source
Ad

Cue AI는 받아쓰기 및 에이전트 작업을 단축키로 수행하는 음성 기반 데스크톱 에이전트로, 클라우드 기반 텍스트 정리 단계를 Google DeepMind의 Gemma 4 E4B로 대체하여 Ollama를 통해 로컬에서 실행합니다. 이 전환으로 중간 정리 지연 시간이 876ms에서 488ms로 44% 감소했으며, 전체 처리 시간(말하기, 정리, 삽입)이 타이핑보다 빠르다고 느껴지는 인지 한계인 500ms 미만으로 개선되었습니다.

주요 결과

  • 지연 시간: 정리 단계 중간값이 876ms에서 488ms로 감소 (Apple Silicon M 시리즈, Ollama, 혼합 언어 입력 포함 227개 실제 음성 샘플 기준).
  • 사용량: 기본 설정 전환 후 4주 동안 사용자당 받아쓰기 사용량이 약 30% 증가했습니다. 이전에 짧은 메시지만 받아쓰던 사용자가 긴 내용을 받아쓰기 시작했으며, 시간에 민감한 작업에서 음성 모드 채택이 늘어났습니다.
  • 비용: Gemma 4 E4B를 기기에서 실행함으로써 추론 비용이 거의 0에 가까워져, 무료 티어에서 제한이나 페이월 없이 무제한 받아쓰기가 가능해졌습니다.
Ad

작동 방식

정리 파이프라인은 의도적으로 단순합니다. 오디오는 클라우드 STT를 통해 텍스트로 변환된 후, 약 400토큰의 간결한 시스템 프롬프트와 함께 Gemma 4 E4B로 전송됩니다. 이 프롬프트는 구두점 복원, 문장 분리, 불필요한 단어 제거, 동음이의어 교정, 활성 입력 필드에 맞춘 형식 적용(예: 짧은 명령어에는 마침표 없음, 이메일에는 전체 문장 부호) 등의 서식 규칙을 적용합니다. 정리된 텍스트는 네이티브 OS API를 통해 붙여넣기 됩니다.

Cue의 배포는 프롬프트 엔지니어링만으로 기본 모델을 사용합니다. 활성 앱 컨텍스트(앱 이름, 필드 유형, 플레이스홀더 텍스트)가 프롬프트에 포함되어 모델이 사용자가 Slack 메시지, 이메일 또는 터미널 명령어 중 무엇을 작성 중인지 알 수 있습니다. 클라우드 경로는 여전히 대체 수단으로 유지되며, Ollama가 실행 중이 아닐 경우 중단 없이 클라우드 모델로 라우팅됩니다.

Gemma 4가 선택된 이유

팀은 원래 Gemma를 오프라인 대체 수단으로만 사용할 계획이었으며, 더 큰 클라우드 모델이 더 나은 정확도를 제공할 것이라고 가정했습니다. 그러나 227개의 실제 음성 샘플에 대한 벤치마크에서 Gemma 4 E4B가 과도한 편집 없이 형식을 지정하고 교정할 수 있는 적절한 용량을 가지고 있음을 보여주었습니다. 즉, 사용자의 자연스러운 발화를 formal한 산문으로 다듬지 않고 보존합니다. 이러한 역전—Gemma 로컬을 기본, 클라우드를 대체 수단으로—은 현재 Cue의 모든 받아쓰기 작업의 운영 기반이 되었습니다.

📖 전체 소스 읽기: HN AI Agents

Ad

👀 See Also

AMD R9700에서 VS Code Copilot과 Qwen3.6-35B-A3B-UD-Q5_K_XL 로컬 실행
Tools

AMD R9700에서 VS Code Copilot과 Qwen3.6-35B-A3B-UD-Q5_K_XL 로컬 실행

한 사용자가 AMD R9700 GPU 하나에서 Vulkan을 이용해 Qwen3.6-35B-A3B-UD-Q5_K_XL 모델을 llama.cpp로 실행한 작업 설정을 공유합니다. 최소한의 조정만으로 전체 웹사이트와 Playwright 테스트를 처음부터 생성하는 데 성공했습니다.

OpenClawRadar
ACO 시스템: GitHub 이슈에서 병합된 PR까지의 멀티에이전트 AI 파이프라인
Tools

ACO 시스템: GitHub 이슈에서 병합된 PR까지의 멀티에이전트 AI 파이프라인

ACO System은 6개의 특화 AI 에이전트가 GitHub Issue에서 병합된 PR까지 전체 개발 파이프라인을 자율적으로 실행하는 오픈소스 멀티 에이전트 프레임워크입니다. 결정론적 Architect 게이트가 개발자에게 도달하기 전에 잘못된 스토리를 차단합니다.

OpenClawRadar
RTX 5060 Ti에서 Qwen3로 로컬 음성 어시스턴트 구현하기
Tools

RTX 5060 Ti에서 Qwen3로 로컬 음성 어시스턴트 구현하기

Qwen3 ASR, LLM 및 TTS를 RTX 5060 Ti에서 활용한 완전 로컬 홈 자동화 음성 어시스턴트로, 모건 프리먼 목소리 복제 및 다양한 통합 도구를 특징으로 합니다.

OpenClawRadar
클로드 코드의 작업 완료 착각: 변경 사항보다 에이전트의 경로를 검토해야 하는 이유
Tools

클로드 코드의 작업 완료 착각: 변경 사항보다 에이전트의 경로를 검토해야 하는 이유

Claude Code는 깔끔한 diff, 통과하는 테스트, 좋은 요약을 생성할 수 있지만, 실제 동작, 보안 문제, 아키텍처 제약을 놓칠 수 있습니다. 저자는 최종 diff뿐만 아니라 행동 체인(계획, 읽은 파일, 실행한 명령, 테스트 출력)을 검토하는 것이 이제 필수라고 주장합니다.

OpenClawRadar