Cue AI, Gemma 4로 음성 받아쓰기 속도 향상: 지연 시간 44% 단축, 사용량 30% 증가
Cue AI는 받아쓰기 및 에이전트 작업을 단축키로 수행하는 음성 기반 데스크톱 에이전트로, 클라우드 기반 텍스트 정리 단계를 Google DeepMind의 Gemma 4 E4B로 대체하여 Ollama를 통해 로컬에서 실행합니다. 이 전환으로 중간 정리 지연 시간이 876ms에서 488ms로 44% 감소했으며, 전체 처리 시간(말하기, 정리, 삽입)이 타이핑보다 빠르다고 느껴지는 인지 한계인 500ms 미만으로 개선되었습니다.
주요 결과
- 지연 시간: 정리 단계 중간값이 876ms에서 488ms로 감소 (Apple Silicon M 시리즈, Ollama, 혼합 언어 입력 포함 227개 실제 음성 샘플 기준).
- 사용량: 기본 설정 전환 후 4주 동안 사용자당 받아쓰기 사용량이 약 30% 증가했습니다. 이전에 짧은 메시지만 받아쓰던 사용자가 긴 내용을 받아쓰기 시작했으며, 시간에 민감한 작업에서 음성 모드 채택이 늘어났습니다.
- 비용: Gemma 4 E4B를 기기에서 실행함으로써 추론 비용이 거의 0에 가까워져, 무료 티어에서 제한이나 페이월 없이 무제한 받아쓰기가 가능해졌습니다.
작동 방식
정리 파이프라인은 의도적으로 단순합니다. 오디오는 클라우드 STT를 통해 텍스트로 변환된 후, 약 400토큰의 간결한 시스템 프롬프트와 함께 Gemma 4 E4B로 전송됩니다. 이 프롬프트는 구두점 복원, 문장 분리, 불필요한 단어 제거, 동음이의어 교정, 활성 입력 필드에 맞춘 형식 적용(예: 짧은 명령어에는 마침표 없음, 이메일에는 전체 문장 부호) 등의 서식 규칙을 적용합니다. 정리된 텍스트는 네이티브 OS API를 통해 붙여넣기 됩니다.
Cue의 배포는 프롬프트 엔지니어링만으로 기본 모델을 사용합니다. 활성 앱 컨텍스트(앱 이름, 필드 유형, 플레이스홀더 텍스트)가 프롬프트에 포함되어 모델이 사용자가 Slack 메시지, 이메일 또는 터미널 명령어 중 무엇을 작성 중인지 알 수 있습니다. 클라우드 경로는 여전히 대체 수단으로 유지되며, Ollama가 실행 중이 아닐 경우 중단 없이 클라우드 모델로 라우팅됩니다.
Gemma 4가 선택된 이유
팀은 원래 Gemma를 오프라인 대체 수단으로만 사용할 계획이었으며, 더 큰 클라우드 모델이 더 나은 정확도를 제공할 것이라고 가정했습니다. 그러나 227개의 실제 음성 샘플에 대한 벤치마크에서 Gemma 4 E4B가 과도한 편집 없이 형식을 지정하고 교정할 수 있는 적절한 용량을 가지고 있음을 보여주었습니다. 즉, 사용자의 자연스러운 발화를 formal한 산문으로 다듬지 않고 보존합니다. 이러한 역전—Gemma 로컬을 기본, 클라우드를 대체 수단으로—은 현재 Cue의 모든 받아쓰기 작업의 운영 기반이 되었습니다.
📖 전체 소스 읽기: HN AI Agents
👀 See Also

AbsolutelySkilled 레지스트리가 Claude Code용 156개의 프로덕션 준비 완료 스킬 추가
한 개발자가 세션 간에 지속되는 Claude Code용 156개의 구조화된 스킬 모듈 레지스트리인 AbsolutelySkilled를 만들었습니다. 각 스킬에는 SKILL.md 파일에 트리거 조건, 참조 파일, 테스트 케이스, 안티패턴이 포함되어 있습니다.

레딧 사용자가 재시도 루프를 깨기 위해 실패 학습 코딩 에이전트를 실험합니다
r/LocalLLaMA의 한 개발자가 단순화된 근본 원인을 저장하고 수정 사항을 매칭하여 반복적인 오류 루프를 줄이는 코딩 에이전트 실험을 설명합니다.

Nexus 데스크톱 앱, TTRPG 캠페인 관리를 위한 MCP 설정 자동화
Claude Desktop의 모든 MCP를 수동으로 편집하는 데 지치셨나요? Nexus는 TTRPG 캠페인 관리를 위해 Archivist, Foundry VTT, Notion, Obsidian, NotebookLM을 설치하고 구성합니다.

Codegraph: 사전 색인된 지식 그래프가 클로드/커서 도구 호출을 94% 줄임
Codegraph는 심볼 관계, 호출 그래프, 코드 구조에 대한 사전 색인된 지식 그래프를 사용하여 API 도구 호출을 최대 94%까지 줄이고, Claude, Cursor, Codex, OpenCode 에이전트의 사용 속도를 약 77% 향상시킵니다.