Cue AI usa Gemma 4 para ditado de voz mais rápido: queda de 44% na latência, 30% mais uso

✍️ OpenClawRadar📅 Publicado: July 21, 2026🔗 Source
Ad

A Cue AI, agente desktop ativado por voz que executa tarefas de ditado e ações agênticas via tecla de atalho, substituiu sua etapa de refinamento de texto baseada em nuvem pelo Gemma 4 E4B do Google DeepMind, executado localmente via Ollama. A mudança reduziu a latência mediana de refinamento de 876ms para 488ms — uma redução de 44% — e manteve o ciclo completo (falar, refinar, inserir) confortavelmente abaixo de 500ms, o limite perceptual para parecer mais rápido que digitar.

Principais Resultados

  • Latência: Etapa de refinamento caiu de 876ms para 488ms mediana (medido em Apple Silicon M-series via Ollama, 227 amostras de voz reais incluindo entrada multilíngue).
  • Uso: O ditado por usuário aumentou ~30% nas quatro semanas após a mudança padrão. Usuários que antes ditavam mensagens curtas passaram a ditar mensagens mais longas, e a adoção do modo de voz cresceu para trabalhos sensíveis ao tempo.
  • Custo: Executar o Gemma 4 E4B no dispositivo reduziu os custos marginais de inferência a zero, permitindo ditado ilimitado no nível gratuito sem limites ou paywall.
Ad

Como Funciona

O pipeline de refinamento é intencionalmente simples: o áudio é transcrito via STT em nuvem e, em seguida, enviado ao Gemma 4 E4B com um prompt de sistema compacto de ~400 tokens que impõe regras de formatação — restaurando pontuação, segmentando frases, removendo palavras de preenchimento, corrigindo homófonos e adaptando-se ao campo de entrada ativo (por exemplo, sem ponto final para comandos curtos, pontuação completa para e-mails). O texto refinado é colado via APIs nativas do SO.

A implantação da Cue usa o modelo base apenas com engenharia de prompt. O contexto do aplicativo ativo (nome do aplicativo, tipo de campo, texto do placeholder) é injetado no prompt para que o modelo saiba se o usuário está compondo uma mensagem no Slack, um e-mail ou um comando de terminal. O caminho em nuvem permanece como fallback: se o Ollama não estiver em execução, a Cue roteia para um modelo em nuvem sem interrupção.

Por que o Gemma 4 Venceu

A equipe originalmente planejava usar o Gemma apenas como fallback offline, assumindo que um modelo maior em nuvem forneceria maior precisão. Avaliações em 227 amostras de voz reais mostraram que o Gemma 4 E4B tem a capacidade certa para formatar e corrigir sem editar demais — preservando a fala natural do usuário em vez de suavizá-la para prosa formal. Essa inversão — Gemma local como padrão, nuvem como fallback — agora é a espinha dorsal operacional de cada ditado da Cue.

📖 Leia a fonte completa: HN AI Agents

Ad

👀 See Also

Habilidade de Escrita de Livro Multi-Agente OpenClaw Lançada
Tools

Habilidade de Escrita de Livro Multi-Agente OpenClaw Lançada

Um sistema multiagente de escrita de livros construído sobre o OpenClaw foi lançado como uma skill, apresentando conexão DeepWiki MCP, geração de imagens GLM para ilustrações, estimativa de orçamento e revisão em nível de capítulo. Dois capítulos do Livro Paradigma OpenClaw foram atualizados usando esta ferramenta.

OpenClawRadar
Implementando Verificações de IA com Continue para Revisões de PR Controladas por Código-Fonte
Tools

Implementando Verificações de IA com Continue para Revisões de PR Controladas por Código-Fonte

O Continue integra verificações de IA diretamente no fluxo de trabalho de pull requests, usando arquivos markdown como verificações controladas por versão, visíveis através das verificações de status do GitHub.

OpenClawRadar
🦀
Tools

Wakehook: Dispare Automações Matinais do OpenClaw no Horário Real de Despertar, Não no Cron

Wakehook lê dados de sono do Google Health/Fitbit e envia um evento user.awake para o OpenClaw quando você realmente acorda. Auto-hospedável, baseado em polling, sem necessidade de URL pública.

OpenClawRadar
Claude Code Hook Monitora o Acúmulo de WIP em Fluxos de Trabalho de Codificação com IA
Tools

Claude Code Hook Monitora o Acúmulo de WIP em Fluxos de Trabalho de Codificação com IA

Um desenvolvedor criou um hook UserPromptSubmit para o Claude Code que revela o acúmulo de trabalho em andamento em quatro filas: alterações não commitadas com mais de 200 linhas, três ou mais commits não enviados, commits enviados sem arquivos de changeset e PRs de release abertos por mais de 24 horas.

OpenClawRadar