Cue AI usa Gemma 4 para dictado por voz más rápido: 44% menos latencia, 30% más uso

✍️ OpenClawRadar📅 Publicado: 21 de julio de 2026🔗 Source
Ad

Cue AI, un agente de escritorio activado por voz que realiza dictados y tareas agénticas mediante teclas de acceso rápido, reemplazó su paso de corrección de texto en la nube con Gemma 4 E4B de Google DeepMind ejecutándose localmente a través de Ollama. El cambio redujo la latencia media de corrección de 876 ms a 488 ms, una reducción del 44%, y mantuvo el tiempo total (hablar, corregir, insertar) cómodamente por debajo de los 500 ms, el umbral perceptivo para sentirse más rápido que escribir.

Resultados clave

  • Latencia: El paso de corrección se redujo de una mediana de 876 ms a 488 ms (medido en Apple Silicon M-series mediante Ollama, con 227 muestras de voz reales, incluyendo entrada en varios idiomas).
  • Uso: El dictado por usuario aumentó aproximadamente un 30% en las cuatro semanas posteriores al cambio predeterminado. Los usuarios que antes dictaban mensajes cortos comenzaron a dictar más largos, y la adopción del modo de voz creció para trabajos sensibles al tiempo.
  • Costo: Ejecutar Gemma 4 E4B en el dispositivo llevó los costos marginales de inferencia a cero, permitiendo dictados ilimitados en el nivel gratuito sin límites ni barreras de pago.
Ad

Cómo funciona

El proceso de corrección es intencionalmente simple: el audio se transcribe mediante STT en la nube, luego se envía a Gemma 4 E4B con un prompt de sistema compacto de aproximadamente 400 tokens que impone reglas de formato: restaurar puntuación, segmentar oraciones, eliminar palabras de relleno, corregir homófonos y adaptarse al campo de entrada activo (por ejemplo, sin punto final para comandos cortos, puntuación completa para correos electrónicos). El texto corregido se pega mediante las API nativas del sistema operativo.

La implementación de Cue utiliza el modelo base solo con ingeniería de prompts. El contexto de la aplicación activa (nombre de la aplicación, tipo de campo, texto de marcador de posición) se inyecta en el prompt para que el modelo sepa si el usuario está redactando un mensaje de Slack, un correo electrónico o un comando de terminal. La ruta en la nube permanece como respaldo: si Ollama no se está ejecutando, Cue redirige a un modelo en la nube sin interrupción.

Por qué ganó Gemma 4

El equipo originalmente planeó usar Gemma solo como respaldo sin conexión, asumiendo que un modelo en la nube más grande proporcionaría mejor precisión. Las pruebas comparativas con 227 muestras de voz reales mostraron que Gemma 4 E4B tiene la capacidad adecuada para formatear y corregir sin sobreditar, preservando el habla natural del usuario en lugar de suavizarlo en prosa formal. Esta inversión (Gemma local como predeterminado, nube como respaldo) es ahora la columna vertebral operativa de cada dictado de Cue.

📖 Lee la fuente completa: HN AI Agents

Ad

👀 Ver también

Configuración de OpenClaw sin Interfaz Gráfica con Discord mediante Scripts Docker
Herramientas

Configuración de OpenClaw sin Interfaz Gráfica con Discord mediante Scripts Docker

Un repositorio de GitHub proporciona scripts para ejecutar OpenClaw con Discord en un contenedor Docker sin interfaz gráfica, evitando la TUI/WebUI. Incluye un script de gestión con comandos como claw init, start y stop, además de soporte preconfigurado para OpenAI Responses API, Chromium y varias herramientas.

OpenClawRadar
Eden AI: Centro de API europeo para modelos de IA – Se reposiciona como alternativa a OpenRouter
Herramientas

Eden AI: Centro de API europeo para modelos de IA – Se reposiciona como alternativa a OpenRouter

Eden AI ofrece una API unificada única para acceder a más de 500 modelos de IA (LLM, visión, OCR, voz) con enrutamiento inteligente, mecanismos de respaldo y control de región. Se posiciona como una alternativa europea a OpenRouter.

OpenClawRadar
Cómo construí una habilidad para desplegar agentes OpenClaw en aplicaciones web - Una mirada detrás de cámaras.
Herramientas

Cómo construí una habilidad para desplegar agentes OpenClaw en aplicaciones web - Una mirada detrás de cámaras.

Explora una nueva habilidad innovadora desarrollada para agentes de OpenClaw que facilita la implementación sencilla en aplicaciones web. Conoce sus características, ventajas y cómo transforma los procesos de producción.

OpenClawRadar
Habilidad de Tendr: Operaciones CLI Determinísticas para la Gestión de Memoria del Agente
Herramientas

Habilidad de Tendr: Operaciones CLI Determinísticas para la Gestión de Memoria del Agente

Tendr Skill es una Habilidad de Agente que separa el razonamiento de la ejecución para la memoria estructurada a largo plazo, permitiendo que los agentes decidan qué necesita cambiar mientras una herramienta CLI maneja las operaciones estructurales de manera determinista. Es compatible con [[wikilinks]] y jerarquías semánticas explícitas entre archivos.

OpenClawRadar