Cue AI usa Gemma 4 para dictado por voz más rápido: 44% menos latencia, 30% más uso
Cue AI, un agente de escritorio activado por voz que realiza dictados y tareas agénticas mediante teclas de acceso rápido, reemplazó su paso de corrección de texto en la nube con Gemma 4 E4B de Google DeepMind ejecutándose localmente a través de Ollama. El cambio redujo la latencia media de corrección de 876 ms a 488 ms, una reducción del 44%, y mantuvo el tiempo total (hablar, corregir, insertar) cómodamente por debajo de los 500 ms, el umbral perceptivo para sentirse más rápido que escribir.
Resultados clave
- Latencia: El paso de corrección se redujo de una mediana de 876 ms a 488 ms (medido en Apple Silicon M-series mediante Ollama, con 227 muestras de voz reales, incluyendo entrada en varios idiomas).
- Uso: El dictado por usuario aumentó aproximadamente un 30% en las cuatro semanas posteriores al cambio predeterminado. Los usuarios que antes dictaban mensajes cortos comenzaron a dictar más largos, y la adopción del modo de voz creció para trabajos sensibles al tiempo.
- Costo: Ejecutar Gemma 4 E4B en el dispositivo llevó los costos marginales de inferencia a cero, permitiendo dictados ilimitados en el nivel gratuito sin límites ni barreras de pago.
Cómo funciona
El proceso de corrección es intencionalmente simple: el audio se transcribe mediante STT en la nube, luego se envía a Gemma 4 E4B con un prompt de sistema compacto de aproximadamente 400 tokens que impone reglas de formato: restaurar puntuación, segmentar oraciones, eliminar palabras de relleno, corregir homófonos y adaptarse al campo de entrada activo (por ejemplo, sin punto final para comandos cortos, puntuación completa para correos electrónicos). El texto corregido se pega mediante las API nativas del sistema operativo.
La implementación de Cue utiliza el modelo base solo con ingeniería de prompts. El contexto de la aplicación activa (nombre de la aplicación, tipo de campo, texto de marcador de posición) se inyecta en el prompt para que el modelo sepa si el usuario está redactando un mensaje de Slack, un correo electrónico o un comando de terminal. La ruta en la nube permanece como respaldo: si Ollama no se está ejecutando, Cue redirige a un modelo en la nube sin interrupción.
Por qué ganó Gemma 4
El equipo originalmente planeó usar Gemma solo como respaldo sin conexión, asumiendo que un modelo en la nube más grande proporcionaría mejor precisión. Las pruebas comparativas con 227 muestras de voz reales mostraron que Gemma 4 E4B tiene la capacidad adecuada para formatear y corregir sin sobreditar, preservando el habla natural del usuario en lugar de suavizarlo en prosa formal. Esta inversión (Gemma local como predeterminado, nube como respaldo) es ahora la columna vertebral operativa de cada dictado de Cue.
📖 Lee la fuente completa: HN AI Agents
👀 Ver también

Factura de Habilidades: Un Marco de Gobernanza Basado en Markdown para Habilidades de Codificación con IA
Un desarrollador creó Skill Bill, un marco de 44 habilidades de IA basadas en Markdown para Kotlin, Android/KMP, PHP y Go que aborda problemas de gestión de prompts como la deriva de nombres y la lógica duplicada. Incluye habilidades de orquestador como 'feature-implement' que encadena 10-12 invocaciones de habilidades y se sincroniza con Claude Code, Copilot, GLM y Codex.

Chat Saver CG: Extensión de Navegador Creada con Claude Exporta Conversaciones en 12 Plataformas de IA
Un desarrollador creó Chat Saver CG, una extensión de navegador que exporta y transfiere conversaciones entre Claude, ChatGPT, Gemini y otras 9 plataformas de IA, utilizando ampliamente a Claude para el desarrollo, incluyendo decisiones de arquitectura, depuración de problemas de análisis DOM y escritura de lógica de adaptador.

OpenClaw Client añade seguimiento de costos en vivo de API, límites de gasto y controles de agentes detallados
El cliente OpenClaw ahora cuenta con una interfaz de uso en vivo con barras de progreso circulares, límites de gasto por agente, gestión de subagentes, alternancia de habilidades y cambio de modelos de diferentes proveedores.

StarSteady: respuestas de reseñas de Google con IA y solicitudes de SMS para negocios locales
StarSteady es un SaaS creado por una sola persona que genera respuestas elaboradas por IA para reseñas de Google/Yelp y envía solicitudes de reseñas por SMS a los clientes, desde $39/mes con una prueba gratuita de 5 respuestas/5 SMS.