Cue AI utilise Gemma 4 pour une dictée vocale plus rapide : baisse de 44 % de la latence, augmentation de 30 % de l'utilisation

✍️ OpenClawRadar📅 Publié: July 21, 2026🔗 Source
Ad

Cue AI, un agent de bureau activé par la voix qui exécute des tâches de dictée et des tâches agentiques via des raccourcis clavier, a remplacé son étape de polissage de texte basée sur le cloud par Gemma 4 E4B de Google DeepMind, exécuté localement via Ollama. Ce changement a réduit la latence médiane de polissage de 876 ms à 488 ms — soit une réduction de 44 % — et a porté le temps aller-retour (parler, polir, insérer) confortablement en dessous de 500 ms, le seuil perceptuel pour être plus rapide que la frappe.

Résultats clés

  • Latence : L'étape de polissage est passée de 876 ms à 488 ms en médiane (mesurée sur Apple Silicon M-series via Ollama, 227 échantillons vocaux réels incluant des entrées multilingues).
  • Utilisation : La dictée par utilisateur a augmenté d'environ 30 % dans les quatre semaines suivant le changement par défaut. Les utilisateurs qui dictaient auparavant de courts messages ont commencé à dicter des messages plus longs, et l'adoption du mode vocal a augmenté pour les tâches urgentes.
  • Coût : L'exécution de Gemma 4 E4B sur l'appareil a réduit les coûts d'inférence marginaux à zéro, permettant une dictée illimitée sur le niveau gratuit sans plafond ni barrière payante.
Ad

Comment ça marche

Le pipeline de polissage est intentionnellement simple : l'audio est transcrit via STT cloud, puis envoyé à Gemma 4 E4B avec une invite système compacte d'environ 400 tokens qui impose des règles de formatage — rétablir la ponctuation, segmenter les phrases, supprimer les mots de remplissage, corriger les homophones et s'adapter au champ de saisie actif (par exemple, pas de point final pour les commandes courtes, ponctuation complète pour les e-mails). Le texte poli est collé via les API natives du système d'exploitation.

Le déploiement de Cue utilise le modèle de base avec seulement de l'ingénierie d'invite. Le contexte de l'application active (nom de l'application, type de champ, texte indicatif) est injecté dans l'invite pour que le modèle sache si l'utilisateur compose un message Slack, un e-mail ou une commande de terminal. Le chemin cloud reste comme solution de repli : si Ollama n'est pas en cours d'exécution, Cue achemine vers un modèle cloud sans interruption.

Pourquoi Gemma 4 a gagné

L'équipe prévoyait initialement d'utiliser Gemma uniquement comme solution de repli hors ligne, supposant qu'un modèle cloud plus grand offrirait une meilleure précision. Les benchmarks sur 227 échantillons vocaux réels ont montré que Gemma 4 E4B a la capacité appropriée pour formater et corriger sans sur-éditer — préservant le langage naturel de l'utilisateur au lieu de le lisser en prose formelle. Cette inversion — Gemma local par défaut, cloud en repli — est désormais le pilier opérationnel de chaque dictée Cue.

📖 Lire la source complète : HN AI Agents

Ad

👀 See Also