Cue AI utilise Gemma 4 pour une dictée vocale plus rapide : baisse de 44 % de la latence, augmentation de 30 % de l'utilisation

✍️ OpenClawRadar📅 Publié: July 21, 2026🔗 Source
Ad

Cue AI, un agent de bureau activé par la voix qui exécute des tâches de dictée et des tâches agentiques via des raccourcis clavier, a remplacé son étape de polissage de texte basée sur le cloud par Gemma 4 E4B de Google DeepMind, exécuté localement via Ollama. Ce changement a réduit la latence médiane de polissage de 876 ms à 488 ms — soit une réduction de 44 % — et a porté le temps aller-retour (parler, polir, insérer) confortablement en dessous de 500 ms, le seuil perceptuel pour être plus rapide que la frappe.

Résultats clés

  • Latence : L'étape de polissage est passée de 876 ms à 488 ms en médiane (mesurée sur Apple Silicon M-series via Ollama, 227 échantillons vocaux réels incluant des entrées multilingues).
  • Utilisation : La dictée par utilisateur a augmenté d'environ 30 % dans les quatre semaines suivant le changement par défaut. Les utilisateurs qui dictaient auparavant de courts messages ont commencé à dicter des messages plus longs, et l'adoption du mode vocal a augmenté pour les tâches urgentes.
  • Coût : L'exécution de Gemma 4 E4B sur l'appareil a réduit les coûts d'inférence marginaux à zéro, permettant une dictée illimitée sur le niveau gratuit sans plafond ni barrière payante.
Ad

Comment ça marche

Le pipeline de polissage est intentionnellement simple : l'audio est transcrit via STT cloud, puis envoyé à Gemma 4 E4B avec une invite système compacte d'environ 400 tokens qui impose des règles de formatage — rétablir la ponctuation, segmenter les phrases, supprimer les mots de remplissage, corriger les homophones et s'adapter au champ de saisie actif (par exemple, pas de point final pour les commandes courtes, ponctuation complète pour les e-mails). Le texte poli est collé via les API natives du système d'exploitation.

Le déploiement de Cue utilise le modèle de base avec seulement de l'ingénierie d'invite. Le contexte de l'application active (nom de l'application, type de champ, texte indicatif) est injecté dans l'invite pour que le modèle sache si l'utilisateur compose un message Slack, un e-mail ou une commande de terminal. Le chemin cloud reste comme solution de repli : si Ollama n'est pas en cours d'exécution, Cue achemine vers un modèle cloud sans interruption.

Pourquoi Gemma 4 a gagné

L'équipe prévoyait initialement d'utiliser Gemma uniquement comme solution de repli hors ligne, supposant qu'un modèle cloud plus grand offrirait une meilleure précision. Les benchmarks sur 227 échantillons vocaux réels ont montré que Gemma 4 E4B a la capacité appropriée pour formater et corriger sans sur-éditer — préservant le langage naturel de l'utilisateur au lieu de le lisser en prose formelle. Cette inversion — Gemma local par défaut, cloud en repli — est désormais le pilier opérationnel de chaque dictée Cue.

📖 Lire la source complète : HN AI Agents

Ad

👀 See Also

Serveur MCP connecte Claude au marché d'agent à agent
Tools

Serveur MCP connecte Claude au marché d'agent à agent

Un développeur a créé un serveur MCP qui expose cinq outils et deux ressources, permettant à Claude de rechercher, invoquer et payer des capacités auprès d'autres agents d'IA sur un marché. Le serveur inclut un stockage persistant dans un coffre-fort d'agent et a été largement implémenté en utilisant Claude Code.

OpenClawRadar
Passerelle de Contexte : Un Proxy Open-Source pour Compresser le Contexte des Agents IA
Tools

Passerelle de Contexte : Un Proxy Open-Source pour Compresser le Contexte des Agents IA

Context Gateway est un proxy open-source qui se place entre les agents de codage et les LLM, compressant les sorties d'outils avant qu'elles n'entrent dans la fenêtre de contexte. Il utilise de petits modèles de langage pour détecter le signal dans le contexte, effectue une compaction en arrière-plan à 85% de la capacité de la fenêtre, et inclut des plafonds de dépenses, un tableau de bord et des notifications Slack.

OpenClawRadar
Equibles : Serveur MCP auto-hébergé pour les données financières américaines – Dépôts SEC, 13F, Transactions d’initiés, FRED
Tools

Equibles : Serveur MCP auto-hébergé pour les données financières américaines – Dépôts SEC, 13F, Transactions d’initiés, FRED

Equibles est un serveur MCP open source qui extrait des données financières publiques américaines (dépôts SEC, 13F, transactions d'initiés/congressionnelles, données de vente à découvert, FRED) et les expose en tant qu'outils MCP pour tout agent LLM local.

OpenClawRadar
OpenTabs : Serveur MCP avec plus de 100 plugins pour accéder aux outils d'IA basés sur navigateur
Tools

OpenTabs : Serveur MCP avec plus de 100 plugins pour accéder aux outils d'IA basés sur navigateur

OpenTabs est un serveur MCP associé à une extension Chrome qui expose plus de 100 plugins avec environ 2 000 outils en se connectant aux API internes d'applications web comme Slack, Discord et GitHub. Il fonctionne avec les sessions de navigation existantes, éliminant ainsi les clés API et les flux OAuth.

OpenClawRadar