Cue AI использует Gemma 4 для ускорения голосового набора: снижение задержки на 44%, рост использования на 30%
Cue AI — голосовой десктопный агент, выполняющий диктовку и агентские задачи по хоткею — заменил облачный этап полировки текста на Gemma 4 E4B от Google DeepMind, работающую локально через Ollama. Переход сократил медианную задержку полировки с 876 мс до 488 мс (снижение на 44%) и позволил уложить полный цикл (произнесение, полировка, вставка) в комфортные 500 мс — воспринимаемый порог, при котором диктовка ощущается быстрее печати.
Ключевые результаты
- Задержка: Этап полировки сократился с 876 мс до 488 мс медианного времени (измерения на Apple Silicon M-series через Ollama, 227 реальных голосовых примеров, включая смешанный языковой ввод).
- Использование: Объем диктовки на пользователя вырос примерно на 30% за четыре недели после перехода по умолчанию. Пользователи, которые ранее диктовали короткие сообщения, начали диктовать более длинные, а использование голосового режима возросло для задач, чувствительных ко времени.
- Стоимость: Запуск Gemma 4 E4B на устройстве обнулил маржинальные затраты на инференс, что позволило предоставить неограниченную диктовку на бесплатном тарифе без лимитов и paywall.
Как это работает
Конвейер полировки намеренно прост: аудио транскрибируется через облачный STT, затем отправляется в Gemma 4 E4B с компактным системным промптом (~400 токенов), который задает правила форматирования — восстановление пунктуации, разбиение на предложения, удаление слов-паразитов, исправление омофонов и адаптацию к активному полю ввода (например, без точки в конце для коротких команд, полная пунктуация для email). Отполированный текст вставляется через нативные OS API.
В развертывании Cue используется базовая модель только с промпт-инжинирингом. Контекст активного приложения (имя приложения, тип поля, текст-плейсхолдер) добавляется в промпт, чтобы модель знала, составляет ли пользователь сообщение в Slack, email или команду в терминале. Облачный путь остается в качестве запасного: если Ollama не запущен, Cue перенаправляет запрос на облачную модель без прерывания.
Почему победила Gemma 4
Изначально команда планировала использовать Gemma только как офлайн-резерв, предполагая, что более крупная облачная модель обеспечит лучшую точность. Однако бенчмарки на 227 реальных голосовых примерах показали, что Gemma 4 E4B обладает нужной мощностью для форматирования и исправления без излишнего редактирования — сохраняя естественную речь пользователя вместо сглаживания в формальный текст. Эта инверсия — локальная Gemma по умолчанию, облачная как запасной вариант — теперь является операционной основой каждой диктовки Cue.
📖 Читать полный источник: HN AI Agents
👀 Смотрите также

StarSteady: AI-управляемые ответы на отзывы Google и SMS-запросы для локального бизнеса
StarSteady — это созданный одним разработчиком SaaS-инструмент, который генерирует ответы на отзывы в Google/Yelp с помощью ИИ и отправляет SMS-запросы на отзывы клиентам. Цена начинается от $39 в месяц, доступен бесплатный пробный период на 5 ответов ИИ и 5 SMS.

Gemma Gem: Встроенный ИИ-агент для автоматизации браузера через WebGPU
Gemma Gem — это расширение для Chrome, которое запускает модель Gemma 4 от Google (2B или 4B) полностью на устройстве с использованием WebGPU, без API-ключей или облачных зависимостей. Оно предоставляет инструменты для чтения содержимого страницы, создания скриншотов, кликов по элементам, ввода текста, прокрутки и выполнения JavaScript через чат-интерфейс.

Система автоматического исправления использует Claude Code Headless для обнаружения и устранения ошибок в продакшене.
Разработчик создал автоматизированную систему исправления ошибок в продакшене с использованием Claude Code CLI в headless-режиме. Система обнаруживает ошибки из логов, создает изолированные git worktree для каждой проблемы, запрашивает у Claude написание исправлений и требует ручного подтверждения через Telegram перед созданием PR.

Открытый CLAUDE.md помогает агентам Claude Code работать продуктивно часами, не зацикливаясь
Один файл CLAUDE.md на 70 строк не даёт агентам Claude Code уходить в повествование и зацикливаться на исправлениях. Сессии превращаются из трёхчасовых провалов в полноценные продуктивные циклы.