Cue AI использует Gemma 4 для ускорения голосового набора: снижение задержки на 44%, рост использования на 30%
Cue AI — голосовой десктопный агент, выполняющий диктовку и агентские задачи по хоткею — заменил облачный этап полировки текста на Gemma 4 E4B от Google DeepMind, работающую локально через Ollama. Переход сократил медианную задержку полировки с 876 мс до 488 мс (снижение на 44%) и позволил уложить полный цикл (произнесение, полировка, вставка) в комфортные 500 мс — воспринимаемый порог, при котором диктовка ощущается быстрее печати.
Ключевые результаты
- Задержка: Этап полировки сократился с 876 мс до 488 мс медианного времени (измерения на Apple Silicon M-series через Ollama, 227 реальных голосовых примеров, включая смешанный языковой ввод).
- Использование: Объем диктовки на пользователя вырос примерно на 30% за четыре недели после перехода по умолчанию. Пользователи, которые ранее диктовали короткие сообщения, начали диктовать более длинные, а использование голосового режима возросло для задач, чувствительных ко времени.
- Стоимость: Запуск Gemma 4 E4B на устройстве обнулил маржинальные затраты на инференс, что позволило предоставить неограниченную диктовку на бесплатном тарифе без лимитов и paywall.
Как это работает
Конвейер полировки намеренно прост: аудио транскрибируется через облачный STT, затем отправляется в Gemma 4 E4B с компактным системным промптом (~400 токенов), который задает правила форматирования — восстановление пунктуации, разбиение на предложения, удаление слов-паразитов, исправление омофонов и адаптацию к активному полю ввода (например, без точки в конце для коротких команд, полная пунктуация для email). Отполированный текст вставляется через нативные OS API.
В развертывании Cue используется базовая модель только с промпт-инжинирингом. Контекст активного приложения (имя приложения, тип поля, текст-плейсхолдер) добавляется в промпт, чтобы модель знала, составляет ли пользователь сообщение в Slack, email или команду в терминале. Облачный путь остается в качестве запасного: если Ollama не запущен, Cue перенаправляет запрос на облачную модель без прерывания.
Почему победила Gemma 4
Изначально команда планировала использовать Gemma только как офлайн-резерв, предполагая, что более крупная облачная модель обеспечит лучшую точность. Однако бенчмарки на 227 реальных голосовых примерах показали, что Gemma 4 E4B обладает нужной мощностью для форматирования и исправления без излишнего редактирования — сохраняя естественную речь пользователя вместо сглаживания в формальный текст. Эта инверсия — локальная Gemma по умолчанию, облачная как запасной вариант — теперь является операционной основой каждой диктовки Cue.
📖 Читать полный источник: HN AI Agents
👀 Смотрите также

CodeLedger: Открытый плагин Claude Code отслеживает использование токенов и фоновые агенты
CodeLedger — это плагин с открытым исходным кодом для сервера MCP в Claude Code, который автоматически отслеживает использование токенов в проектах, идентифицирует фоновых агентов и предоставляет рекомендации по оптимизации затрат на основе анализа локальных JSONL-файлов сессий.

Создание самообновляющегося руководства по стилю письма для контента с использованием ИИ
Команда, создающая платформу для извлечения голоса Noren, разработала руководство по стилю в формате Markdown на 117 строк, которое переписывается после каждой опубликованной статьи, используя Claude для соблюдения правил и запрещая слова, звучащие как ИИ, такие как 'cadence' и 'optimize'.

Результаты тестирования APEX Benchmark: производительность Qwen 3.5 в реальных задачах программирования
Результаты тестирования APEX показывают производительность моделей Qwen 3.5 на 70 реальных задачах по программированию с GitHub. Версия 397B опускается до 1194 ELO на задачах уровня «мастер», в то время как GLM-4.7 в квантованном виде лидирует среди локальных моделей с 1572 ELO.

Culpa: Открытый движок детерминированного воспроизведения для отладки ИИ-агентов
Culpa — это инструмент с открытым исходным кодом, который записывает сессии LLM-агентов с полным контекстом выполнения, обеспечивая детерминированное воспроизведение с использованием записанных ответов в качестве заглушек вместо обращения к реальным API. Работает с API Anthropic и OpenAI через режим прокси или Python SDK.