Создание голосового агента с задержкой менее 500 мс: архитектура и анализ производительности

Архитектура и производительность голосового агента
Ник Тихонов создал голосового агента с нуля, который в среднем имеет сквозную задержку около 400 мс (от окончания речи пользователя до первого слога ответа). Это включает полный цикл STT → LLM → TTS с чистыми перебиваниями и без предварительно сгенерированных ответов. Данная реализация превзошла аналогичную настройку Vapi по задержке в 2 раза.
Ключевые технические идеи
Основным осознанием стало то, что голос — это проблема очередности реплик, а не транскрипции. Одного лишь детектирования голосовой активности (VAD) недостаточно; требуется семантическое определение конца реплики. Система сводится к одному циклу с двумя состояниями: говорит или слушает.
Критические переходы:
- Мгновенная отмена при перебивании
- Мгновенный ответ в конце реплики
Технические требования
STT → LLM → TTS должны работать в потоковом режиме. Последовательные конвейеры неэффективны для естественного разговора. Время до первого токена (TTFT) доминирует во всех голосовых интерфейсах — первый токен является критическим путём. TTFT Groq в ~80 мс был определён как самое большое преимущество в производительности.
Инфраструктурные соображения
География важнее промптов. Все компоненты должны быть размещены в одном месте, иначе задержка становится неприемлемой ещё до начала обработки системой. Сборка заняла примерно один день и около $100 в API-кредитах.
Почему голосовые агенты сложны
Голосовые агенты представляют собой значительное увеличение сложности по сравнению с текстовыми агентами. Оркестрация непрерывна и происходит в реальном времени, требуя тщательного управления несколькими моделями одновременно. Система должна постоянно решать, говорит пользователь или слушает, причём переходы между этими состояниями являются наиболее сложным аспектом.
Когда пользователь начинает говорить, агент должен немедленно прекратить речь — отменить генерацию, отменить синтез речи и очистить любой буферизованный звук. Когда пользователь перестаёт говорить, система должна уверенно определить, что он закончил, и начать отвечать с минимальной задержкой.
Подход к архитектуре
Разработчик начал с итераций по архитектуре в ChatGPT вне редактора, чтобы сначала построить ментальную модель. Вся проблема была сведена к одному циклу и крошечному конечному автомату. Основной вопрос, на который должен отвечать голосовой агент: говорит пользователь или слушает?
Два состояния:
- Пользователь говорит
- Пользователь слушает
Эта логика определения очереди реплик составляет основу каждой голосовой системы. Реализация доступна на GitHub для ознакомления и дальнейшей разработки.
📖 Read the full source: HN AI Agents
👀 Смотрите также

Клод AI оценивает каждый стартап YC Spring 2026 — полная сводка конвейера
Пользователь Reddit запустил Claude для каждой стартап-компании YC Spring 2026, собирая данные из LinkedIn и прессы, чтобы присвоить рейтинг от S до D. Большинство получили оценку B или C.

re_gent: Git для ИИ-агентов кодинга – Контроль версий активности агента
re_gent — это инструмент с открытым исходным кодом, который обеспечивает контроль версий для сессий ИИ-агентов, отслеживая каждый вызов инструмента, сохраняя подсказки и различия в файлах, и предоставляя команды, такие как `rgt log`, `rgt blame` и `rgt rewind` (скоро появится).

Опция: Оркестрация AI-агентов для написания кода в Kubernetes от тикета до PR
Optio — это система оркестрации с открытым исходным кодом, которая преобразует задачи (тикеты) в принятые пул-реквесты с помощью ИИ-агентов для написания кода, таких как Claude Code или Codex. Она управляет полным жизненным циклом в изолированных подах Kubernetes, используя цикл обратной связи, который автоматически возобновляет работу агентов при сбоях CI или получении отзывов по ревью.

Шесть инструментов с открытым исходным кодом, решающих проблемы безопасности, стоимости и сложности OpenClaw
Разработчик протестировал шесть инструментов сообщества для устранения уязвимостей безопасности OpenClaw, отмеченных Cisco, растущих затрат и сложной настройки. ClawSec обеспечивает сканирование безопасности и проверку целостности, Antfarm позволяет создавать детерминированные рабочие процессы с несколькими агентами, а LanceDB Pro улучшает поиск в памяти с помощью гибридного векторного поиска.