Разработчик достиг задержки менее секунды для STT/TTS с локальными серверами Whisper и Coqui-TTS.

✍️ OpenClawRadar📅 Опубликовано: 13 апреля 2026 г.🔗 Source
Разработчик достиг задержки менее секунды для STT/TTS с локальными серверами Whisper и Coqui-TTS.
Ad

Разработчик поделился реализациями серверов с открытым исходным кодом, которые обеспечивают задержку менее секунды для преобразования речи в текст и текста в речь в локальных ИИ-агентах, устраняя разговорную задержку, обычно связанную с облачными решениями.

Показатели производительности

Реализация обеспечивает:

  • ~0,2 секунды задержки для преобразования речи в текст (STT)
  • ~250 мс задержки для преобразования текста в речь (TTS)

Это представляет собой значительное улучшение по сравнению с упомянутым ранее узким местом в 2-3 секунды ожидания.

Техническая реализация

Сервер STT

  • Создан с использованием Whisper large-v3-turbo
  • Пользовательская реализация моста
  • Гибридная архитектура с управлением потоками GPU для параллельной обработки без перегрузки видеопамяти

Сервер TTS

  • Использует Coqui-TTS, работающий на локальном сервере
  • API, совместимый с OpenAI
  • Оптимизирован для синтеза с низкой задержкой
  • Включает клонированный голос Пола Беттани/Джарвиса
Ad

Требования к оборудованию

  • Выделенный узел с GPU NVIDIA RTX
  • Ускорение на GPU обязательно для достижения таких скоростей

Компоненты с открытым исходным кодом

Разработчик опубликовал два репозитория на GitHub:

Они включают реализации серверов и скрипты интеграции OpenClaw для создания локальных агентов.

Результаты

Агент теперь демонстрирует по-настоящему разговорное поведение с:

  • Правильной обработкой прерываний
  • Почти мгновенными ответами
  • Нулевой передачей аудиоданных внешним API

Разработчик готов ответить на вопросы о настройке сервера, управлении видеопамятью и интеграции в другие ИИ-проекты.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Результаты тестирования: Когда использовать Claude Opus с Codex или чистый Opus для генерации кода
Инструменты

Результаты тестирования: Когда использовать Claude Opus с Codex или чистый Opus для генерации кода

Контрольный тест проверил подход 'Планирование с Opus, выполнение с Codex' на трех реальных задачах программирования. Результаты показывают точку пересечения затрат примерно на 600 строках кода с конкретными рекомендациями в зависимости от размера проекта.

OpenClawRadar
Экранбокс: Открытый код виртуальных рабочих столов для ИИ-агентов, полностью созданных голосом
Инструменты

Экранбокс: Открытый код виртуальных рабочих столов для ИИ-агентов, полностью созданных голосом

Screenbox предоставляет изолированные Linux-рабочие столы в Docker для AI-агентов, решая конфликты при параллельном запуске нескольких агентов. Проект был полностью создан с помощью голосовых команд в Claude Code, и создатель не видел ни одной строки кода.

OpenClawRadar
Claude Code добавляет автоматический режим для принятия решений о разрешениях
Инструменты

Claude Code добавляет автоматический режим для принятия решений о разрешениях

Claude Code теперь имеет автоматический режим, который позволяет Claude принимать решения о разрешениях вместо того, чтобы требовать ручного подтверждения для каждой записи файла и bash-команды. Этот режим включает защитные механизмы, которые проверяют каждое действие перед его выполнением, с использованием классификатора для анализа вызовов инструментов на предмет потенциально опасных действий.

OpenClawRadar
Запуск NemoClaw с локальным vLLM: Заметки по настройке и наблюдения по разработке агентов
Инструменты

Запуск NemoClaw с локальным vLLM: Заметки по настройке и наблюдения по разработке агентов

Разработчик задокументировал запуск платформы изолированных AI-агентов NVIDIA NemoClaw с локальной моделью Nemotron 9B v2 через vLLM на WSL2. Ключевые выводы включают детали маршрутизации вывода, проблемы совместимости парсеров и наблюдения о разрыве в разработке агентов.

OpenClawRadar