Разработчик достиг задержки менее секунды для STT/TTS с локальными серверами Whisper и Coqui-TTS.

✍️ OpenClawRadar📅 Опубликовано: 13 апреля 2026 г.🔗 Source
Разработчик достиг задержки менее секунды для STT/TTS с локальными серверами Whisper и Coqui-TTS.
Ad

Разработчик поделился реализациями серверов с открытым исходным кодом, которые обеспечивают задержку менее секунды для преобразования речи в текст и текста в речь в локальных ИИ-агентах, устраняя разговорную задержку, обычно связанную с облачными решениями.

Показатели производительности

Реализация обеспечивает:

  • ~0,2 секунды задержки для преобразования речи в текст (STT)
  • ~250 мс задержки для преобразования текста в речь (TTS)

Это представляет собой значительное улучшение по сравнению с упомянутым ранее узким местом в 2-3 секунды ожидания.

Техническая реализация

Сервер STT

  • Создан с использованием Whisper large-v3-turbo
  • Пользовательская реализация моста
  • Гибридная архитектура с управлением потоками GPU для параллельной обработки без перегрузки видеопамяти

Сервер TTS

  • Использует Coqui-TTS, работающий на локальном сервере
  • API, совместимый с OpenAI
  • Оптимизирован для синтеза с низкой задержкой
  • Включает клонированный голос Пола Беттани/Джарвиса
Ad

Требования к оборудованию

  • Выделенный узел с GPU NVIDIA RTX
  • Ускорение на GPU обязательно для достижения таких скоростей

Компоненты с открытым исходным кодом

Разработчик опубликовал два репозитория на GitHub:

Они включают реализации серверов и скрипты интеграции OpenClaw для создания локальных агентов.

Результаты

Агент теперь демонстрирует по-настоящему разговорное поведение с:

  • Правильной обработкой прерываний
  • Почти мгновенными ответами
  • Нулевой передачей аудиоданных внешним API

Разработчик готов ответить на вопросы о настройке сервера, управлении видеопамятью и интеграции в другие ИИ-проекты.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

LAP: Собрано более 1500 спецификаций API для использования в LLM с целью снижения галлюцинаций у Claude
Инструменты

LAP: Собрано более 1500 спецификаций API для использования в LLM с целью снижения галлюцинаций у Claude

LAP — это инструмент, который компилирует более 1500 реальных спецификаций API в облегчённый формат, оптимизированный для LLM, предоставляя проверенные конечные точки и параметры, чтобы предотвратить создание AI-агентами, такими как Claude, некорректных вызовов API.

OpenClawRadar
Шесть репозиториев GitHub для разработки кода с Claude
Инструменты

Шесть репозиториев GitHub для разработки кода с Claude

Пользователь Reddit протестировал и поделился шестью репозиториями GitHub, предназначенными для улучшения проектов Claude Code, включая инструменты для структурированной разработки, генерации пользовательского интерфейса, управления задачами, памяти, изучения экосистемы и автоматизации рабочих процессов.

OpenClawRadar
InsForge: Открытая бэкенд-платформа для ИИ-агентов программирования
Инструменты

InsForge: Открытая бэкенд-платформа для ИИ-агентов программирования

InsForge — это открытая бэкенд-платформа (Apache 2.0), предоставляющая AI-агентам кода управляемую базу данных, аутентификацию, хранилище, вычисления, хостинг и AI-шлюз, управляемые через CLI или MCP.

OpenClawRadar
BaseLayer: Открытый Конвейер Поведенческого Сжатия для Систем Памяти ИИ
Инструменты

BaseLayer: Открытый Конвейер Поведенческого Сжатия для Систем Памяти ИИ

BaseLayer — это открытый конвейер, который извлекает убеждения, поведение, противоречия и напряжения из разговоров, дневников и опубликованных текстов, сжимая их в краткое описание идентичности для ИИ-моделей. Он был протестирован на наборах данных от 8 личных дневниковых записей до крупных корпусов, таких как письма акционерам Уоррена Баффета (350 тыс. слов) и инвестиционные меморандумы Говарда Маркса (600 тыс. слов).

OpenClawRadar