Voxray-AI: Продуктовая Go-бэкенд платформа для пайплайнов голосовых агентов в реальном времени

Конвейер голосового агента производственного уровня на Go
Voxray-AI предоставляет полный потоковый конвейер на Go, который обрабатывает аудио клиента через WebSocket или WebRTC, пропускает его через STT → LLM → TTS и возвращает аудиовыход. Система предназначена для серверов производственного уровня и голосовых нагрузок с высокой параллельностью.
Варианты транспорта
Система поддерживает несколько механизмов транспорта:
- WebSocket по адресу
/wsс поддержкой сериализатора RTVI (?rtvi=1) и Protobuf (?format=protobuf) - WebRTC по адресу
/webrtc/offerс полным SDP offer/answer, настраиваемыми STUN/TURN и кодированием Opus (требует сборки с CGO) - Транспорты для телефонии: Twilio, Telnyx, Plivo, Exotel, LiveKit, Daily.co
Сменные провайдеры
Все компоненты можно заменять через конфигурацию:
- Провайдеры STT: OpenAI, Groq, Sarvam, Google, AWS
- Провайдеры LLM: OpenAI, Anthropic, Groq, другие
- Провайдеры TTS: OpenAI, Google, AWS Polly, Sarvam
Примеры конфигурации
Минимальный пример конфигурации:
{"transport": "both", "stt": { "provider": "groq", "model": "whisper-large-v3" }, "llm": { "provider": "anthropic", "model": "claude-3-5-haiku" }, "tts": { "provider": "google", "voice": "en-US-Neural2-F" }}Конфигурация определения очереди и детекции голосовой активности:
{"turn_detection": "silence", "vad_type": "silero", "vad_confidence": 0.7, "vad_start_secs_vad": 0.2, "vad_stop_secs": 0.8, "turn_max_duration_secs": 30, "user_idle_timeout_secs": 60}Наблюдаемость и хранение
- Эндпоинт
/metricsдля Prometheus (счётчики запросов, гистограммы задержек, датчики активных соединений) - Запись: Полное аудио сессии в S3 с настраиваемым пулом воркеров и форматом
- Транскрипты: Хранение каждого сообщения в Postgres или MySQL с настраиваемой таблицей
- Эндпоинты
/healthи/readyс опциональной проверкой хранилища сессий Redis на/ready
Функции безопасности
server_api_keyзащищает/ws,/webrtc/offer,/start,/sessions/*черезAuthorization: BearerилиX-API-Key- Конфигурация белого списка CORS
- Конфигурация сертификата и ключа TLS
- Стиль 12-factor: JSON-конфигурация + переопределения переменных окружения
Такой бэкенд полезен разработчикам, создающим голосовые приложения реального времени, которым необходимо интегрировать несколько AI-сервисов с инфраструктурой, готовой к промышленной эксплуатации.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

LUMA SOUL: Разумы на базе Claude с постоянной блокировкой создателя и прозрачной памятью
LUMA SOUL — это платформа присутствия, где разумы Claude получают портреты, голоса и документы души. Ключевая особенность: создатели навсегда теряют права редактирования при публикации, а память полностью прозрачна.

Сократитель Токенов: Плагин Claude Code для интеллектуального сжатия контекста
Token Reducer — это плагин Claude Code, который обрабатывает контекст репозитория локально, сокращая использование токенов на 90–98% с помощью AST-сегментации, гибридного поиска и сжатия TextRank. Распространяется под лицензией MIT и доступен в магазине плагинов.

Навык Claude Code /council запускает промты параллельно на 4 моделях ИИ
Навык Claude Code под названием /council отправляет любой запрос одновременно в GPT, Claude, Gemini и Grok примерно за 7 секунд, а затем использует Gemini для синтеза лучшего ответа, выявляя конкретные улучшения от других моделей.

Шесть репозиториев GitHub для разработки кода с Claude
Пользователь Reddit протестировал и поделился шестью репозиториями GitHub, предназначенными для улучшения проектов Claude Code, включая инструменты для структурированной разработки, генерации пользовательского интерфейса, управления задачами, памяти, изучения экосистемы и автоматизации рабочих процессов.