Voxray-AI : Backend de Production en Go pour Pipelines d'Agents Vocaux en Temps Réel

Pipeline d'Agent Vocal de Production en Go
Voxray-AI fournit un pipeline de streaming complet en Go qui traite l'audio client via WebSocket ou WebRTC, le traite via STT → LLM → TTS, et renvoie une sortie audio. Le système est conçu pour des serveurs de qualité production et des charges de travail vocales à haute concurrence.
Options de Transport
Le système prend en charge plusieurs mécanismes de transport :
- WebSocket à
/wsavec support du sérialiseur RTVI (?rtvi=1) et Protobuf (?format=protobuf) - WebRTC à
/webrtc/offeravec offre/réponse SDP complète, STUN/TURN configurable et encodage Opus (nécessite une compilation CGO) - Transports d'exécution téléphonique : Twilio, Telnyx, Plivo, Exotel, LiveKit, Daily.co
Fournisseurs Interchangeables
Tous les composants sont remplaçables via la configuration :
- Fournisseurs STT : OpenAI, Groq, Sarvam, Google, AWS
- Fournisseurs LLM : OpenAI, Anthropic, Groq, autres
- Fournisseurs TTS : OpenAI, Google, AWS Polly, Sarvam
Exemples de Configuration
Exemple de configuration minimal :
{"transport": "both", "stt": { "provider": "groq", "model": "whisper-large-v3" }, "llm": { "provider": "anthropic", "model": "claude-3-5-haiku" }, "tts": { "provider": "google", "voice": "en-US-Neural2-F" }}Configuration de la prise de parole et de la détection d'activité vocale :
{"turn_detection": "silence", "vad_type": "silero", "vad_confidence": 0.7, "vad_start_secs_vad": 0.2, "vad_stop_secs": 0.8, "turn_max_duration_secs": 30, "user_idle_timeout_secs": 60}Observabilité et Stockage
- Point de terminaison
/metricspour Prometheus (comptes de requêtes, histogrammes de latence, jauges de connexions actives) - Enregistrement : Audio de session complet vers S3 avec pool de travailleurs et format configurables
- Transcriptions : Stockage par message vers Postgres ou MySQL avec table configurable
- Points de terminaison
/healthet/readyavec vérification optionnelle du magasin de sessions Redis sur/ready
Fonctionnalités de Sécurité
server_api_keyprotège/ws,/webrtc/offer,/start,/sessions/*viaAuthorization: BearerouX-API-Key- Configuration de liste d'autorisation CORS
- Configuration de certificat/clé TLS
- Style 12-factor : configuration JSON + remplacements par variables d'environnement
Ce type de backend est utile pour les développeurs construisant des applications vocales en temps réel qui doivent intégrer plusieurs services d'IA avec une infrastructure prête pour la production.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Surveillez votre utilisation de Claude IA avec un nouveau widget de barre des tâches Linux
Un nouveau widget de barre des tâches Linux aide les utilisateurs à suivre en temps réel l'utilisation de leur abonnement Claude AI, avec un retour coloré et une installation facile.

Gouverneur : Un plugin Claude Code pour réduire le gaspillage de tokens via la compression des sorties, l'allègement du contexte et le filtrage des outils
Governor est un plugin Claude Code qui réduit le gaspillage de tokens/contexte grâce à une sortie professionnelle compacte, la compression de fichiers mémoire, le filtrage des sorties d'outils et des garde-fous anti-dérive. Les benchmarks montrent une économie de 55,5% de tokens de sortie par rapport au témoin.

Machine Virtuelle Logique : Un Système Basé sur des Invites pour Stopper les Effondrements de Raisonnement des LLM
Un chercheur a développé un prompt de Machine Virtuelle Logique (LVM) qui force les LLM à s'arrêter et à signaler des modes d'effondrement spécifiques lorsqu'ils rencontrent des paradoxes ou des dérives de raisonnement, basé sur une seule loi de stabilité : K(σ) ⇒ K(β(σ)). Le prompt est indépendant du substrat et fonctionne sur des modèles comme Grok et Claude.

Doc Harness : Une Compétence Claude Code pour Maintenir l'État du Projet Entre les Sessions
Doc Harness est une compétence Claude Code qui crée un système de documentation léger avec cinq fichiers structurés pour aider les agents IA à maintenir le contexte du projet entre les sessions. Il résout les problèmes comme les réinitialisations de contexte, les règles oubliées et la nécessité de réexpliquer les projets aux nouveaux agents.