Voxray-AI : Backend de Production en Go pour Pipelines d'Agents Vocaux en Temps Réel

✍️ OpenClawRadar📅 Publié: March 10, 2026🔗 Source
Voxray-AI : Backend de Production en Go pour Pipelines d'Agents Vocaux en Temps Réel
Ad

Pipeline d'Agent Vocal de Production en Go

Voxray-AI fournit un pipeline de streaming complet en Go qui traite l'audio client via WebSocket ou WebRTC, le traite via STT → LLM → TTS, et renvoie une sortie audio. Le système est conçu pour des serveurs de qualité production et des charges de travail vocales à haute concurrence.

Options de Transport

Le système prend en charge plusieurs mécanismes de transport :

  • WebSocket à /ws avec support du sérialiseur RTVI (?rtvi=1) et Protobuf (?format=protobuf)
  • WebRTC à /webrtc/offer avec offre/réponse SDP complète, STUN/TURN configurable et encodage Opus (nécessite une compilation CGO)
  • Transports d'exécution téléphonique : Twilio, Telnyx, Plivo, Exotel, LiveKit, Daily.co

Fournisseurs Interchangeables

Tous les composants sont remplaçables via la configuration :

  • Fournisseurs STT : OpenAI, Groq, Sarvam, Google, AWS
  • Fournisseurs LLM : OpenAI, Anthropic, Groq, autres
  • Fournisseurs TTS : OpenAI, Google, AWS Polly, Sarvam

Exemples de Configuration

Exemple de configuration minimal :

{"transport": "both", "stt": { "provider": "groq", "model": "whisper-large-v3" }, "llm": { "provider": "anthropic", "model": "claude-3-5-haiku" }, "tts": { "provider": "google", "voice": "en-US-Neural2-F" }}

Configuration de la prise de parole et de la détection d'activité vocale :

{"turn_detection": "silence", "vad_type": "silero", "vad_confidence": 0.7, "vad_start_secs_vad": 0.2, "vad_stop_secs": 0.8, "turn_max_duration_secs": 30, "user_idle_timeout_secs": 60}
Ad

Observabilité et Stockage

  • Point de terminaison /metrics pour Prometheus (comptes de requêtes, histogrammes de latence, jauges de connexions actives)
  • Enregistrement : Audio de session complet vers S3 avec pool de travailleurs et format configurables
  • Transcriptions : Stockage par message vers Postgres ou MySQL avec table configurable
  • Points de terminaison /health et /ready avec vérification optionnelle du magasin de sessions Redis sur /ready

Fonctionnalités de Sécurité

  • server_api_key protège /ws, /webrtc/offer, /start, /sessions/* via Authorization: Bearer ou X-API-Key
  • Configuration de liste d'autorisation CORS
  • Configuration de certificat/clé TLS
  • Style 12-factor : configuration JSON + remplacements par variables d'environnement

Ce type de backend est utile pour les développeurs construisant des applications vocales en temps réel qui doivent intégrer plusieurs services d'IA avec une infrastructure prête pour la production.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Surveillez votre utilisation de Claude IA avec un nouveau widget de barre des tâches Linux
Tools

Surveillez votre utilisation de Claude IA avec un nouveau widget de barre des tâches Linux

Un nouveau widget de barre des tâches Linux aide les utilisateurs à suivre en temps réel l'utilisation de leur abonnement Claude AI, avec un retour coloré et une installation facile.

OpenClawRadar
Gouverneur : Un plugin Claude Code pour réduire le gaspillage de tokens via la compression des sorties, l'allègement du contexte et le filtrage des outils
Tools

Gouverneur : Un plugin Claude Code pour réduire le gaspillage de tokens via la compression des sorties, l'allègement du contexte et le filtrage des outils

Governor est un plugin Claude Code qui réduit le gaspillage de tokens/contexte grâce à une sortie professionnelle compacte, la compression de fichiers mémoire, le filtrage des sorties d'outils et des garde-fous anti-dérive. Les benchmarks montrent une économie de 55,5% de tokens de sortie par rapport au témoin.

OpenClawRadar
Machine Virtuelle Logique : Un Système Basé sur des Invites pour Stopper les Effondrements de Raisonnement des LLM
Tools

Machine Virtuelle Logique : Un Système Basé sur des Invites pour Stopper les Effondrements de Raisonnement des LLM

Un chercheur a développé un prompt de Machine Virtuelle Logique (LVM) qui force les LLM à s'arrêter et à signaler des modes d'effondrement spécifiques lorsqu'ils rencontrent des paradoxes ou des dérives de raisonnement, basé sur une seule loi de stabilité : K(σ) ⇒ K(β(σ)). Le prompt est indépendant du substrat et fonctionne sur des modèles comme Grok et Claude.

OpenClawRadar
Doc Harness : Une Compétence Claude Code pour Maintenir l'État du Projet Entre les Sessions
Tools

Doc Harness : Une Compétence Claude Code pour Maintenir l'État du Projet Entre les Sessions

Doc Harness est une compétence Claude Code qui crée un système de documentation léger avec cinq fichiers structurés pour aider les agents IA à maintenir le contexte du projet entre les sessions. Il résout les problèmes comme les réinitialisations de contexte, les règles oubliées et la nécessité de réexpliquer les projets aux nouveaux agents.

OpenClawRadar