Voxray-AI: Backend de Producción en Go para Pipelines de Agentes de Voz en Tiempo Real

Canalización de Agente de Voz de Producción en Go
Voxray-AI proporciona una canalización de transmisión completa en Go que maneja el audio del cliente a través de WebSocket o WebRTC, lo procesa a través de STT → LLM → TTS y devuelve la salida de audio. El sistema está diseñado para servidores de grado de producción y cargas de trabajo de voz de alta concurrencia.
Opciones de Transporte
El sistema admite múltiples mecanismos de transporte:
- WebSocket en
/wscon soporte para serializador RTVI (?rtvi=1) y Protobuf (?format=protobuf) - WebRTC en
/webrtc/offercon intercambio completo de oferta/respuesta SDP, STUN/TURN configurable y codificación Opus (requiere compilación con CGO) - Transportes de ejecución de telefonía: Twilio, Telnyx, Plivo, Exotel, LiveKit, Daily.co
Proveedores Intercambiables
Todos los componentes son intercambiables mediante configuración:
- Proveedores de STT: OpenAI, Groq, Sarvam, Google, AWS
- Proveedores de LLM: OpenAI, Anthropic, Groq, otros
- Proveedores de TTS: OpenAI, Google, AWS Polly, Sarvam
Ejemplos de Configuración
Ejemplo de configuración mínima:
{"transport": "both", "stt": { "provider": "groq", "model": "whisper-large-v3" }, "llm": { "provider": "anthropic", "model": "claude-3-5-haiku" }, "tts": { "provider": "google", "voice": "en-US-Neural2-F" }}Configuración de toma de turnos y detección de actividad de voz:
{"turn_detection": "silence", "vad_type": "silero", "vad_confidence": 0.7, "vad_start_secs_vad": 0.2, "vad_stop_secs": 0.8, "turn_max_duration_secs": 30, "user_idle_timeout_secs": 60}Observabilidad y Almacenamiento
- Endpoint
/metricspara Prometheus (recuentos de solicitudes, histogramas de latencia, indicadores de conexiones activas) - Grabación: Audio completo de sesión a S3 con grupo de trabajadores y formato configurables
- Transcripciones: Almacenamiento por mensaje en Postgres o MySQL con tabla configurable
- Endpoints
/healthy/readycon verificación opcional del almacén de sesiones Redis en/ready
Características de Seguridad
server_api_keyprotege/ws,/webrtc/offer,/start,/sessions/*medianteAuthorization: BeareroX-API-Key- Configuración de lista de permitidos CORS
- Configuración de certificado/clave TLS
- Estilo 12-factor: configuración JSON + anulaciones por variables de entorno
Este tipo de backend es útil para desarrolladores que construyen aplicaciones de voz en tiempo real que necesitan integrar múltiples servicios de IA con infraestructura lista para producción.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

Propuesta de Claude: Memoria de Alcance y Aislamiento Hermético de Instancias
Una propuesta formal a Anthropic de un usuario avanzado: alcance de memoria global/local y aislamiento hermético de instancias para Claude, permitiendo sesiones deterministas y auditables.

Claude Octopus v8.48: Complemento de Orquestación Multi-IA para Flujos de Trabajo de Desarrollo
Claude Octopus v8.48 es un complemento de código abierto que orquesta los modelos de IA Claude, Codex y Gemini en paralelo con roles distintos a lo largo de las fases de desarrollo. Incluye una puerta de consenso del 75% entre fases, ventanas de contexto nuevas para tareas complejas y comandos específicos como /octo:embrace para el desarrollo de ciclo de vida completo.

Andamio de Habilidades: Construye Habilidades de OpenClaw Sin Escribir Código
Skill Scaffolder es una herramienta de código abierto que permite a los usuarios crear habilidades para OpenClaw describiendo lo que quieren en inglés sencillo. Maneja todo el proceso—entrevistando a los usuarios, escribiendo archivos de habilidad, probando e instalando—sin requerir archivos YAML, Python o de configuración.

Semble: Búsqueda de código para agentes de IA usando un 98% menos de tokens que grep+read
Semble es una biblioteca de búsqueda de código de código abierto para agentes de IA que combina embeddings estáticos Model2Vec con BM25, funcionando completamente en CPU. Indexa un repositorio en ~250 ms y responde consultas en ~1.5 ms, logrando un NDCG@10 de 0.854 — el 99% de la calidad de un transformer de 137M de parámetros — mientras usa un 98% menos de tokens que grep+read.