Voxray-AI: Backend de Producción en Go para Pipelines de Agentes de Voz en Tiempo Real

Canalización de Agente de Voz de Producción en Go
Voxray-AI proporciona una canalización de transmisión completa en Go que maneja el audio del cliente a través de WebSocket o WebRTC, lo procesa a través de STT → LLM → TTS y devuelve la salida de audio. El sistema está diseñado para servidores de grado de producción y cargas de trabajo de voz de alta concurrencia.
Opciones de Transporte
El sistema admite múltiples mecanismos de transporte:
- WebSocket en
/wscon soporte para serializador RTVI (?rtvi=1) y Protobuf (?format=protobuf) - WebRTC en
/webrtc/offercon intercambio completo de oferta/respuesta SDP, STUN/TURN configurable y codificación Opus (requiere compilación con CGO) - Transportes de ejecución de telefonía: Twilio, Telnyx, Plivo, Exotel, LiveKit, Daily.co
Proveedores Intercambiables
Todos los componentes son intercambiables mediante configuración:
- Proveedores de STT: OpenAI, Groq, Sarvam, Google, AWS
- Proveedores de LLM: OpenAI, Anthropic, Groq, otros
- Proveedores de TTS: OpenAI, Google, AWS Polly, Sarvam
Ejemplos de Configuración
Ejemplo de configuración mínima:
{"transport": "both", "stt": { "provider": "groq", "model": "whisper-large-v3" }, "llm": { "provider": "anthropic", "model": "claude-3-5-haiku" }, "tts": { "provider": "google", "voice": "en-US-Neural2-F" }}Configuración de toma de turnos y detección de actividad de voz:
{"turn_detection": "silence", "vad_type": "silero", "vad_confidence": 0.7, "vad_start_secs_vad": 0.2, "vad_stop_secs": 0.8, "turn_max_duration_secs": 30, "user_idle_timeout_secs": 60}Observabilidad y Almacenamiento
- Endpoint
/metricspara Prometheus (recuentos de solicitudes, histogramas de latencia, indicadores de conexiones activas) - Grabación: Audio completo de sesión a S3 con grupo de trabajadores y formato configurables
- Transcripciones: Almacenamiento por mensaje en Postgres o MySQL con tabla configurable
- Endpoints
/healthy/readycon verificación opcional del almacén de sesiones Redis en/ready
Características de Seguridad
server_api_keyprotege/ws,/webrtc/offer,/start,/sessions/*medianteAuthorization: BeareroX-API-Key- Configuración de lista de permitidos CORS
- Configuración de certificado/clave TLS
- Estilo 12-factor: configuración JSON + anulaciones por variables de entorno
Este tipo de backend es útil para desarrolladores que construyen aplicaciones de voz en tiempo real que necesitan integrar múltiples servicios de IA con infraestructura lista para producción.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

Restricciones: Capa Externa de Gobernanza en Fase Alfa Temprana para Agentes de IA
Constrails es una capa externa de gobernanza en tiempo de ejecución para agentes de IA que coloca una capa de control entre los agentes y sus herramientas, implementando verificaciones de capacidad, puntuación de riesgo, evaluación de políticas y registro de auditoría. El proyecto en fase alfa temprana tiene como objetivo abordar las preocupaciones de seguridad trasladando los controles fuera del propio agente.
AIttache: Un servidor MCP de solo lectura que no puede destruir tu producción
AItache es un servidor MCP con más de 25 conectores de solo lectura (terminal, servidores, clima, Steam) que físicamente no puede modificar nada, diseñado para dar contexto de logs a los LLMs sin autonomía.

Configurar OpenClaw con Alquiler de GPU VAST.AI para Prompts Ilimitados de Ollama
Un usuario describe combinar el alquiler de GPU de VAST.AI con Ollama y OpenClaw para superar los límites de prompts, pero encontró desafíos de configuración que requirieron edición manual de JSON.

Diseño Abierto: Alternativa de Código Abierto a Claude Design que Funciona en tus Agentes CLI Locales
Open Design es un motor de diseño local-first y BYOK que convierte 11 CLIs de agentes de codificación (Claude Code, Codex, Cursor, Gemini CLI, etc.) en un flujo de trabajo de diseño con 72 sistemas de diseño de nivel de marca y 31 habilidades componibles, exportando HTML/PDF/PPTX/MP4.