Voxray-AI: Backend de Producción en Go para Pipelines de Agentes de Voz en Tiempo Real

✍️ OpenClawRadar📅 Publicado: 10 de marzo de 2026🔗 Source
Voxray-AI: Backend de Producción en Go para Pipelines de Agentes de Voz en Tiempo Real
Ad

Canalización de Agente de Voz de Producción en Go

Voxray-AI proporciona una canalización de transmisión completa en Go que maneja el audio del cliente a través de WebSocket o WebRTC, lo procesa a través de STT → LLM → TTS y devuelve la salida de audio. El sistema está diseñado para servidores de grado de producción y cargas de trabajo de voz de alta concurrencia.

Opciones de Transporte

El sistema admite múltiples mecanismos de transporte:

  • WebSocket en /ws con soporte para serializador RTVI (?rtvi=1) y Protobuf (?format=protobuf)
  • WebRTC en /webrtc/offer con intercambio completo de oferta/respuesta SDP, STUN/TURN configurable y codificación Opus (requiere compilación con CGO)
  • Transportes de ejecución de telefonía: Twilio, Telnyx, Plivo, Exotel, LiveKit, Daily.co

Proveedores Intercambiables

Todos los componentes son intercambiables mediante configuración:

  • Proveedores de STT: OpenAI, Groq, Sarvam, Google, AWS
  • Proveedores de LLM: OpenAI, Anthropic, Groq, otros
  • Proveedores de TTS: OpenAI, Google, AWS Polly, Sarvam

Ejemplos de Configuración

Ejemplo de configuración mínima:

{"transport": "both", "stt": { "provider": "groq", "model": "whisper-large-v3" }, "llm": { "provider": "anthropic", "model": "claude-3-5-haiku" }, "tts": { "provider": "google", "voice": "en-US-Neural2-F" }}

Configuración de toma de turnos y detección de actividad de voz:

{"turn_detection": "silence", "vad_type": "silero", "vad_confidence": 0.7, "vad_start_secs_vad": 0.2, "vad_stop_secs": 0.8, "turn_max_duration_secs": 30, "user_idle_timeout_secs": 60}
Ad

Observabilidad y Almacenamiento

  • Endpoint /metrics para Prometheus (recuentos de solicitudes, histogramas de latencia, indicadores de conexiones activas)
  • Grabación: Audio completo de sesión a S3 con grupo de trabajadores y formato configurables
  • Transcripciones: Almacenamiento por mensaje en Postgres o MySQL con tabla configurable
  • Endpoints /health y /ready con verificación opcional del almacén de sesiones Redis en /ready

Características de Seguridad

  • server_api_key protege /ws, /webrtc/offer, /start, /sessions/* mediante Authorization: Bearer o X-API-Key
  • Configuración de lista de permitidos CORS
  • Configuración de certificado/clave TLS
  • Estilo 12-factor: configuración JSON + anulaciones por variables de entorno

Este tipo de backend es útil para desarrolladores que construyen aplicaciones de voz en tiempo real que necesitan integrar múltiples servicios de IA con infraestructura lista para producción.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

Propuesta de Claude: Memoria de Alcance y Aislamiento Hermético de Instancias
Herramientas

Propuesta de Claude: Memoria de Alcance y Aislamiento Hermético de Instancias

Una propuesta formal a Anthropic de un usuario avanzado: alcance de memoria global/local y aislamiento hermético de instancias para Claude, permitiendo sesiones deterministas y auditables.

OpenClawRadar
Claude Octopus v8.48: Complemento de Orquestación Multi-IA para Flujos de Trabajo de Desarrollo
Herramientas

Claude Octopus v8.48: Complemento de Orquestación Multi-IA para Flujos de Trabajo de Desarrollo

Claude Octopus v8.48 es un complemento de código abierto que orquesta los modelos de IA Claude, Codex y Gemini en paralelo con roles distintos a lo largo de las fases de desarrollo. Incluye una puerta de consenso del 75% entre fases, ventanas de contexto nuevas para tareas complejas y comandos específicos como /octo:embrace para el desarrollo de ciclo de vida completo.

OpenClawRadar
Andamio de Habilidades: Construye Habilidades de OpenClaw Sin Escribir Código
Herramientas

Andamio de Habilidades: Construye Habilidades de OpenClaw Sin Escribir Código

Skill Scaffolder es una herramienta de código abierto que permite a los usuarios crear habilidades para OpenClaw describiendo lo que quieren en inglés sencillo. Maneja todo el proceso—entrevistando a los usuarios, escribiendo archivos de habilidad, probando e instalando—sin requerir archivos YAML, Python o de configuración.

OpenClawRadar
Semble: Búsqueda de código para agentes de IA usando un 98% menos de tokens que grep+read
Herramientas

Semble: Búsqueda de código para agentes de IA usando un 98% menos de tokens que grep+read

Semble es una biblioteca de búsqueda de código de código abierto para agentes de IA que combina embeddings estáticos Model2Vec con BM25, funcionando completamente en CPU. Indexa un repositorio en ~250 ms y responde consultas en ~1.5 ms, logrando un NDCG@10 de 0.854 — el 99% de la calidad de un transformer de 137M de parámetros — mientras usa un 98% menos de tokens que grep+read.

OpenClawRadar