Voxray-AI: Backend de Producción en Go para Pipelines de Agentes de Voz en Tiempo Real

✍️ OpenClawRadar📅 Publicado: 10 de marzo de 2026🔗 Source
Voxray-AI: Backend de Producción en Go para Pipelines de Agentes de Voz en Tiempo Real
Ad

Canalización de Agente de Voz de Producción en Go

Voxray-AI proporciona una canalización de transmisión completa en Go que maneja el audio del cliente a través de WebSocket o WebRTC, lo procesa a través de STT → LLM → TTS y devuelve la salida de audio. El sistema está diseñado para servidores de grado de producción y cargas de trabajo de voz de alta concurrencia.

Opciones de Transporte

El sistema admite múltiples mecanismos de transporte:

  • WebSocket en /ws con soporte para serializador RTVI (?rtvi=1) y Protobuf (?format=protobuf)
  • WebRTC en /webrtc/offer con intercambio completo de oferta/respuesta SDP, STUN/TURN configurable y codificación Opus (requiere compilación con CGO)
  • Transportes de ejecución de telefonía: Twilio, Telnyx, Plivo, Exotel, LiveKit, Daily.co

Proveedores Intercambiables

Todos los componentes son intercambiables mediante configuración:

  • Proveedores de STT: OpenAI, Groq, Sarvam, Google, AWS
  • Proveedores de LLM: OpenAI, Anthropic, Groq, otros
  • Proveedores de TTS: OpenAI, Google, AWS Polly, Sarvam

Ejemplos de Configuración

Ejemplo de configuración mínima:

{"transport": "both", "stt": { "provider": "groq", "model": "whisper-large-v3" }, "llm": { "provider": "anthropic", "model": "claude-3-5-haiku" }, "tts": { "provider": "google", "voice": "en-US-Neural2-F" }}

Configuración de toma de turnos y detección de actividad de voz:

{"turn_detection": "silence", "vad_type": "silero", "vad_confidence": 0.7, "vad_start_secs_vad": 0.2, "vad_stop_secs": 0.8, "turn_max_duration_secs": 30, "user_idle_timeout_secs": 60}
Ad

Observabilidad y Almacenamiento

  • Endpoint /metrics para Prometheus (recuentos de solicitudes, histogramas de latencia, indicadores de conexiones activas)
  • Grabación: Audio completo de sesión a S3 con grupo de trabajadores y formato configurables
  • Transcripciones: Almacenamiento por mensaje en Postgres o MySQL con tabla configurable
  • Endpoints /health y /ready con verificación opcional del almacén de sesiones Redis en /ready

Características de Seguridad

  • server_api_key protege /ws, /webrtc/offer, /start, /sessions/* mediante Authorization: Bearer o X-API-Key
  • Configuración de lista de permitidos CORS
  • Configuración de certificado/clave TLS
  • Estilo 12-factor: configuración JSON + anulaciones por variables de entorno

Este tipo de backend es útil para desarrolladores que construyen aplicaciones de voz en tiempo real que necesitan integrar múltiples servicios de IA con infraestructura lista para producción.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

Restricciones: Capa Externa de Gobernanza en Fase Alfa Temprana para Agentes de IA
Herramientas

Restricciones: Capa Externa de Gobernanza en Fase Alfa Temprana para Agentes de IA

Constrails es una capa externa de gobernanza en tiempo de ejecución para agentes de IA que coloca una capa de control entre los agentes y sus herramientas, implementando verificaciones de capacidad, puntuación de riesgo, evaluación de políticas y registro de auditoría. El proyecto en fase alfa temprana tiene como objetivo abordar las preocupaciones de seguridad trasladando los controles fuera del propio agente.

OpenClawRadar
🦀
Herramientas

AIttache: Un servidor MCP de solo lectura que no puede destruir tu producción

AItache es un servidor MCP con más de 25 conectores de solo lectura (terminal, servidores, clima, Steam) que físicamente no puede modificar nada, diseñado para dar contexto de logs a los LLMs sin autonomía.

OpenClawRadar
Configurar OpenClaw con Alquiler de GPU VAST.AI para Prompts Ilimitados de Ollama
Herramientas

Configurar OpenClaw con Alquiler de GPU VAST.AI para Prompts Ilimitados de Ollama

Un usuario describe combinar el alquiler de GPU de VAST.AI con Ollama y OpenClaw para superar los límites de prompts, pero encontró desafíos de configuración que requirieron edición manual de JSON.

OpenClawRadar
Diseño Abierto: Alternativa de Código Abierto a Claude Design que Funciona en tus Agentes CLI Locales
Herramientas

Diseño Abierto: Alternativa de Código Abierto a Claude Design que Funciona en tus Agentes CLI Locales

Open Design es un motor de diseño local-first y BYOK que convierte 11 CLIs de agentes de codificación (Claude Code, Codex, Cursor, Gemini CLI, etc.) en un flujo de trabajo de diseño con 72 sistemas de diseño de nivel de marca y 31 habilidades componibles, exportando HTML/PDF/PPTX/MP4.

OpenClawRadar