Voxray-AI: Backend de Produção em Go para Pipelines de Agentes de Voz em Tempo Real

Pipeline de Agente de Voz de Produção em Go
O Voxray-AI fornece um pipeline de streaming completo em Go que processa o áudio do cliente através de WebSocket ou WebRTC, processa-o através de STT → LLM → TTS e retorna a saída de áudio. O sistema é projetado para servidores de nível de produção e cargas de trabalho de voz de alta concorrência.
Opções de Transporte
O sistema suporta múltiplos mecanismos de transporte:
- WebSocket em
/wscom suporte a serializador RTVI (?rtvi=1) e Protobuf (?format=protobuf) - WebRTC em
/webrtc/offercom oferta/resposta SDP completa, STUN/TURN configurável e codificação Opus (requer compilação CGO) - Transportes de execução de telefonia: Twilio, Telnyx, Plivo, Exotel, LiveKit, Daily.co
Provedores Plugáveis
Todos os componentes são intercambiáveis via configuração:
- Provedores de STT: OpenAI, Groq, Sarvam, Google, AWS
- Provedores de LLM: OpenAI, Anthropic, Groq, outros
- Provedores de TTS: OpenAI, Google, AWS Polly, Sarvam
Exemplos de Configuração
Exemplo mínimo de configuração:
{"transport": "both", "stt": { "provider": "groq", "model": "whisper-large-v3" }, "llm": { "provider": "anthropic", "model": "claude-3-5-haiku" }, "tts": { "provider": "google", "voice": "en-US-Neural2-F" }}Configuração de detecção de vez e atividade de voz:
{"turn_detection": "silence", "vad_type": "silero", "vad_confidence": 0.7, "vad_start_secs_vad": 0.2, "vad_stop_secs": 0.8, "turn_max_duration_secs": 30, "user_idle_timeout_secs": 60}Observabilidade e Armazenamento
- Endpoint
/metricspara Prometheus (contagens de requisições, histogramas de latência, medidores de conexões ativas) - Gravação: Áudio completo da sessão para S3 com pool de workers configurável e formato
- Transcrições: Armazenamento por mensagem para Postgres ou MySQL com tabela configurável
- Endpoints
/healthe/readycom verificação opcional de armazenamento de sessão Redis em/ready
Recursos de Segurança
server_api_keyprotege/ws,/webrtc/offer,/start,/sessions/*viaAuthorization: BearerouX-API-Key- Configuração de lista de permissões CORS
- Configuração de certificado/chave TLS
- Estilo 12-factor: configuração JSON + substituições por variáveis de ambiente
Este tipo de backend é útil para desenvolvedores que constroem aplicações de voz em tempo real que precisam integrar múltiplos serviços de IA com infraestrutura pronta para produção.
📖 Leia o código-fonte completo: r/LocalLLaMA
👀 See Also

Semble: Um Servidor MCP Local para Claude Code com Redução de 98% de Tokens
Semble é um servidor MCP de código aberto para Claude Code que substitui fluxos de trabalho com grep+read, usando embeddings, BM25 e reranking para reduzir o uso de tokens em ~98% enquanto indexa repositórios em ~250ms.

Servidor MCP GodotIQ Dá aos Agentes de Codificação de IA Compreensão Espacial das Cenas Godot
GodotIQ é um servidor MCP que fornece aos agentes de codificação uma verdadeira compreensão de cenas 2D/3D, sinais e dependências de código no Godot. Em um teste, ele construiu autonomamente um jogo de sobrevivência twin-stick em uma hora a partir de assets e um prompt.

Análise de ações em tempo real adicionada ao Claude Desktop via servidor MCP
Um desenvolvedor criou um servidor MCP chamado agent-toolbelt que adiciona capacidades de análise de ações em tempo real ao Claude Desktop e Claude Code, fornecendo dados ao vivo para análise de investimentos em vez dos palpites baseados em dados de treinamento do Claude.

Detalhes da API de Ferramentas do Claude Code Revelados
Um usuário do Reddit extraiu detalhes sobre a API de ferramentas do Claude Code, incluindo operações do sistema de arquivos, execução bash, busca na web e como as chamadas de ferramentas são estruturadas usando blocos semelhantes a XML.