Voxray-AI: Produktions-Backend in Go für Echtzeit-Sprachagenten-Pipelines

✍️ OpenClawRadar📅 Veröffentlicht: 10. März 2026🔗 Source
Voxray-AI: Produktions-Backend in Go für Echtzeit-Sprachagenten-Pipelines
Ad

Produktionsreife Sprachagenten-Pipeline in Go

Voxray-AI bietet eine vollständige Streaming-Pipeline in Go, die Client-Audio über WebSocket oder WebRTC verarbeitet, es durch STT → LLM → TTS leitet und Audioausgaben zurückgibt. Das System ist für produktionsreife Server und hochgradig parallele Sprachworkloads konzipiert.

Transportoptionen

Das System unterstützt mehrere Transportmechanismen:

  • WebSocket unter /ws mit RTVI-Serialisierer (?rtvi=1) und Protobuf-Unterstützung (?format=protobuf)
  • WebRTC unter /webrtc/offer mit vollständigem SDP-Angebot/Antwort, konfigurierbarem STUN/TURN und Opus-Kodierung (erfordert CGO-Build)
  • Telefonie-Transporte: Twilio, Telnyx, Plivo, Exotel, LiveKit, Daily.co

Plug-and-Play-Anbieter

Alle Komponenten sind über Konfiguration austauschbar:

  • STT-Anbieter: OpenAI, Groq, Sarvam, Google, AWS
  • LLM-Anbieter: OpenAI, Anthropic, Groq, andere
  • TTS-Anbieter: OpenAI, Google, AWS Polly, Sarvam

Konfigurationsbeispiele

Minimales Konfigurationsbeispiel:

{"transport": "both", "stt": { "provider": "groq", "model": "whisper-large-v3" }, "llm": { "provider": "anthropic", "model": "claude-3-5-haiku" }, "tts": { "provider": "google", "voice": "en-US-Neural2-F" }}

Konfiguration für Sprecherwechsel und Spracherkennung:

{"turn_detection": "silence", "vad_type": "silero", "vad_confidence": 0.7, "vad_start_secs_vad": 0.2, "vad_stop_secs": 0.8, "turn_max_duration_secs": 30, "user_idle_timeout_secs": 60}
Ad

Beobachtbarkeit & Speicherung

  • /metrics-Endpunkt für Prometheus (Anfragezahlen, Latenzhistogramme, aktive Verbindungszähler)
  • Aufzeichnung: Vollständige Sitzungsaudio in S3 mit konfigurierbarem Worker-Pool und Format
  • Transkripte: Pro-Nachricht-Speicherung in Postgres oder MySQL mit konfigurierbarer Tabelle
  • /health- und /ready-Endpunkte mit optionaler Redis-Sitzungsspeicherprüfung bei /ready

Sicherheitsfunktionen

  • server_api_key schützt /ws, /webrtc/offer, /start, /sessions/* über Authorization: Bearer oder X-API-Key
  • CORS-Allowlist-Konfiguration
  • TLS-Zertifikat/Schlüssel-Konfiguration
  • 12-Faktor-Stil: JSON-Konfiguration + Umgebungsvariablen-Überschreibungen

Diese Art von Backend ist nützlich für Entwickler, die Echtzeit-Sprachanwendungen erstellen, die mehrere KI-Dienste mit produktionsreifer Infrastruktur integrieren müssen.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Claude AI-Produkteinführungsfähigkeit: Strukturierte Playbooks für KI-Produkteinführungen
Werkzeuge

Claude AI-Produkteinführungsfähigkeit: Strukturierte Playbooks für KI-Produkteinführungen

Eine kostenlose Claude-Fähigkeit bietet sechs erprobte Launch-Playbooks, die Strategie, Vorbereitung, Kommunikation und Kanalausführung für KI-Produkt-Launches abdecken. Das Repository enthält englische und chinesische Materialien, die nach Launch-Phasen organisiert sind.

OpenClawRadar
Ausnutzen des verborgenen Agentursignals (Â) von LLMs für besseres Tool Calling
Werkzeuge

Ausnutzen des verborgenen Agentursignals (Â) von LLMs für besseres Tool Calling

Ein Entwickler entdeckte, dass LLMs eine linear trennbare Richtung im verborgenen Zustand namens  haben, die Werkzeugaufrufe mit einem AUC > 0,94 vorhersagt. Die Nutzung dieses Signals, um Werkzeugaufrufe zu erzwingen, verbesserte die Leistung von Qwen3-1.7B von 26,7 % auf 85 % (+58 % Gewinn) und reduzierte Fehler ohne Werkzeugaufruf von 43 % auf 2,6 %.

OpenClawRadar
ClaudeMeter: Open-Source macOS-Menüleisten-App zur Echtzeit-Verfolgung der Claude-Nutzung
Werkzeuge

ClaudeMeter: Open-Source macOS-Menüleisten-App zur Echtzeit-Verfolgung der Claude-Nutzung

ClaudeMeter ist eine kostenlose, Open-Source-macOS-Menüleisten-App für Claude Max-Abonnenten, die Sitzungs- und wöchentliche Nutzungsprozentsätze, Reset-Timer und Tempoanzeigen anzeigt, ohne den Arbeitsablauf zu unterbrechen. Die gesamte App wurde mit Claude (Claude Code/Opus) für Swift-Code, Supabase-Backend und Edge Functions erstellt.

OpenClawRadar
llmLibrarian: Lokale RAG-Engine mit MCP-Integration für dateibasierte KI-Suche
Werkzeuge

llmLibrarian: Lokale RAG-Engine mit MCP-Integration für dateibasierte KI-Suche

llmLibrarian ist eine lokale RAG-Engine, die Abrufe über MCP verfügbar macht und es KI-Agenten wie Claude ermöglicht, indizierte Dateien abzufragen. Es nutzt ChromaDB-Sammlungen zur Organisation, Ollama für die Synthese und behält alles auf dem Gerät.

OpenClawRadar