Voxray-AI: Produktions-Backend in Go für Echtzeit-Sprachagenten-Pipelines

Produktionsreife Sprachagenten-Pipeline in Go
Voxray-AI bietet eine vollständige Streaming-Pipeline in Go, die Client-Audio über WebSocket oder WebRTC verarbeitet, es durch STT → LLM → TTS leitet und Audioausgaben zurückgibt. Das System ist für produktionsreife Server und hochgradig parallele Sprachworkloads konzipiert.
Transportoptionen
Das System unterstützt mehrere Transportmechanismen:
- WebSocket unter
/wsmit RTVI-Serialisierer (?rtvi=1) und Protobuf-Unterstützung (?format=protobuf) - WebRTC unter
/webrtc/offermit vollständigem SDP-Angebot/Antwort, konfigurierbarem STUN/TURN und Opus-Kodierung (erfordert CGO-Build) - Telefonie-Transporte: Twilio, Telnyx, Plivo, Exotel, LiveKit, Daily.co
Plug-and-Play-Anbieter
Alle Komponenten sind über Konfiguration austauschbar:
- STT-Anbieter: OpenAI, Groq, Sarvam, Google, AWS
- LLM-Anbieter: OpenAI, Anthropic, Groq, andere
- TTS-Anbieter: OpenAI, Google, AWS Polly, Sarvam
Konfigurationsbeispiele
Minimales Konfigurationsbeispiel:
{"transport": "both", "stt": { "provider": "groq", "model": "whisper-large-v3" }, "llm": { "provider": "anthropic", "model": "claude-3-5-haiku" }, "tts": { "provider": "google", "voice": "en-US-Neural2-F" }}Konfiguration für Sprecherwechsel und Spracherkennung:
{"turn_detection": "silence", "vad_type": "silero", "vad_confidence": 0.7, "vad_start_secs_vad": 0.2, "vad_stop_secs": 0.8, "turn_max_duration_secs": 30, "user_idle_timeout_secs": 60}Beobachtbarkeit & Speicherung
/metrics-Endpunkt für Prometheus (Anfragezahlen, Latenzhistogramme, aktive Verbindungszähler)- Aufzeichnung: Vollständige Sitzungsaudio in S3 mit konfigurierbarem Worker-Pool und Format
- Transkripte: Pro-Nachricht-Speicherung in Postgres oder MySQL mit konfigurierbarer Tabelle
/health- und/ready-Endpunkte mit optionaler Redis-Sitzungsspeicherprüfung bei/ready
Sicherheitsfunktionen
server_api_keyschützt/ws,/webrtc/offer,/start,/sessions/*überAuthorization: BeareroderX-API-Key- CORS-Allowlist-Konfiguration
- TLS-Zertifikat/Schlüssel-Konfiguration
- 12-Faktor-Stil: JSON-Konfiguration + Umgebungsvariablen-Überschreibungen
Diese Art von Backend ist nützlich für Entwickler, die Echtzeit-Sprachanwendungen erstellen, die mehrere KI-Dienste mit produktionsreifer Infrastruktur integrieren müssen.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Claude AI-Produkteinführungsfähigkeit: Strukturierte Playbooks für KI-Produkteinführungen
Eine kostenlose Claude-Fähigkeit bietet sechs erprobte Launch-Playbooks, die Strategie, Vorbereitung, Kommunikation und Kanalausführung für KI-Produkt-Launches abdecken. Das Repository enthält englische und chinesische Materialien, die nach Launch-Phasen organisiert sind.

Ausnutzen des verborgenen Agentursignals (Â) von LLMs für besseres Tool Calling
Ein Entwickler entdeckte, dass LLMs eine linear trennbare Richtung im verborgenen Zustand namens  haben, die Werkzeugaufrufe mit einem AUC > 0,94 vorhersagt. Die Nutzung dieses Signals, um Werkzeugaufrufe zu erzwingen, verbesserte die Leistung von Qwen3-1.7B von 26,7 % auf 85 % (+58 % Gewinn) und reduzierte Fehler ohne Werkzeugaufruf von 43 % auf 2,6 %.

ClaudeMeter: Open-Source macOS-Menüleisten-App zur Echtzeit-Verfolgung der Claude-Nutzung
ClaudeMeter ist eine kostenlose, Open-Source-macOS-Menüleisten-App für Claude Max-Abonnenten, die Sitzungs- und wöchentliche Nutzungsprozentsätze, Reset-Timer und Tempoanzeigen anzeigt, ohne den Arbeitsablauf zu unterbrechen. Die gesamte App wurde mit Claude (Claude Code/Opus) für Swift-Code, Supabase-Backend und Edge Functions erstellt.

llmLibrarian: Lokale RAG-Engine mit MCP-Integration für dateibasierte KI-Suche
llmLibrarian ist eine lokale RAG-Engine, die Abrufe über MCP verfügbar macht und es KI-Agenten wie Claude ermöglicht, indizierte Dateien abzufragen. Es nutzt ChromaDB-Sammlungen zur Organisation, Ollama für die Synthese und behält alles auf dem Gerät.