Voxray-AI: Produktions-Backend in Go für Echtzeit-Sprachagenten-Pipelines

Produktionsreife Sprachagenten-Pipeline in Go
Voxray-AI bietet eine vollständige Streaming-Pipeline in Go, die Client-Audio über WebSocket oder WebRTC verarbeitet, es durch STT → LLM → TTS leitet und Audioausgaben zurückgibt. Das System ist für produktionsreife Server und hochgradig parallele Sprachworkloads konzipiert.
Transportoptionen
Das System unterstützt mehrere Transportmechanismen:
- WebSocket unter
/wsmit RTVI-Serialisierer (?rtvi=1) und Protobuf-Unterstützung (?format=protobuf) - WebRTC unter
/webrtc/offermit vollständigem SDP-Angebot/Antwort, konfigurierbarem STUN/TURN und Opus-Kodierung (erfordert CGO-Build) - Telefonie-Transporte: Twilio, Telnyx, Plivo, Exotel, LiveKit, Daily.co
Plug-and-Play-Anbieter
Alle Komponenten sind über Konfiguration austauschbar:
- STT-Anbieter: OpenAI, Groq, Sarvam, Google, AWS
- LLM-Anbieter: OpenAI, Anthropic, Groq, andere
- TTS-Anbieter: OpenAI, Google, AWS Polly, Sarvam
Konfigurationsbeispiele
Minimales Konfigurationsbeispiel:
{"transport": "both", "stt": { "provider": "groq", "model": "whisper-large-v3" }, "llm": { "provider": "anthropic", "model": "claude-3-5-haiku" }, "tts": { "provider": "google", "voice": "en-US-Neural2-F" }}Konfiguration für Sprecherwechsel und Spracherkennung:
{"turn_detection": "silence", "vad_type": "silero", "vad_confidence": 0.7, "vad_start_secs_vad": 0.2, "vad_stop_secs": 0.8, "turn_max_duration_secs": 30, "user_idle_timeout_secs": 60}Beobachtbarkeit & Speicherung
/metrics-Endpunkt für Prometheus (Anfragezahlen, Latenzhistogramme, aktive Verbindungszähler)- Aufzeichnung: Vollständige Sitzungsaudio in S3 mit konfigurierbarem Worker-Pool und Format
- Transkripte: Pro-Nachricht-Speicherung in Postgres oder MySQL mit konfigurierbarer Tabelle
/health- und/ready-Endpunkte mit optionaler Redis-Sitzungsspeicherprüfung bei/ready
Sicherheitsfunktionen
server_api_keyschützt/ws,/webrtc/offer,/start,/sessions/*überAuthorization: BeareroderX-API-Key- CORS-Allowlist-Konfiguration
- TLS-Zertifikat/Schlüssel-Konfiguration
- 12-Faktor-Stil: JSON-Konfiguration + Umgebungsvariablen-Überschreibungen
Diese Art von Backend ist nützlich für Entwickler, die Echtzeit-Sprachanwendungen erstellen, die mehrere KI-Dienste mit produktionsreifer Infrastruktur integrieren müssen.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Freddy MCP Server verbindet Wearables mit KI-Agenten durch kopfloses Anmelden
Freddy ist ein persönlicher MCP-Server, der Wearables (Polar, Oura, Withings, Suunto, Intervals.icu, Hevy, plus WHOOP, Strava, Dexcom in der Beta) über OAuth mit KI-Clients wie Claude Code, ChatGPT und Notion AI verbindet. Das neue Headless-Sign-In ermöglicht geplante Workflows für autonome Agenten.

Verwendung des MCP-Code-Modus für effiziente Claude-Schlüsselwortrecherche
Ein Entwickler baute einen MCP-Server, der Claude ermöglicht, autonome Keyword-Recherche mithilfe eines Code-Modus-Musters durchzuführen, wodurch die Tool-Definitions-Tokens von Tausenden auf etwa 1.000 mit nur zwei Tools reduziert wurden: Suche und Ausführung.

Clawion: OpenClaw-Wrapper mit Claude Max-Unterstützung und GitHub-Integration
Clawion ist ein OpenClaw-Wrapper, der Claude Max unterstützt, ohne dass ein API-Schlüssel erforderlich ist. Die Einrichtung umfasst die Auswahl einer Vorlage, die Verbindung von Telegram und die Bereitstellung eines Code-Begleiters mit GitHub-Integration für die automatisierte Erstellung von Pull-Requests.

AI Doomsday Toolbox v0.932 fügt Benchmarking, Datensatzerstellung und einen Agenten-Arbeitsbereich für lokale KI auf Android hinzu.
AI Doomsday Toolbox v0.932 führt Benchmarking für lokale LLMs auf Android-Geräten ein, einen Datensatz-Ersteller, der Text-/PDF-Dateien in das Alpaca-JSON-Format konvertiert, und einen KI-Agenten-Arbeitsbereich mit Termux-Integration. Das Update umfasst außerdem Untertitel-Einbrennen mit Whisper und integrierte Ollama-Verwaltungstools.