Entwickler erreicht Sub-Sekunden-Latenz bei STT/TTS mit lokalen Whisper- und Coqui-TTS-Servern

Ein Entwickler hat Open-Source-Server-Implementierungen geteilt, die eine Latenz von unter einer Sekunde für Spracherkennung und Sprachsynthese in lokalen KI-Agenten erreichen und damit die typische Konversationsverzögerung cloudbasierter Lösungen beseitigen.
Leistungsbenchmarks
Die Implementierung erreicht:
- ~0,2 Sekunden Latenz für Spracherkennung (STT)
- ~250 ms Latenz für Sprachsynthese (TTS)
Dies stellt eine deutliche Verbesserung gegenüber den zuvor genannten 2-3 Sekunden Wartezeiten als Engpass dar.
Technische Implementierung
STT-Server
- Erstellt mit Whisper large-v3-turbo
- Benutzerdefinierte Bridge-Implementierung
- Hybride GPU-Architektur mit Thread-Management für Nebenläufigkeit ohne VRAM-Engpässe
TTS-Server
- Verwendet Coqui-TTS auf einem lokalen Server
- OpenAI-kompatible API
- Für niedrige Latenz bei der Synthese optimiert
- Beinhaltet geklonte Paul Bettany/Jarvis-Stimme
Hardware-Anforderungen
- Dedizierter Knoten mit NVIDIA RTX GPU
- GPU-Beschleunigung ist für diese Geschwindigkeiten zwingend erforderlich
Open-Source-Komponenten
Der Entwickler hat zwei GitHub-Repositories veröffentlicht:
Diese beinhalten Server-Implementierungen und OpenClaw-Integrationsskripte zum Aufbau lokaler Agenten.
Ergebnisse
Der Agent zeigt nun wirklich konversationelles Verhalten mit:
- Korrekter Unterbrechungsbehandlung
- Fast sofortigen Antworten
- Keiner Übertragung von Audiodaten an externe APIs
Der Entwickler steht für Fragen zur Server-Einrichtung, VRAM-Verwaltung und Integration in andere KI-Projekte zur Verfügung.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Superglue CLI: Lassen Sie KI-Agenten API-Aufrufe ohne vorgefertigte Tools ausführen
Superglue CLI bietet eine Fähigkeit, die KI-Codierungsagenten beibringt, wie man seine Befehle verwendet, Authentifizierung handhabt, Tools erstellt und Fehler debuggt. Anstatt vorgefertigte Tools für jede API-Integration zu erstellen, können Agenten API-Spezifikationen zur Laufzeit lesen und mehrstufige Aufrufe planen.

OpenClaw: Revolutionierung der Webseitenwartung durch kontinuierliche Überwachung
OpenClaw, eine innovative von KI gesteuerte Agentur, definiert die Wartung von Webseiten neu, indem sie unermüdlich rund um die Uhr arbeitet. Mit fortschrittlicher Automatisierung sorgt sie für eine optimale Funktionalität der Webseite und behebt Probleme umgehend.

OpenClaw-Plugin verbindet KI-Agenten mit dem Meshtastic-Funknetz für den netzunabhängigen Betrieb
Ein neues Open-Source-Plugin verbindet das OpenClaw-Framework mit dem LoRa-Funkmaschenetzwerk von Meshtastic und ermöglicht KI-Gespräche, API-Abfragen und Gerätesteuerung ohne Internet- oder Mobilfunkverbindung.

TeenyApp lässt Claude Full-Stack-Websites aus einem einzigen Chat-Link erstellen und bereitstellen
TeenyApp bietet eine Live-Subdomain und ein Agent-Token, das Claude per HTTP nutzen kann, um Code zu erstellen, Migrationen durchzuführen, Authentifizierung einzurichten und direkt auf eine echte URL zu deployen – ohne den Chat zu verlassen.