Aufbau eines Sprachassistenten mit unter 500 ms Latenz: Architektur und Leistungseinblicke

Architektur und Leistung des Sprachagenten
Nick Tikhonov hat einen Sprachagenten von Grund auf neu gebaut, der durchschnittlich ~400 ms End-to-End-Latenz (Ende des Anrufs → erste Silbe) erreicht. Dies umfasst vollständiges STT → LLM → TTS in der Schleife mit sauberen Unterbrechungen und ohne vorberechnete Antworten. Die Implementierung übertraf das entsprechende Setup von Vapi bei der Latenz um das 2-fache.
Kern technische Erkenntnisse
Die entscheidende Erkenntnis war, dass Sprache ein Problem des Sprechwechsels ist, kein Transkriptionsproblem. Voice Activity Detection (VAD) allein reicht nicht aus; eine semantische Sprechwechselerkennung ist erforderlich. Das System reduziert sich auf eine Schleife mit zwei Zuständen: Sprechen vs. Zuhören.
Die kritischen Übergänge sind:
- Sofortiges Abbrechen bei Unterbrechung
- Sofortiges Antworten bei Sprechwechsel
Technische Anforderungen
STT → LLM → TTS muss streamen. Sequentielle Pipelines sind für natürliche Gespräche ineffektiv. Die Zeit bis zum ersten Token (TTFT) dominiert alles in Sprachschnittstellen - der erste Token ist der kritische Pfad. Groqs ~80 ms TTFT wurde als der größte Leistungsgewinn identifiziert.
Infrastrukturüberlegungen
Geografie ist wichtiger als Eingabeaufforderungen. Alle Komponenten müssen gemeinsam platziert werden, sonst wird die Latenz unerträglich, bevor das System überhaupt mit der Verarbeitung beginnt. Der Aufbau dauerte etwa einen Tag und kostete ungefähr 100 US-Dollar an API-Guthaben.
Warum Sprachagenten herausfordernd sind
Sprachagenten stellen einen erheblichen Komplexitätsanstieg im Vergleich zu Textagenten dar. Die Orchestrierung ist kontinuierlich und in Echtzeit, was eine sorgfältige Verwaltung mehrerer Modelle gleichzeitig erfordert. Das System muss ständig entscheiden, ob der Benutzer spricht oder zuhört, wobei die Übergänge zwischen diesen Zuständen der schwierigste Aspekt sind.
Wenn der Benutzer zu sprechen beginnt, muss der Agent sofort aufhören zu sprechen - die Generierung abbrechen, die Sprachsynthese abbrechen und jeglichen gepufferten Audioinhalt löschen. Wenn der Benutzer aufhört zu sprechen, muss das System sicher entscheiden, dass er fertig ist, und mit minimaler Verzögerung antworten.
Architekturansatz
Der Entwickler begann damit, die Architektur mit ChatGPT außerhalb des Editors zu iterieren, um zunächst ein mentales Modell aufzubauen. Das gesamte Problem wurde auf eine einzelne Schleife und einen winzigen Zustandsautomaten reduziert. Die Kernfrage, die ein Sprachagent beantworten muss, lautet: Spricht der Benutzer oder hört er zu?
Die beiden Zustände sind:
- Der Benutzer spricht
- Der Benutzer hört zu
Diese Sprechwechselerkennungslogik bildet den Kern jedes Sprachsystems. Die Implementierung ist auf GitHub als Referenz und für die Weiterentwicklung verfügbar.
📖 Read the full source: HN AI Agents
👀 Siehe auch

Dual DGX Sparks vs. Mac Studio M3 Ultra: Praktischer Vergleich für den lokalen Betrieb von Qwen3.5 397B
Ein Entwickler verglich das lokale Ausführen von Qwen3.5 397B auf einem 10.000 US-Dollar teuren Mac Studio M3 Ultra 512GB und einem 10.000 US-Dollar teuren Dual-DGX-Spark-Setup. Das Mac Studio erreichte 30–40 Tok/s mit 800 GB/s Bandbreite, aber langsamer Vorauffüllung, während die Sparks 27–28 Tok/s mit schnellerer Rechenleistung, aber komplexer Einrichtung lieferten.

Traubenwurzel-Tool reduziert Claude-Code-Tokenverbrauch durch Zwischenspeicherung des Repository-Kontextes
Ein kostenloses experimentelles Tool namens Grape Root behebt redundanten Token-Verbrauch in Claude Code, indem es einen leichtgewichtigen Zustand über zuvor erkundete Repository-Dateien verwaltet und unnötige Wiederholungslesevorgänge unveränderter Dateien bei Folgefragen verhindert.

Kanwas: Open-Source Shared Context Board für Teams und KI-Agenten
Kanwas ist ein Open-Source-Multiplayer-Arbeitsbereich, in dem Teams und KI-Agenten auf einer Leinwand Dokumente, Belege und Entscheidungen mit Live-Streaming von Tool-Aufrufen teilen. Es wird selbst gehostet über Docker, ist git-basiert und verwendet Yjs und BlockNote.

SLayer: Eine quelloffene semantische Schicht für KI-Agenten, die aus Abfragen lernt
SLayer ist eine leichte, einbettbare semantische Schicht, die es KI-Agenten ermöglicht, Datenbanken abzufragen, Modelle zu verwalten und aus Interaktionen über MCP, REST, CLI oder Python zu lernen.