Lokale Sprachsteuerungseinrichtung für KI-Agenten auf Apple Silicon

Diese Einrichtung beschreibt, wie man lokale Sprachsteuerung für KI-Agenten mit Parakeet STT und Kokoro TTS auf Apple Silicon implementiert, speziell getestet auf einem Mac Mini M4. Das Ziel war es, eine vollständig lokale und schnelle Sprachinteraktionsschicht zu erreichen, ohne Abhängigkeiten von Cloud-Diensten.
Wichtige Details
- Hardware: Mac Mini M4, der OpenClaw + Claude als KI-Agent verwendet.
- Softwareeinrichtung: Parakeet für Spracherkennung (STT), das Sprachinput in ungefähr 240 ms transkribiert, und Kokoro für Text-zu-Sprache (TTS), das nahezu sofortige Antworten liefert.
- Vorteile: Der Wechsel von der Texteingabe zu Sprachbefehlen verbessert die Flexibilität des Workflows erheblich und ermöglicht betriebsunabhängige Arbeit, beispielsweise vom Balkon oder beim Gassigehen mit dem Hund.
- Herausforderungen: Gelegentlich hat STT Schwierigkeiten mit der Akzenterkennung, was humorvoll dazu führen kann, dass der KI-Agent die Aussprache des Nutzers korrigiert.
- Verbesserungen: Eine Browsererweiterung, die einen 3D-Avatar namens Mimora integriert, ermöglicht visuelle Interaktionen und zeigt verschiedene Ausdrücke wie Zuhören, Nachdenken und Freude während der Antworten des Agenten.
Diese Konfiguration ist ideal für alle, die cloud-unabhängige, schnelle Sprachinteraktion mit KI-Agenten suchen, insbesondere mit Apple Silicon Hardware.
📖 Lesen Sie die vollständige Quelle: r/LocalLLaMA
👀 Siehe auch

OpenClaw Alexa Voice Proxy ermöglicht bidirektionale Sprachinteraktion
openclaw-alexa-voice ist ein Node.js-Proxy, der eine Alexa Custom Skill mit dem OpenClaw-Gateway verbindet und ein dreistufiges Antwortsystem für Sprachabfragen bietet. Er verarbeitet schnelle Antworten unter 1 Sekunde, Agentenantworten unter 12 Sekunden und zurückgestellte komplexe Abfragen, die asynchron innerhalb von 2 Minuten bearbeitet werden.

OmniCoder-9B-Fine-Tuning zeigt eine starke Leistung für agentenbasiertes Codieren auf Systemen mit 8 GB VRAM.
Ein Reddit-Nutzer testete OmniCoder-9B, eine Feinabstimmung von Qwen3.5-9B auf Opus-Traces, mit OpenCode und berichtete von Geschwindigkeiten von über 40 Tokens pro Sekunde unter Verwendung der Q4_K_M GGUF-Quantisierung bei einer Kontextlänge von 100k auf einem System mit 8GB VRAM.

Sprechen Sie mit Claw: Open-Source iOS-Sprachschnittstelle für OpenClaw Telegram Bots
Eine Open-Source-iOS-App, die Sprachinteraktion mit OpenClaw-betriebenen Telegram-Bots ermöglicht. Die App sendet Audio an einen lokalen Mac-Server zur Verarbeitung, wobei Antworten sowohl als Text als auch als Audio zurückgegeben werden.
LTM: Ein JSON-Protokoll für portables Agentengedächtnis über Modelle und Maschinen hinweg
LTM ist ein JSON-Protokoll (Core Memory Packet) plus CLI/Server zum Speichern von Agentenkontext – Sackgassen, Einschränkungen, nächste Schritte – über Modelle, Editoren und Maschinen hinweg. Pakete sind 2-5 KB groß, schwärzen Geheimnisse und unterstützen MCP.