개발자가 로컬 Whisper와 Coqui-TTS 서버로 1초 미만의 STT/TTS 지연 시간 달성

한 개발자가 로컬 AI 에이전트에서 음성-텍스트 및 텍스트-음성 변환에 대해 1초 미만의 지연 시간을 달성하는 오픈소스 서버 구현체를 공유했으며, 이는 일반적으로 클라우드 기반 솔루션과 관련된 대화 지연을 제거합니다.
성능 벤치마크
이 구현체는 다음과 같은 성능을 달성합니다:
- 음성-텍스트 변환(STT)에 약 0.2초 지연 시간
- 텍스트-음성 변환(TTS)에 약 250ms 지연 시간
이는 이전 병목 현상으로 언급된 2-3초 대기 시간에 비해 상당한 개선을 나타냅니다.
기술적 구현
STT 서버
- Whisper large-v3-turbo를 사용하여 구축됨
- 사용자 정의 브리지 구현
- VRAM 과부하 없이 동시성을 위한 하이브리드 스레드 관리 GPU 아키텍처
TTS 서버
- 로컬 서버에서 실행되는 Coqui-TTS 사용
- OpenAI 호환 API
- 저지연 합성을 위해 최적화됨
- 복제된 Paul Bettany/Jarvis 음성 포함
하드웨어 요구사항
- NVIDIA RTX GPU가 장착된 전용 노드
- 이러한 속도를 위해 GPU 가속이 필수적임
오픈소스화된 구성 요소
개발자는 두 개의 GitHub 저장소를 공개했습니다:
여기에는 서버 구현체와 로컬 에이전트 구축을 위한 OpenClaw 통합 스크립트가 포함되어 있습니다.
결과
이제 에이전트는 다음과 같은 진정한 대화형 동작을 보여줍니다:
- 올바른 인터럽트 처리
- 거의 즉각적인 응답
- 외부 API로 전송되는 오디오 데이터 없음
개발자는 서버 설정, VRAM 관리 및 다른 AI 프로젝트 통합에 관한 질문에 답변할 수 있습니다.
📖 Read the full source: r/LocalLLaMA
👀 See Also

OpenClaw의 QMD 메모리 검색 고속 경로에 묵시적 결함이 있었습니다
OpenClaw의 기본 메모리 검색은 기본적인 키워드 매칭을 사용하지만, 사용자는 작업 공간의 마크다운 파일을 대상으로 의미론적 검색을 수행하는 QMD로 전환할 수 있습니다. MCPorter를 통한 빠른 경로는 세 가지 버그로 인해 모든 호출이 조용히 실패하고 더 느린 CLI 실행으로 대체되는 상태였습니다.

클로드 코드용 맞춤 상태 표시줄에서 컨텍스트 사용량, 속도 제한, 토큰 개수를 한눈에 확인할 수 있습니다
커스텀 스크립트가 Claude Code에 지속적인 상태 표시줄을 추가하여 컨텍스트 점유율, 5시간 요금 한도 %, KV 캐시 읽기, 누적 입력/출력 토큰, 모델명, 작업 디렉토리를 표시합니다. 다크 터미널에 맞춰 색상으로 구분됩니다.

AI Doomsday Toolbox v0.932는 Android 로컬 AI를 위한 벤치마킹, 데이터셋 생성, 에이전트 작업 공간을 추가합니다.
AI Doomsday Toolbox v0.932는 Android 기기에서 로컬 LLM 벤치마킹, 텍스트/PDF 파일을 Alpaca JSON 형식으로 변환하는 데이터셋 생성기, Termux 통합 AI 에이전트 작업 공간을 도입했습니다. 이 업데이트에는 Whisper를 이용한 자막 입히기와 내장 Ollama 관리 도구도 포함됩니다.
Cocall.ai MCP: 실시간 인간 에스컬레이션이 가능한 아웃바운드 전화 통화
Cocall.ai는 Claude를 위한 MCP로, 전이중 음성-음성 모델을 사용하여 아웃바운드 전화 통화를 가능하게 합니다. 중간에 일시 중지하여 추측하는 대신 특정 질문을 할 수 있고, IVR을 탐색하며, 필요할 때 통화를 사용자에게 전환할 수 있습니다.