OpenClaw용 로컬 음성-텍스트 변환, Parakeet TDT 0.6b v3 사용

OpenClaw를 위한 로컬 자막 생성 설정
커뮤니티 개발자가 NVIDIA의 Parakeet TDT 0.6b v3 모델을 OpenClaw 내에서 로컬 음성-텍스트 변환에 맞게 조정했습니다. 이 모델은 ONNX 추론을 통해 CPU에서 실행되어 API 비용을 제거하고 25개의 유럽 언어를 지원합니다.
기술적 구현
이 솔루션은 CPU 배포를 위한 Docker 컨테이너를 제공하는 GitHub 저장소(groxaxo/parakeet-tdt-0.6b-v3-fastapi-openai)를 사용합니다. 컨테이너는 http://127.0.0.1:5092/v1에서 OpenAI 호환 API 엔드포인트를 노출합니다.
지원되는 언어는 다음과 같습니다: 불가리아어(bg), 크로아티아어(hr), 체코어(cs), 덴마크어(da), 네덜란드어(nl), 영어(en), 에스토니아어(et), 핀란드어(fi), 프랑스어(fr), 독일어(de), 그리스어(el), 헝가리어(hu), 이탈리아어(it), 라트비아어(lv), 리투아니아어(lt), 몰타어(mt), 폴란드어(pl), 포르투갈어(pt), 루마니아어(ro), 슬로바키아어(sk), 슬로베니아어(sl), 스페인어(es), 스웨덴어(sv), 러시아어(ru), 우크라이나어(uk).
OpenClaw와의 통합
개발자는 자막 생성을 위한 Python 스크립트를 제공합니다:
#!/home/openclaw/.local/share/pipx/venvs/openai/bin/python
import sys
from openai import OpenAI
client = OpenAI(
base_url="http://127.0.0.1:5092/v1",
api_key="sk-no-key-required"
)
audio_file = open(sys.argv[1], "rb")
transcript = client.audio.transcriptions.create(
model="parakeet-tdt-0.6b-v3",
file=audio_file,
response_format="text"
)
print(transcript)
이 스크립트는 OpenClaw의 openclaw.json 파일에서 구성할 수 있습니다:
"tools": {
"media": {
"audio": {
"enabled": true,
"models": [
{
"type": "cli",
"command": "/home/openclaw/.local/bin/transcribe",
"args": ["{{MediaPath}}"],
"timeoutSeconds": 60
}
]
}
}
}또는 OpenClaw는 스크립트의 모델 이름과 더미 API 키를 사용하여 OpenAI 호환 API 엔드포인트를 직접 사용하도록 구성할 수 있습니다.
배포 참고사항
개발자는 M4 Pro가 탑재된 Mac Mini의 ARM64 Ubuntu Linux VM에서 이를 테스트했으며, 적절한 Intel 호환 CPU에서 합리적으로 빠르게 실행되어야 한다고 언급했습니다. Docker 컨테이너는 GitHub 저장소의 README 지침에 따라 빌드됩니다.
📖 전체 소스 읽기: r/openclaw
👀 See Also

AMD의 레모네이드: GPU와 NPU용 오픈 소스 로컬 LLM 서버
Lemonade는 GPU와 NPU에서 텍스트, 이미지, 음성 모델을 실행하는 오픈 소스 로컬 AI 서버입니다. OpenAI API와 호환되며, 여러 모델을 동시에 지원하고, 2MB의 네이티브 C++ 백엔드를 갖추고 있습니다.

홈랩 AI 센티널: LLM 통합 자체 호스팅 모니터링 어시스턴트
Homelab AI Sentinel은 LLM을 통해 모니터링 웹훅을 처리하여 일반 영어로 된 진단을 생성하는 자체 호스팅 도구입니다. 11개의 경고 소스, 10개의 알림 플랫폼을 지원하며, Ollama 및 LM Studio를 포함한 모든 OpenAI 호환 엔드포인트와 함께 작동하여 로컬 추론이 가능합니다.

수행사: 에이전트 내레이션을 침묵시켜 맥락과 토큰을 절약하는 기술
레딧 사용자가 클로드 에이전트 응답에서 서사, 서문, 후문을 제거하는 스킬 'monk'를 게시했으며, 턴당 출력 토큰이 약 54% 감소하고 100회에서 컨텍스트 용량이 29-39% 증가한다고 주장합니다.

오픈소스 Claude 코드 재구현, 로컬 모델 호환성을 위한 패치 적용
한 개발자가 오픈소스 Claude Code 재구현에 패치를 적용하여 Ollama 및 로컬 모델과 호환되도록 하였습니다. 하드코딩된 Anthropic 클라이언트 의존성을 제거함으로써 CLI가 이제 모델 이름과 환경 변수에서 제공자를 자동으로 감지합니다.