클로드 보이스: 클로드 코드용 단어 강조 기능이 포함된 로컬 TTS

claude-voice의 기능
Claude-voice는 Claude Code의 /voice 모드에 텍스트 음성 변환 기능을 추가합니다. 이 모드는 일반적으로 음성 입력만 받고 응답은 무음 텍스트로 반환합니다. 이 도구는 Claude가 응답을 소리 내어 읽고 실시간 단어 하이라이트를 통해 응답을 완성합니다.
주요 기능 및 구현
이 도구는 개발자가 기존 옵션에서 발견한 한계를 해결합니다:
- ElevenLabs 무료 티어는 API를 통해 음성을 사용할 수 없음(즉시 402 오류 발생)
- VoiceMode(GitHub에서 893개 스타)는 DJ 모드, 사운드 폰트, 팀 연결 기능을 갖춘 100개 이상의 파일로 구성된 MCP 서버로, 필요 이상으로 복잡함
- OpenAI TTS는 작동하지만 비용이 발생하며 모든 데이터를 해당 서버로 전송함
- 기존 옵션 중 어느 것도 단어 수준 하이라이트 기능이 없었음 - 모두 단순히 백그라운드에서 오디오를 재생함
Claude-voice의 구체적인 기능:
- Claude Code Stop 후크로 설치되는 단일 Python 파일
- Kokoro TTS 사용(8200만 매개변수, CPU에서 실행) - 완전히 로컬, API 키 필요 없음
- 슬라이딩 윈도우와 진행률 표시줄을 사용한 실시간 가라오케 스타일 단어 하이라이트
- 말하기 전에 마크다운, 코드 블록, URL 제거
- 개발자 발음 수정(CLI, API, JSON, nginx, kubectl 모두 올바르게 발음됨)
- 아무 키나 눌러 음성 중단 가능
- 12가지 음성 사용 가능(미국/영국, 남성/여성)
- claude-voice 설정이 후크를 자동으로 추가함 - 수동 구성 필요 없음
성능 및 설정
첫 오디오까지의 시간은 약 1초(웜), 6초(콜드, 모델 로딩)입니다. 가장 어려운 구현 과제는 Claude Code의 렌더러 아래에 쓰기 위한 /dev/tty 트릭을 알아내는 것이었습니다.
설치 명령:
pip install kokoro sounddevice numpy
git clone https://github.com/Null-Phnix/claude-voice
cd claude-voice
python speak.py setup
python speak.py demo데모 영상은 음성 모드를 사용하여 노르웨이 신화에서 로키의 사기꾼 역할에 대해 Claude에게 묻는 장면을 보여주며, Claude가 응답하고 TTS가 전체 답변을 읽어주면서 터미널 하단에서 단어 하이라이트가 실행됩니다.
📖 Read the full source: r/ClaudeAI
👀 See Also

클로드 코드 개발을 위한 여섯 개의 GitHub 저장소
레딧 사용자가 Claude Code 프로젝트 향상을 위해 설계된 6개의 GitHub 저장소를 테스트하고 공유했습니다. 여기에는 구조화된 개발, UI 생성, 작업 관리, 메모리, 생태계 탐색 및 워크플로우 자동화 도구가 포함됩니다.

PageAgent: Ollama 지원으로 웹 페이지 내에서 실행되는 브라우저 AI 에이전트
PageAgent는 웹 페이지 내부에서 직접 AI 에이전트를 실행하는 JavaScript 라이브러리로, 스크린샷 대신 라이브 DOM을 텍스트로 읽어들입니다. Ollama를 포함한 모든 OpenAI 호환 엔드포인트와 작동하여 브라우저에서 직접 로컬 LLM 호출을 가능하게 합니다.

clarp: 6월 15일 종량제 이전 클로드의 오픈소스 드롭인 대체제
Claude -p가 6월 15일부로 종량제로 전환됩니다. clarp는 로컬 워크플로우를 대체하는 오픈소스 CLI입니다. 바이너리 이름만 claude에서 clarp로 변경하면 됩니다.

MemAware 벤치마크, AI 기억력을 키워드 검색 이상으로 테스트하다
MemAware는 3가지 난이도에 걸친 900개의 질문으로 구성된 벤치마크로, 메모리가 있는 AI 어시스턴트가 힌트가 없는 쿼리에서 관련 컨텍스트를 표면화할 수 있는지 테스트합니다. 결과는 BM25 검색이 메모리 없음 대비 2.8% vs 0.8%로 점수를 기록한 반면, 벡터 검색은 도메인 간 연결에서 0.7%로 떨어졌음을 보여줍니다.