Claude-voice: TTS Local com Destaque de Palavras para Código Claude

O que o claude-voice faz
Claude-voice adiciona funcionalidade de conversão de texto em voz ao modo /voice do Claude Code, que normalmente só aceita entrada de voz mas responde com texto silencioso. Esta ferramenta completa o ciclo fazendo o Claude falar suas respostas em voz alta com destaque de palavras em tempo real.
Características principais e implementação
A ferramenta aborda limitações que o desenvolvedor encontrou nas opções existentes:
- O plano gratuito do ElevenLabs não pode usar vozes via API (erro 402 instantâneo)
- VoiceMode (893 estrelas no GitHub) é um servidor MCP com mais de 100 arquivos com modo DJ, fontes de som e recursos de conexão em equipe - mais complexo do que o necessário
- OpenAI TTS funciona mas custa dinheiro e envia tudo para seus servidores
- Nenhuma das opções existentes tinha destaque em nível de palavra - todas apenas reproduzem áudio em segundo plano
Características específicas do Claude-voice:
- Um arquivo Python que instala como um hook Stop do Claude Code
- Usa Kokoro TTS (82 milhões de parâmetros, roda em CPU) - totalmente local, nenhuma chave de API necessária
- Destaque de palavras estilo karaokê em tempo real com janela deslizante e barra de progresso
- Remove markdown, blocos de código e URLs antes de falar
- Corrige pronúncia do desenvolvedor (CLI, API, JSON, nginx, kubectl todos falados corretamente)
- Pressione qualquer tecla para interromper a fala
- 12 vozes disponíveis (Americana/Britânica, masculina/feminina)
- A configuração do claude-voice adiciona o hook automaticamente - nenhuma configuração manual necessária
Desempenho e configuração
Tempo para o primeiro áudio é aproximadamente 1 segundo quente, 6 segundos frio (carregamento do modelo). O maior desafio de implementação foi descobrir o truque do /dev/tty para escrever abaixo do renderizador do Claude Code.
Comandos de instalação:
pip install kokoro sounddevice numpy
git clone https://github.com/Null-Phnix/claude-voice
cd claude-voice
python speak.py setup
python speak.py demoO vídeo de demonstração mostra perguntar ao Claude sobre o papel de Loki como trapaceiro na mitologia nórdica usando o modo de voz, com o Claude respondendo e o TTS lendo a resposta completa com destaque de palavras rodando na parte inferior do terminal.
📖 Read the full source: r/ClaudeAI
👀 See Also

Supra-50M-Raciocínio: Modelo Tiny de Código Aberto com Pensamento em Cadeia de Raciocínio
SupraLabs lança Supra-50M-Reasoning, um modelo de 50M parâmetros ajustado para gerar cadeia de pensamento completa antes das respostas. Dataset de 500 amostras escritas à mão, totalmente open source.
CTOP: Interface de Terminal para Monitorar Sessões do Claude Code, Zero Dependências
CTOP é uma TUI Node.js sem dependências que mostra CPU, memória, saturação da janela de contexto, detalhamento de tokens e estimativas de custo para todas as sessões em execução do Claude Code e Codex.

NLA transforma as ativações internas do Gemma 3 em texto legível para qualquer token
A Anthropic lançou os Natural Language Autoencoders (NLA), que decodificam o estado interno de um modelo em texto. Combinado com o Gemma 3, o Auto Verbalizer explica o que o modelo estava "pensando" para qualquer token gerado. Os pesos estão no Hugging Face; demo no Neuronpedia.

Ctxpact: Proxy de Compactação de Contexto para LLMs Locais
Ctxpact é um proxy compatível com OpenAI que comprime entradas excessivamente grandes para LLMs locais com janelas de contexto de 16k, usando um pipeline de 3 etapas que inclui estratégias de DCP, sumarização e extração. Benchmarks mostram 110k tokens comprimidos para 12k com 8/8 de precisão em compreensão de leitura.