Echo-TTS Portado para Apple Silicon com MLX para TTS Nativo com Clonagem de Voz

O Echo-TTS, um modelo de transformador de difusão (DiT) de 2,4B parâmetros para texto em fala com clonagem de voz, foi adaptado do CUDA para rodar nativamente no silício da série M da Apple usando MLX. A adaptação permite que o modelo gere fala em uma voz alvo quando recebe texto e um pequeno clipe de áudio de alguém falando.
Desempenho e Benchmarks
Em um Mac mini M4 básico de 16GB, o modelo gera um clone de voz curto de 5 segundos em cerca de 10 segundos. Clones de até 30 segundos levam aproximadamente 60 segundos para gerar.
Principais Recursos
- Quantização de 8 bits: Reduz o uso de memória de aproximadamente 6 GB para cerca de 4 GB, roda mais rápido com perda de qualidade insignificante.
- Geração em blocos: Permite streaming e continuações de áudio.
Detalhes do Desenvolvimento
Esta foi uma adaptação assistida por IA. O Claude Opus 4.6 lidou com especificação e validação, o GPT-5.3-Codex realizou a implementação, e o desenvolvedor conduziu o projeto através do OpenClaw.
O repositório está disponível em github.com/mznoj/echo-tts-mlx.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Construindo um Agente de Voz com Latência Inferior a 500ms: Arquitetura e Insights de Desempenho
Um desenvolvedor criou um agente de voz do zero, alcançando uma latência de ponta a ponta de aproximadamente 400ms com streaming completo de STT → LLM → TTS. As principais percepções incluem tratar a voz como um problema de revezamento de turnos, usar detecção semântica de fim de turno e colocar todos os componentes no mesmo local para latência mínima.

Rastreador de Uso de Habilidades OpenClaw: Monitore Quais Habilidades Você Realmente Usa
Um desenvolvedor criou uma ferramenta para rastrear análises de uso de habilidades do OpenClaw, incluindo contagens de invocações, detalhamentos por agente e canal, e rankings das principais habilidades em diferentes períodos de tempo.
WorldClaw: Geração de Mundo Aberto 3D Agêntica em Escala
O WorldClaw da Tencent é um novo sistema para geração agêntica de mundos abertos 3D em escala, visando criar ambientes virtuais grandes e detalhados.

Sistema Operacional Creation: Um Runtime Local de LLM com Porta σ Que Permite que Modelos Digam "Não Sei" em Vez de Alucinar
O Creation OS envolve LLMs locais (BitNet, Qwen, Gemma, qualquer GGUF) com um σ-gate que mede múltiplos canais de incerteza e decide ACEITAR, REPENSAR ou ABSTER-SE por saída. Sem nuvem, sem API. Precisão no TruthfulQA melhorou ~29% via regeneração seletiva.