Microsoft VibeVoice: Modelos ASR de 60 Min e TTS de 90 Min de Código Aberto

A Microsoft disponibilizou como código aberto o VibeVoice, uma família de modelos de voz IA de ponta que abrange ASR e TTS. O modelo ASR (VibeVoice-ASR-7B) processa até 60 minutos de áudio de formato longo em uma única passagem (janela de 64K tokens), gerando transcrições estruturadas com identificação do falante, timestamps e texto — com suporte a mais de 50 idiomas. Também oferece suporte a hotwords personalizadas pelo usuário para termos específicos de domínio. O modelo TTS (VibeVoice-TTS-1.5B) pode sintetizar até 90 minutos de fala com múltiplos falantes (até 4 falantes). Uma variante em tempo real (VibeVoice-Realtime-0.5B) suporta entrada de texto em streaming e geração de formato longo com vozes multilíngues (9 idiomas) e 11 vozes em inglês.
Detalhes Técnicos Principais
- Inovação central: Tokenizadores de fala contínuos (Acústico e Semântico) com uma taxa de quadros ultrabaixa de 7,5 Hz, preservando a fidelidade do áudio e aumentando a eficiência computacional para sequências longas.
- Arquitetura: Estrutura de difusão de próximo token — um LLM lida com o contexto textual e o fluxo do diálogo, e um cabeçote de difusão gera detalhes acústicos de alta fidelidade.
- Capacidades ASR: Áudio de 60 minutos em passagem única, ASR + diarização + timestamps (Quem, Quando, O quê), hotwords personalizáveis.
- Capacidades TTS: Síntese de formato longo de 90 minutos com até 4 falantes distintos; streaming em tempo real via VibeVoice-Realtime-0.5B.
- Aceleração de inferência: Suporte a inferência vLLM (veja
vllm-asr). - Fine-tuning: Código de fine-tuning ASR está disponível.
- Integração Hugging Face: VibeVoice-ASR agora faz parte do lançamento do Transformers (06/03/2026).
Links rápidos:
- Modelo ASR: Link HF | Playground
- Modelo TTS: Link HF (código desabilitado)
- TTS em tempo real: Link HF | Colab
Nota: O código do VibeVoice-TTS foi removido do repositório (05/09/2025) devido a preocupações com uso indevido, mas os códigos ASR e TTS em tempo real permanecem ativos.
📖 Leia a fonte completa: HN AI Agents
👀 See Also

Servidor MCP Indexa Bases de Código em Grafo de Conhecimento para Redução de 10x em Tokens
Um novo servidor MCP chamado codebase-memory-mcp analisa bases de código em um grafo de conhecimento persistente usando tree-sitter, reduzindo o uso de tokens em pelo menos 10x para consultas estruturais. Testado em 35 repositórios do mundo real, ele substitui a exploração arquivo por arquivo por consultas em grafo.

Modo Cowork do Claude explicado: execução de tarefas em nível de arquivo versus modos de bate-papo e código
O modo Cowork do Claude opera dentro de uma pasta escolhida para realizar tarefas em nível de arquivo, como organizar pastas bagunçadas, extrair dados estruturados de capturas de tela e combinar notas dispersas em documentos estruturados.

Nexus: Protocolo de IA para IA de Código Aberto com Descoberta, Confiança e Pagamentos
Nexus é um protocolo auto-hospedado que permite que agentes de IA se descubram, negociem termos, verifiquem respostas e lidem com micropagamentos sem intervenção humana. Inclui cinco camadas: descoberta, confiança, protocolo, roteamento e federação, com 66 testes e licenciamento MIT.

AlphaCreek: Um Servidor MCP que Fragmenta Arquivos SEC para Reduzir o Uso de Tokens em 85%
AlphaCreek é um conector MCP gratuito para o Claude que reduz o consumo de tokens em ~85% ao trabalhar com arquivos da SEC, primeiro retornando um sumário e depois buscando apenas as seções que o agente solicitar.