Microsoft VibeVoice: Modelos ASR de 60 Min e TTS de 90 Min de Código Aberto

✍️ OpenClawRadar📅 Publicado: April 28, 2026🔗 Source
Microsoft VibeVoice: Modelos ASR de 60 Min e TTS de 90 Min de Código Aberto
Ad

A Microsoft disponibilizou como código aberto o VibeVoice, uma família de modelos de voz IA de ponta que abrange ASR e TTS. O modelo ASR (VibeVoice-ASR-7B) processa até 60 minutos de áudio de formato longo em uma única passagem (janela de 64K tokens), gerando transcrições estruturadas com identificação do falante, timestamps e texto — com suporte a mais de 50 idiomas. Também oferece suporte a hotwords personalizadas pelo usuário para termos específicos de domínio. O modelo TTS (VibeVoice-TTS-1.5B) pode sintetizar até 90 minutos de fala com múltiplos falantes (até 4 falantes). Uma variante em tempo real (VibeVoice-Realtime-0.5B) suporta entrada de texto em streaming e geração de formato longo com vozes multilíngues (9 idiomas) e 11 vozes em inglês.

Ad

Detalhes Técnicos Principais

  • Inovação central: Tokenizadores de fala contínuos (Acústico e Semântico) com uma taxa de quadros ultrabaixa de 7,5 Hz, preservando a fidelidade do áudio e aumentando a eficiência computacional para sequências longas.
  • Arquitetura: Estrutura de difusão de próximo token — um LLM lida com o contexto textual e o fluxo do diálogo, e um cabeçote de difusão gera detalhes acústicos de alta fidelidade.
  • Capacidades ASR: Áudio de 60 minutos em passagem única, ASR + diarização + timestamps (Quem, Quando, O quê), hotwords personalizáveis.
  • Capacidades TTS: Síntese de formato longo de 90 minutos com até 4 falantes distintos; streaming em tempo real via VibeVoice-Realtime-0.5B.
  • Aceleração de inferência: Suporte a inferência vLLM (veja vllm-asr).
  • Fine-tuning: Código de fine-tuning ASR está disponível.
  • Integração Hugging Face: VibeVoice-ASR agora faz parte do lançamento do Transformers (06/03/2026).

Links rápidos:

Nota: O código do VibeVoice-TTS foi removido do repositório (05/09/2025) devido a preocupações com uso indevido, mas os códigos ASR e TTS em tempo real permanecem ativos.

📖 Leia a fonte completa: HN AI Agents

Ad

👀 See Also

Servidor MCP Indexa Bases de Código em Grafo de Conhecimento para Redução de 10x em Tokens
Tools

Servidor MCP Indexa Bases de Código em Grafo de Conhecimento para Redução de 10x em Tokens

Um novo servidor MCP chamado codebase-memory-mcp analisa bases de código em um grafo de conhecimento persistente usando tree-sitter, reduzindo o uso de tokens em pelo menos 10x para consultas estruturais. Testado em 35 repositórios do mundo real, ele substitui a exploração arquivo por arquivo por consultas em grafo.

OpenClawRadar
Modo Cowork do Claude explicado: execução de tarefas em nível de arquivo versus modos de bate-papo e código
Tools

Modo Cowork do Claude explicado: execução de tarefas em nível de arquivo versus modos de bate-papo e código

O modo Cowork do Claude opera dentro de uma pasta escolhida para realizar tarefas em nível de arquivo, como organizar pastas bagunçadas, extrair dados estruturados de capturas de tela e combinar notas dispersas em documentos estruturados.

OpenClawRadar
Nexus: Protocolo de IA para IA de Código Aberto com Descoberta, Confiança e Pagamentos
Tools

Nexus: Protocolo de IA para IA de Código Aberto com Descoberta, Confiança e Pagamentos

Nexus é um protocolo auto-hospedado que permite que agentes de IA se descubram, negociem termos, verifiquem respostas e lidem com micropagamentos sem intervenção humana. Inclui cinco camadas: descoberta, confiança, protocolo, roteamento e federação, com 66 testes e licenciamento MIT.

OpenClawRadar
AlphaCreek: Um Servidor MCP que Fragmenta Arquivos SEC para Reduzir o Uso de Tokens em 85%
Tools

AlphaCreek: Um Servidor MCP que Fragmenta Arquivos SEC para Reduzir o Uso de Tokens em 85%

AlphaCreek é um conector MCP gratuito para o Claude que reduz o consumo de tokens em ~85% ao trabalhar com arquivos da SEC, primeiro retornando um sumário e depois buscando apenas as seções que o agente solicitar.

OpenClawRadar