Cartão de título principal para o artigo 'VibeVoice-ASR-Streaming-1.5B' com a tag 'O que sabemos até agora', subtítulo 'O speech-to-text de streaming da Microsoft foi lançado sem alarde', e chips com os textos 'Lançado em 2 de setembro de 2026', 'MIT · Pesos abertos' e '10 idiomas'. O logotipo do OrcaRouter é composto no canto inferior direito.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B, Explicado: o ASR de streaming da Microsoft chegou sem lançamento

Autor

Alistair Wren

Data de publicação

Voltar para todas as publicações

Em 2 de setembro de 2026, a Microsoft Research enviou dois novos checkpoints de conversão de fala em texto para o Hugging Face sem comunicado à imprensa, sem postagem em blog e sem alarde: microsoft/VibeVoice-ASR-Streaming-1.5B e seu irmão maior microsoft/VibeVoice-ASR-Streaming-7B. O único anúncio até agora é uma entrada de notícias datada de 3 de setembro de 2026 na seção de Notícias do repositório GitHub de código aberto VibeVoice da Microsoft, descrevendo o lançamento como um modelo ASR unificado de streaming que transcreve quem disse o quê enquanto o áudio ainda está chegando, com hotwords personalizadas e dez idiomas. Ambos os checkpoints são licenciados sob MIT, ambos foram criados com cerca de cinco minutos de diferença um do outro na conta oficial do microsoft no Hugging Face, e ambos mostraram zero downloads quando verificamos um dia depois. Não encontramos nenhuma cobertura de terceiros sobre nenhum dos dois.

Isso faz deste um artigo incomum: um lançamento real e datável — pesos no Hugging Face datados de 2 de setembro, um anúncio no repositório datado de 3 de setembro — que o mundo em geral ainda não conheceu. Tudo o que é possível saber a seguir vem da leitura do repositório: os arquivos de configuração, a ficha do modelo e a documentação de streaming da própria Microsoft. Tudo o que ainda não foi confirmado — precisão, latência real, se a atribuição de falante em streaming sobrevive a uma chamada real com dois falantes — está assim rotulado. Não há benchmark para citar porque a Microsoft ainda não publicou um em formato de texto.

O único anúncio é uma linha de notícias.

VibeVoice é a família de modelos de fala de código aberto da Microsoft Research, licenciados sob a licença MIT. Seu membro ASR mais conhecido, microsoft/VibeVoice-ASR, foi lançado em 21 de janeiro de 2026: um modelo em lote que processa até sessenta minutos de áudio em uma única passagem e retorna transcrições estruturadas com falante, marcação temporal e conteúdo — cerca de 700.000 downloads no Hugging Face desde então. Em 2 de setembro, a mesma organização publicou as versões de streaming, microsoft/VibeVoice-ASR-Streaming-7B e microsoft/VibeVoice-ASR-Streaming-1.5B; a API do Hugging Face registra o 7B em 2026-09-02T15:46 UTC e o 1.5B cinco minutos depois, às 15:51 UTC. A tabela de modelos do repositório GitHub agora lista VibeVoice-ASR-Streaming como uma entrada própria, e sua seção de notícias traz a publicação de 3 de setembro que o anuncia.

O que é genuinamente novo em relação ao modelo de janeiro é o modelo de interação: os checkpoints de streaming transcrevem à medida que o áudio chega, em vez de esperar por um arquivo completo. Todo o resto — a arquitetura subjacente de tokens de fala, a saída atribuída ao falante, o mecanismo de hotword — é uma continuação do design em lote, ampliado e redirecionado para uso em tempo real. Observe a diferença de idiomas desde o início: o modelo em lote anuncia mais de 50 idiomas, enquanto o cartão de streaming lista dez.

A screenshot of the microsoft/VibeVoice GitHub repository README showing the model table that lists VibeVoice-ASR-Streaming as a member of the family and the News section entry dated September 3, 2026 announcing the streaming ASR release.

O que "streaming" significa neste checkpoint

O documento de streaming da Microsoft descreve a intenção claramente: o modelo transcreve enquanto o áudio ainda está chegando e emite texto a cada bloco de áudio, de modo que uma transcrição aparece à medida que o falante fala. O arquivo preprocessor_config.json do repositório 1.5B torna a cadência concreta:

• Taxa de amostragem e taxa de tokens — áudio de entrada de 24 kHz, comprimido 3.200×, o que resulta em um fluxo de tokens de fala de aproximadamente 7,5 Hz (cerca de um token a cada 133 ms).

• Chunk — 22 quadros, que a 7,5 Hz equivale a cerca de 2,9 segundos de áudio por segmento emitido.

• Lookahead — 4 frames, cerca de 0,5 segundos de áudio futuro usados para refinar o segmento atual.

(O cálculo é direto a partir do repositório: 22 × 3.200 = 70.400 amostras ≈ 2,93 s a 24 kHz; 4 × 3.200 = 12.800 amostras ≈ 0,53 s. A própria documentação da Microsoft nota que um checkpoint sempre executa no chunk em que foi treinado, portanto esses valores não são ajustáveis no momento da inferência.)

Isso o coloca na família de streaming em blocos, e não na palavra por palavra: uma transcrição ao vivo cresce em incrementos de cerca de três segundos, com aproximadamente meio segundo de lookahead, e não em parciais por token. Esse é um design legítimo e comum para transcrição de reuniões e chamadas, mas apresenta um perfil de latência diferente de sistemas que emitem parciais em menos de um segundo — portanto, trate "streaming" como um espectro e avalie-o em relação ao seu próprio orçamento de latência antes de basear um produto de legendagem ao vivo nisso.

Por baixo do capô: um LLM de fala em escala Qwen

Ler o config.json do checkpoint de 1.5B revela a agora familiar receita VibeVoice em escala menor:

O decodificador é um modelo de linguagem da família Qwen2 cujas dimensões correspondem exatamente à classe Qwen2.5 de 1.5B — 28 camadas, 1.536 unidades ocultas, 12 cabeças de atenção com 2 cabeças de chave-valor e uma janela de 65.536 tokens. O LLM é o que permite ao modelo manter a compreensão do falante e do conteúdo ao longo da transcrição.

• Tokenizadores acústicos e semânticos — codificadores convolucionais profundos com stride de 8/5/5/4/2/2 — convertem áudio de 24 kHz no fluxo de tokens de fala de ~7,5 Hz que o decodificador lê.

• Uma cabeça de difusão (DDPM, 20 etapas de denoising, v-prediction) fica no lado da geração, consistente com o restante da linha VibeVoice.

Honestidade sobre o tamanho: os próprios metadados do safetensors do checkpoint listam cerca de 3 bilhões de parâmetros, aproximadamente 5,6 GB de pesos. O "1,5B" no nome refere-se à escala do backbone de linguagem — a leitura natural de uma configuração cujo decodificador é um modelo Qwen de classe 1,5B — com os tokenizadores de áudio e o cabeçote de difusão adicionando o restante. A string de arquitetura na configuração, VibeVoiceForASRStreamingTraining, sinaliza que este é um checkpoint da família de pesquisa.

A single-column scoreboard titled 'VibeVoice-ASR-Streaming-1.5B — the scoreboard' with the subtitle 'Key specs read from the Hugging Face checkpoint and Microsoft's repo' and six rows: 'Released: Sept 2, 2026', 'Streaming cadence: ~3 s chunks, ~0.5 s lookahead', 'Languages: 10', 'Speaker output: who said what (unverified)', 'Scale: 1.5B LM backbone, ~3B total', 'License: MIT, open weights'. Footer: 'Specs from HF config and microsoft/VibeVoice repo — no independent benchmarks yet.' The OrcaRouter logo is composited in the bottom-right corner.

Quem disse o quê, em dez idiomas.

A principal capacidade do model card é a transcrição em streaming com atribuição de falante: ele “transcreve continuamente quem disse o quê à medida que a fala chega”, de acordo com o próprio item do card. Ele também anuncia hotwords personalizadas para termos de domínio e lista dez idiomas suportados — chinês, inglês, francês, alemão, italiano, japonês, coreano, português, russo e espanhol.

A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the MIT license tag, the automatic-speech-recognition pipeline tag, and the card description of streaming speaker-attributed transcription with customized hotwords and ten languages.

As palavras de ativação são implementadas pelo mesmo mecanismo de viés de contexto que o modelo em lote usa. Na demonstração de linha de comando da Microsoft, você as passa como informações de contexto — por exemplo, --context_info "Microsoft,VibeVoice" — para direcionar o reconhecimento para nomes e termos técnicos sem qualquer ajuste fino. O cartão não diz nada sobre detecção automática de idioma ou alternância de código para o modelo de streaming, o que é outra lacuna em relação às alegações do modelo em lote.

Uma ressalva merece ênfase. A página de documentação de streaming concentra-se na emissão em blocos e em hotwords; ela não detalha como a atribuição de falantes é mantida entre os limites dos blocos. A diarização em streaming é genuinamente difícil — os falantes se sobrepõem, e um limite de bloco é exatamente onde a atribuição se desvia. O enquadramento de "quem disse o quê" no cartão é uma afirmação do fornecedor até que alguém execute uma chamada ao vivo real com dois falantes através dele e verifique.

Onde se encaixa: a família VibeVoice e o campo de streaming-ASR de 2026.

Dentro da família, o lançamento se encaixa da seguinte forma:

• microsoft/VibeVoice-ASR (21 de janeiro de 2026) — o carro-chefe em lote: até 60 minutos em uma única passada, mais de 50 idiomas, saída Quem/Quando/O quê, hotwords, cerca de 700 mil downloads.

• microsoft/VibeVoice-ASR-Streaming-7B e microsoft/VibeVoice-ASR-Streaming-1.5B (2 de setembro de 2026) — as novas variantes de streaming; o assunto deste artigo é a 1.5B.

• microsoft/VibeVoice-ASR-BitNet (23 de julho de 2026) — um mecanismo de borda quantizado, orientado para CPU, para o modelo em lote.

• Os modelos VibeVoice-1.5B TTS e VibeVoice-Realtime-0.5B de TTS em streaming são membros separados da mesma família, não fazem parte da linha ASR.

O campo mais amplo de ASR de pesos abertos vem se movendo em direção ao tempo real ao longo de todo o ano, então um novo modelo de streaming encontra pontos diretos de comparação. Qwen3-ASR (Alibaba, ~1,7B) é um modelo unificado de streaming e offline que cobre mais de 50 idiomas e dialetos. O Nemotron 3.5 ASR da NVIDIA é um modelo de streaming de 0,6B que abrange 40 idiomas, sob a licença OpenMDW em vez de MIT. O Granite Speech 5.0 470M TurboCTC da IBM é Apache-2.0, com números de throughput divulgados pelo fornecedor que são excepcionalmente altos. Frente a esses, o modelo de streaming da Microsoft se diferencia em três pontos: licenciamento MIT, um backbone de LLM que traz compreensão de falante e conteúdo em vez de um modelo puramente acústico, e o enquadramento de transcrição ao vivo com atribuição ao falante. Suas questões em aberto são precisão e latência no mundo real — nenhuma das duas tem ainda um número independente.

O que ainda não foi verificado

Ler o repositório mostra o design; não mostra quão bem ele funciona. Especificamente:

• Nenhum número de precisão ou latência no texto. A ficha do modelo traz uma figura de resultados como imagem, mas nenhuma tabela numérica de WER, RTF ou latência em prosa — nada para citar de forma independente.

• Nenhuma avaliação de terceiros. Os downloads estavam em zero um dia após o upload; não há benchmark da comunidade, nenhuma entrada em leaderboard e nenhum teste independente que pudéssemos encontrar.

• O caminho de serving é uma configuração de pesquisa a partir do código-fonte. A documentação de streaming da Microsoft é executada a partir de um clone do repositório VibeVoice no GitHub dentro de um contêiner NVIDIA PyTorch (nvcr.io/nvidia/pytorch, com flash-attention recomendado). O model card também mostra um trecho de código do pipeline do Transformers e remete os detalhes de instalação para o GitHub; não verificamos se a versão atualmente lançada do Transformers executa inferência de streaming neste checkpoint sem configuração adicional.

• O enquadramento é pesquisa em primeiro lugar. O repositório da Microsoft descreve os modelos VibeVoice como destinados a fins de pesquisa e desenvolvimento. Os pesos são MIT; a postura é "aqui está a ciência", não "aqui está um produto com suporte." Reserve orçamento para sua própria etapa de avaliação.

Você deveria construir sobre isso?

Para equipes que já hospedam ASR por conta própria, isso vale uma avaliação de fim de semana se o seu áudio estiver dentro do conjunto de dez idiomas e você precisar especificamente de transcrição ao vivo com atribuição de falante de um modelo sob licença MIT. Preveja cerca de 5,6 GB de pesos para o modelo 1.5B em uma GPU NVIDIA e uma instalação a partir do código-fonte, e planeje medir a acurácia você mesmo no seu próprio áudio antes de confiar nele.

Para equipes que hoje implementam um pipeline de transcrição em produção, a resposta prudente é aguardar uma de três coisas: a Microsoft publicar os números de precisão e latência que atualmente existem apenas como imagem; um benchmark independente; ou um caminho de serviço mantido com um runtime suportado. A cadência fragmentada de ~3 segundos também é uma especificação para validar em relação ao seu requisito de latência, em vez de presumir algo a partir da palavra "streaming".

A forma mais barata de manter a opção em aberto é evitar amarrar sua aplicação a um único mecanismo de transcrição. Uma camada de roteamento que disponibiliza vários modelos por meio de uma única API significa que, quando o VibeVoice-ASR-Streaming — ou o próximo ASR aberto — estiver disponível em um provedor de inferência, testá-lo A/B contra o modelo atualmente em uso no mesmo tráfego será uma mudança de configuração, não uma troca de plataforma. Como um roteador de passagem cobra o preço de tabela do provedor sem nenhum acréscimo, essa comparação continua de baixo custo, e o failover automático impede que um modelo novo e ainda não comprovado se torne um ponto único de falha no seu pipeline. Esse é o padrão geral para adotar qualquer modelo recém-lançado: deixe que ele conquiste um lugar no tráfego real antes de apostar a produção nele.

Perguntas Frequentes

O VibeVoice-ASR-Streaming-1.5B é um lançamento real da Microsoft?

Sim. O checkpoint está na conta oficial da microsoft no Hugging Face com timestamp de criação de 2 de setembro de 2026, e o repositório microsoft/VibeVoice no GitHub referencia o VibeVoice-ASR-Streaming em sua tabela de modelos com uma notícia datada de 3 de setembro de 2026. O que é incomum não é a procedência, mas o silêncio: nenhum comunicado à imprensa, nenhuma postagem em blog e nenhuma cobertura de terceiros até o momento em que este texto foi escrito.

Por que dois tamanhos, 7B e 1.5B?

A Microsoft enviou os dois checkpoints no mesmo minuto, mas não publicou uma comparação. Pelas configurações, o 1.5B é o extremo menor — um backbone de linguagem Qwen da classe 1.5B mais o stack de áudio, cerca de 3B de parâmetros e ~5,6 GB de pesos. A leitura natural é um 7B de maior precisão e um 1.5B mais barato e rápido, mas a Microsoft não afirmou isso, e não há benchmarks que confirmem o trade-off.

Em que isso difere do VibeVoice-ASR anterior?

O modelo do lote de janeiro processa até 60 minutos de áudio em uma única passada e anuncia mais de 50 idiomas. Os checkpoints de streaming transcrevem enquanto o áudio chega, emitindo uma transcrição em blocos de aproximadamente 3 segundos, com cerca de 0,5 segundo de antecipação, e o cartão do modelo lista dez idiomas. Ambos compartilham a mesma arquitetura de tokens de fala, a ideia de saída atribuída ao falante e o mecanismo de hotword.

Por enquanto, o VibeVoice-ASR-Streaming-1.5B é um checkpoint mais uma linha de notícias. Leia o repositório se você fizer auto-hospedagem e precisar de um ASR de streaming com licença permissiva para avaliar; espere pelos números se estiver escolhendo um motor de produção. O sinal interessante é que a Microsoft está empurrando sua linha de voz para tempo real em dois tamanhos ao mesmo tempo — e fez isso tão silenciosamente que um dia depois, o contador de downloads ainda marcava zero.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube