Um cartão de título hero gerado para 'VibeVoice-ASR-Streaming-1.5B vs Whisper Large v3 Turbo: streaming nativo contra o cavalo de batalha de 99 idiomas', com o subtítulo 'Streaming nativo contra o cavalo de batalha de 99 idiomas' e dois cartões de modelo — VibeVoice-ASR-Streaming-1.5B (Microsoft Research · 2 de setembro de 2026 · MIT · nativo para streaming · 10 idiomas) e Whisper Large v3 Turbo (OpenAI · outubro de 2024 · MIT · em lote · 99 idiomas) — além de tags que dizem 'trechos de ~2,9 s + ~0,5 s de antecipação', '7M+ downloads / mês (Whisper)' e 'Nenhum benchmark publicado ainda'. O logotipo do OrcaRouter é sobreposto no canto inferior direito.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B vs Whisper Large v3 Turbo: streaming nativo contra o burro de carga de 99 idiomas

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Há uma boa chance de que o modelo de transcrição de fala que você executa hoje seja o Whisper Large v3 Turbo, e há um novo modelo questionando se deveria ser. O Whisper Large v3 Turbo da OpenAI — o checkpoint destilado de 809M parâmetros lançado em outubro de 2024 — é o cavalo de batalha de pesos abertos: 99 idiomas, aproximadamente quatro a oito vezes mais rápido que o large-v3 original, pequeno o suficiente para um laptop, licença MIT e respaldado pelo maior ecossistema de transcrição existente. VibeVoice-ASR-Streaming-1.5B, enviado pela Microsoft Research em 2 de setembro de 2026, é o desafiante construído para a única coisa que o Whisper não faz nativamente: transmissão em fluxo contínuo. Ele transcreve em partes à medida que o áudio chega, em vez de engolir janelas fixas; alega saída com atribuição de falantes e tem dez idiomas e nenhum benchmark publicado em seu nome.

Essa última cláusula é o motivo pelo qual esta página está estruturada em torno de uma questão de migração, e não de um confronto. Os números do Whisper Large v3 Turbo são mensurados e públicos — LibriSpeech, o composto Open ASR, Common Voice — enquanto o model card do VibeVoice-ASR-Streaming-1.5B não publica nenhum valor de WER ou latência em texto, e não existe nenhum benchmark independente no momento em que isto é escrito. Tudo sobre o lado da Microsoft abaixo é o que é possível saber a partir de seu repositório: os arquivos de configuração, o model card e a documentação de streaming da Microsoft. Tudo sobre o lado do Whisper é um registro público consolidado. Os dois não foram executados em confronto direto; a comparação é entre o que está comprovado e o que é prometido.

O modelo que você provavelmente já está executando

Whisper Large v3 Turbo conquistou seu lugar da maneira pouco glamorosa: é rápido, compacto, multilíngue e previsível do jeito que equipes de produção gostam. Destilado do Whisper large-v3 de 1,55B de parâmetros para 809M de parâmetros, ele mantém cobertura de 99 idiomas e cerca de 95% da precisão do large-v3 — aproximadamente 2,1% de WER no LibriSpeech clean, em torno de 7,7–7,8% no composto Open ASR, com a maior degradação em idiomas de poucos recursos e tonais — enquanto roda várias vezes mais rápido e cabe em cerca de 1,6 GB de VRAM em FP16. Tem licença MIT, roda via faster-whisper, whisper.cpp e três anos de integrações, e sua página no Hugging Face mostra mais de sete milhões de downloads em um único mês. Se você faz auto-hospedagem de transcrição, muito provavelmente é este o modelo responsável por isso.

O que o Whisper Large v3 Turbo não é, e nunca afirmou ser, é um modelo de streaming. Ele ingere áudio em janelas fixas de 30 segundos e retorna uma transcrição por janela; não tem detecção nativa de atividade de voz, nem endpointing, nem diarização de falantes, nem mecanismo de hotword. A transcrição ao vivo no Whisper é sempre um retrofit que você constrói — e é no retrofit que residem a latência e o custo de engenharia.

O que realmente muda se você mudar

• Modelo de latência — o VibeVoice-ASR-Streaming-1.5B, por design, emite texto uma vez por bloco resolvido de cerca de 2,9 segundos, com ~0,5 s de lookahead, ao contrário do Whisper Large v3 Turbo, um modelo em lote com janela de 30 segundos que precisa de uma camada de divisão em blocos e junção das saídas (chunking e stitching) para se aproximar de uma saída em tempo real.

• Formato da sessão — sessões ao vivo ilimitadas, com contexto transportado entre blocos em um cache de prefixo, versus janelas discretas de 30 segundos sem estado de conversação entre janelas.

• Idiomas — dez (chinês, inglês, francês, alemão, italiano, japonês, coreano, português, russo, espanhol) vs 99.

• Precisão em publicações — nenhuma publicada vs ~2,1% LibriSpeech clean, ~7,7–7,8% Open ASR composite, tudo medido e público.

Extras de saída — alega atribuição de quem disse o quê em streaming e hotwords vs timestamps de palavras disponíveis, mas sem diarização e sem hotwords nativamente.

• Hardware — ~5,6 GB de pesos bf16 em uma GPU NVIDIA, instalação a partir da fonte vs ~1,6 GB FP16, roda em laptops e CPUs via whisper.cpp e faster-whisper.

• Licença — MIT, ambos.

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs Whisper Large v3 Turbo — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, Streaming native ~2.9 s chunks, Languages 10, WER none published, Extras who-said-what + hotwords, Hardware ~5.6 GB NVIDIA GPU, License MIT. Right column Whisper Large v3 Turbo: Released Oct 2024, Streaming none / 30 s windows, Languages 99, WER ~2.1% LibriSpeech clean, Extras timestamps, no diarization, Hardware ~1.6 GB laptop-class, License MIT. Footer reads 'Whisper figures measured and public; VibeVoice specs read from the HF repo, no benchmark exists yet.' The OrcaRouter logo is composited in the bottom-right corner.

O problema da adaptação de streaming

A maneira honesta de pensar sobre este confronto é que o Whisper Large v3 Turbo tem um problema de streaming pelo qual você já pagou ou ainda está pagando. Um pipeline ao vivo no Whisper significa um detector de atividade de voz para encontrar fala, um fragmentador para dividir o áudio em janelas do tamanho do Whisper, janelas sobrepostas para que as palavras não se percam nas bordas, e um montador para reconciliar as transcrições parciais. Implementações comunitárias dessa pilha chegam a aproximadamente um a cinco segundos de latência de ponta a ponta — viável para notas de reuniões, aquém do padrão exigido para agentes de telefone e legendagem ao vivo.

VibeVoice-ASR-Streaming-1.5B elimina o retrofit pela própria construção. Sua configuração de pré-processamento fixa um bloco de 22 frames e um lookahead de 4 frames em um fluxo de tokens de fala de ~7,5 Hz — cerca de 2,9 segundos de áudio por segmento emitido, meio segundo de contexto futuro — e a documentação da Microsoft descreve que o contexto de blocos anteriores é preservado por meio do cache KV, portanto uma sessão ao vivo não recomputa do zero. Mas leia a palavra "streaming" com atenção em ambos os lados dessa comparação: nenhum dos modelos é um mecanismo de parciais por palavra do tipo que as APIs comerciais de menor latência vendem. O transcript do VibeVoice cresce em incrementos de aproximadamente três segundos por projeto, que é um ritmo diferente e geralmente aceitável para reuniões, mas não é subsegundo; e, se o seu requisito é ter palavras na tela em menos de um segundo, você deve medir essa geometria de blocos contra esse orçamento antes de construir sobre ela.

Precisão: o que você abre mão para adotar streaming nativo

Aqui está a lacuna que deve orientar a decisão. O Whisper Large v3 Turbo tem um histórico público de precisão que você pode auditar — e, quando a gravação está dentro dos seus 99 idiomas, esse histórico é sólido. O VibeVoice-ASR-Streaming-1.5B não tem esse histórico: a avaliação do model card é uma imagem, a Microsoft não publicou nenhuma WER de streaming em texto, e a única âncora numérica da família é a WER média de 7,77% informada pelo fornecedor no card do modelo em lote VibeVoice-ASR, em oito conjuntos de teste em inglês, o que descreve um modelo diferente, não-streaming. A afirmação honesta é que migrar sua transcrição para o VibeVoice-ASR-Streaming-1.5B hoje significa aceitar um nível de precisão desconhecido no seu próprio áudio — exatamente por isso, qualquer avaliação dele precisa ser executada por você, nas suas gravações reais mais difíceis, antes de ele ganhar tráfego de produção.

A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

Idiomas e atribuição de falantes: a lacuna de recursos afeta os dois lados

A comparação de recursos não é unilateral, e é isso que torna a escolha genuinamente interessante. Se o seu áudio for multilíngue, a decisão termina imediatamente: os 99 idiomas do Whisper Large v3 Turbo cobrem o que os dez do VibeVoice-ASR-Streaming-1.5B não cobrem, e um teto de dez idiomas é desqualificante para qualquer pipeline que veja uma ampla mistura de fala. Mas se a sua carga de trabalho estiver dentro desses dez idiomas e o que você realmente precisa é saber quem disse o quê em uma reunião ao vivo, a seta aponta para o outro lado: o Whisper não oferece diarização nativa nem hotwords, enquanto o VibeVoice-ASR-Streaming-1.5B afirma ter ambos — saída em streaming com atribuição de falante e hotwords de termos de domínio passadas como prompt de contexto. A afirmação não é verificada, e a diarização em streaming entre limites de blocos é difícil o suficiente para merecer ceticismo, mas é o recurso concreto que nenhuma quantidade de engenharia do Whisper oferece de fábrica.

A matemática da migração

Custo e esforço favorecem a solução atual. O Whisper Large v3 Turbo já roda na sua stack, em hardware que você possui — um laptop, uma CPU, uma GPU modesta — e migrar para o VibeVoice-ASR-Streaming-1.5B significa subir uma instalação de pesquisa a partir do código-fonte em uma GPU NVIDIA com ~5,6 GB de pesos, verificar um caminho de carregamento cuja classe de arquitetura ainda não está na documentação pública do Transformers e construir do zero o benchmark do qual sua decisão depende. Isso é um projeto de verdade, e o retorno depende de essas funcionalidades não verificadas serem importantes para você.

A screenshot of the Hugging Face model card for openai/whisper-large-v3-turbo, showing the OpenAI namespace, the model title Whisper, the MIT license tag, the 99-languages tag, and the automatic-speech-recognition pipeline tags, with the description of Whisper as a state-of-the-art automatic speech recognition model.

A forma barata de executar esse projeto é não tratá-lo como uma substituição. Mantenha o Whisper Large v3 Turbo como padrão e envie uma fatia do áudio ao vivo para o VibeVoice-ASR-Streaming-1.5B por meio de uma única API — o padrão para o qual existe uma camada de roteamento: mais de 200 modelos atrás de um único endpoint pelo preço de lista do provedor, sem markup, failover automático quando o novo modelo falha, e um DSL de roteamento que permite que diferentes cargas de trabalho escolham diferentes transcritores em uma única chamada. Esse é o modelo do OrcaRouter, e é a diferença entre apostar seu pipeline de produção em um checkpoint de dois dias e deixar que esse checkpoint conquiste seu lugar ao lado do cavalo de batalha em suas próprias transcrições.

Perguntas frequentes

O Whisper Large v3 Turbo consegue sequer fazer transmissão ao vivo?

Apenas como retrofit. O Whisper Large v3 Turbo é um modelo em lote que processa janelas fixas de 30 segundos; por isso, a transcrição ao vivo exige construir, sobre ele, um detector de atividade de voz, um particionador de blocos, uma estratégia de sobreposição e um montador. Existem implementações funcionais que entregam entre um e cinco segundos de latência, o que atende a anotações de reunião, mas fica aquém do requisito de menos de um segundo para agentes de call center e legendagem ao vivo. O VibeVoice-ASR-Streaming-1.5B é nativo de streaming — ele emite texto a cada bloco de aproximadamente 2,9 segundos, com cerca de 0,5 segundo de antecipação —, mas é um streaming por blocos, e não resultados parciais palavra por palavra. Portanto, avalie também essa cadência em relação ao seu próprio orçamento de latência.

Não tenho dados de benchmark suficientes para comparar diretamente a precisão do VibeVoice-ASR-Streaming-1.5B com o Whisper Large v3 Turbo. Modelos de reconhecimento de fala podem variar em desempenho conforme o idioma, o sotaque, o ruído de fundo e o tipo de áudio. Recomendo consultar avaliações oficiais ou executar testes nos seus próprios conjuntos de dados para uma comparação precisa.

Ninguém pode responder a isso ainda, nem a Microsoft. A precisão do Whisper Large v3 Turbo é medida e pública — aproximadamente 2,1% de WER no LibriSpeech clean e 7,7–7,8% no composto Open ASR. O VibeVoice-ASR-Streaming-1.5B não tem um valor de WER de streaming publicado em texto e nenhum benchmark independente até o momento desta escrita. A única maneira de responder à pergunta é executar o checkpoint no seu próprio áudio e comparar as transcrições com o seu sistema atual — que é precisamente o teste que esta página recomenda antes de qualquer migração.

Quais idiomas os dois suportam?

O Whisper Large v3 Turbo oferece suporte a 99 idiomas com um único conjunto de pesos. O VibeVoice-ASR-Streaming-1.5B lista dez: chinês, inglês, francês, alemão, italiano, japonês, coreano, português, russo e espanhol. Para qualquer áudio fora desse conjunto de dez idiomas, o Whisper é a única opção neste emparelhamento, e a lacuna multilíngue é a razão mais clara pela qual a maioria das equipes permanecerá onde está.

Whisper Large v3 Turbo é o modelo certo para a maioria das equipes na maioria das vezes, e um checkpoint de dois dias sem benchmarks não é motivo para trocar de plataforma. É motivo para rodar um experimento. Se o seu áudio estiver em uma das dez línguas do VibeVoice-ASR-Streaming-1.5B e a atribuição de locutor em tempo real for capaz de mudar o seu produto, coloque-o no ar atrás de um roteador, direcione uma fatia do tráfego real para ele e deixe que as transcrições — não a ausência de um benchmark em ambos os lados — decidam.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube