Um cartão de título em destaque comparando 'VibeVoice-ASR-Streaming-7B vs Whisper Large v3 Turbo', com overline 'ASR de pesos abertos - setembro de 2026', um subtítulo que diz que o checkpoint de streaming da Microsoft encontra o padrão de pesos abertos - o que o streaming agrega e o que custam 0,8B vs 9B de parâmetros, chips 'Pesos MIT - 2 de setembro', 'Pesos MIT - 2024' e 'Whisper: 99 idiomas', e uma nota de rodapé 'O recorde do Whisper é público'. O logotipo do OrcaRouter é composto no canto inferior direito.
Guides & Insights

VibeVoice-ASR-Streaming-7B vs Whisper Large v3 Turbo: O que o checkpoint de streaming da Microsoft adiciona ao padrão de pesos abertos

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Durante a maior parte dos últimos dois anos, a resposta para "transcrever nós mesmos, de forma barata" tem sido o Whisper Large v3 Turbo — o modelo de pesos abertos de 809 milhões de parâmetros da OpenAI, licenciado sob MIT, 99 idiomas, pequeno o suficiente para rodar em uma estação de trabalho e gratuito uma vez que você possui o hardware. Em 2 de setembro de 2026, a Microsoft Research publicou um desafiante para esse padrão: o VibeVoice-ASR-Streaming-7B, um checkpoint de streaming licenciado sob MIT no Hugging Face que transcreve conforme o áudio chega, afirma ter saída com atribuição de locutor e — ao contrário do modelo que a maioria das equipes já executa — nunca foi projetado para ser um trabalho em lote. Ambos os modelos têm pesos abertos de grandes laboratórios. Quase todo o resto sobre eles é uma troca, e esta página é sobre qual troca você está realmente fazendo.

Uma assimetria molda toda a comparação, então ela vem primeiro. O Whisper Large v3 Turbo é o modelo de fala mais reproduzido de forma independente no mundo: seus números de erro de palavra foram reexecutados por milhares de equipes em benchmarks públicos e em seus próprios áudios por anos, e seus pontos fracos são tão documentados quanto seus pontos fortes. O VibeVoice-ASR-Streaming-7B tem um dia de existência, não possui nenhum benchmark independente em lugar algum, e a Microsoft não publicou uma taxa de erro de palavra em streaming em texto legível. Tudo do lado da Microsoft abaixo é lido a partir do repositório — config, model card e documentação de streaming da Microsoft — e rotulado como tal.

O padrão de pesos abertos, e por que ele perdura

Whisper Large v3 Turbo é o irmão destilado do Whisper Large v3: mantém o encoder de 32 camadas e reduz o decoder de 32 para quatro camadas, fazendo a contagem de parâmetros cair para 809M e o throughput quase quadruplicar na GPU, ao mesmo tempo em que se mantém próximo em precisão. Como os pesos são MIT e o modelo é pequeno, ele se tornou o mecanismo de transcrição embarcado padrão para bots de reuniões, ferramentas de legendas e pipelines de registro de chamadas. Seus limites são igualmente conhecidos. É um modelo em lote: recebe um arquivo de áudio e devolve uma transcrição, em vez de produzir palavras à medida que são faladas. Não foi treinado para tradução, e essa tarefa degrada severamente. Sua precisão em fala ruidosa, com sotaque ou sobreposta é irregular, e ele retorna texto simples: sem pontuação nem capitalização por padrão, sem diarização de falantes, sem timestamps nesta variante, sem viés de palavras-chave. Stacks de produção construídos sobre o Whisper montam essas peças separadamente, cada uma adicionando sua própria latência e modos de falha.

A screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B (captured September 3, 2026) showing the model card opening line 'VibeVoice-ASR-Streaming is a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the ASR/Transcription/Speech-to-Text/Streaming tag row, the 'Model size 9B params' and BF16 badges, and the Code and Demo links.

A lacuna de especificação

• Parâmetros — 809M (decoder destilado) vs cerca de 9B no total (um backbone de linguagem Qwen2-7B mais codificadores de fala; o "7B" refere-se ao LLM, e a página do Hugging Face lista 9B).

• Licença — MIT, pesos abertos, ambos.

• {{1}}Streaming — em lote por design{{/1}}: {{2}}implementações de streaming auto-hospedadas normalmente têm de 1 a 5 segundos de latência, em comparação com o streaming nativo{{/2}}: {{3}}chunks de ~2,9 segundos com ~0,5 segundo de lookahead{{/3}}, {{4}}texto emitido por chunk{{/4}}, {{5}}contexto preservado em um cache KV{{/5}}.

• Idiomas — 99 com anos de reprodução comunitária vs 10 declarados (en, zh, es, pt, de, ja, ko, fr, ru, it).

• Além da transcrição — nenhum por padrão versus a alegada saída em streaming de quem disse o quê e hotwords personalizadas (não verificado).

• Precisão na transcrição — 2,1% de WER no LibriSpeech test-clean, 4,2% no test-other, ~7,7% no composto Open ASR, 8–12% em áudio ruidoso em testes da comunidade, todos reproduzidos de forma independente vs nenhum valor de WER de streaming publicado como texto.

• Pegada de memória — roda em um laptop ou em uma única GPU modesta, contra aproximadamente 18 GB de pesos bf16 antes do cache KV; planeje uma GPU de classe 24 GB.

A two-column scoreboard titled 'VibeVoice-ASR-Streaming-7B vs Whisper Large v3 Turbo - the scoreboard'. Left column VibeVoice-ASR-Streaming-7B (released Sep 2, 2026 - MIT open weights): parameters - about 9B (Qwen2-7B + encoders); streaming - native, ~2.9 s chunks; WER in print - none in text; output extras - claimed speaker IDs + hotwords; languages - 10 declared; hardware - ~18 GB bf16, 24 GB-class GPU. Right column Whisper Large v3 Turbo (open weights, released 2024): 809M distilled; batch, 1-5 s self-host streaming; 2.1% / 4.2% LibriSpeech, ~7.7% Open ASR; none by default; 99; laptop to small GPU. Footer: 'Whisper WER independently reproduced. VibeVoice specs read from the HF repo; no benchmark exists yet.'

O que o streaming realmente adiciona

A razão de se olhar além do Whisper Large v3 Turbo está no cenário de uso em tempo real, e é aí que os dois modelos deixam de ser comparáveis. O Whisper é orientado a lotes: para obter palavras enquanto o falante ainda está falando, as equipes precisam adicionar técnicas de divisão em blocos (chunking), detecção de atividade de voz e código de colagem, e implementações de streaming auto-hospedadas normalmente ficam com latência de um a cinco segundos — ficando aquém da marca de menos de um segundo para agentes telefônicos e legendagem ao vivo sem uma engenharia séria por trás. O VibeVoice-ASR-Streaming-7B foi criado para esse cenário. Sua configuração mostra o áudio comprimido 3.200× em um fluxo de tokens de 7,5 quadros por segundo, processado em blocos de 22 quadros com uma antecipação de quatro quadros — cerca de 2,9 segundos de áudio por bloco — com o texto emitido à medida que cada bloco é resolvido e o contexto anterior mantido no cache KV, de modo que uma sessão não recalcula tudo do zero. Essa cadência é uma característica de projeto derivada da configuração, não uma latência medida, e ninguém publicou um número de ponta a ponta para ela ainda; mas a arquitetura é, sem ambiguidade, uma arquitetura de transcrição ao vivo de uma forma que o Whisper não é.

O histórico do Whisper é longo e público; o do novo checkpoint está em branco.

A precisão é onde a idade do Whisper Large v3 Turbo é um trunfo. Seus 2,1% de WER no LibriSpeech test-clean e 4,2% no test-other são números de pesos abertos reproduzidos por inúmeras equipes; seus aproximadamente 7,7% no composto do ranking Open ASR ficam cerca de um ponto atrás do Large v3 completo; e seus documentados 8–12% em áudio ruidoso em testes da comunidade significam que ninguém se surpreende com isso. Essas fraquezas fazem parte do histórico — elas dizem exatamente onde o modelo precisa de ajuda antes de você construir sobre ele.

VibeVoice-ASR-Streaming-7B não tem nenhum desses registros. A ficha do modelo traz uma figura de avaliação como imagem e o relatório técnico de streaming da Microsoft é um PDF, mas não há taxa de erro por palavra de streaming citável em prosa. A única âncora numérica da família é a tabela reportada pelo fornecedor na ficha do VibeVoice-ASR batch — 7,77% de WER médio em oito conjuntos de teste em inglês e 2,20% no LibriSpeech clean — que não é o número deste checkpoint, e a recepção da comunidade ao modelo batch em si tem sido mista: elogiado pela diarização pronta para uso, criticado por ser pesado e ocasionalmente propenso a alucinações. Nada disso se transfere para o modelo de streaming, e é exatamente esse o ponto: com o Whisper você conhece os modos de falha antecipadamente; com o VibeVoice-ASR-Streaming-7B você é o primeiro testador.

Idiomas e tamanho: 99 contra 10, 0,8B contra 9B.

Os dois custos mais concretos da troca são idiomas e tamanho. O Whisper Large v3 Turbo transcreve 99 idiomas; idiomas de poucos recursos e idiomas tonais sofrem degradação — tailandês, cantonês e galês são os pontos fracos comumente citados — mas a lista tem anos de reprodução pela comunidade por trás dela. O VibeVoice-ASR-Streaming-7B declara dez: inglês, espanhol, chinês, português, alemão, japonês, coreano, francês, russo e italiano. Se o seu tráfego está dentro desses dez, a cobertura não é um problema; se não está, a comparação termina aqui. O tamanho é o segundo custo: 809M de parâmetros roda em um laptop, enquanto cerca de 9B de parâmetros totais em bf16 significa aproximadamente 18 GB de pesos antes do cache KV e uma GPU de classe 24 GB para servi-lo confortavelmente. Para equipes que já executam o Whisper em hardware modesto, isso é um passo real em infraestrutura, justificado apenas por uma necessidade genuína de transcrição ao vivo.

Quando grátis não é a questão

Whisper Large v3 Turbo é gratuito para executar; o custo está no hardware e na engenharia ao redor dele. Uma implantação faster-whisper em uma única T4 custa na ordem de US$ 0,05–US$ 0,10 por hora de áudio ao preço atual da GPU, e uma carga de trabalho contínua adiciona a pilha de diarização e pontuação que você precisa construir porque o Whisper retorna texto simples. O VibeVoice-ASR-Streaming-7B também é gratuito para executar, em hardware mais caro, em troca de uma arquitetura de streaming que afirma ter a atribuição de falantes e os controles de contexto que faltam ao Whisper — afirmações que você mesmo estaria verificando, já que não existe benchmark independente. Para transcrição em lote em volume, a taxa de transferência e o tamanho mínimo do Whisper ainda vencem. Para áudio ao vivo com vários falantes, em que a transcrição precisa chegar durante a conversa, o Whisper trabalha contra o próprio design, e o checkpoint de streaming trabalha a favor — se é que funciona, que é exatamente a pergunta a ser respondida com seu próprio áudio em sua própria GPU.

A screenshot of the microsoft/VibeVoice GitHub repository (captured September 3, 2026) showing the 'Open-Source Frontier Voice AI' description, the MIT license badge, directories including demo, docs, finetuning-asr, vibevoice and vllm_plugin, and recent commits including 'Add streaming ASR inference'.

A pilha pragmática

A resposta mais comum no mundo real não é “um ou outro”, mas “ambos”, e é essa a recomendação aqui: manter o Whisper Large v3 Turbo como o canal de lote de alto volume, onde seu histórico e seu consumo de recursos o tornam imbatível, e avaliar o VibeVoice-ASR-Streaming-7B no canal ao vivo que o Whisper não consegue atender com a latência necessária — com um portão de avaliação explícito, porque não há nenhum benchmark em que se basear. Os dois podem compartilhar um único orçamento de GPU e uma única base de código. Nessa pilha, o ponto em que uma camada de roteamento mostra seu valor é a camada acima das transcrições, não a transcrição em si: o OrcaRouter não faz roteamento de fala para texto hoje e nenhum dos dois modelos está em seu catálogo, mas os sumarizadores, as regras de alerta e os planejadores de agentes que consomem uma transcrição ao vivo são exatamente os mais de 200 modelos de linguagem que ele disponibiliza por meio de uma única API, com os preços de tabela dos provedores repassados sem margem e failover automático entre provedores. Um checkpoint de streaming lançado sem um único benchmark merece o mesmo tratamento que qualquer modelo não comprovado recebe — uma fatia do tráfego real com um mecanismo de fallback, conquistando ou perdendo sua confiança com base nas evidências das suas próprias reuniões, e não em uma ficha técnica do modelo.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube