
VibeVoice-ASR-Streaming-7B vs Whisper Large v3 Turbo: O que o checkpoint de streaming da Microsoft adiciona ao padrão de pesos abertos
- AlibabaNOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligência72Código
- DeepSeekNOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianQwen3.8 27B2026-08-1552Inteligência68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
Durante a maior parte dos últimos dois anos, a resposta para "transcrever nós mesmos, de forma barata" tem sido o Whisper Large v3 Turbo — o modelo de pesos abertos de 809 milhões de parâmetros da OpenAI, licenciado sob MIT, 99 idiomas, pequeno o suficiente para rodar em uma estação de trabalho e gratuito uma vez que você possui o hardware. Em 2 de setembro de 2026, a Microsoft Research publicou um desafiante para esse padrão: o VibeVoice-ASR-Streaming-7B, um checkpoint de streaming licenciado sob MIT no Hugging Face que transcreve conforme o áudio chega, afirma ter saída com atribuição de locutor e — ao contrário do modelo que a maioria das equipes já executa — nunca foi projetado para ser um trabalho em lote. Ambos os modelos têm pesos abertos de grandes laboratórios. Quase todo o resto sobre eles é uma troca, e esta página é sobre qual troca você está realmente fazendo.
Uma assimetria molda toda a comparação, então ela vem primeiro. O Whisper Large v3 Turbo é o modelo de fala mais reproduzido de forma independente no mundo: seus números de erro de palavra foram reexecutados por milhares de equipes em benchmarks públicos e em seus próprios áudios por anos, e seus pontos fracos são tão documentados quanto seus pontos fortes. O VibeVoice-ASR-Streaming-7B tem um dia de existência, não possui nenhum benchmark independente em lugar algum, e a Microsoft não publicou uma taxa de erro de palavra em streaming em texto legível. Tudo do lado da Microsoft abaixo é lido a partir do repositório — config, model card e documentação de streaming da Microsoft — e rotulado como tal.
O padrão de pesos abertos, e por que ele perdura
Whisper Large v3 Turbo é o irmão destilado do Whisper Large v3: mantém o encoder de 32 camadas e reduz o decoder de 32 para quatro camadas, fazendo a contagem de parâmetros cair para 809M e o throughput quase quadruplicar na GPU, ao mesmo tempo em que se mantém próximo em precisão. Como os pesos são MIT e o modelo é pequeno, ele se tornou o mecanismo de transcrição embarcado padrão para bots de reuniões, ferramentas de legendas e pipelines de registro de chamadas. Seus limites são igualmente conhecidos. É um modelo em lote: recebe um arquivo de áudio e devolve uma transcrição, em vez de produzir palavras à medida que são faladas. Não foi treinado para tradução, e essa tarefa degrada severamente. Sua precisão em fala ruidosa, com sotaque ou sobreposta é irregular, e ele retorna texto simples: sem pontuação nem capitalização por padrão, sem diarização de falantes, sem timestamps nesta variante, sem viés de palavras-chave. Stacks de produção construídos sobre o Whisper montam essas peças separadamente, cada uma adicionando sua própria latência e modos de falha.

A lacuna de especificação
• Parâmetros — 809M (decoder destilado) vs cerca de 9B no total (um backbone de linguagem Qwen2-7B mais codificadores de fala; o "7B" refere-se ao LLM, e a página do Hugging Face lista 9B).
• Licença — MIT, pesos abertos, ambos.
• {{1}}Streaming — em lote por design{{/1}}: {{2}}implementações de streaming auto-hospedadas normalmente têm de 1 a 5 segundos de latência, em comparação com o streaming nativo{{/2}}: {{3}}chunks de ~2,9 segundos com ~0,5 segundo de lookahead{{/3}}, {{4}}texto emitido por chunk{{/4}}, {{5}}contexto preservado em um cache KV{{/5}}.
• Idiomas — 99 com anos de reprodução comunitária vs 10 declarados (en, zh, es, pt, de, ja, ko, fr, ru, it).
• Além da transcrição — nenhum por padrão versus a alegada saída em streaming de quem disse o quê e hotwords personalizadas (não verificado).
• Precisão na transcrição — 2,1% de WER no LibriSpeech test-clean, 4,2% no test-other, ~7,7% no composto Open ASR, 8–12% em áudio ruidoso em testes da comunidade, todos reproduzidos de forma independente vs nenhum valor de WER de streaming publicado como texto.
• Pegada de memória — roda em um laptop ou em uma única GPU modesta, contra aproximadamente 18 GB de pesos bf16 antes do cache KV; planeje uma GPU de classe 24 GB.

O que o streaming realmente adiciona
A razão de se olhar além do Whisper Large v3 Turbo está no cenário de uso em tempo real, e é aí que os dois modelos deixam de ser comparáveis. O Whisper é orientado a lotes: para obter palavras enquanto o falante ainda está falando, as equipes precisam adicionar técnicas de divisão em blocos (chunking), detecção de atividade de voz e código de colagem, e implementações de streaming auto-hospedadas normalmente ficam com latência de um a cinco segundos — ficando aquém da marca de menos de um segundo para agentes telefônicos e legendagem ao vivo sem uma engenharia séria por trás. O VibeVoice-ASR-Streaming-7B foi criado para esse cenário. Sua configuração mostra o áudio comprimido 3.200× em um fluxo de tokens de 7,5 quadros por segundo, processado em blocos de 22 quadros com uma antecipação de quatro quadros — cerca de 2,9 segundos de áudio por bloco — com o texto emitido à medida que cada bloco é resolvido e o contexto anterior mantido no cache KV, de modo que uma sessão não recalcula tudo do zero. Essa cadência é uma característica de projeto derivada da configuração, não uma latência medida, e ninguém publicou um número de ponta a ponta para ela ainda; mas a arquitetura é, sem ambiguidade, uma arquitetura de transcrição ao vivo de uma forma que o Whisper não é.
O histórico do Whisper é longo e público; o do novo checkpoint está em branco.
A precisão é onde a idade do Whisper Large v3 Turbo é um trunfo. Seus 2,1% de WER no LibriSpeech test-clean e 4,2% no test-other são números de pesos abertos reproduzidos por inúmeras equipes; seus aproximadamente 7,7% no composto do ranking Open ASR ficam cerca de um ponto atrás do Large v3 completo; e seus documentados 8–12% em áudio ruidoso em testes da comunidade significam que ninguém se surpreende com isso. Essas fraquezas fazem parte do histórico — elas dizem exatamente onde o modelo precisa de ajuda antes de você construir sobre ele.
VibeVoice-ASR-Streaming-7B não tem nenhum desses registros. A ficha do modelo traz uma figura de avaliação como imagem e o relatório técnico de streaming da Microsoft é um PDF, mas não há taxa de erro por palavra de streaming citável em prosa. A única âncora numérica da família é a tabela reportada pelo fornecedor na ficha do VibeVoice-ASR batch — 7,77% de WER médio em oito conjuntos de teste em inglês e 2,20% no LibriSpeech clean — que não é o número deste checkpoint, e a recepção da comunidade ao modelo batch em si tem sido mista: elogiado pela diarização pronta para uso, criticado por ser pesado e ocasionalmente propenso a alucinações. Nada disso se transfere para o modelo de streaming, e é exatamente esse o ponto: com o Whisper você conhece os modos de falha antecipadamente; com o VibeVoice-ASR-Streaming-7B você é o primeiro testador.
Idiomas e tamanho: 99 contra 10, 0,8B contra 9B.
Os dois custos mais concretos da troca são idiomas e tamanho. O Whisper Large v3 Turbo transcreve 99 idiomas; idiomas de poucos recursos e idiomas tonais sofrem degradação — tailandês, cantonês e galês são os pontos fracos comumente citados — mas a lista tem anos de reprodução pela comunidade por trás dela. O VibeVoice-ASR-Streaming-7B declara dez: inglês, espanhol, chinês, português, alemão, japonês, coreano, francês, russo e italiano. Se o seu tráfego está dentro desses dez, a cobertura não é um problema; se não está, a comparação termina aqui. O tamanho é o segundo custo: 809M de parâmetros roda em um laptop, enquanto cerca de 9B de parâmetros totais em bf16 significa aproximadamente 18 GB de pesos antes do cache KV e uma GPU de classe 24 GB para servi-lo confortavelmente. Para equipes que já executam o Whisper em hardware modesto, isso é um passo real em infraestrutura, justificado apenas por uma necessidade genuína de transcrição ao vivo.
Quando grátis não é a questão
Whisper Large v3 Turbo é gratuito para executar; o custo está no hardware e na engenharia ao redor dele. Uma implantação faster-whisper em uma única T4 custa na ordem de US$ 0,05–US$ 0,10 por hora de áudio ao preço atual da GPU, e uma carga de trabalho contínua adiciona a pilha de diarização e pontuação que você precisa construir porque o Whisper retorna texto simples. O VibeVoice-ASR-Streaming-7B também é gratuito para executar, em hardware mais caro, em troca de uma arquitetura de streaming que afirma ter a atribuição de falantes e os controles de contexto que faltam ao Whisper — afirmações que você mesmo estaria verificando, já que não existe benchmark independente. Para transcrição em lote em volume, a taxa de transferência e o tamanho mínimo do Whisper ainda vencem. Para áudio ao vivo com vários falantes, em que a transcrição precisa chegar durante a conversa, o Whisper trabalha contra o próprio design, e o checkpoint de streaming trabalha a favor — se é que funciona, que é exatamente a pergunta a ser respondida com seu próprio áudio em sua própria GPU.

A pilha pragmática
A resposta mais comum no mundo real não é “um ou outro”, mas “ambos”, e é essa a recomendação aqui: manter o Whisper Large v3 Turbo como o canal de lote de alto volume, onde seu histórico e seu consumo de recursos o tornam imbatível, e avaliar o VibeVoice-ASR-Streaming-7B no canal ao vivo que o Whisper não consegue atender com a latência necessária — com um portão de avaliação explícito, porque não há nenhum benchmark em que se basear. Os dois podem compartilhar um único orçamento de GPU e uma única base de código. Nessa pilha, o ponto em que uma camada de roteamento mostra seu valor é a camada acima das transcrições, não a transcrição em si: o OrcaRouter não faz roteamento de fala para texto hoje e nenhum dos dois modelos está em seu catálogo, mas os sumarizadores, as regras de alerta e os planejadores de agentes que consomem uma transcrição ao vivo são exatamente os mais de 200 modelos de linguagem que ele disponibiliza por meio de uma única API, com os preços de tabela dos provedores repassados sem margem e failover automático entre provedores. Um checkpoint de streaming lançado sem um único benchmark merece o mesmo tratamento que qualquer modelo não comprovado recebe — uma fatia do tráfego real com um mecanismo de fallback, conquistando ou perdendo sua confiança com base nas evidências das suas próprias reuniões, e não em uma ficha técnica do modelo.
