Um cartão de título principal gerado para 'VibeVoice-ASR-Streaming-1.5B vs NVIDIA Parakeet TDT 0.6B: um desafiante MIT não comprovado contra o campeão do Open ASR', com o subtítulo 'O padrão comprovado versus o desafiante de um dia', com dois cartões de modelo — VibeVoice-ASR-Streaming-1.5B (Microsoft Research · 2 de setembro de 2026 · MIT · Nenhum benchmark publicado ainda) e NVIDIA Parakeet TDT 0.6B (NVIDIA · 5 de maio de 2025 · CC-BY-4.0 · Open ASR nº 1 desde maio de 2025) — e tags que dizem 'WER médio de 6,05% (Parakeet)', '16 meses de diferença' e 'Quem-disse-o-quê + hotwords (Microsoft, não verificado)'. O logotipo do OrcaRouter é composto no canto inferior direito.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B vs NVIDIA Parakeet TDT 0.6B: um desafiante não comprovado do MIT contra o campeão Open ASR

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Se você precisa de reconhecimento de fala com pesos abertos em produção hoje, há um padrão: NVIDIA Parakeet TDT 0.6B. Desde maio de 2025, o Parakeet TDT 0.6B v2, de 600 milhões de parâmetros, mantém o primeiro lugar no leaderboard Hugging Face Open ASR, com uma taxa média de erro de palavras de 6,05% — posição que terceiros reproduzem há mais de um ano. O mais novo pretenso desafiante é o VibeVoice-ASR-Streaming-1.5B, disponibilizado pela Microsoft Research em 2 de setembro de 2026 — dezesseis meses depois do Parakeet, sob licença MIT, com uma história de atribuição de locutor em streaming e, até agora, nenhuma métrica de precisão publicada. Esta página compara o campeão e o desafiante quanto a evidências, arquitetura e o que cada um realmente entrega de fábrica.

Duas designações importam antes das especificações, porque são a forma completa deste confronto. Os números do Parakeet estão definidos: a média de WER de 6,05% e o throughput de cerca de 3.386 RTFx por trás da afirmação de "uma hora de áudio em cerca de um segundo" constam em leaderboards públicos e em materiais da NVIDIA há mais de um ano. O lado do VibeVoice-ASR-Streaming-1.5B é o que se pode saber a partir de seu repositório — model card, arquivos de configuração e a documentação de streaming da Microsoft — porque a Microsoft não publicou nenhum WER, latência ou throughput em texto, e nenhum benchmark independente do checkpoint existe até o momento em que escrevo. Uma coluna de cada comparação abaixo é testada em batalha; a outra é uma folha de especificações.

Dezesseis meses e um reinado no topo do ranking os separam

O Parakeet TDT 0.6B v2 chegou em 5 de maio de 2025 como a resposta da NVIDIA ao problema do ASR em streaming: um codificador FastConformer combinado a um decodificador transdutor de token e duração (TDT) que prevê cada token e a sua duração em uma única etapa — um truque de eficiência que elimina a sobrecarga do token em branco dos transdutores convencionais. É CC-BY-4.0, amigável ao uso comercial, e conquistou o topo do ranking Open ASR graças à sua taxa média de erro de palavras de 6,05%. Também trouxe recursos de produção que o ranking não mede — pontuação, capitalização, timestamps em nível de palavra — e um codificador de atenção total que aceita até 24 minutos de áudio em uma única passagem, o que o torna útil para reuniões longas e podcasts sem divisão agressiva em blocos.

VibeVoice-ASR-Streaming-1.5B é o desafiante no sentido mais puro: existe, está documentado, e nada sobre o quão bem funciona foi estabelecido. A linha de notícias da Microsoft no GitHub, datada de 3 de setembro, anuncia um modelo ASR de streaming unificado que "transcreve continuamente quem disse o que à medida que a fala chega", com hotwords e dez idiomas, e a configuração do checkpoint descreve uma tradição de engenharia totalmente diferente — um decoder de modelo de linguagem da família Qwen2 alimentado por tokenizadores de áudio convolucionais, com uma cabeça de difusão produzindo saída em blocos de cerca de 2,9 segundos e aproximadamente 0,5 segundos de lookahead. Enquanto o Parakeet é um modelo de fala construído especificamente, refinado ao longo de um ano de implantações reais, o VibeVoice-ASR-Streaming-1.5B é um checkpoint de família de pesquisa com dois dias de existência.

A assimetria de evidências é a história.

Leia o restante desta página com um fato diante de você: esta comparação tem números de apenas um lado. Do lado do Parakeet TDT 0.6B há um ano de defesa do leaderboard — 6,05% de WER médio nos conjuntos públicos de formato curto em inglês do Open ASR, ~3.386 RTFx em batch 128 em hardware NVIDIA, e um ecossistema de ferramentas de implantação NeMo, aceleração TensorRT e quantização FP8 que já foi utilizado em produção. Do lado do VibeVoice-ASR-Streaming-1.5B há o valor de avaliação do model card, que é uma imagem em vez de texto, e os 7,77% de WER médio reportados pelo fornecedor no card do VibeVoice-ASR batch em oito conjuntos de teste em inglês — um número que descreve o modelo não streaming e não pode ser transferido para este checkpoint. O desafiante pode muito bem ser excelente; o ponto é que "pode muito bem ser" é toda a base de evidências.

A verificação da especificação

• Parâmetros — NVIDIA Parakeet TDT 0.6B: 600M, encoder FastConformer + decoder TDT vs. VibeVoice-ASR-Streaming-1.5B: total de ~3B (backbone Qwen de classe 1.5B mais tokenizers e diffusion head).

• Lançado — 5 de maio de 2025 vs 2 de setembro de 2026.

• Precisão — 6,05% de WER médio, Open ASR #1 desde maio de 2025, reproduzido por terceiros vs. nenhum publicado.

• Velocidade — ~3.386 RTFx com batch 128 em hardware NVIDIA, ~1 hora de áudio por segundo versus nenhum valor de throughput publicado.

• Streaming — capaz de fazer streaming com contexto de atenção total de até 24 minutos por passagem vs streaming em partes, com partes de ~2,9 s e antecipação de ~0,5 s.

• Extras de saída — pontuação, capitalização, carimbos de tempo em nível de palavra versus atribuição em streaming de quem disse o quê (não verificada) e palavras de gatilho; dez idiomas.

• Licença — CC-BY-4.0 vs MIT.

• Ecossistema — NVIDIA NeMo com TensorRT e FP8 vs demos do repositório microsoft/VibeVoice e um plugin vLLM.

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs NVIDIA Parakeet TDT 0.6B — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, Params ~3B total, Architecture speech LLM + diffusion, WER none published, Streaming ~2.9 s chunks, Extras who-said-what + hotwords, License MIT. Right column NVIDIA Parakeet TDT 0.6B v2: Released May 5 2025, Params 600M, Architecture FastConformer + TDT, WER 6.05% Open ASR #1, Streaming full-attention up to 24 min, Extras punctuation + timestamps, License CC-BY-4.0. Footer reads 'Parakeet figures per the Open ASR leaderboard, settled since 2025; VibeVoice specs read from the HF repo, no benchmark exists yet.' The OrcaRouter logo is composited in the bottom-right corner.A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

Por baixo dos panos: duas ideias sobre para que servem os modelos de fala

As arquiteturas codificam duas crenças diferentes sobre a tarefa. O Parakeet TDT 0.6B trata a transcrição como um problema de processamento de sinal resolvido com eficiência: um encoder FastConformer extrai a acústica e o decoder TDT emite tokens de texto e durações em conjunto — é por isso que ele roda a milhares de vezes a velocidade do tempo real e por que se sente confortável no stack de deploy da NVIDIA. O VibeVoice-ASR-Streaming-1.5B trata a transcrição como um problema de linguagem: comprima o áudio em um fluxo de tokens, entregue-o a um modelo de linguagem que já leu o contexto equivalente a uma transcrição, e deixe o entendimento do LM sobre quem diz o quê e como as conversas se encaixam fazer o trabalho. O backbone de LLM também explica por que o checkpoint tem ~3B de parâmetros em vez de 600M, e por que a Microsoft não reivindicou presença em edge — este é um modelo que quer uma GPU e usa a memória para carregar contexto.

Para transcrição ao vivo, a consequência prática é o formato da latência. O codificador de atenção total do Parakeet processa janelas longas em uma única passada — uma filosofia de streaming bem diferente do contrato fixo de blocos e antecipação (chunk-and-lookahead) do VibeVoice-ASR-Streaming-1.5B, com cerca de 2,9 segundos de áudio por segmento emitido. Nenhum dos dois é um streamer de parciais por palavra no estilo das APIs comerciais de menor latência; ambos são sistemas baseados em blocos, e o mais adequado depende de o áudio chegar como arquivos finitos ou como uma sessão ao vivo sem termo definido.

A história do recurso e os bairros de implantação

De fábrica, o Parakeet TDT 0.6B é o produto de transcrição mais completo: pontuação e capitalização vêm com a transcrição, timestamps no nível da palavra estão lá para alinhamento, e janelas de passagem única de 24 minutos significam menos erros de divisão em gravações longas. O VibeVoice-ASR-Streaming-1.5B contrapõe-se com recursos que o Parakeet não lista: saída com atribuição de falante e hotwords, em dez idiomas. A afirmação de diarização em streaming é exatamente o tipo de coisa que precisa de verificação independente — as fronteiras dos blocos são onde a atribuição se desvia — mas é a razão para olhar para o modelo da Microsoft em vez do da NVIDIA se o seu requisito é saber quem disse o quê numa reunião ao vivo.

A screenshot of the Hugging Face model card for nvidia/parakeet-tdt-0.6b-v2, showing the NVIDIA namespace, the model title 'Parakeet TDT 0.6B V2 (En)', the automatic-speech-recognition and NeMo pipeline tags, and the card description of the 600-million-parameter FastConformer model with TDT decoder, punctuation and timestamps, audio segments up to 24 minutes in a single pass, and an RTFx of 3380 on the Open ASR leaderboard at batch 128.

Os ecossistemas são tão diferentes quanto os modelos. Parakeet TDT 0.6B é um cidadão do NVIDIA NeMo: TensorRT, FP8 e ferramentas de implantação ajustadas para GPUs NVIDIA, o que é excelente se você já estiver na infraestrutura NVIDIA. VibeVoice-ASR-Streaming-1.5B vive em um repositório de pesquisa: os caminhos documentados são os demos em Python da Microsoft e um plugin vLLM; sua classe de arquitetura ainda não está na documentação pública do Transformers, e colocá-lo em operação exige uma instalação a partir do código-fonte e sua própria verificação de que o caminho de carregamento funciona. Para uma equipe que valoriza uma implantação estável e bem documentada, essa diferença por si só pode superar a lacuna de benchmark.

Os argumentos a favor do atual titular, os argumentos a favor do desafiante

O caso do NVIDIA Parakeet TDT 0.6B é o caso de uma quantidade conhecida: um ano de defesa de leaderboard, reprodução por terceiros, licença comercial, recursos de produção e um ecossistema de implantação que absorveu tráfego real. Se você está lançando um recurso de transcrição em inglês neste trimestre e quer pesos abertos, esta é a opção padrão defensável, e o ônus da prova recai sobre qualquer coisa que afirme substituí-la.

O argumento em favor do VibeVoice-ASR-Streaming-1.5B é mais restrito e específico: você precisa de atribuição de locutor em streaming ou de hotwords, você precisa de mais do que inglês, ou acredita que a abordagem de modelo de linguagem para a fala vai vencer e quer entrar cedo. É uma aposta, não uma decisão — ainda não há um número que justifique migrar tráfego de produção para ele, e a própria postura da Microsoft é de pesquisa em primeiro lugar. Nenhum dos dois modelos é servido pelo OrcaRouter hoje, então a forma de baixo custo de testar a aposta é o padrão que se aplica a qualquer modelo aberto jovem: manter a camada de ASR atrás de uma única API de roteamento que serve 200+ modelos pelo preço de tabela do provedor, sem markup e com failover automático, rotear uma fatia de áudio real para o VibeVoice-ASR-Streaming-1.5B assim que um provedor o hospedar e deixar que as transcrições do seu próprio tráfego decidam se o desafiante merece a coroa que o Parakeet usa há dezesseis meses.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube