
VibeVoice-ASR-Streaming-1.5B vs NVIDIA Parakeet TDT 0.6B: um desafiante não comprovado do MIT contra o campeão Open ASR
- AlibabaNOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligência72Código
- DeepSeekNOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianQwen3.8 27B2026-08-1552Inteligência68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
Se você precisa de reconhecimento de fala com pesos abertos em produção hoje, há um padrão: NVIDIA Parakeet TDT 0.6B. Desde maio de 2025, o Parakeet TDT 0.6B v2, de 600 milhões de parâmetros, mantém o primeiro lugar no leaderboard Hugging Face Open ASR, com uma taxa média de erro de palavras de 6,05% — posição que terceiros reproduzem há mais de um ano. O mais novo pretenso desafiante é o VibeVoice-ASR-Streaming-1.5B, disponibilizado pela Microsoft Research em 2 de setembro de 2026 — dezesseis meses depois do Parakeet, sob licença MIT, com uma história de atribuição de locutor em streaming e, até agora, nenhuma métrica de precisão publicada. Esta página compara o campeão e o desafiante quanto a evidências, arquitetura e o que cada um realmente entrega de fábrica.
Duas designações importam antes das especificações, porque são a forma completa deste confronto. Os números do Parakeet estão definidos: a média de WER de 6,05% e o throughput de cerca de 3.386 RTFx por trás da afirmação de "uma hora de áudio em cerca de um segundo" constam em leaderboards públicos e em materiais da NVIDIA há mais de um ano. O lado do VibeVoice-ASR-Streaming-1.5B é o que se pode saber a partir de seu repositório — model card, arquivos de configuração e a documentação de streaming da Microsoft — porque a Microsoft não publicou nenhum WER, latência ou throughput em texto, e nenhum benchmark independente do checkpoint existe até o momento em que escrevo. Uma coluna de cada comparação abaixo é testada em batalha; a outra é uma folha de especificações.
Dezesseis meses e um reinado no topo do ranking os separam
O Parakeet TDT 0.6B v2 chegou em 5 de maio de 2025 como a resposta da NVIDIA ao problema do ASR em streaming: um codificador FastConformer combinado a um decodificador transdutor de token e duração (TDT) que prevê cada token e a sua duração em uma única etapa — um truque de eficiência que elimina a sobrecarga do token em branco dos transdutores convencionais. É CC-BY-4.0, amigável ao uso comercial, e conquistou o topo do ranking Open ASR graças à sua taxa média de erro de palavras de 6,05%. Também trouxe recursos de produção que o ranking não mede — pontuação, capitalização, timestamps em nível de palavra — e um codificador de atenção total que aceita até 24 minutos de áudio em uma única passagem, o que o torna útil para reuniões longas e podcasts sem divisão agressiva em blocos.
VibeVoice-ASR-Streaming-1.5B é o desafiante no sentido mais puro: existe, está documentado, e nada sobre o quão bem funciona foi estabelecido. A linha de notícias da Microsoft no GitHub, datada de 3 de setembro, anuncia um modelo ASR de streaming unificado que "transcreve continuamente quem disse o que à medida que a fala chega", com hotwords e dez idiomas, e a configuração do checkpoint descreve uma tradição de engenharia totalmente diferente — um decoder de modelo de linguagem da família Qwen2 alimentado por tokenizadores de áudio convolucionais, com uma cabeça de difusão produzindo saída em blocos de cerca de 2,9 segundos e aproximadamente 0,5 segundos de lookahead. Enquanto o Parakeet é um modelo de fala construído especificamente, refinado ao longo de um ano de implantações reais, o VibeVoice-ASR-Streaming-1.5B é um checkpoint de família de pesquisa com dois dias de existência.
A assimetria de evidências é a história.
Leia o restante desta página com um fato diante de você: esta comparação tem números de apenas um lado. Do lado do Parakeet TDT 0.6B há um ano de defesa do leaderboard — 6,05% de WER médio nos conjuntos públicos de formato curto em inglês do Open ASR, ~3.386 RTFx em batch 128 em hardware NVIDIA, e um ecossistema de ferramentas de implantação NeMo, aceleração TensorRT e quantização FP8 que já foi utilizado em produção. Do lado do VibeVoice-ASR-Streaming-1.5B há o valor de avaliação do model card, que é uma imagem em vez de texto, e os 7,77% de WER médio reportados pelo fornecedor no card do VibeVoice-ASR batch em oito conjuntos de teste em inglês — um número que descreve o modelo não streaming e não pode ser transferido para este checkpoint. O desafiante pode muito bem ser excelente; o ponto é que "pode muito bem ser" é toda a base de evidências.
A verificação da especificação
• Parâmetros — NVIDIA Parakeet TDT 0.6B: 600M, encoder FastConformer + decoder TDT vs. VibeVoice-ASR-Streaming-1.5B: total de ~3B (backbone Qwen de classe 1.5B mais tokenizers e diffusion head).
• Lançado — 5 de maio de 2025 vs 2 de setembro de 2026.
• Precisão — 6,05% de WER médio, Open ASR #1 desde maio de 2025, reproduzido por terceiros vs. nenhum publicado.
• Velocidade — ~3.386 RTFx com batch 128 em hardware NVIDIA, ~1 hora de áudio por segundo versus nenhum valor de throughput publicado.
• Streaming — capaz de fazer streaming com contexto de atenção total de até 24 minutos por passagem vs streaming em partes, com partes de ~2,9 s e antecipação de ~0,5 s.
• Extras de saída — pontuação, capitalização, carimbos de tempo em nível de palavra versus atribuição em streaming de quem disse o quê (não verificada) e palavras de gatilho; dez idiomas.
• Licença — CC-BY-4.0 vs MIT.
• Ecossistema — NVIDIA NeMo com TensorRT e FP8 vs demos do repositório microsoft/VibeVoice e um plugin vLLM.


Por baixo dos panos: duas ideias sobre para que servem os modelos de fala
As arquiteturas codificam duas crenças diferentes sobre a tarefa. O Parakeet TDT 0.6B trata a transcrição como um problema de processamento de sinal resolvido com eficiência: um encoder FastConformer extrai a acústica e o decoder TDT emite tokens de texto e durações em conjunto — é por isso que ele roda a milhares de vezes a velocidade do tempo real e por que se sente confortável no stack de deploy da NVIDIA. O VibeVoice-ASR-Streaming-1.5B trata a transcrição como um problema de linguagem: comprima o áudio em um fluxo de tokens, entregue-o a um modelo de linguagem que já leu o contexto equivalente a uma transcrição, e deixe o entendimento do LM sobre quem diz o quê e como as conversas se encaixam fazer o trabalho. O backbone de LLM também explica por que o checkpoint tem ~3B de parâmetros em vez de 600M, e por que a Microsoft não reivindicou presença em edge — este é um modelo que quer uma GPU e usa a memória para carregar contexto.
Para transcrição ao vivo, a consequência prática é o formato da latência. O codificador de atenção total do Parakeet processa janelas longas em uma única passada — uma filosofia de streaming bem diferente do contrato fixo de blocos e antecipação (chunk-and-lookahead) do VibeVoice-ASR-Streaming-1.5B, com cerca de 2,9 segundos de áudio por segmento emitido. Nenhum dos dois é um streamer de parciais por palavra no estilo das APIs comerciais de menor latência; ambos são sistemas baseados em blocos, e o mais adequado depende de o áudio chegar como arquivos finitos ou como uma sessão ao vivo sem termo definido.
A história do recurso e os bairros de implantação
De fábrica, o Parakeet TDT 0.6B é o produto de transcrição mais completo: pontuação e capitalização vêm com a transcrição, timestamps no nível da palavra estão lá para alinhamento, e janelas de passagem única de 24 minutos significam menos erros de divisão em gravações longas. O VibeVoice-ASR-Streaming-1.5B contrapõe-se com recursos que o Parakeet não lista: saída com atribuição de falante e hotwords, em dez idiomas. A afirmação de diarização em streaming é exatamente o tipo de coisa que precisa de verificação independente — as fronteiras dos blocos são onde a atribuição se desvia — mas é a razão para olhar para o modelo da Microsoft em vez do da NVIDIA se o seu requisito é saber quem disse o quê numa reunião ao vivo.

Os ecossistemas são tão diferentes quanto os modelos. Parakeet TDT 0.6B é um cidadão do NVIDIA NeMo: TensorRT, FP8 e ferramentas de implantação ajustadas para GPUs NVIDIA, o que é excelente se você já estiver na infraestrutura NVIDIA. VibeVoice-ASR-Streaming-1.5B vive em um repositório de pesquisa: os caminhos documentados são os demos em Python da Microsoft e um plugin vLLM; sua classe de arquitetura ainda não está na documentação pública do Transformers, e colocá-lo em operação exige uma instalação a partir do código-fonte e sua própria verificação de que o caminho de carregamento funciona. Para uma equipe que valoriza uma implantação estável e bem documentada, essa diferença por si só pode superar a lacuna de benchmark.
Os argumentos a favor do atual titular, os argumentos a favor do desafiante
O caso do NVIDIA Parakeet TDT 0.6B é o caso de uma quantidade conhecida: um ano de defesa de leaderboard, reprodução por terceiros, licença comercial, recursos de produção e um ecossistema de implantação que absorveu tráfego real. Se você está lançando um recurso de transcrição em inglês neste trimestre e quer pesos abertos, esta é a opção padrão defensável, e o ônus da prova recai sobre qualquer coisa que afirme substituí-la.
O argumento em favor do VibeVoice-ASR-Streaming-1.5B é mais restrito e específico: você precisa de atribuição de locutor em streaming ou de hotwords, você precisa de mais do que inglês, ou acredita que a abordagem de modelo de linguagem para a fala vai vencer e quer entrar cedo. É uma aposta, não uma decisão — ainda não há um número que justifique migrar tráfego de produção para ele, e a própria postura da Microsoft é de pesquisa em primeiro lugar. Nenhum dos dois modelos é servido pelo OrcaRouter hoje, então a forma de baixo custo de testar a aposta é o padrão que se aplica a qualquer modelo aberto jovem: manter a camada de ASR atrás de uma única API de roteamento que serve 200+ modelos pelo preço de tabela do provedor, sem markup e com failover automático, rotear uma fatia de áudio real para o VibeVoice-ASR-Streaming-1.5B assim que um provedor o hospedar e deixar que as transcrições do seu próprio tráfego decidam se o desafiante merece a coroa que o Parakeet usa há dezesseis meses.
