Um cartão de título em destaque gerado para 'VibeVoice-ASR-Streaming-1.5B vs Granite Speech 5.0 470M TurboCTC: as duas apostas discretas de streaming com pesos abertos', com o subtítulo 'Dois modelos de ASR de streaming com pesos abertos, com oito dias de diferença', dois cartões de modelo — VibeVoice-ASR-Streaming-1.5B (Microsoft Research · 2 de setembro de 2026 · MIT · ~3B no total · LLM de fala) e Granite Speech 5.0 470M TurboCTC (IBM · 25 de agosto de 2026 · Apache-2.0 · 470M · codificador CTC puro) — e tags que dizem 'Velocidade de nível edge (IBM)', 'Somente inglês (IBM)' e 'Quem disse o quê em 10 idiomas (Microsoft, não verificado)'. O logotipo do OrcaRouter foi composto no canto inferior direito.
Guides & Insights

VibeVoice-ASR-Streaming-1.5B vs Granite Speech 5.0 470M TurboCTC: as duas apostas discretas de streaming com pesos abertos

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Os dois lançamentos mais interessantes de streaming de fala para texto com pesos abertos do final de agosto de 2026 foram disponibilizados sem evento de lançamento. Em 25 de agosto, a IBM publicou o Granite Speech 5.0 470M TurboCTC no Hugging Face — pesos, model card e um post de blog, nada mais — e, em 2 de setembro, a Microsoft Research enviou o VibeVoice-ASR-Streaming-1.5B sob o namespace microsoft sem anúncio algum, além de uma linha de notícias no repositório VibeVoice no GitHub. São o mesmo tipo de coisa e apostas de engenharia opostas: o modelo da IBM é um encoder CTC puro de 470 milhões de parâmetros, projetado para rodar a velocidades de borda em um laptop, enquanto o da Microsoft é um modelo de linguagem de fala da classe 1,5B, envolto em tokenizadores de áudio e uma cabeça de difusão — cerca de três bilhões de parâmetros no total —, construído para entender a fala como linguagem enquanto a transcreve.

Antes dos números, os rótulos de origem que mantêm esta comparação honesta. Tudo o que está marcado como reportado pela IBM vem do model card do Granite Speech 5.0 470M TurboCTC e das suas entradas no leaderboard Open ASR; foi executado pelo harness oficial da IBM no dia do lançamento e ainda não foi reproduzido de forma independente. Tudo o que diz respeito ao VibeVoice-ASR-Streaming-1.5B vem da leitura do repositório — os arquivos de configuração, o model card e a documentação de streaming da Microsoft — porque a Microsoft não publicou números de precisão ou latência por escrito e ninguém fora da Microsoft fez benchmark do checkpoint. Os dois não foram executados em um harness compartilhado; esta comparação avalia ambos à luz das mesmas evidências públicas, que é tudo o que qualquer uma das empresas ofereceu até agora.

Dois lançamentos silenciosos, com oito dias de diferença

Ambos os modelos chegaram da mesma forma discreta, o que vale a pena afirmar claramente, porque nenhuma das duas empresas disse muito desde então. O Granite Speech 5.0 470M TurboCTC da IBM é o membro sob licença Apache-2.0 de um lançamento com duas variantes — a IBM também publicou um irmão não comercial -NC com números principais ligeiramente melhores — e sua ficha técnica traz data de lançamento em 25 de agosto de 2026, com suporte nativo a Transformers e uma submissão ao ranking Open ASR datada do mesmo dia. O par de streaming da Microsoft, VibeVoice-ASR-Streaming-7B e VibeVoice-ASR-Streaming-1.5B, foi criado no Hugging Face no mesmo minuto, em 2 de setembro; o comunicado no GitHub que anuncia "um modelo ASR de streaming unificado que transcreve continuamente quem disse o quê à medida que a fala chega" é datado de 3 de setembro e nomeia o 7B, deixando o 1.5B, aqui abordado, como o irmão menor que foi lançado silenciosamente ao lado dele.

A parte interessante é que duas equipes escolheram a palavra "streaming" e construíram coisas opostas. Granite Speech 5.0 470M TurboCTC é um codificador conformer treinado com CTC e decodificado em uma única passagem não autorregressiva — não há decodificador gerando token por token, então o modelo é estruturalmente barato e estruturalmente rápido. VibeVoice-ASR-Streaming-1.5B é um LLM de fala: dois tokenizadores convolucionais convertem áudio de 24 kHz em um fluxo de tokens de fala de ~7,5 Hz, um decodificador da família Qwen2 (28 camadas, 1.536 unidades ocultas — a classe de 1,5B) o lê, e uma cabeça de difusão produz a transcrição em blocos de cerca de 2,9 segundos com aproximadamente meio segundo de antecipação. Um é um carro de corrida; o outro é um pequeno modelo de linguagem que por acaso escuta.

A verificação da especificação

• Parâmetros — Granite Speech 5.0 470M TurboCTC: 470M, somente encoder vs VibeVoice-ASR-Streaming-1.5B: ~3B no total (backbone LM classe 1.5B mais tokenizadores e cabeça de difusão).

• Arquitetura — codificador conformer com self-attention em blocos e autocondicionamento, treinado com CTC, decodificação gananciosa não autorregressiva vs. tokenizadores acústico/semântico duplos alimentando um decodificador causal da família Qwen2 com uma cabeça de difusão DDPM.

• Cadência de saída — ~12.5 frames de saída por segundo, em streaming por blocos, vs. tokens de fala a ~7.5 Hz, com texto emitido a cada bloco de ~2.9 s e ~0.5 s de lookahead.

{{1}}Idiomas — apenas inglês versus dez: chinês, inglês, francês, alemão, italiano, japonês, coreano, português, russo e espanhol.{{/1}}

• Pesos — aproximadamente 0,5B de parâmetros / uma fração de um GB, classe de borda vs ~5,6 GB bf16, classe de GPU NVIDIA.

• Precisão no texto impresso — WER médio de ~5,00% relatado pela IBM nos conjuntos de formato curto do Open ASR, versus nenhum valor de WER publicado no texto.

• Licença — Apache-2.0 vs MIT.

• Lançado — 25 de agosto de 2026 vs 2 de setembro de 2026.

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs Granite Speech 5.0 470M TurboCTC — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, Params ~3B total / 1.5B-class LM, Architecture speech LLM + diffusion, Languages 10, Streaming ~2.9 s chunks + ~0.5 s lookahead, WER none published, License MIT. Right column Granite Speech 5.0 470M TurboCTC: Released Aug 25 2026, Params 470M, Architecture conformer CTC, Languages English only, Streaming chunkwise ~12.5 frames/s, WER ~5.00% (IBM-reported), License Apache-2.0. Footer reads 'Granite figures IBM-reported, unverified; VibeVoice specs read from the HF repo; no independent benchmark of either exists yet.' The OrcaRouter logo is composited in the bottom-right corner.

Velocidade: um é feito para ser pequeno, o outro para ser um modelo de linguagem

A divisão arquitetural aparece primeiro na velocidade e no hardware. O Granite Speech 5.0 470M TurboCTC é voltado para laptops, smartphones e outros dispositivos de borda. Como um codificador CTC puro não faz amostragem — a saída é uma única passagem gulosa sobre uma cabeça BPE de 16.384 unidades —, é extremamente barato de executar, e o model card da IBM relata uma métrica de throughput do Open ASR, medida em uma única H200, que fica na casa das dezenas de milhares de RTFx para a linha TurboCTC, juntamente com uma demonstração WebGPU que transcreve ao vivo em uma aba do navegador. Esses números foram medidos pela IBM e não foram reproduzidos, mas o ponto estrutural se sustenta por si só: um codificador de 470M sem decodificador autorregressivo é um modelo que você pode executar no hardware que um celular já oferece.

VibeVoice-ASR-Streaming-1.5B faz a escolha oposta. Seu decodificador é um modelo de linguagem causal, o que significa que o texto é gerado em um loop mais pesado do que um argmax de CTC, e as formas documentadas de executá-lo são auto-hospedadas em GPUs NVIDIA — os demos em Python do repositório microsoft/VibeVoice ou seu plugin vLLM — com ~5,6 GB de pesos bf16 antes de qualquer cache KV. A Microsoft não publicou nenhuma alegação de throughput ou fator de tempo real, portanto não há número de fornecedor para contrapor ao da IBM. O que a arquitetura de LLM compra em vez disso é contexto: o modelo carrega a compreensão de falante e conteúdo ao longo da transcrição da mesma forma que um modelo de linguagem faz, o que é a diferença entre transcrever som e acompanhar uma conversa.

Precisão: um fornecedor imprimiu números, o outro imprimiu uma imagem.

Com base nas evidências, o Granite Speech 5.0 470M TurboCTC está à frente do VibeVoice-ASR-Streaming-1.5B por um benchmark inteiro e publicável. A IBM executou seu modelo no harness oficial do leaderboard Open ASR no dia do lançamento e relata uma taxa média de erro de palavras em torno de 5.00% nos conjuntos públicos ingleses de formato curto — um número medido pelo fornecedor, não verificado por terceiros e totalmente ausente do lado da Microsoft nesta comparação. O model card do VibeVoice-ASR-Streaming-1.5B traz uma figura de resultados de avaliação como imagem, mas nenhum WER, RTF ou latência numérica em texto; a única âncora numérica na família VibeVoice é o WER médio de 7.77% relatado pelo fornecedor no card do VibeVoice-ASR em lote, em oito conjuntos de teste de inglês, que descreve o modelo não streaming e não se aplica aqui. Independentemente de como os eventuais testes independentes terminem, o resumo honesto hoje é que a IBM publicou um número e a Microsoft publicou uma imagem.

A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

Idiomas e saída: somente inglês versus quem disse o quê em dez

Granite Speech 5.0 470M TurboCTC é exclusivamente em inglês e retorna texto transcrito bruto. Isso não é uma limitação para as cargas de trabalho que a IBM tem em vista — transcrição empresarial em inglês em hardware de borda — mas encerra a comparação no momento em que seu áudio não está em inglês. O VibeVoice-ASR-Streaming-1.5B lista dez idiomas e afirma fornecer saída em streaming com atribuição de falante: a ficha do modelo diz que ele "transcreve continuamente quem disse o quê à medida que a fala chega", com hotwords para termos de domínio passadas como um prompt de contexto. Ambos os extras merecem uma leitura cética — diarização em streaming entre limites de chunks é genuinamente difícil, e a afirmação não foi verificada — mas são a razão pela qual uma equipe com reuniões multilíngues ao vivo consideraria o modelo da Microsoft.

Licenciamento e ecossistema: Apache-2.0 versus MIT, Transformers versus um repositório de pesquisa

Ambas as licenças permitem uso comercial, o que já distingue este par da variante -NC da IBM da mesma arquitetura. O Granite Speech 5.0 470M TurboCTC é Apache-2.0, com a concessão de patente usual, e é nativo no Hugging Face Transformers (AutoModelForCTC de transformers >= 5.16) além do mlx-audio para Apple Silicon — ou seja, roda em qualquer lugar onde roda a maior comunidade de implantação do ecossistema, no hardware de qualquer fornecedor. O VibeVoice-ASR-Streaming-1.5B é MIT, o que é ainda mais simples, mas seu caminho de serviço é uma configuração de pesquisa a partir do código-fonte: a classe de arquitetura do checkpoint, VibeVoiceForASRStreamingTraining, não está na documentação pública do Transformers, e os próprios documentos de streaming da Microsoft apontam para o código de demonstração do repositório e um plugin vLLM, em vez de um carregamento de biblioteca padrão. Para uma equipe de produção, a diferença é real: um modelo se integra a um pipeline Transformers existente hoje, e o outro pede que você monte um repositório de pesquisa e verifique o caminho de carregamento por conta própria.

A screenshot of the Hugging Face model card for ibm-granite/granite-speech-5.0-470m-turboctc, showing the model title Granite-Speech-5.0-470M-TurboCTC, the Apache-2.0 license tag, the English-language tag, the automatic-speech-recognition pipeline tag, and the model summary describing a compact 470 million parameter English ASR model for edge deployment.

Qual lançamento silencioso você deve avaliar?

Avalie o Granite Speech 5.0 470M TurboCTC primeiro se sua carga de trabalho for em inglês, seu hardware for de classe de borda ou limitado por CPU, e você quiser um modelo que se encaixe no Transformers com um número na ficha técnica para validar. É a aposta de menor risco em todas as dimensões, exceto uma — ele não vai ajudar você com um segundo idioma ou com uma transcrição de reunião ao vivo que precise saber quem está falando.

Avalie o VibeVoice-ASR-Streaming-1.5B se você precisar de streaming multilíngue, se a saída de quem-disse-o-quê ou hotwords forem recursos que você queira testar, ou se preferir apostar em uma abordagem baseada em modelo de linguagem para reconhecimento de fala em vez de um codificador puro. Reserve orçamento para uma GPU NVIDIA, uma instalação a partir do código-fonte, cerca de 5.6 GB de pesos e uma avaliação projetada por você mesmo, porque ninguém — incluindo a Microsoft — publicou um número em que se possa confiar até agora.

O que nenhum lançamento silencioso muda é o valor de manter a camada ASR intercambiável enquanto você descobre qual aposta compensa. Ambos os modelos são novos e nenhum deles é servido pelo OrcaRouter no momento em que escrevo isto; quando um provedor hospedar um deles, a forma de baixo risco de testá-lo é atrás de uma camada de roteamento que serve 200+ modelos ao preço de lista do provedor — margem de 0%, então mudanças de preço entram no mesmo dia — com failover automático para o que você já confia. Roteie um trecho de áudio real para o novo modelo, leia as transcrições e deixe seu próprio tráfego, não uma planilha de benchmark do dia do lançamento, decidir qual aposta silenciosa foi a certa.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube