Cartão de destaque do artigo com o texto 'Grok Voice Transcribe 2.0 vs VibeVoice ASR Streaming 7B', com o selo 'COMPARAÇÃO DE MODELOS' e o subtítulo 'o número que a Microsoft não publicou', com chips lendo 2,7% de WER em streaming, 0,49 s para a primeira parcial, chunks de 2,9 s com atribuição de falante e pesos MIT em 18 GB, sobre um gradiente de branco para azul com o logotipo da OrcaRouter no canto inferior direito.
Guides & Insights

Grok Voice Transcribe 2.0 vs VibeVoice ASR Streaming 7B: O número que a Microsoft não publicou

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O VibeVoice ASR Streaming 7B é o reconhecedor de fala em streaming unificado da Microsoft, carregado no Hugging Face em 2 de setembro de 2026 e anunciado no repositório microsoft/VibeVoice um dia depois sob a licença MIT, e faz algo que nem o Grok Voice Transcribe 2.0 nem a maioria de seus concorrentes faz: emite texto com atribuição de falante à medida que o áudio chega, sem uma etapa separada de diarização. O relatório técnico da Microsoft afirma que o checkpoint 7B alcança a menor média de WER e CER em cinco conjuntos de avaliação e a melhor atribuição de falante, ou empatada em primeiro, em 12 de 13 configurações de avaliação. O que a ficha do modelo não faz é publicar um único número em texto — nenhum WER, nenhum RTF, nenhum valor de latência; os resultados existem apenas como imagens no relatório. O Grok Voice Transcribe 2.0, lançado dezesseis dias depois, em 18 de setembro de 2026, a US$ 0,10 por hora de áudio para processamento em lote e US$ 0,20 por hora para streaming, publica tudo: 2,7% de WER da transcrição final e 3,4% de WER da primeira parcial no painel de streaming da Artificial Analysis, 0,49 segundos para cada. Portanto, o ponto de partida honesto para esta comparação é que um dos dois modelos é mensuravelmente mais bem documentado do que o outro, e essa assimetria é, por si só, o fato mais relevante para a decisão neste confronto.

O que a Microsoft publicou, e o que um leitor pode fazer com isso

O relatório do VibeVoice é pesquisa real e as afirmações nele contidas são específicas em forma, se não em valor. Ele avaliou quatro benchmarks de reuniões — AliMeeting, AISHELL-4, AMI-SDM e AMI-IHM — além do MLC-Challenge, em nove idiomas, e relata dois resultados de destaque: o modelo 7B teve o menor WER/CER médio nos cinco conjuntos e a melhor atribuição de locutor, ou empatada em primeiro lugar, em 12 de 13 configurações de avaliação. Ambas são afirmações relativas, o que é um tipo significativo de afirmação: "menor nos cinco conjuntos" é uma afirmação sobre ordenação, e ordenação é o que um comprador precisa.

O que está ausente é qualquer número absoluto. Não há percentual de WER para comparar com nada, nem número de throughput, nem medição de latência, e nenhum detalhamento por conjunto no texto. Uma tabela de comparação que coloca o VibeVoice ao lado do Grok Voice Transcribe 2.0 e atribui um número ao modelo da Microsoft está inventando esse número. O que se pode dizer é que o VibeVoice venceu sua própria avaliação de cinco conjuntos e que ninguém fora da Microsoft a repetiu — nenhum benchmark independente, nenhuma avaliação de terceiros e, no momento em que isto foi escrito, nenhum provedor de inferência hospedada listando o modelo. A comparação é, portanto, entre um número documentado e uma classificação não documentada, e a classificação não documentada não é o mais fraco dos dois só porque não tem casas decimais.

A documentação do Grok Voice Transcribe 2.0 tem o problema oposto. Seus 2,7% e 3,4% vêm do painel AA-WER Streaming da Artificial Analysis, um composto ponderado do AA-AgentTalk com 50% e do VoxPopuli e Earnings22 com 25% cada — cerca de oito horas de áudio conversacional em inglês com formato de agente, executado de forma independente, o que representa uma proveniência genuinamente mais forte do que uma avaliação do próprio fornecedor. Mas é uma fatia estreita do inglês, e a própria página do painel plota 27 dos 33 modelos que a SpaceXAI contabiliza quando afirma o primeiro lugar entre 32. Um número preciso num teste estreito e uma alegação imprecisa num teste mais amplo não são diretamente comparáveis, e este artigo não vai fingir o contrário.

Dois segundos e meio contra meio segundo

A comparação de latência é o único ponto em que os dois modelos podem ser colocados lado a lado sem qualquer ressalva quanto aos conjuntos de dados, porque ambos publicam sua configuração de streaming — e a diferença é arquitetural, e não uma escolha de ajuste.

VibeVoice ASR Streaming 7B funciona em blocos. Seus checkpoints disponibilizados usam 22 quadros latentes por bloco, o que, à taxa de 7,5 quadros latentes por segundo do modelo, corresponde a cerca de 2,9 segundos de áudio por bloco, com um lookahead de quatro quadros latentes — aproximadamente 0,5 segundo de áudio futuro — e uma latência esperada de atribuição de locutor de cerca de 2,00 segundos. Ele emite texto uma vez por bloco. Esse é um sistema de streaming real, mas a cadência é medida em segundos, não em milissegundos.

O Grok Voice Transcribe 2.0 retorna sua primeira transcrição parcial 0,49 segundos depois que o falante para, e finaliza 0,49 segundos após o fim da fala. Ele comprou essa velocidade com precisão — a taxa de erro da primeira parcial caiu de 18,3% na versão 1.0 para 3,4% na 2.0, ao custo de passar de 0,25 segundos para 0,49 segundos na mesma medida.

Coloque um ao lado do outro:

• Cadência de streaming — Grok Voice Transcribe 2.0 emite parciais continuamente com latência de primeira parcial de 0,49 segundo, em comparação com o VibeVoice ASR Streaming 7B, que emite um bloco de texto aproximadamente a cada 2,9 segundos

• Latência de atribuição de locutor — incluída no mesmo caminho de 0,49 segundos vs aproximadamente 2,00 segundos por design

• Lookahead — não publicado vs. quatro quadros latentes, cerca de 0,5 segundos de áudio futuro

• Efeito prático — um agente de voz pode agir sobre uma frase em andamento, versus um sistema que recebe um parágrafo rotulado por falante a cada três segundos

Nenhum dos dois está errado. Um bloco de 2,9 segundos é um design perfeitamente razoável para transcrição de reuniões, em que a saída é um documento e o valor está no fato de o documento chegar durante a reunião, e não depois dela. É o design errado para um agente conversacional, no qual um silêncio de três segundos não é uma pausa, é uma falha. A diferença entre as duas cadências é de cerca de seis vezes, e corresponde quase exatamente à diferença entre transcrever uma conversa e participar de uma.

Screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B, showing the MIT licence tag, the 10 languages and Streaming tags, the model card opening line 'a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the 9B parameter and BF16 tensor type fields, a notice that no inference provider deploys it, and the architecture diagram showing 2.9 second chunks with 0.5 second lookahead.

Atribuição de falante como saída, não como etapa de pipeline

É aqui que o modelo da Microsoft está genuinamente à frente, e vale a pena entender o design, porque é a razão pela qual o chunking é grosseiro.

O VibeVoice usa dois tokenizadores pré-treinados — um codificador acústico e um codificador semântico — operando a 24 kHz com downsampling de 3.200× para produzir 7,5 quadros latentes por segundo, um a cada 133 milissegundos. Esses quadros são projetados em um backbone de modelo de linguagem Qwen2.5, e a fala de entrada e o texto gerado são intercalados como uma única sequência, com a fala e o texto observados anteriormente mantidos no contexto do modelo. A consequência é que a identidade do falante nunca é um problema separado: o modelo não está transcrevendo para depois decidir quem falou; ele está gerando texto condicionado a um histórico de áudio que ainda contém as vozes. É por isso que não há uma etapa de diarização para alinhar, e por que a afirmação da Microsoft sobre atribuição de falante em 12 das 13 configurações é arquiteturalmente crível, em vez de um resultado acoplado a posteriori.

O custo desse design é a retenção de histórico que cresce linearmente com a duração da gravação, e é por isso que os checkpoints lançados visam gravações de até oito minutos. Esse é um teto real e é declarado abertamente. Isso exclui o modelo para trabalhos de longa duração — uma chamada de resultados de duas horas, um dia inteiro de áudio de central de atendimento — a menos que você construa sua própria segmentação e reinicialização, o que reintroduz exatamente a complexidade que a arquitetura foi projetada para eliminar.

O Grok Voice Transcribe 2.0 resolve o mesmo problema de forma diferente e com um conjunto diferente de limites. Inclui diarização sem custo adicional e suporta até oito canais de áudio independentes num único pedido. Para telefonia de centros de contacto, onde cada participante chega frequentemente no seu próprio canal, a separação por canal é mais fiável do que a diarização e não tem uma taxa de erro associada. Para áudio misto, depende da qualidade da diarização e, ao contrário do Muse Voice Transcribe da Meta — que publicou uma taxa média de erro de diarização de 17,5% —, a SpaceXAI não publicou qualquer valor de diarização. Por isso, ambos os modelos deixam uma lacuna nas evidências de diarização: um publica uma classificação sem um valor, o outro publica uma lista de funcionalidades sem uma medição.

Dezoito gigabytes, dez idiomas, MIT

Os fatos de implantação divergem de forma tão completa que quase não constituem uma comparação. O VibeVoice ASR Streaming 7B tem aproximadamente 18 GB de pesos bf16 — o card do Hugging Face lista 9B de parâmetros totais para o checkpoint chamado 7B, com um irmão de 1,5B em cerca de 5,6 GB — licenciado sob MIT, com demos em Python e um plugin do vLLM para servir. Dez idiomas: chinês, inglês, francês, alemão, italiano, japonês, coreano, português, russo e espanhol. A Microsoft o posiciona para pesquisa e desenvolvimento.

Grok Voice Transcribe 2.0 é um endpoint gerenciado, sem pesos para baixar, com 12 formatos de entrada, de áudio telefônico de 8 kHz a 48 kHz, até oito canais, 100 termos-chave por solicitação, detecção automática de idioma com troca no meio da gravação, normalização inversa de texto em 25 idiomas, arquivos de até 500 MB e limites de serviço de 10 solicitações por segundo e 100 sessões de streaming simultâneas por equipe. Ele é executado em us-east-1 e somente em us-east-1.

• Pesos — MIT, 18 GB, seus para rodar em qualquer lugar vs nenhum, somente hospedado pelo fornecedor

• Idiomas — 10 idiomas nomeados vs detecção automática com suporte de formatação em 25

• Viés de termos-chave — suportado via hotwords vs. até 100 termos-chave por solicitação

• Duração da gravação — cerca de oito minutos por checkpoint, antes que a retenção de histórico se torne o fator limitante, versus nenhum limite publicado, com arquivos de até 500 MB

• Controle de região — o que você implantar versus us-east-1

• Custo — sem taxa de licenciamento, além de 18 GB de memória de GPU e um stack de serviço, em comparação com US$ 0,10 por hora de processamento em lote e US$ 0,20 por hora de streaming

Um modelo de 18 GB não é algo que se execute num portátil, e o plugin vLLM implica uma GPU com memória real. Em contrapartida, uma licença MIT num modelo desse tamanho é incomum e valiosa: é o único dos dois que pode ser executado dentro da sua própria rede sem qualquer relação com fornecedores, o que, para áudio regulamentado, não é uma preferência, mas um requisito. A alternativa gerida é barata por hora e impossível de implementar no local.

A two-column generated scoreboard titled 'Grok Voice Transcribe 2.0 vs VibeVoice ASR Streaming 7B — the scoreboard'. The left column gives Grok Voice Transcribe 2.0 the rows: final WER 2.7% streaming, first partial 0.49s, cadence continuous partials, diarization included with no figure published, $0.10 per batch hour, managed in us-east-1. The right column gives VibeVoice ASR Streaming 7B the rows: WER lowest of five sets but unpublished, speaker attribution about 2.00s, cadence 2.9 second chunks, diarization built into streaming, MIT weights at about 18 GB, recordings up to 8 minutes. A footer reads 'VibeVoice figures Microsoft-reported with no absolute values published; Grok figures per Artificial Analysis.'

Onde a decisão de roteamento pertence

O custo é onde os dois modelos finalmente se tornam comparáveis de uma forma que produz um número. O caminho em lote do Grok Voice Transcribe 2.0 custa US$ 0,10 por hora de áudio, cerca de US$ 1,67 por 1.000 minutos, e seu caminho de streaming, US$ 0,20, cerca de US$ 3,33. O VibeVoice ASR Streaming 7B não tem custo de licença algum; o que ele tem, em vez disso, é cerca de 18 GB de memória de GPU residente e uma pilha de serviço vLLM que você mesmo opera. Um modelo da classe 7B desse tamanho não vai ser barato por hora de áudio em hardware alugado, e a curva de utilização é implacável — uma GPU mantida aquecida para o tráfego de pico custa o mesmo, esteja ela transcrevendo ou ociosa.

Essa é a forma habitual do argumento de construir versus comprar, e ele se resolve de maneira diferente dependendo do volume e de se é permitido que o áudio saia da sua rede. O que mudou no último mês é a velocidade com que a resposta muda: o líder de precisão em streaming mudou de mãos duas vezes em três semanas, e um modelo lançado no início de setembro foi superado em meados de setembro. Qualquer arquitetura que torne caro reverter a escolha do modelo agora é a arquitetura errada para esta categoria.

O OrcaRouter é onde essa inversão fica barata. Uma única chave compatível com OpenAI cobre mais de 200 modelos com failover automático entre fornecedores, de modo que a falha de um endpoint gerenciado numa única região é um evento de roteamento, e não uma indisponibilidade, e o preço de tabela dos fornecedores é repassado com 0% de margem — ou seja, uma alteração de preço de um fornecedor ou um novo checkpoint fica ativa do nosso lado no mesmo dia. Para uma equipe que quer testar o VibeVoice contra o Grok Voice Transcribe 2.0 no seu próprio áudio, ou manter um fallback auto-hospedado atrás da mesma interface que um primário gerenciado, o ponto de chamada deixa de ser aquilo que tem de mudar.

Screenshot of the microsoft/VibeVoice GitHub repository showing the description 'Open-Source Frontier Voice AI' and the MIT licence in the About sidebar, the file listing with demo and vibevoice directories both updated with streaming ASR inference code and a vllm_plugin directory, the repository's 53.6 thousand stars, and a GitHub Trending badge reading number 1 Repository Of The Day.

O veredito honesto: o VibeVoice ASR Streaming 7B é o modelo mais interessante e o Grok Voice Transcribe 2.0 é o produto mais utilizável, e a diferença entre essas duas afirmações se explica inteiramente pelo fato de um fornecedor publicar gráficos e o outro publicar números. Se o seu requisito é transcrição local de reuniões com atribuição de falantes e menos de oito minutos de duração, o checkpoint da Microsoft é o único dos dois que se qualifica. Se o seu requisito é um agente de voz que responda dentro de uma pausa conversacional, uma cadência de blocos de 2,9 segundos o desqualifica antes mesmo de se discutir a precisão. E se você está esperando a comparação que resolveria a questão — o mesmo áudio nos dois modelos, avaliado por alguém que não trabalha para nenhuma das duas empresas —, essa medição ainda não existe, o que vale a pena lembrar na próxima vez que uma tabela colocar um número ao lado do nome do VibeVoice.