
Grok Voice Transcribe 2.0 vs VibeVoice ASR Streaming 7B: O número que a Microsoft não publicou
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
O VibeVoice ASR Streaming 7B é o reconhecedor de fala em streaming unificado da Microsoft, carregado no Hugging Face em 2 de setembro de 2026 e anunciado no repositório microsoft/VibeVoice um dia depois sob a licença MIT, e faz algo que nem o Grok Voice Transcribe 2.0 nem a maioria de seus concorrentes faz: emite texto com atribuição de falante à medida que o áudio chega, sem uma etapa separada de diarização. O relatório técnico da Microsoft afirma que o checkpoint 7B alcança a menor média de WER e CER em cinco conjuntos de avaliação e a melhor atribuição de falante, ou empatada em primeiro, em 12 de 13 configurações de avaliação. O que a ficha do modelo não faz é publicar um único número em texto — nenhum WER, nenhum RTF, nenhum valor de latência; os resultados existem apenas como imagens no relatório. O Grok Voice Transcribe 2.0, lançado dezesseis dias depois, em 18 de setembro de 2026, a US$ 0,10 por hora de áudio para processamento em lote e US$ 0,20 por hora para streaming, publica tudo: 2,7% de WER da transcrição final e 3,4% de WER da primeira parcial no painel de streaming da Artificial Analysis, 0,49 segundos para cada. Portanto, o ponto de partida honesto para esta comparação é que um dos dois modelos é mensuravelmente mais bem documentado do que o outro, e essa assimetria é, por si só, o fato mais relevante para a decisão neste confronto.
O que a Microsoft publicou, e o que um leitor pode fazer com isso
O relatório do VibeVoice é pesquisa real e as afirmações nele contidas são específicas em forma, se não em valor. Ele avaliou quatro benchmarks de reuniões — AliMeeting, AISHELL-4, AMI-SDM e AMI-IHM — além do MLC-Challenge, em nove idiomas, e relata dois resultados de destaque: o modelo 7B teve o menor WER/CER médio nos cinco conjuntos e a melhor atribuição de locutor, ou empatada em primeiro lugar, em 12 de 13 configurações de avaliação. Ambas são afirmações relativas, o que é um tipo significativo de afirmação: "menor nos cinco conjuntos" é uma afirmação sobre ordenação, e ordenação é o que um comprador precisa.
O que está ausente é qualquer número absoluto. Não há percentual de WER para comparar com nada, nem número de throughput, nem medição de latência, e nenhum detalhamento por conjunto no texto. Uma tabela de comparação que coloca o VibeVoice ao lado do Grok Voice Transcribe 2.0 e atribui um número ao modelo da Microsoft está inventando esse número. O que se pode dizer é que o VibeVoice venceu sua própria avaliação de cinco conjuntos e que ninguém fora da Microsoft a repetiu — nenhum benchmark independente, nenhuma avaliação de terceiros e, no momento em que isto foi escrito, nenhum provedor de inferência hospedada listando o modelo. A comparação é, portanto, entre um número documentado e uma classificação não documentada, e a classificação não documentada não é o mais fraco dos dois só porque não tem casas decimais.
A documentação do Grok Voice Transcribe 2.0 tem o problema oposto. Seus 2,7% e 3,4% vêm do painel AA-WER Streaming da Artificial Analysis, um composto ponderado do AA-AgentTalk com 50% e do VoxPopuli e Earnings22 com 25% cada — cerca de oito horas de áudio conversacional em inglês com formato de agente, executado de forma independente, o que representa uma proveniência genuinamente mais forte do que uma avaliação do próprio fornecedor. Mas é uma fatia estreita do inglês, e a própria página do painel plota 27 dos 33 modelos que a SpaceXAI contabiliza quando afirma o primeiro lugar entre 32. Um número preciso num teste estreito e uma alegação imprecisa num teste mais amplo não são diretamente comparáveis, e este artigo não vai fingir o contrário.
Dois segundos e meio contra meio segundo
A comparação de latência é o único ponto em que os dois modelos podem ser colocados lado a lado sem qualquer ressalva quanto aos conjuntos de dados, porque ambos publicam sua configuração de streaming — e a diferença é arquitetural, e não uma escolha de ajuste.
VibeVoice ASR Streaming 7B funciona em blocos. Seus checkpoints disponibilizados usam 22 quadros latentes por bloco, o que, à taxa de 7,5 quadros latentes por segundo do modelo, corresponde a cerca de 2,9 segundos de áudio por bloco, com um lookahead de quatro quadros latentes — aproximadamente 0,5 segundo de áudio futuro — e uma latência esperada de atribuição de locutor de cerca de 2,00 segundos. Ele emite texto uma vez por bloco. Esse é um sistema de streaming real, mas a cadência é medida em segundos, não em milissegundos.
O Grok Voice Transcribe 2.0 retorna sua primeira transcrição parcial 0,49 segundos depois que o falante para, e finaliza 0,49 segundos após o fim da fala. Ele comprou essa velocidade com precisão — a taxa de erro da primeira parcial caiu de 18,3% na versão 1.0 para 3,4% na 2.0, ao custo de passar de 0,25 segundos para 0,49 segundos na mesma medida.
Coloque um ao lado do outro:
• Cadência de streaming — Grok Voice Transcribe 2.0 emite parciais continuamente com latência de primeira parcial de 0,49 segundo, em comparação com o VibeVoice ASR Streaming 7B, que emite um bloco de texto aproximadamente a cada 2,9 segundos
• Latência de atribuição de locutor — incluída no mesmo caminho de 0,49 segundos vs aproximadamente 2,00 segundos por design
• Lookahead — não publicado vs. quatro quadros latentes, cerca de 0,5 segundos de áudio futuro
• Efeito prático — um agente de voz pode agir sobre uma frase em andamento, versus um sistema que recebe um parágrafo rotulado por falante a cada três segundos
Nenhum dos dois está errado. Um bloco de 2,9 segundos é um design perfeitamente razoável para transcrição de reuniões, em que a saída é um documento e o valor está no fato de o documento chegar durante a reunião, e não depois dela. É o design errado para um agente conversacional, no qual um silêncio de três segundos não é uma pausa, é uma falha. A diferença entre as duas cadências é de cerca de seis vezes, e corresponde quase exatamente à diferença entre transcrever uma conversa e participar de uma.

Atribuição de falante como saída, não como etapa de pipeline
É aqui que o modelo da Microsoft está genuinamente à frente, e vale a pena entender o design, porque é a razão pela qual o chunking é grosseiro.
O VibeVoice usa dois tokenizadores pré-treinados — um codificador acústico e um codificador semântico — operando a 24 kHz com downsampling de 3.200× para produzir 7,5 quadros latentes por segundo, um a cada 133 milissegundos. Esses quadros são projetados em um backbone de modelo de linguagem Qwen2.5, e a fala de entrada e o texto gerado são intercalados como uma única sequência, com a fala e o texto observados anteriormente mantidos no contexto do modelo. A consequência é que a identidade do falante nunca é um problema separado: o modelo não está transcrevendo para depois decidir quem falou; ele está gerando texto condicionado a um histórico de áudio que ainda contém as vozes. É por isso que não há uma etapa de diarização para alinhar, e por que a afirmação da Microsoft sobre atribuição de falante em 12 das 13 configurações é arquiteturalmente crível, em vez de um resultado acoplado a posteriori.
O custo desse design é a retenção de histórico que cresce linearmente com a duração da gravação, e é por isso que os checkpoints lançados visam gravações de até oito minutos. Esse é um teto real e é declarado abertamente. Isso exclui o modelo para trabalhos de longa duração — uma chamada de resultados de duas horas, um dia inteiro de áudio de central de atendimento — a menos que você construa sua própria segmentação e reinicialização, o que reintroduz exatamente a complexidade que a arquitetura foi projetada para eliminar.
O Grok Voice Transcribe 2.0 resolve o mesmo problema de forma diferente e com um conjunto diferente de limites. Inclui diarização sem custo adicional e suporta até oito canais de áudio independentes num único pedido. Para telefonia de centros de contacto, onde cada participante chega frequentemente no seu próprio canal, a separação por canal é mais fiável do que a diarização e não tem uma taxa de erro associada. Para áudio misto, depende da qualidade da diarização e, ao contrário do Muse Voice Transcribe da Meta — que publicou uma taxa média de erro de diarização de 17,5% —, a SpaceXAI não publicou qualquer valor de diarização. Por isso, ambos os modelos deixam uma lacuna nas evidências de diarização: um publica uma classificação sem um valor, o outro publica uma lista de funcionalidades sem uma medição.
Dezoito gigabytes, dez idiomas, MIT
Os fatos de implantação divergem de forma tão completa que quase não constituem uma comparação. O VibeVoice ASR Streaming 7B tem aproximadamente 18 GB de pesos bf16 — o card do Hugging Face lista 9B de parâmetros totais para o checkpoint chamado 7B, com um irmão de 1,5B em cerca de 5,6 GB — licenciado sob MIT, com demos em Python e um plugin do vLLM para servir. Dez idiomas: chinês, inglês, francês, alemão, italiano, japonês, coreano, português, russo e espanhol. A Microsoft o posiciona para pesquisa e desenvolvimento.
Grok Voice Transcribe 2.0 é um endpoint gerenciado, sem pesos para baixar, com 12 formatos de entrada, de áudio telefônico de 8 kHz a 48 kHz, até oito canais, 100 termos-chave por solicitação, detecção automática de idioma com troca no meio da gravação, normalização inversa de texto em 25 idiomas, arquivos de até 500 MB e limites de serviço de 10 solicitações por segundo e 100 sessões de streaming simultâneas por equipe. Ele é executado em us-east-1 e somente em us-east-1.
• Pesos — MIT, 18 GB, seus para rodar em qualquer lugar vs nenhum, somente hospedado pelo fornecedor
• Idiomas — 10 idiomas nomeados vs detecção automática com suporte de formatação em 25
• Viés de termos-chave — suportado via hotwords vs. até 100 termos-chave por solicitação
• Duração da gravação — cerca de oito minutos por checkpoint, antes que a retenção de histórico se torne o fator limitante, versus nenhum limite publicado, com arquivos de até 500 MB
• Controle de região — o que você implantar versus us-east-1
• Custo — sem taxa de licenciamento, além de 18 GB de memória de GPU e um stack de serviço, em comparação com US$ 0,10 por hora de processamento em lote e US$ 0,20 por hora de streaming
Um modelo de 18 GB não é algo que se execute num portátil, e o plugin vLLM implica uma GPU com memória real. Em contrapartida, uma licença MIT num modelo desse tamanho é incomum e valiosa: é o único dos dois que pode ser executado dentro da sua própria rede sem qualquer relação com fornecedores, o que, para áudio regulamentado, não é uma preferência, mas um requisito. A alternativa gerida é barata por hora e impossível de implementar no local.

Onde a decisão de roteamento pertence
O custo é onde os dois modelos finalmente se tornam comparáveis de uma forma que produz um número. O caminho em lote do Grok Voice Transcribe 2.0 custa US$ 0,10 por hora de áudio, cerca de US$ 1,67 por 1.000 minutos, e seu caminho de streaming, US$ 0,20, cerca de US$ 3,33. O VibeVoice ASR Streaming 7B não tem custo de licença algum; o que ele tem, em vez disso, é cerca de 18 GB de memória de GPU residente e uma pilha de serviço vLLM que você mesmo opera. Um modelo da classe 7B desse tamanho não vai ser barato por hora de áudio em hardware alugado, e a curva de utilização é implacável — uma GPU mantida aquecida para o tráfego de pico custa o mesmo, esteja ela transcrevendo ou ociosa.
Essa é a forma habitual do argumento de construir versus comprar, e ele se resolve de maneira diferente dependendo do volume e de se é permitido que o áudio saia da sua rede. O que mudou no último mês é a velocidade com que a resposta muda: o líder de precisão em streaming mudou de mãos duas vezes em três semanas, e um modelo lançado no início de setembro foi superado em meados de setembro. Qualquer arquitetura que torne caro reverter a escolha do modelo agora é a arquitetura errada para esta categoria.
O OrcaRouter é onde essa inversão fica barata. Uma única chave compatível com OpenAI cobre mais de 200 modelos com failover automático entre fornecedores, de modo que a falha de um endpoint gerenciado numa única região é um evento de roteamento, e não uma indisponibilidade, e o preço de tabela dos fornecedores é repassado com 0% de margem — ou seja, uma alteração de preço de um fornecedor ou um novo checkpoint fica ativa do nosso lado no mesmo dia. Para uma equipe que quer testar o VibeVoice contra o Grok Voice Transcribe 2.0 no seu próprio áudio, ou manter um fallback auto-hospedado atrás da mesma interface que um primário gerenciado, o ponto de chamada deixa de ser aquilo que tem de mudar.

O veredito honesto: o VibeVoice ASR Streaming 7B é o modelo mais interessante e o Grok Voice Transcribe 2.0 é o produto mais utilizável, e a diferença entre essas duas afirmações se explica inteiramente pelo fato de um fornecedor publicar gráficos e o outro publicar números. Se o seu requisito é transcrição local de reuniões com atribuição de falantes e menos de oito minutos de duração, o checkpoint da Microsoft é o único dos dois que se qualifica. Se o seu requisito é um agente de voz que responda dentro de uma pausa conversacional, uma cadência de blocos de 2,9 segundos o desqualifica antes mesmo de se discutir a precisão. E se você está esperando a comparação que resolveria a questão — o mesmo áudio nos dois modelos, avaliado por alguém que não trabalha para nenhuma das duas empresas —, essa medição ainda não existe, o que vale a pena lembrar na próxima vez que uma tabela colocar um número ao lado do nome do VibeVoice.
