Um cartão de título principal comparando 'VibeVoice-ASR-Streaming-7B vs GPT-Transcribe', com o sobretítulo 'Voz para texto - setembro de 2026', um subtítulo que diz: um checkpoint de sessão ao vivo encontra o endpoint de arquivos auditado da OpenAI - dois momentos diferentes na vida do áudio, etiquetas 'Pesos MIT - 2 de setembro', 'API da OpenAI - 28 de julho' e 'GPT: 3,31% AA-WER', e uma nota de rodapé 'A evidência é unilateral'. O logotipo da OrcaRouter aparece sobreposto no canto inferior direito.
Guides & Insights

VibeVoice-ASR-Streaming-7B vs GPT-Transcribe: Um checkpoint de sessão ao vivo contra o endpoint de arquivos da OpenAI

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Os dois modelos desta página não são rivais no sentido que seus nomes sugerem — eles são feitos para momentos diferentes na vida de uma gravação de áudio, e a comparação honesta é sobre em qual momento o seu produto se encontra. GPT Transcribe é o endpoint de transcrição assíncrona da OpenAI: você envia um arquivo finalizado, ele processa cerca de 34× mais rápido que o tempo real e retorna uma transcrição, com preço de $0,0045 por minuto de áudio e uma taxa de erro de palavras de 3,31% medida de forma independente no benchmark AA-WER da Artificial Analysis. VibeVoice-ASR-Streaming-7B tem o formato oposto: o checkpoint de streaming da Microsoft Research, enviado discretamente ao Hugging Face em 2 de setembro de 2026 sob licença MIT, é feito para transcrever áudio enquanto ele ainda está chegando — uma sessão WebSocket que emite texto em partes conforme a gravação cresce. Compará-los apenas pela precisão seria sem sentido, porque um lado tem um número auditado e o outro não publicou nenhum valor em texto.

Tudo abaixo está rotulado de acordo. Os valores do GPT Transcribe são o preço publicado pela OpenAI e a medição independente da Artificial Analysis, ambos de registro público desde o lançamento do modelo em 28 de julho de 2026. O lado do VibeVoice-ASR-Streaming-7B é o que se pode saber a partir do repositório — a configuração do checkpoint, o model card e a documentação de streaming da Microsoft — porque nenhum terceiro o avaliou e a Microsoft não divulgou uma taxa de erro de palavras em streaming em texto legível.

Dois momentos diferentes na vida do áudio

O GPT Transcribe é projetado para gravações que já aconteceram. O endpoint da OpenAI aceita arquivos de áudio de até 25 MB nos formatos usuais — mp3, mp4, mpeg, mpga, m4a, wav, webm — e retorna a transcrição completa após o processamento, a aproximadamente 34× o tempo real, então uma gravação de uma hora é finalizada em alguns minutos. É a via de lote, e a OpenAI a precifica de acordo: US$ 0,0045 por minuto de áudio, cerca de US$ 0,27 por hora de áudio. Se a sua necessidade é genuinamente ao vivo, a OpenAI vende um modelo separado para isso — GPT Live Transcribe a US$ 0,017 por minuto, quase quatro vezes o preço do lote — que é o que mais se aproxima, do lado da OpenAI, do que o VibeVoice-ASR-Streaming-7B faz.

O VibeVoice-ASR-Streaming-7B colapsa essa distinção na outra direção: é um checkpoint de streaming que também lida com arquivos inteiros. Sua configuração de pré-processamento mostra o contrato ao vivo — áudio de entrada a 24 kHz, comprimido 3.200× para um fluxo de tokens de 7,5 Hz, depois processado em blocos de 22 quadros com antecipação de 4 quadros, cerca de 2,9 segundos de áudio por bloco com aproximadamente meio segundo de contexto futuro, emitindo texto à medida que cada bloco é resolvido. O contexto da sessão é transportado adiante por meio do cache KV, de modo que uma sessão longa não é recalculada do zero. O caminho documentado para servir o modelo (um plugin do vLLM) expõe um endpoint de stream via WebSocket para sessões ao vivo e um endpoint de transcrição de arquivo inteiro — portanto, os mesmos pesos atendem às duas formas —, mas a razão de existir do modelo é a modalidade ao vivo, e não há medidor por minuto porque não há API hospedada. A GPU é por sua conta.

A screenshot of the Hugging Face model page for microsoft/VibeVoice-ASR-Streaming-7B (captured September 3, 2026) showing the model card opening line 'VibeVoice-ASR-Streaming is a unified streaming ASR model that transcribes Who (Speaker) said What (Content), with support for Customized Hotwords and 10 languages', the ASR/Transcription/Speech-to-Text/Streaming tag row, the 'Model size 9B params' and BF16 badges, and the Code and Demo links.

O registro de evidências é unilateral.

GPT Transcribe é uma das APIs de transcrição mais rigorosamente avaliadas em produção. A Artificial Analysis a classificou com uma taxa de erro de palavras de 3,31% no AA-WER — nona entre cerca de cinquenta sistemas monitorados — com um ponto fraco conhecido escondido nos subescores: no conjunto Earnings22, deliberadamente com áudio difícil, ela cai para 6,10%. Esses são números auditados e reproduzíveis de um ranking neutro, e vêm com limitações que também estão documentadas. O modelo foi lançado 25% mais barato que seu antecessor GPT-4o Transcribe e cerca de 0,7 ponto melhor no mesmo benchmark.

VibeVoice-ASR-Streaming-7B não tem nenhum número comparável em lugar algum. Sua ficha do modelo traz uma figura de avaliação como imagem e o relatório técnico da Microsoft é um PDF, mas não há nenhum valor de WER em streaming ou de latência citável em prosa, nem nada verificável de forma independente. A única âncora numérica na família VibeVoice é a tabela reportada pelo fornecedor na ficha do modelo em lote VibeVoice-ASR — uma média de 7,77% de WER em oito conjuntos de teste de inglês e 2,20% no LibriSpeech clean — que descreve o modelo não-streaming e não deve ser lida como a precisão deste checkpoint. Se sua decisão de compra precisa de um número que você possa defender perante um colega, apenas um lado dessa comparação tem um.

O que cada um retorna além da transcrição simples.

Os dois modelos apostam no contexto de maneiras diferentes, e é aí que a comparação de funcionalidades fica interessante. A proposta do GPT Transcribe é fornecer dicas de contexto: você pode passar uma descrição em texto livre da gravação, uma lista de palavras-chave e nomes próprios, além de uma lista de idiomas esperados. A OpenAI relata que, em seu benchmark Context-Aware ASR, a acurácia semântica melhorou de 41,6% sem contexto para 45,2% com contexto. Ele também retorna o idioma detectado. O que ele não faz é diarização de falantes nem timestamps em nível de palavra — a OpenAI aponta modelos separados para isso — portanto, a transcrição de uma reunião retorna como um único paredão de texto indiferenciado, a menos que você mesmo construa a camada de falantes.

VibeVoice-ASR-Streaming-7B faz a aposta oposta. Sua ficha técnica afirma saída em streaming com atribuição de falante — quem disse o quê, emitido conforme o chunk é resolvido — além de hotwords personalizadas por meio de um prompt de contexto (a flag de CLI é --context_info). Esse é o recurso que o GPT Transcribe explicitamente deixa de fora, e é por isso que os dois modelos não são intercambiáveis para áudio ao vivo com múltiplos falantes. O contrapeso é a verificação: os recursos ausentes do GPT Transcribe são uma decisão de produto documentada, enquanto a atribuição de falante reivindicada pelo VibeVoice é uma declaração da ficha técnica que nenhum teste independente confirmou. Os dois lados também divergem quanto a timestamps — nenhum dos dois oferece timestamps em nível de palavra no caminho que está sendo comparado, embora o modelo em lote da família VibeVoice os ofereça.

A two-column scoreboard titled 'VibeVoice-ASR-Streaming-7B vs GPT-Transcribe - the scoreboard'. Left column VibeVoice-ASR-Streaming-7B (released Sep 2, 2026 - MIT open weights): job shape - streaming session, live audio; throughput - emits per ~2.9 s chunk; WER published - none in text; speaker output - claimed who-said-what, unverified; context controls - hotwords via --context_info; cost - /bin/bash weights, ~18 GB bf16. Right column GPT-Transcribe (released Jul 28, 2026 - hosted API): async file endpoint, files up to 25 MB; ~34x faster than real time; 3.31% AA-WER (6.10% Earnings22); no speaker output; prompt + keywords + language hints; /bin/bash.27 per audio-hour hosted. Footer: 'GPT-Transcribe price per OpenAI; WER per Artificial Analysis. VibeVoice specs read from the HF repo.'

Formas de preço e a questão da propriedade

As estruturas de custo dificilmente poderiam ser mais diferentes, e nenhuma é estritamente melhor. O GPT Transcribe é uma API com cobrança por uso: US$ 0,27 por hora de áudio, sem infraestrutura, sem GPU, 25 MB por solicitação e as garantias operacionais da OpenAI — o preço de não rodar um modelo de fala por conta própria. O VibeVoice-ASR-Streaming-7B custa US$ 0 pelos pesos, mas exige cerca de 18 GB de bf16 antes do cache KV, o que significa uma GPU de classe 24 GB, o código de demonstração da microsoft/VibeVoice ou o plugin vLLM, além de monitoramento e escalonamento próprios. A licença MIT é a diferença que nenhum preço por minuto consegue capturar: os pesos são seus para manter, para fazer fine-tuning e para rodar no hardware que você controla, sem medição por usuário e sem limite de 25 MB.

A cobertura de idiomas é o ponto em que ambos os lados são mais vagos do que os compradores gostariam. O VibeVoice-ASR-Streaming-7B lista 10 idiomas em seu model card — inglês, chinês, espanhol, português, alemão, japonês, coreano, francês, russo, italiano — contra os 50+ da versão em lote do VibeVoice-ASR. A OpenAI não publica uma lista comparável de idiomas verificados para o GPT Transcribe; ela relata resultados fortes em 22 idiomas do Common Voice em seus materiais de lançamento, e seu ponto fraco acústico auditado no Earnings22 é um lembrete de que "suportado" e "lida com áudio ruidoso nesse idioma" são afirmações diferentes. Se suas necessidades de cobertura são amplas, nenhuma das listas resolve a questão — teste seus dialetos reais.

A screenshot of the microsoft/VibeVoice GitHub repository (captured September 3, 2026) showing the 'Open-Source Frontier Voice AI' description, the MIT license badge, directories including demo, docs, finetuning-asr, vibevoice and vllm_plugin, and recent commits including 'Add streaming ASR inference'.

Conclusão: escolha pela faixa, não pela pontuação.

Escolha o GPT Transcribe quando o áudio for um arquivo finalizado, quando você quiser um número de precisão documentado com limites conhecidos, ou quando não executar sua própria infraestrutura de fala valer US$ 0,27 por hora — e combine-o com o GPT Live Transcribe somente se a entrega em tempo real justificar o preço de quase 4×. Escolha o VibeVoice-ASR-Streaming-7B quando o trabalho for ao vivo e com vários falantes, quando você quiser que a transcrição chegue enquanto a conversa ainda está acontecendo, quando a saída de streaming atribuída ao falante for um recurso que você deseja avaliar, ou quando pesos abertos e controle de dados importarem mais do que um benchmark medido.

Uma nota estrutural para equipes que desenvolvem em qualquer uma das duas: a camada de transcrição não é algo que o OrcaRouter roteia hoje — nenhum dos modelos de fala para texto desta página está em seu catálogo, então a escolha de ASR permanece inteiramente sua. O que o roteamento oferece é a camada acima da transcrição. Um feed de transcrição ao vivo só é útil quando algo age sobre ele — o sumarizador, a regra de alerta, o planejador do agente de voz — e essa é a pilha que o OrcaRouter expõe com uma única API em mais de 200 modelos, a preços de lista do provedor, repassados sem margem, além de failover automático. O padrão que torna viável experimentar um checkpoint não comprovado como o VibeVoice-ASR-Streaming-7B é exatamente este: manter o endpoint que consome suas transcrições intercambiável, e um modelo ainda sem benchmark pode ganhar ou perder seu tráfego com base na evidência do seu próprio áudio, em vez de uma alegação do dia do lançamento.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube