
VibeVoice-ASR-Streaming-7B vs GPT-Transcribe: Um checkpoint de sessão ao vivo contra o endpoint de arquivos da OpenAI
- AlibabaNOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligência72Código
- DeepSeekNOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianQwen3.8 27B2026-08-1552Inteligência68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
Os dois modelos desta página não são rivais no sentido que seus nomes sugerem — eles são feitos para momentos diferentes na vida de uma gravação de áudio, e a comparação honesta é sobre em qual momento o seu produto se encontra. GPT Transcribe é o endpoint de transcrição assíncrona da OpenAI: você envia um arquivo finalizado, ele processa cerca de 34× mais rápido que o tempo real e retorna uma transcrição, com preço de $0,0045 por minuto de áudio e uma taxa de erro de palavras de 3,31% medida de forma independente no benchmark AA-WER da Artificial Analysis. VibeVoice-ASR-Streaming-7B tem o formato oposto: o checkpoint de streaming da Microsoft Research, enviado discretamente ao Hugging Face em 2 de setembro de 2026 sob licença MIT, é feito para transcrever áudio enquanto ele ainda está chegando — uma sessão WebSocket que emite texto em partes conforme a gravação cresce. Compará-los apenas pela precisão seria sem sentido, porque um lado tem um número auditado e o outro não publicou nenhum valor em texto.
Tudo abaixo está rotulado de acordo. Os valores do GPT Transcribe são o preço publicado pela OpenAI e a medição independente da Artificial Analysis, ambos de registro público desde o lançamento do modelo em 28 de julho de 2026. O lado do VibeVoice-ASR-Streaming-7B é o que se pode saber a partir do repositório — a configuração do checkpoint, o model card e a documentação de streaming da Microsoft — porque nenhum terceiro o avaliou e a Microsoft não divulgou uma taxa de erro de palavras em streaming em texto legível.
Dois momentos diferentes na vida do áudio
O GPT Transcribe é projetado para gravações que já aconteceram. O endpoint da OpenAI aceita arquivos de áudio de até 25 MB nos formatos usuais — mp3, mp4, mpeg, mpga, m4a, wav, webm — e retorna a transcrição completa após o processamento, a aproximadamente 34× o tempo real, então uma gravação de uma hora é finalizada em alguns minutos. É a via de lote, e a OpenAI a precifica de acordo: US$ 0,0045 por minuto de áudio, cerca de US$ 0,27 por hora de áudio. Se a sua necessidade é genuinamente ao vivo, a OpenAI vende um modelo separado para isso — GPT Live Transcribe a US$ 0,017 por minuto, quase quatro vezes o preço do lote — que é o que mais se aproxima, do lado da OpenAI, do que o VibeVoice-ASR-Streaming-7B faz.
O VibeVoice-ASR-Streaming-7B colapsa essa distinção na outra direção: é um checkpoint de streaming que também lida com arquivos inteiros. Sua configuração de pré-processamento mostra o contrato ao vivo — áudio de entrada a 24 kHz, comprimido 3.200× para um fluxo de tokens de 7,5 Hz, depois processado em blocos de 22 quadros com antecipação de 4 quadros, cerca de 2,9 segundos de áudio por bloco com aproximadamente meio segundo de contexto futuro, emitindo texto à medida que cada bloco é resolvido. O contexto da sessão é transportado adiante por meio do cache KV, de modo que uma sessão longa não é recalculada do zero. O caminho documentado para servir o modelo (um plugin do vLLM) expõe um endpoint de stream via WebSocket para sessões ao vivo e um endpoint de transcrição de arquivo inteiro — portanto, os mesmos pesos atendem às duas formas —, mas a razão de existir do modelo é a modalidade ao vivo, e não há medidor por minuto porque não há API hospedada. A GPU é por sua conta.

O registro de evidências é unilateral.
GPT Transcribe é uma das APIs de transcrição mais rigorosamente avaliadas em produção. A Artificial Analysis a classificou com uma taxa de erro de palavras de 3,31% no AA-WER — nona entre cerca de cinquenta sistemas monitorados — com um ponto fraco conhecido escondido nos subescores: no conjunto Earnings22, deliberadamente com áudio difícil, ela cai para 6,10%. Esses são números auditados e reproduzíveis de um ranking neutro, e vêm com limitações que também estão documentadas. O modelo foi lançado 25% mais barato que seu antecessor GPT-4o Transcribe e cerca de 0,7 ponto melhor no mesmo benchmark.
VibeVoice-ASR-Streaming-7B não tem nenhum número comparável em lugar algum. Sua ficha do modelo traz uma figura de avaliação como imagem e o relatório técnico da Microsoft é um PDF, mas não há nenhum valor de WER em streaming ou de latência citável em prosa, nem nada verificável de forma independente. A única âncora numérica na família VibeVoice é a tabela reportada pelo fornecedor na ficha do modelo em lote VibeVoice-ASR — uma média de 7,77% de WER em oito conjuntos de teste de inglês e 2,20% no LibriSpeech clean — que descreve o modelo não-streaming e não deve ser lida como a precisão deste checkpoint. Se sua decisão de compra precisa de um número que você possa defender perante um colega, apenas um lado dessa comparação tem um.
O que cada um retorna além da transcrição simples.
Os dois modelos apostam no contexto de maneiras diferentes, e é aí que a comparação de funcionalidades fica interessante. A proposta do GPT Transcribe é fornecer dicas de contexto: você pode passar uma descrição em texto livre da gravação, uma lista de palavras-chave e nomes próprios, além de uma lista de idiomas esperados. A OpenAI relata que, em seu benchmark Context-Aware ASR, a acurácia semântica melhorou de 41,6% sem contexto para 45,2% com contexto. Ele também retorna o idioma detectado. O que ele não faz é diarização de falantes nem timestamps em nível de palavra — a OpenAI aponta modelos separados para isso — portanto, a transcrição de uma reunião retorna como um único paredão de texto indiferenciado, a menos que você mesmo construa a camada de falantes.
VibeVoice-ASR-Streaming-7B faz a aposta oposta. Sua ficha técnica afirma saída em streaming com atribuição de falante — quem disse o quê, emitido conforme o chunk é resolvido — além de hotwords personalizadas por meio de um prompt de contexto (a flag de CLI é --context_info). Esse é o recurso que o GPT Transcribe explicitamente deixa de fora, e é por isso que os dois modelos não são intercambiáveis para áudio ao vivo com múltiplos falantes. O contrapeso é a verificação: os recursos ausentes do GPT Transcribe são uma decisão de produto documentada, enquanto a atribuição de falante reivindicada pelo VibeVoice é uma declaração da ficha técnica que nenhum teste independente confirmou. Os dois lados também divergem quanto a timestamps — nenhum dos dois oferece timestamps em nível de palavra no caminho que está sendo comparado, embora o modelo em lote da família VibeVoice os ofereça.

Formas de preço e a questão da propriedade
As estruturas de custo dificilmente poderiam ser mais diferentes, e nenhuma é estritamente melhor. O GPT Transcribe é uma API com cobrança por uso: US$ 0,27 por hora de áudio, sem infraestrutura, sem GPU, 25 MB por solicitação e as garantias operacionais da OpenAI — o preço de não rodar um modelo de fala por conta própria. O VibeVoice-ASR-Streaming-7B custa US$ 0 pelos pesos, mas exige cerca de 18 GB de bf16 antes do cache KV, o que significa uma GPU de classe 24 GB, o código de demonstração da microsoft/VibeVoice ou o plugin vLLM, além de monitoramento e escalonamento próprios. A licença MIT é a diferença que nenhum preço por minuto consegue capturar: os pesos são seus para manter, para fazer fine-tuning e para rodar no hardware que você controla, sem medição por usuário e sem limite de 25 MB.
A cobertura de idiomas é o ponto em que ambos os lados são mais vagos do que os compradores gostariam. O VibeVoice-ASR-Streaming-7B lista 10 idiomas em seu model card — inglês, chinês, espanhol, português, alemão, japonês, coreano, francês, russo, italiano — contra os 50+ da versão em lote do VibeVoice-ASR. A OpenAI não publica uma lista comparável de idiomas verificados para o GPT Transcribe; ela relata resultados fortes em 22 idiomas do Common Voice em seus materiais de lançamento, e seu ponto fraco acústico auditado no Earnings22 é um lembrete de que "suportado" e "lida com áudio ruidoso nesse idioma" são afirmações diferentes. Se suas necessidades de cobertura são amplas, nenhuma das listas resolve a questão — teste seus dialetos reais.

Conclusão: escolha pela faixa, não pela pontuação.
Escolha o GPT Transcribe quando o áudio for um arquivo finalizado, quando você quiser um número de precisão documentado com limites conhecidos, ou quando não executar sua própria infraestrutura de fala valer US$ 0,27 por hora — e combine-o com o GPT Live Transcribe somente se a entrega em tempo real justificar o preço de quase 4×. Escolha o VibeVoice-ASR-Streaming-7B quando o trabalho for ao vivo e com vários falantes, quando você quiser que a transcrição chegue enquanto a conversa ainda está acontecendo, quando a saída de streaming atribuída ao falante for um recurso que você deseja avaliar, ou quando pesos abertos e controle de dados importarem mais do que um benchmark medido.
Uma nota estrutural para equipes que desenvolvem em qualquer uma das duas: a camada de transcrição não é algo que o OrcaRouter roteia hoje — nenhum dos modelos de fala para texto desta página está em seu catálogo, então a escolha de ASR permanece inteiramente sua. O que o roteamento oferece é a camada acima da transcrição. Um feed de transcrição ao vivo só é útil quando algo age sobre ele — o sumarizador, a regra de alerta, o planejador do agente de voz — e essa é a pilha que o OrcaRouter expõe com uma única API em mais de 200 modelos, a preços de lista do provedor, repassados sem margem, além de failover automático. O padrão que torna viável experimentar um checkpoint não comprovado como o VibeVoice-ASR-Streaming-7B é exatamente este: manter o endpoint que consome suas transcrições intercambiável, e um modelo ainda sem benchmark pode ganhar ou perder seu tráfego com base na evidência do seu próprio áudio, em vez de uma alegação do dia do lançamento.
