
MAI-Transcribe-2-Streaming vs MAI-Transcribe-2: Pague 5,4× por Timing em Nível de Palavra
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 221 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
MAI-Transcribe-2-Streaming e MAI-Transcribe-2 são a mesma família de modelos dividida em dois níveis de preços, e a divisão é suficientemente clara para se planejar com base nela. MAI-Transcribe-2 foi lançado em 3 de setembro de 2026 como modelo em lote: taxa de erro de palavras de 2,0% no quadro não streaming da Artificial Analysis, aproximadamente 411× o tempo real, e US$ 0,10 por hora de áudio — cerca de US$ 1,67 por 1.000 minutos. MAI-Transcribe-2-Streaming foi lançado em 1 de outubro de 2026 como a variante em tempo real: uma taxa de erro de palavras em streaming declarada de 2,5% a 0,13 segundos até a transcrição final, que a Microsoft descreve como a primeira em precisão tanto em transcrições finais quanto parciais, medida na metodologia de streaming da Artificial Analysis, em vez de já plotada como uma linha no quadro do rastreador. US$ 0,54 por hora de áudio — cerca de US$ 9,00 por 1.000 minutos. Os mesmos 60 idiomas, a mesma distribuição apenas por API, sem pesos publicados. O streaming custa 5,4× a tarifa em lote e, nos próprios números da Microsoft, 0,5 ponto de precisão. Se isso é uma pechincha ou um imposto depende inteiramente de uma pergunta: algo no seu pipeline precisa da transcrição antes que a frase termine?
Como os dois modelos vêm de um único fornecedor e de uma única superfície de documentação, a comparação é incomumente limpa — sem suposições sobre paridade de recursos, sem incompatibilidade de versões de benchmark, sem “os números deles versus os nossos”. É um único fornecedor precificando duas velocidades da mesma capacidade, e o trabalho interessante é descobrir quais cargas de trabalho o nível barato realmente cobre.
A família, em duas fileiras
• MAI-Transcribe-2 — em lote, áudio pré-gravado, lançado em 3 de setembro de 2026. 2,0% AA-WER, segundo colocado no leaderboard não streaming da Artificial Analysis. Aproximadamente 411× em tempo real, também em segundo. $0,10 por hora de áudio, cerca de $1,67 por 1.000 minutos, como oferta por tempo limitado até o final do ano, sem preço padrão publicado. Inclui diarização de falantes e retorna timestamps em nível de palavra. 60 idiomas com identificação automática de idioma.
• MAI-Transcribe-2-Streaming — transcrição contínua em tempo real, no estilo WebSocket, lançada em 1º de outubro de 2026. A Microsoft relata WER de 2,5% na transcrição final a 0,13 segundos após o fim da fala, e os mesmos 2,5% no primeiro resultado parcial a 0,12 segundos, o que ela descreve como o primeiro em precisão nos dois — uma alegação do fornecedor medida na metodologia de streaming da Artificial Analysis, embora, no momento da redação, o próprio painel do rastreador (37 modelos) ainda não tenha plotado o modelo, e o líder atual do rastreador seja o Grok Voice Transcribe 2.0, com 2,73% e 0,49 segundos. US$ 0,54 por hora de áudio, cerca de US$ 9,00 por 1.000 minutos, preço introdutório até o fim do ano. 60 idiomas com detecção automática contínua de idioma. Nenhuma alegação publicada de diarização, nenhuma alegação publicada de timestamps por palavra.
A única assimetria que não tem a ver com velocidade ou preço é a capacidade: a diarização e os timestamps por palavra do modelo em lote são recursos documentados, e os do modelo de streaming não são. Isso importa mais do que a diferença de 0,5 ponto de precisão, e é o motivo pelo qual muitas equipes vão acabar rodando os dois.

O que 5.4× realmente oferece
A US$ 1,67 por 1.000 minutos, a transcrição em lote nesse nível de precisão é praticamente gratuita na margem. A US$ 9,00 por 1.000 minutos, o streaming é um custo real — aproximadamente o custo de transcrever o mesmo áudio cinco vezes, mais meio ponto de precisão. Portanto, a questão não é se o tempo real vale mais; é quais minutos específicos precisam dele.
As cargas de trabalho em que isso fica claro: legendas ao vivo que uma pessoa lê enquanto o falante fala, em que 0,13 segundos versus fim do arquivo é o produto inteiro; assistência em tempo real a agentes e pontuação de conformidade, em que uma intervenção que chega depois que a chamada terminou é inútil; e aplicações de voz interativas, em que um turno não pode ser concluído até que a transcrição seja concluída. Nos três casos, o modelo em lote não é uma opção mais barata, é uma não opção — não existe preço no qual a transcrição pós-hoc se torne em tempo real.
Os workloads em que claramente não se aplica: gravação de reuniões e chamadas processada a posteriori, arquivos de mídia, QA em lote de contact center, revisão de conformidade de chamadas concluídas, legendagem de podcasts e vídeos. Esses são exatamente os pipelines nos quais o tempo real de 411× do modelo em lote e a tarifa de $1,67 foram feitos para vencer, e pagar 5,4× para economizar algumas centenas de milissegundos em uma transcrição que ninguém vai ler até amanhã é um desperdício puro. Some os recursos de diarização e carimbo de tempo por palavra — o modelo em lote os tem documentados, o modelo de streaming não — e o caso a posteriori só se fortalece, não se enfraquece.
O meio-termo interessante é aquele em que os dois são genuinamente complementares: executar streaming para a superfície ao vivo e lote para o registo. Uma chamada de apoio transcrita em tempo real para alimentar um painel de assistência ao agente e, depois, retranscrita em lote durante a noite para produzir a transcrição de arquivo com diarização e marcas temporais, custa um pequeno acréscimo face ao lote isolado e obtém ambos os comportamentos. Esse padrão só se tornou possível em setembro, e é a versão de outubro que o completa.
Onde a estrutura de duas divisões aparece
Duas coisas nesta família merecem atenção porque são estruturais e não incidentais.
Primeiro, a hierarquia de precisão está invertida em relação ao padrão habitual. Modelos de streaming normalmente pagam uma penalidade substancial de precisão pela saída em tempo real; aqui, a penalidade é de 0,5 pontos, de 2,0% no ranking de batch para 2,5% alegados no de streaming. A Microsoft conseguiu um modelo em tempo real a meio ponto do seu carro-chefe de batch, segundo os seus próprios números, o que é a verdadeira conquista de engenharia do lançamento de outubro, se se mantiver — não a colocação no topo do ranking, que uma boa nova execução poderia alterar e que o rastreador ainda não confirmou.
Em segundo lugar, o preço também está invertido em relação ao padrão habitual. Os fornecedores normalmente dão desconto no nível de maior volume; a Microsoft precificou o streaming em 5,4 vezes o batch e deixou ambos em preços introdutórios que expiram ao mesmo tempo. Isso soa menos como um prêmio deliberado para streaming e mais como dois lançamentos separados, cada um com um desconto de lançamento, sem nenhum preço padrão publicado para qualquer um deles. Equipes que planejam um orçamento para 2027 devem tratar os dois números como provisórios — tanto US$ 1,67 quanto US$ 9,00 estão rotulados como por tempo limitado, e nenhum dos dois tem um preço sucessor anunciado.

O que ainda não foi provado
As questões em aberto do modelo em lote de setembro continuam em aberto: nenhuma taxa de erro de diarização publicada, nenhum detalhamento por idioma por trás da alegação de 60 idiomas, e um preço promocional sem sucessor nomeado. O modelo de streaming acrescenta mais uma que é específica do trabalho em tempo real — o WER de streaming é medido em áudio limpo, e a qualidade da transcrição parcial em um fluxo de campo distante ruidoso é o modo de falha que mais importa na implantação e é o menos coberto pelo material de lançamento. Ele também herda a proximidade do ranking de streaming: os três primeiros no ranking de 37 modelos do tracker estão a uma fração de ponto, então "primeiro" é um estado que uma nova execução pode mudar — e o primeiro lugar da Microsoft é uma alegação, não uma linha.
A questão no nível da família é a que merece atenção, no entanto. A Microsoft agora vende a mesma capacidade a dois preços com diferença de cinco vezes entre si, com a camada mais cara sem dois recursos que a camada mais barata documenta. Se a diarização e os timestamps de palavras chegarem ao SKU de streaming, a diferença se reduz a um mero trade-off entre latência e preço, o que torna a decisão muito mais simples. Se não chegarem, a estrutura de duas divisões é permanente e as arquiteturas devem ser construídas em torno dela.
Onde isto deixa uma stack de transcrição

O resultado prático é que a transcrição deixou de ser um único item de linha em setembro e passou a ser uma decisão de roteamento em outubro. Um pipeline que antes padronizava tudo em uma única API agora quer streaming para a superfície ao vivo, processamento em lote para o registro e uma regra para definir qual áudio segue qual caminho — e essa regra é, ela própria, um problema de roteamento, o que é uma quantidade estranha de complexidade para cair no ciclo de lançamento de um único fornecedor.
Isso recai com mais força sobre o que fica acima da transcrição. Qualquer que seja a camada que produza o texto, esse texto é então resumido, classificado, expurgado e encaminhado, e essas etapas rodam em modelos de linguagem com seus próprios perfis de latência e custo — uma transcrição ao vivo quer um modelo rápido e barato; uma para arquivo pode se permitir um modelo mais forte. O OrcaRouter cobre exatamente essa camada: uma única API para mais de 200 modelos, preços de tabela dos provedores repassados com 0% de margem, failover automático e uma DSL de roteamento que escolhe um modelo por carga de trabalho, em vez de por pipeline. Nem o MAI-Transcribe-2-Streaming nem o MAI-Transcribe-2 estão nessa lista — ambos são servidos pela própria pilha de fala da Microsoft —, mas uma camada de transcrição de duas divisões é o argumento mais forte até agora para manter tudo o que está a jusante dela portátil.
O resumo honesto: streaming não é um MAI-Transcribe-2 melhor, é um segundo produto a um segundo preço. Compre-o para os minutos que realmente precisam ser em tempo real, deixe o resto no nível barato, e reserve orçamento para as duas tarifas serem reajustadas quando o período introdutório terminar.
