Card de destaque do artigo com o texto 'MAI-Transcribe-2-Streaming vs MAI-Transcribe-2', com o selo 'MESMA FAMÍLIA · DOIS NÍVEIS DE PREÇO' e o subtítulo 'Pague 5,4x pela temporização em nível de palavra', construído como dois cards de nomes de modelos separados por um selo VS, com uma faixa de chips mostrando $9,00 versus $1,67 por 1.000 minutos, uma taxa de erro de palavra alegada de 2,5% versus uma auditada de 2,0%, 0,13 s até a transcrição final versus aproximadamente 411x o tempo real, e timestamps mais diarização apenas no nível em lote, sobre um gradiente de branco para azul com o logotipo OrcaRouter no canto inferior direito.
Guides & Insights

MAI-Transcribe-2-Streaming vs MAI-Transcribe-2: Pague 5,4× por Timing em Nível de Palavra

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

MAI-Transcribe-2-Streaming e MAI-Transcribe-2 são a mesma família de modelos dividida em dois níveis de preços, e a divisão é suficientemente clara para se planejar com base nela. MAI-Transcribe-2 foi lançado em 3 de setembro de 2026 como modelo em lote: taxa de erro de palavras de 2,0% no quadro não streaming da Artificial Analysis, aproximadamente 411× o tempo real, e US$ 0,10 por hora de áudio — cerca de US$ 1,67 por 1.000 minutos. MAI-Transcribe-2-Streaming foi lançado em 1 de outubro de 2026 como a variante em tempo real: uma taxa de erro de palavras em streaming declarada de 2,5% a 0,13 segundos até a transcrição final, que a Microsoft descreve como a primeira em precisão tanto em transcrições finais quanto parciais, medida na metodologia de streaming da Artificial Analysis, em vez de já plotada como uma linha no quadro do rastreador. US$ 0,54 por hora de áudio — cerca de US$ 9,00 por 1.000 minutos. Os mesmos 60 idiomas, a mesma distribuição apenas por API, sem pesos publicados. O streaming custa 5,4× a tarifa em lote e, nos próprios números da Microsoft, 0,5 ponto de precisão. Se isso é uma pechincha ou um imposto depende inteiramente de uma pergunta: algo no seu pipeline precisa da transcrição antes que a frase termine?

Como os dois modelos vêm de um único fornecedor e de uma única superfície de documentação, a comparação é incomumente limpa — sem suposições sobre paridade de recursos, sem incompatibilidade de versões de benchmark, sem “os números deles versus os nossos”. É um único fornecedor precificando duas velocidades da mesma capacidade, e o trabalho interessante é descobrir quais cargas de trabalho o nível barato realmente cobre.

A família, em duas fileiras

• MAI-Transcribe-2 — em lote, áudio pré-gravado, lançado em 3 de setembro de 2026. 2,0% AA-WER, segundo colocado no leaderboard não streaming da Artificial Analysis. Aproximadamente 411× em tempo real, também em segundo. $0,10 por hora de áudio, cerca de $1,67 por 1.000 minutos, como oferta por tempo limitado até o final do ano, sem preço padrão publicado. Inclui diarização de falantes e retorna timestamps em nível de palavra. 60 idiomas com identificação automática de idioma.

• MAI-Transcribe-2-Streaming — transcrição contínua em tempo real, no estilo WebSocket, lançada em 1º de outubro de 2026. A Microsoft relata WER de 2,5% na transcrição final a 0,13 segundos após o fim da fala, e os mesmos 2,5% no primeiro resultado parcial a 0,12 segundos, o que ela descreve como o primeiro em precisão nos dois — uma alegação do fornecedor medida na metodologia de streaming da Artificial Analysis, embora, no momento da redação, o próprio painel do rastreador (37 modelos) ainda não tenha plotado o modelo, e o líder atual do rastreador seja o Grok Voice Transcribe 2.0, com 2,73% e 0,49 segundos. US$ 0,54 por hora de áudio, cerca de US$ 9,00 por 1.000 minutos, preço introdutório até o fim do ano. 60 idiomas com detecção automática contínua de idioma. Nenhuma alegação publicada de diarização, nenhuma alegação publicada de timestamps por palavra.

A única assimetria que não tem a ver com velocidade ou preço é a capacidade: a diarização e os timestamps por palavra do modelo em lote são recursos documentados, e os do modelo de streaming não são. Isso importa mais do que a diferença de 0,5 ponto de precisão, e é o motivo pelo qual muitas equipes vão acabar rodando os dois.

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2-Streaming dated October 1, 2026, headlined 'Our first streaming transcription model debuts at no. 1 on Artificial Analysis' and introducing the MAI-Transcribe and MAI-Voice models, with the companion MAI-Voice-2.1 and MAI-Voice-2.1-Flash announcements from the same release.

O que 5.4× realmente oferece

A US$ 1,67 por 1.000 minutos, a transcrição em lote nesse nível de precisão é praticamente gratuita na margem. A US$ 9,00 por 1.000 minutos, o streaming é um custo real — aproximadamente o custo de transcrever o mesmo áudio cinco vezes, mais meio ponto de precisão. Portanto, a questão não é se o tempo real vale mais; é quais minutos específicos precisam dele.

As cargas de trabalho em que isso fica claro: legendas ao vivo que uma pessoa lê enquanto o falante fala, em que 0,13 segundos versus fim do arquivo é o produto inteiro; assistência em tempo real a agentes e pontuação de conformidade, em que uma intervenção que chega depois que a chamada terminou é inútil; e aplicações de voz interativas, em que um turno não pode ser concluído até que a transcrição seja concluída. Nos três casos, o modelo em lote não é uma opção mais barata, é uma não opção — não existe preço no qual a transcrição pós-hoc se torne em tempo real.

Os workloads em que claramente não se aplica: gravação de reuniões e chamadas processada a posteriori, arquivos de mídia, QA em lote de contact center, revisão de conformidade de chamadas concluídas, legendagem de podcasts e vídeos. Esses são exatamente os pipelines nos quais o tempo real de 411× do modelo em lote e a tarifa de $1,67 foram feitos para vencer, e pagar 5,4× para economizar algumas centenas de milissegundos em uma transcrição que ninguém vai ler até amanhã é um desperdício puro. Some os recursos de diarização e carimbo de tempo por palavra — o modelo em lote os tem documentados, o modelo de streaming não — e o caso a posteriori só se fortalece, não se enfraquece.

O meio-termo interessante é aquele em que os dois são genuinamente complementares: executar streaming para a superfície ao vivo e lote para o registo. Uma chamada de apoio transcrita em tempo real para alimentar um painel de assistência ao agente e, depois, retranscrita em lote durante a noite para produzir a transcrição de arquivo com diarização e marcas temporais, custa um pequeno acréscimo face ao lote isolado e obtém ambos os comportamentos. Esse padrão só se tornou possível em setembro, e é a versão de outubro que o completa.

Onde a estrutura de duas divisões aparece

Duas coisas nesta família merecem atenção porque são estruturais e não incidentais.

Primeiro, a hierarquia de precisão está invertida em relação ao padrão habitual. Modelos de streaming normalmente pagam uma penalidade substancial de precisão pela saída em tempo real; aqui, a penalidade é de 0,5 pontos, de 2,0% no ranking de batch para 2,5% alegados no de streaming. A Microsoft conseguiu um modelo em tempo real a meio ponto do seu carro-chefe de batch, segundo os seus próprios números, o que é a verdadeira conquista de engenharia do lançamento de outubro, se se mantiver — não a colocação no topo do ranking, que uma boa nova execução poderia alterar e que o rastreador ainda não confirmou.

Em segundo lugar, o preço também está invertido em relação ao padrão habitual. Os fornecedores normalmente dão desconto no nível de maior volume; a Microsoft precificou o streaming em 5,4 vezes o batch e deixou ambos em preços introdutórios que expiram ao mesmo tempo. Isso soa menos como um prêmio deliberado para streaming e mais como dois lançamentos separados, cada um com um desconto de lançamento, sem nenhum preço padrão publicado para qualquer um deles. Equipes que planejam um orçamento para 2027 devem tratar os dois números como provisórios — tanto US$ 1,67 quanto US$ 9,00 estão rotulados como por tempo limitado, e nenhum dos dois tem um preço sucessor anunciado.

A generated two-column scoreboard card titled 'One family, two divisions' contrasting MAI-Transcribe-2 (batch) — non-streaming, 2.0% AA-WER at #2, roughly 411x real time at #2, $1.67 per 1,000 minutes ($0.10 per audio-hour), bundled diarization, returned word timestamps, 60 languages with automatic ID, released September 3, 2026 — with MAI-Transcribe-2-Streaming — streaming, 2.5% claimed word error rate, 0.13s to final transcript, $9.00 per 1,000 minutes ($0.54 per audio-hour), diarization not published, word timestamps not published, 60 languages with continuous detection, released October 1, 2026, with the OrcaRouter logo bottom right.

O que ainda não foi provado

As questões em aberto do modelo em lote de setembro continuam em aberto: nenhuma taxa de erro de diarização publicada, nenhum detalhamento por idioma por trás da alegação de 60 idiomas, e um preço promocional sem sucessor nomeado. O modelo de streaming acrescenta mais uma que é específica do trabalho em tempo real — o WER de streaming é medido em áudio limpo, e a qualidade da transcrição parcial em um fluxo de campo distante ruidoso é o modo de falha que mais importa na implantação e é o menos coberto pelo material de lançamento. Ele também herda a proximidade do ranking de streaming: os três primeiros no ranking de 37 modelos do tracker estão a uma fração de ponto, então "primeiro" é um estado que uma nova execução pode mudar — e o primeiro lugar da Microsoft é uma alegação, não uma linha.

A questão no nível da família é a que merece atenção, no entanto. A Microsoft agora vende a mesma capacidade a dois preços com diferença de cinco vezes entre si, com a camada mais cara sem dois recursos que a camada mais barata documenta. Se a diarização e os timestamps de palavras chegarem ao SKU de streaming, a diferença se reduz a um mero trade-off entre latência e preço, o que torna a decisão muito mais simples. Se não chegarem, a estrutura de duas divisões é permanente e as arquiteturas devem ser construídas em torno dela.

Onde isto deixa uma stack de transcrição

A generated routing card titled 'Which minutes go on which tier' splitting workloads into a streaming column (live captions a person reads while the speaker talks, real-time agent assist, compliance or quality scoring that must land before the call ends, interactive voice turns) and a batch column (meeting and call recordings processed after the fact, media archives, contact-centre batch QA, podcast and video captioning, anything needing bundled diarization or word-level timestamps), with a note that a stream-and-reprocess pattern covers both and a footer stating that neither tier is on OrcaRouter and both are served through Microsoft's own speech stack, with the OrcaRouter logo bottom right.

O resultado prático é que a transcrição deixou de ser um único item de linha em setembro e passou a ser uma decisão de roteamento em outubro. Um pipeline que antes padronizava tudo em uma única API agora quer streaming para a superfície ao vivo, processamento em lote para o registro e uma regra para definir qual áudio segue qual caminho — e essa regra é, ela própria, um problema de roteamento, o que é uma quantidade estranha de complexidade para cair no ciclo de lançamento de um único fornecedor.

Isso recai com mais força sobre o que fica acima da transcrição. Qualquer que seja a camada que produza o texto, esse texto é então resumido, classificado, expurgado e encaminhado, e essas etapas rodam em modelos de linguagem com seus próprios perfis de latência e custo — uma transcrição ao vivo quer um modelo rápido e barato; uma para arquivo pode se permitir um modelo mais forte. O OrcaRouter cobre exatamente essa camada: uma única API para mais de 200 modelos, preços de tabela dos provedores repassados com 0% de margem, failover automático e uma DSL de roteamento que escolhe um modelo por carga de trabalho, em vez de por pipeline. Nem o MAI-Transcribe-2-Streaming nem o MAI-Transcribe-2 estão nessa lista — ambos são servidos pela própria pilha de fala da Microsoft —, mas uma camada de transcrição de duas divisões é o argumento mais forte até agora para manter tudo o que está a jusante dela portátil.

O resumo honesto: streaming não é um MAI-Transcribe-2 melhor, é um segundo produto a um segundo preço. Compre-o para os minutos que realmente precisam ser em tempo real, deixe o resto no nível barato, e reserve orçamento para as duas tarifas serem reajustadas quando o período introdutório terminar.