Cartão hero do artigo com o texto 'MAI-Transcribe-2-Streaming está no ar' e o selo 'NOVO MODELO · MICROSOFT AI' e o subtítulo 'Microsoft conquista a coroa da transcrição em streaming com 2,5% de WER', com uma faixa de estatísticas mostrando uma taxa de erro de palavras em streaming de 2,5% a 0,13 s após o fim da fala, rotulada no cartão como alegação da Microsoft e inédita tanto para transcrições finais quanto parciais; 60 idiomas com detecção automática e contínua de idioma; e US$ 9,00 por 1.000 minutos, descrito como US$ 0,54 por hora de áudio, em caráter introdutório até 2026; sobre um gradiente de branco para azul, com o logotipo da OrcaRouter no canto inferior direito.
Guides & Insights

MAI-Transcribe-2-Streaming já está no ar: Microsoft conquista a coroa da transcrição em streaming com 2,5% de WER

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O MAI-Transcribe-2-Streaming é a resposta da Microsoft AI à única pergunta que seu lançamento de setembro deixou em aberto, e a Microsoft AI a respondeu em 28 dias. Lançado em 1º de outubro de 2026, o MAI-Transcribe-2-Streaming é um modelo de fala para texto em tempo real que transcreve à medida que as palavras chegam, em vez de depois que o arquivo termina. A Microsoft afirma que ele ocupa o primeiro lugar em precisão tanto em transcrições finais quanto parciais na avaliação AA-WER Streaming da Artificial Analysis, com taxa de erro de palavras de 2,5% e a transcrição final pronta 0,13 segundos após o fim da fala. Trata-se de uma alegação do fornecedor com base na metodologia de um rastreador, e não de uma linha que o rastreador publica — até o momento da redação, os 37 modelos do quadro não o incluem, e o modelo que ele deslocaria é o Grok Voice Transcribe 2.0 (Streaming), com 2,73% e 0,49 segundos. O modelo no qual ele se baseia, o MAI-Transcribe-2, foi lançado em 3 de setembro como um modelo em lote com 2,0% de WER e sem SKU em tempo real; a variante de streaming fecha essa lacuna sem abrir mão de grande parte da precisão que tornou a versão em lote notável. O que ele abre mão é do preço: o streaming custa 5,4× a tarifa do lote no lançamento.

O enquadramento que a Microsoft quer é um domínio total do ranking de streaming. O enquadramento que os números sustentam é mais restrito e mais interessante — um modelo que afirma liderar em precisão e latência ao mesmo tempo, numa fronteira em que a entrada mais precisa do ranking é quatro vezes mais lenta a estabilizar do que as suas mais rápidas e nenhuma dessas rápidas está abaixo de 3% de erro de palavra, com preço em paridade com o incumbente, em vez de abaixo dele. Aqui está o lançamento como aconteceu, com as alegações do fornecedor rotuladas.

O que a Microsoft lançou em 1º de outubro

O MAI-Transcribe-2-Streaming é disponibilizado por meio da stack de fala da Microsoft no serviço Azure AI Speech, com documentação sob o nome do próprio modelo e o mesmo modelo de distribuição apenas por API e sem pesos da versão em lote. Ele transcreve 60 idiomas com detecção automática e contínua de idioma, de modo que uma sessão que troca de idioma no meio do stream não precisa ser declarada com antecedência. A Microsoft o posiciona na fronteira de Pareto de precisão versus latência do gráfico de streaming da Artificial Analysis — a leitura do próprio fornecedor sobre os dados do tracker, e a leitura que o próprio gráfico do tracker sustenta.

O modelo de streaming não foi o lançamento completo. A Microsoft lançou dois modelos de voz junto com ele: o MAI-Voice-2.1, que abrange 23 idiomas em 26 localidades, e o MAI-Voice-2.1-Flash, que processa até 45 segundos de áudio com cerca de 150 ms de latência. Vistos em conjunto, o lançamento de 1º de outubro é uma pilha conversacional completa em tempo real — ouvir, entender, falar — e não o lançamento de um único modelo.

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2-Streaming dated October 1, 2026, headlined 'Our first streaming transcription model debuts at no. 1 on Artificial Analysis' and introducing the MAI-Transcribe and MAI-Voice models as accurate, fast and low cost, with the companion MAI-Voice-2.1 and MAI-Voice-2.1-Flash announcements from the same release.

Lendo o placar de streaming

O AA-WER Streaming mede duas coisas por modelo: o quão incorreta está a transcrição finalizada e quanto tempo depois de o falante parar ela leva para terminar. A afirmação da Microsoft é que o MAI-Transcribe-2-Streaming lidera nos dois: taxa de erro de palavras de 2,5% na transcrição final a 0,13 segundos após o fim da fala, e os mesmos 2,5% na primeira transcrição parcial a 0,12 segundos, o que, segundo a Microsoft, é o primeiro lugar em precisão em ambos os casos. Leia isso como um número de fornecedor — no momento da redação, o próprio placar de streaming do tracker ainda não plotou o modelo, então não há nenhuma linha independente do MAI-Transcribe-2-Streaming para ler. O que o placar mostra é o campo que ele afirma superar, e o campo está mais próximo do que um enquadramento de "coroa" sugere:

• Grok Voice Transcribe 2.0 — WER de 2,73% no transcrito final a 0,49 segundos após o fim da fala, segundo a Artificial Analysis, e o atual líder do ranking. Isso fica 0,23 pontos atrás dos 2,5% alegados pela Microsoft e cerca de quatro vezes mais lento para se estabilizar — a diferença entre uma legenda que acompanha e uma que fica para trás.

• Muse Voice Transcribe — 3,06% em 0,16 segundos, segundo a Artificial Analysis. O concorrente mais próximo em latência: cerca de 30 milissegundos atrás, e 0,5 ponto pior em precisão do que a alegação da Microsoft.

• ElevenLabs Scribe v2 Realtime — 3,59% em 0,14 segundos, segundo a Artificial Analysis. Praticamente empatado em velocidade, mais de um ponto atrás em precisão.

• Gemini 3.5 Transcribe Live — WER de streaming de 4,00% em 0,40 segundos, o valor que a Artificial Analysis publicou e que o Google cita para seu próprio modelo Live API. Essa é uma diferença de 1,5 ponto, e é a comparação à qual este lançamento se dirige.

A coluna do primeiro parcial é onde a alegação é menos parecida com o resto do placar. No mesmo rastreador, os primeiros parciais do Grok Voice Transcribe 2.0 ficam em 3,36% e os do Gemini 3.5 Transcribe Live em 5,77% — espera-se que os parciais sejam piores que a transcrição final, muitas vezes em um ponto ou mais, porque o modelo está se comprometendo antes que a frase termine. Um primeiro parcial que corresponde ao número final é a parte genuinamente incomum do lançamento da Microsoft, e é a parte que os próprios dados do rastreador ainda não podem confirmar. Cite-o como uma alegação até que exista uma linha.

A ressalva honesta é que 0,13 segundo e 0,16 segundo são a mesma experiência de produto para um humano lendo legendas, e 2,5% contra os 2,73% que atualmente lideram o ranking equivale a cerca de 2 erros a cada 1.000 palavras. Uma vantagem desse tamanho é real, mas pequena, e se é uma vantagem que qualquer pessoa consegue sentir depende da carga de trabalho. Onde isso realmente pesa é na cauda: um fluxo de contact center operando oito horas por dia a 2,73% contra 2,5% significa dezenas de milhares de palavras erradas extras por ano, e erros de palavras em uma transcrição não são distribuídos de forma uniforme — eles se concentram exatamente nos nomes próprios e números que tornam uma transcrição útil.

A generated comparison card titled 'The streaming field, by the numbers' with a left column for MAI-Transcribe-2-Streaming (final-transcript word error rate 2.5% flagged as Microsoft's claim, time to final transcript 0.13s after speech end, first-partial word error rate 2.5% at 0.12s flagged as claimed, $9.00 per 1,000 minutes introductory, 60 languages with automatic detection, and 'not yet plotted' for the tracker's board) and a right column headed 'The field it claims to beat' listing Grok Voice Transcribe 2.0 at 2.73% and 0.49s, Muse Voice Transcribe at 3.06% and 0.16s, ElevenLabs Scribe v2 Realtime at 3.59% and 0.14s, Qwen3 ASR Flash Realtime at 3.73% and 0.48s, Gemini 3.5 Transcribe Live at 4.00% and 0.40s, and a board size of 37 models, with a footer noting that Microsoft's figures are the vendor's own claim measured on Artificial Analysis's streaming methodology while the right-hand column is what Artificial Analysis currently publishes, all times being after detected end of speech, and the OrcaRouter logo bottom right.

O que se compra com US$ 9,00 por 1.000 minutos

O streaming custa mais do que o processamento em lote, e a Microsoft o precificou no topo da camada de tempo real, e não abaixo dela. O MAI-Transcribe-2-Streaming está listado a $0,54 por hora de áudio, o que equivale a $9,00 por 1.000 minutos de áudio em streaming, descrito como uma tarifa introdutória válida até o final do ano. Para comparação, o MAI-Transcribe-2 em lote custa $0,10 por hora de áudio — $1,67 por 1.000 minutos —, então a transcrição em tempo real custa aproximadamente 5,4× a tarifa baseada em arquivo para a mesma família subjacente e 0,5 ponto a mais de erro de palavra. Isso não é uma margem que a Microsoft está escondendo; é o preço honesto de uma conexão persistente e de uma transcrição parcial que precisa estar correta antes que a frase termine.

Em comparação com o resto do segmento de streaming, o panorama é misto. O MAI-Transcribe-2-Streaming empata com o Gemini 3.5 Transcribe Live a cerca de 9 dólares por 1.000 minutos — mais preciso, mesmo custo. Fica acima do ElevenLabs Scribe v2 Realtime e do Deepgram Flux, a cerca de 6,50 dólares por 1.000 minutos, acima do Cartesia Ink-2, a cerca de 4 dólares, e cerca de três vezes o Muse Voice Transcribe, a cerca de 3 dólares. Portanto, o lançamento é uma aposta em precisão e latência com preços equiparados, não uma guerra de preços; as equipes que já usam um modelo de streaming mais barato estarão trocando dólares por pontos de WER.

Esse trade-off vale a pena ser nomeado com precisão, porque é o mesmo trade-off que o lançamento em lote inverteu. Em setembro, a Microsoft tornou a precisão barata. Em outubro, fez a precisão em tempo real custar o mesmo que a de todos os outros. Se o seu pipeline só precisa das transcrições em algum momento, nada em 1º de outubro muda a sua fatura. Se ele precisa delas enquanto a chamada ainda está acontecendo, o cálculo acaba de migrar para a qualidade.

A single-column scoreboard card titled 'MAI-Transcribe-2-Streaming — the launch scoreboard' listing 2.5% final-transcript WER at 0.13s, 2.5% first-partial WER at 0.12s, an accuracy rank claimed at #1 for final and partial transcripts, tracker status 'not yet plotted on the 37-model board', $9.00 per 1,000 minutes ($0.54 per audio-hour) introductory through 2026, 60 languages with automatic continuous detection, no published diarization or word-level timestamp claim for the streaming SKU, and the batch sibling MAI-Transcribe-2 at 2.0% AA-WER, roughly 411x real time and $1.67 per 1,000 minutes, with the OrcaRouter logo bottom right.

Construir sobre uma transcrição é a outra metade dessa decisão, e é aí que uma camada multi-modelo se justifica. Uma transcrição em tempo real raramente é o fim do pipeline — ela é resumida, pontuada, pesquisada, roteada e escalada, e essas etapas exigem modelos diferentes a custos diferentes. O OrcaRouter existe para essa camada: uma API para 200+ modelos, preços de tabela dos provedores repassados com 0% de markup, failover automático e uma DSL de roteamento que pode enviar uma transcrição ao vivo para um modelo para triagem de conformidade e outro para notas de reunião sem uma segunda integração. O próprio MAI-Transcribe-2-Streaming não está nessa lista — ele é servido pela pilha de fala da própria Microsoft —, mas a transcrição em streaming que ele produz é exatamente o tipo de entrada de alto volume e sensível à latência que justifica manter a camada acima dele agnóstica em relação ao modelo.

O que ainda não foi provado

Três coisas estão genuinamente em aberto. Primeiro, a diarização: o modelo em lote inclui a atribuição de locutor sem nenhuma taxa de erro de diarização publicada, e o material de streaming da Microsoft não faz nenhuma afirmação de diarização — para um modelo em tempo real que alimenta assistência ao agente ao vivo ou legendas, quem disse o quê costuma ser o recurso que importa mais do que o WER bruto. Segundo, o detalhamento multilíngue: 60 idiomas com detecção automática contínua de idioma é uma afirmação ampla, e a latência por idioma de um modelo de streaming pode variar muito mais do que a de seu equivalente em lote, porque a qualidade da transcrição parcial depende de quão rapidamente o modelo se compromete com um idioma. A Microsoft não publicou nenhuma tabela de streaming por idioma. Terceiro, o WER de streaming é medido em áudio de benchmark limpo; o modo de falha que prejudica implantações reais é um fluxo ruidoso de campo distante, e nenhuma comparação independente de streaming de campo distante existia no dia do lançamento.

Onde isso deixa a sua stack

O interessante deste lançamento não é a Microsoft ter a transcrição em streaming mais precisa. É a cadência: lote em setembro, streaming em outubro, na mesma família, na mesma superfície de documentação, com uma estrutura de preços que agora abrange de US$ 1,67 a US$ 9,00 por 1.000 minutos para a mesma capacidade subjacente. Isso dá às equipes uma escolha real pela primeira vez — pagar por tempo real apenas onde o tempo real importa, e processar em lote todo o resto —, mas também significa que a camada de transcrição agora é algo que você ajusta por carga de trabalho em vez de padronizar de uma vez.

Leia literalmente a afirmação da manchete e ela se sustenta como uma declaração de fornecedor: a Microsoft diz que o MAI-Transcribe-2-Streaming é o primeiro tanto na precisão do transcrito final quanto na do primeiro parcial, e que está na fronteira de Pareto. Os asteriscos são que o quadro do tracker ainda não plotou o modelo, a vantagem que ele reivindica sobre o líder atual é pequena o suficiente para desaparecer em uma nova execução, a vantagem de preço é zero, e a história da diarização ainda não foi contada. Essas são as coisas a observar, não a coroa.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente