
MAI-Transcribe-2-Streaming já está no ar: Microsoft conquista a coroa da transcrição em streaming com 2,5% de WER
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 221 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
O MAI-Transcribe-2-Streaming é a resposta da Microsoft AI à única pergunta que seu lançamento de setembro deixou em aberto, e a Microsoft AI a respondeu em 28 dias. Lançado em 1º de outubro de 2026, o MAI-Transcribe-2-Streaming é um modelo de fala para texto em tempo real que transcreve à medida que as palavras chegam, em vez de depois que o arquivo termina. A Microsoft afirma que ele ocupa o primeiro lugar em precisão tanto em transcrições finais quanto parciais na avaliação AA-WER Streaming da Artificial Analysis, com taxa de erro de palavras de 2,5% e a transcrição final pronta 0,13 segundos após o fim da fala. Trata-se de uma alegação do fornecedor com base na metodologia de um rastreador, e não de uma linha que o rastreador publica — até o momento da redação, os 37 modelos do quadro não o incluem, e o modelo que ele deslocaria é o Grok Voice Transcribe 2.0 (Streaming), com 2,73% e 0,49 segundos. O modelo no qual ele se baseia, o MAI-Transcribe-2, foi lançado em 3 de setembro como um modelo em lote com 2,0% de WER e sem SKU em tempo real; a variante de streaming fecha essa lacuna sem abrir mão de grande parte da precisão que tornou a versão em lote notável. O que ele abre mão é do preço: o streaming custa 5,4× a tarifa do lote no lançamento.
O enquadramento que a Microsoft quer é um domínio total do ranking de streaming. O enquadramento que os números sustentam é mais restrito e mais interessante — um modelo que afirma liderar em precisão e latência ao mesmo tempo, numa fronteira em que a entrada mais precisa do ranking é quatro vezes mais lenta a estabilizar do que as suas mais rápidas e nenhuma dessas rápidas está abaixo de 3% de erro de palavra, com preço em paridade com o incumbente, em vez de abaixo dele. Aqui está o lançamento como aconteceu, com as alegações do fornecedor rotuladas.
O que a Microsoft lançou em 1º de outubro
O MAI-Transcribe-2-Streaming é disponibilizado por meio da stack de fala da Microsoft no serviço Azure AI Speech, com documentação sob o nome do próprio modelo e o mesmo modelo de distribuição apenas por API e sem pesos da versão em lote. Ele transcreve 60 idiomas com detecção automática e contínua de idioma, de modo que uma sessão que troca de idioma no meio do stream não precisa ser declarada com antecedência. A Microsoft o posiciona na fronteira de Pareto de precisão versus latência do gráfico de streaming da Artificial Analysis — a leitura do próprio fornecedor sobre os dados do tracker, e a leitura que o próprio gráfico do tracker sustenta.
O modelo de streaming não foi o lançamento completo. A Microsoft lançou dois modelos de voz junto com ele: o MAI-Voice-2.1, que abrange 23 idiomas em 26 localidades, e o MAI-Voice-2.1-Flash, que processa até 45 segundos de áudio com cerca de 150 ms de latência. Vistos em conjunto, o lançamento de 1º de outubro é uma pilha conversacional completa em tempo real — ouvir, entender, falar — e não o lançamento de um único modelo.

Lendo o placar de streaming
O AA-WER Streaming mede duas coisas por modelo: o quão incorreta está a transcrição finalizada e quanto tempo depois de o falante parar ela leva para terminar. A afirmação da Microsoft é que o MAI-Transcribe-2-Streaming lidera nos dois: taxa de erro de palavras de 2,5% na transcrição final a 0,13 segundos após o fim da fala, e os mesmos 2,5% na primeira transcrição parcial a 0,12 segundos, o que, segundo a Microsoft, é o primeiro lugar em precisão em ambos os casos. Leia isso como um número de fornecedor — no momento da redação, o próprio placar de streaming do tracker ainda não plotou o modelo, então não há nenhuma linha independente do MAI-Transcribe-2-Streaming para ler. O que o placar mostra é o campo que ele afirma superar, e o campo está mais próximo do que um enquadramento de "coroa" sugere:
• Grok Voice Transcribe 2.0 — WER de 2,73% no transcrito final a 0,49 segundos após o fim da fala, segundo a Artificial Analysis, e o atual líder do ranking. Isso fica 0,23 pontos atrás dos 2,5% alegados pela Microsoft e cerca de quatro vezes mais lento para se estabilizar — a diferença entre uma legenda que acompanha e uma que fica para trás.
• Muse Voice Transcribe — 3,06% em 0,16 segundos, segundo a Artificial Analysis. O concorrente mais próximo em latência: cerca de 30 milissegundos atrás, e 0,5 ponto pior em precisão do que a alegação da Microsoft.
• ElevenLabs Scribe v2 Realtime — 3,59% em 0,14 segundos, segundo a Artificial Analysis. Praticamente empatado em velocidade, mais de um ponto atrás em precisão.
• Gemini 3.5 Transcribe Live — WER de streaming de 4,00% em 0,40 segundos, o valor que a Artificial Analysis publicou e que o Google cita para seu próprio modelo Live API. Essa é uma diferença de 1,5 ponto, e é a comparação à qual este lançamento se dirige.
A coluna do primeiro parcial é onde a alegação é menos parecida com o resto do placar. No mesmo rastreador, os primeiros parciais do Grok Voice Transcribe 2.0 ficam em 3,36% e os do Gemini 3.5 Transcribe Live em 5,77% — espera-se que os parciais sejam piores que a transcrição final, muitas vezes em um ponto ou mais, porque o modelo está se comprometendo antes que a frase termine. Um primeiro parcial que corresponde ao número final é a parte genuinamente incomum do lançamento da Microsoft, e é a parte que os próprios dados do rastreador ainda não podem confirmar. Cite-o como uma alegação até que exista uma linha.
A ressalva honesta é que 0,13 segundo e 0,16 segundo são a mesma experiência de produto para um humano lendo legendas, e 2,5% contra os 2,73% que atualmente lideram o ranking equivale a cerca de 2 erros a cada 1.000 palavras. Uma vantagem desse tamanho é real, mas pequena, e se é uma vantagem que qualquer pessoa consegue sentir depende da carga de trabalho. Onde isso realmente pesa é na cauda: um fluxo de contact center operando oito horas por dia a 2,73% contra 2,5% significa dezenas de milhares de palavras erradas extras por ano, e erros de palavras em uma transcrição não são distribuídos de forma uniforme — eles se concentram exatamente nos nomes próprios e números que tornam uma transcrição útil.

O que se compra com US$ 9,00 por 1.000 minutos
O streaming custa mais do que o processamento em lote, e a Microsoft o precificou no topo da camada de tempo real, e não abaixo dela. O MAI-Transcribe-2-Streaming está listado a $0,54 por hora de áudio, o que equivale a $9,00 por 1.000 minutos de áudio em streaming, descrito como uma tarifa introdutória válida até o final do ano. Para comparação, o MAI-Transcribe-2 em lote custa $0,10 por hora de áudio — $1,67 por 1.000 minutos —, então a transcrição em tempo real custa aproximadamente 5,4× a tarifa baseada em arquivo para a mesma família subjacente e 0,5 ponto a mais de erro de palavra. Isso não é uma margem que a Microsoft está escondendo; é o preço honesto de uma conexão persistente e de uma transcrição parcial que precisa estar correta antes que a frase termine.
Em comparação com o resto do segmento de streaming, o panorama é misto. O MAI-Transcribe-2-Streaming empata com o Gemini 3.5 Transcribe Live a cerca de 9 dólares por 1.000 minutos — mais preciso, mesmo custo. Fica acima do ElevenLabs Scribe v2 Realtime e do Deepgram Flux, a cerca de 6,50 dólares por 1.000 minutos, acima do Cartesia Ink-2, a cerca de 4 dólares, e cerca de três vezes o Muse Voice Transcribe, a cerca de 3 dólares. Portanto, o lançamento é uma aposta em precisão e latência com preços equiparados, não uma guerra de preços; as equipes que já usam um modelo de streaming mais barato estarão trocando dólares por pontos de WER.
Esse trade-off vale a pena ser nomeado com precisão, porque é o mesmo trade-off que o lançamento em lote inverteu. Em setembro, a Microsoft tornou a precisão barata. Em outubro, fez a precisão em tempo real custar o mesmo que a de todos os outros. Se o seu pipeline só precisa das transcrições em algum momento, nada em 1º de outubro muda a sua fatura. Se ele precisa delas enquanto a chamada ainda está acontecendo, o cálculo acaba de migrar para a qualidade.

Construir sobre uma transcrição é a outra metade dessa decisão, e é aí que uma camada multi-modelo se justifica. Uma transcrição em tempo real raramente é o fim do pipeline — ela é resumida, pontuada, pesquisada, roteada e escalada, e essas etapas exigem modelos diferentes a custos diferentes. O OrcaRouter existe para essa camada: uma API para 200+ modelos, preços de tabela dos provedores repassados com 0% de markup, failover automático e uma DSL de roteamento que pode enviar uma transcrição ao vivo para um modelo para triagem de conformidade e outro para notas de reunião sem uma segunda integração. O próprio MAI-Transcribe-2-Streaming não está nessa lista — ele é servido pela pilha de fala da própria Microsoft —, mas a transcrição em streaming que ele produz é exatamente o tipo de entrada de alto volume e sensível à latência que justifica manter a camada acima dele agnóstica em relação ao modelo.
O que ainda não foi provado
Três coisas estão genuinamente em aberto. Primeiro, a diarização: o modelo em lote inclui a atribuição de locutor sem nenhuma taxa de erro de diarização publicada, e o material de streaming da Microsoft não faz nenhuma afirmação de diarização — para um modelo em tempo real que alimenta assistência ao agente ao vivo ou legendas, quem disse o quê costuma ser o recurso que importa mais do que o WER bruto. Segundo, o detalhamento multilíngue: 60 idiomas com detecção automática contínua de idioma é uma afirmação ampla, e a latência por idioma de um modelo de streaming pode variar muito mais do que a de seu equivalente em lote, porque a qualidade da transcrição parcial depende de quão rapidamente o modelo se compromete com um idioma. A Microsoft não publicou nenhuma tabela de streaming por idioma. Terceiro, o WER de streaming é medido em áudio de benchmark limpo; o modo de falha que prejudica implantações reais é um fluxo ruidoso de campo distante, e nenhuma comparação independente de streaming de campo distante existia no dia do lançamento.
Onde isso deixa a sua stack
O interessante deste lançamento não é a Microsoft ter a transcrição em streaming mais precisa. É a cadência: lote em setembro, streaming em outubro, na mesma família, na mesma superfície de documentação, com uma estrutura de preços que agora abrange de US$ 1,67 a US$ 9,00 por 1.000 minutos para a mesma capacidade subjacente. Isso dá às equipes uma escolha real pela primeira vez — pagar por tempo real apenas onde o tempo real importa, e processar em lote todo o resto —, mas também significa que a camada de transcrição agora é algo que você ajusta por carga de trabalho em vez de padronizar de uma vez.
Leia literalmente a afirmação da manchete e ela se sustenta como uma declaração de fornecedor: a Microsoft diz que o MAI-Transcribe-2-Streaming é o primeiro tanto na precisão do transcrito final quanto na do primeiro parcial, e que está na fronteira de Pareto. Os asteriscos são que o quadro do tracker ainda não plotou o modelo, a vantagem que ele reivindica sobre o líder atual é pequena o suficiente para desaparecer em uma nova execução, a vantagem de preço é zero, e a história da diarização ainda não foi contada. Essas são as coisas a observar, não a coroa.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
