Cartão de destaque do artigo com o texto 'MAI-Transcribe-2 Is Live', com o selo 'NEWS · MICROSOFT AI' e o subtítulo 'A aposta da Microsoft de US$ 0,10 por hora para dominar a conversão de fala em texto', com uma faixa de estatísticas mostrando AA-WER 2,0% (#2 segundo a Artificial Analysis), velocidade ~411x em tempo real (#2) e um preço de lançamento de US$ 0,10 por hora, sobre um gradiente de branco para azul com o logotipo da OrcaRouter no canto inferior direito.
Guides & Insights

MAI-Transcribe-2 está no ar: a aposta de US$ 0,10 por hora da Microsoft para dominar a transcrição de fala

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

MAI-Transcribe-2 é o modelo em que a Microsoft AI aposta para transformar a transcrição de fala em texto em uma commodity, em vez de um recurso premium, e os números com que ele foi lançado foram projetados para reforçar esse argumento. Lançado em 3 de setembro de 2026 em pré-visualização pública no Microsoft Foundry, no MAI Playground e nas próprias superfícies de API da Microsoft, o MAI-Transcribe-2 é o terceiro modelo de fala da Microsoft em cinco meses — depois do MAI-Transcribe-1 em abril, a US$ 0,36 por hora de áudio, e do MAI-Transcribe-1.5 em junho — e o primeiro que supera todos os rivais gerenciados que cita nas duas métricas que as equipes realmente usam para decidir. No ranking de taxa de erro de palavras sem transmissão contínua da Artificial Analysis, ele ocupa o segundo lugar com 2,0% de AA-WER e, com aproximadamente 411× o tempo real, também o segundo, o que, em conjunto, o coloca na fronteira de Pareto de precisão e velocidade: nesse ranking, nenhum modelo é ao mesmo tempo mais preciso e mais rápido. O preço de lançamento é cerca de 72% menor que o do próprio antecessor.

O "modelo de reconhecimento de fala mais rápido, preciso e barato do mundo" é o próprio título da Microsoft para o lançamento, e merece ser lido com os asteriscos do material de origem anexados. Esta é a história do lançamento como realmente aconteceu, com as alegações do fornecedor rotuladas e as partes que ainda precisam de comprovação separadas.

O que a Microsoft realmente lançou

MAI-Transcribe-2 é um modelo de transcrição pré-gravado e orientado a lotes, projetado especificamente para áudio de formato longo — reuniões, chamadas, arquivos de mídia e gravações de contact centers. A Microsoft o posiciona exatamente para as cargas de trabalho em que a taxa de transferência e o custo por minuto são predominantes. Ele transcreve em 60 idiomas com identificação automática do idioma, inclui diarização de falantes que atribui as palavras à pessoa correta, retorna timestamps em nível de palavra e oferece suporte a ajuste de palavras-chave para nomes, abreviações e terminologia de domínio. Dois estilos de transcrição configuráveis cobrem a divisão usual: "verbatim", que mantém hesitações e falsos inícios para transcrições em conformidade regulatória, e "clean", que remove disfluências para legendas e notas. A Microsoft também destaca a alternância de código em discursos multilíngues, como Hinglish e Spanglish, e a robustez em áudio ruidoso do mundo real.

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2 (dated September 3, 2026), showing the headline 'MAI-Transcribe-2 is the fastest, most accurate and cheapest speech recognition model in the world' and the opening paragraph naming new features — diarization, configurable transcription styles, word-level timestamps — and comparisons against Gemini 3.5 Transcribe, GPT-Transcribe, Whisper V3-Large and Scribe V2.

A história da disponibilidade importa tanto quanto a lista de recursos. A Microsoft não está restringindo isso por trás de sua pilha de fala empresarial: o modelo pode ser demonstrado hoje no MAI Playground e servido por meio do Microsoft Foundry em pré-visualização pública, com a documentação do Foundry sob o serviço Azure AI Speech. Essa é uma escolha deliberada de distribuição — colocar o modelo de fronteira onde um desenvolvedor pode acessá-lo com uma chave, e não onde um ciclo de vendas empresarial precisa aprová-lo primeiro. A Microsoft não publicou os pesos, e nada no material de lançamento sugere que o fará.

Lendo a manchete literalmente.

"O mais rápido, o mais preciso e o mais barato do mundo" são três afirmações de diferentes forças, e o próprio post de lançamento rebaixa silenciosamente duas delas. A versão honesta de cada uma:

• Acurácia — No ranking da Artificial Analysis, o MAI-Transcribe-2 fica em segundo lugar com 2,0% de AA-WER, não em primeiro; o próprio texto da Microsoft diz segundo. A frase "mais preciso" só se sustenta se for lida como "entre as APIs de lote gerenciadas que se enquadram nesse nível", e mesmo assim é uma afirmação sobre um modelo com quatro dias de existência, não uma coroa consolidada. A Microsoft relata separadamente que ele fica em primeiro no benchmark multilíngue FLEURS, com média de 5,2% de WER em seus 60 idiomas — esse número vem do post de lançamento da Microsoft, ainda não recalculado de forma independente por idioma.

• Velocidade — De acordo com a Artificial Analysis, o MAI-Transcribe-2 opera a aproximadamente 411× o tempo real, ficando em segundo lugar nesse ranking. Curiosamente, o anúncio da própria Microsoft nunca exibe o número absoluto; em vez disso, ele destaca multiplicadores relativos mais amigáveis — “processamento até 10× mais rápido que os principais concorrentes, especialmente para áudio de longa duração” — e especificamente 10× mais rápido que o GPT-Transcribe da OpenAI, 7× mais rápido que o Scribe v2 da ElevenLabs e 5× mais rápido que o Gemini 3.5 Transcribe. Essas proporções são a forma como a Microsoft enquadra os mesmos dados da Artificial Analysis, e as taxas base importam: “5× mais rápido que o Gemini 3.5 Transcribe” parece uma diferença modesta até você convertê-la em minutos de computação por hora de áudio.

• Mais barato — Verdadeiro apenas dentro de dois limites que a Microsoft declara claramente. A tarifa de $0,10 é uma "oferta por tempo limitado até o final do ano", e nenhum preço padrão pós-promoção é divulgado em lugar algum no material de lançamento. E é o mais barato entre APIs gerenciadas de alta precisão; um modelo aberto auto-hospedado como o Whisper Large v3 Turbo ainda transcreve, na prática, pelo custo da eletricidade. O argumento de commodity é real — ele é apenas mais restrito do que o título sugere.

Screenshot of the Artificial Analysis Speech-to-Text leaderboard summary table showing Word Error Rate and Median Speed Factor columns for models including MAI-Transcribe-2 and MAI-Transcribe-1.5 under Microsoft AI, alongside rows for ElevenLabs Scribe v2 and Gemini 3.5 Transcribe.

O que $1,67 por 1.000 minutos compra

Com o preço de US$ 0,10 por hora de áudio, o MAI-Transcribe-2 custa cerca de US$ 1,67 por 1.000 minutos de áudio. A comparação que faz o número ganhar sentido é com as outras APIs de transcrição gerenciadas que competem em precisão. O GPT-Transcribe custa US$ 4,50 por 1.000 minutos; a camada de pré-gravação do Gemini 3.5 Transcribe equivale a cerca de US$ 5 por 1.000 minutos no modelo de preços por tokens do Google; o Scribe v2 da ElevenLabs custa ainda mais caro. Em 1.000 horas de áudio por mês — uma carga de trabalho séria, mas não enorme, de contact center ou mídia — a diferença entre o MAI-Transcribe-2 no preço promocional e o GPT-Transcribe no preço de tabela é de cerca de US$ 170 por mês, todo mês, antes de qualquer diferença de precisão. Essa é a diferença de preço que faz a transcrição deixar de ser um item que as equipes otimizam e passar a ser um item que elas ignoram.

Duas ressalvas devem ser ditas no mesmo fôlego. Primeiro, {{1}}um preço promocional é um experimento de precificação até deixar de ser: equipes que constroem um produto sobre a tarifa de US$ 0,10 devem saber que a tarifa padrão não é divulgada, e o número honesto para planejar um orçamento de 2027 está em algum ponto entre a oferta de lançamento e o que a Microsoft definir quando a oferta expirar.{{/1}} Segundo, {{2}}“mais barato neste nível de precisão” não diz nada sobre o custo total de propriedade — o modelo é exclusivamente via API, portanto a comparação que importa para equipes de alto volume é US$ 1,67 por 1.000 minutos contra o custo completo de operar sua própria stack de modelos de pesos abertos, e não apenas contra outras APIs.{{/2}}

Comprimido em um placar, a posição de lançamento fica assim — cada figura abaixo carrega o rótulo de fonte associado a ela no corpo acima.

A single-column scoreboard titled 'MAI-Transcribe-2 — the scoreboard' listing AA-WER 2.0% (#2 per Artificial Analysis), speed ~411x real time (#2), price $1.67 per 1,000 minutes early-bird through 2026, 60 languages with automatic language ID, bundled diarization with unpublished error rate, and no streaming SKU announced, with the OrcaRouter logo bottom right.

O que ainda não foi provado

Por mais específicas que sejam as afirmações do lançamento, três coisas estão genuinamente em aberto. A primeira é o streaming: o MAI-Transcribe-2 é um modelo em lote, a história de velocidade da Microsoft é sobre throughput de arquivos, e nenhum SKU em tempo real foi anunciado ou demonstrado — o “411×” não é um número de latência de transcrição ao vivo. A segunda é a qualidade da diarização: a atribuição de locutores vem incluída no pacote, mas a Microsoft não publica nenhuma taxa de erro de diarização, e esse é o recurso com maior probabilidade de se sair pior em testes independentes do que a WER. A terceira é o detalhamento multilíngue: uma única média de 60 idiomas no FLEURS pode esconder uma ampla variação entre idiomas, e a Microsoft não publicou a tabela por idioma. Cada uma delas é um motivo pelo qual a história não está encerrada no quarto dia.

Onde isso deixa sua stack de transcrição

Nada disso exige escolher o MAI-Transcribe-2 hoje, o que é exatamente o motivo pelo qual o preço merece atenção de equipes que não estão à procura de um novo fornecedor. A conversão de fala em texto raramente é o fim de um pipeline — as transcrições são resumidas, transformadas em ações, pesquisadas e roteadas, e é nessa camada posterior que uma configuração multi-modelo se justifica. Uma plataforma como a OrcaRouter existe para essa metade da pilha: uma única API para mais de 200 modelos, preços de tabela dos provedores repassados com margem de 0%, failover automático e um DSL de roteamento que permite que uma transcrição alimente um modelo diferente por carga de trabalho — atas de reunião para um resumidor, revisão de conformidade para outro — sem uma segunda integração. O próprio MAI-Transcribe-2 não está hoje nessa relação; ele vive na API própria da Microsoft e nas plataformas de terceiros que a Microsoft lista. Mas o preço de commodity que ele acabou de definir é o melhor argumento até agora para construir a parte acima da transcrição de forma agnóstica em relação ao modelo.

O preço de lançamento é o que tudo revela. A Microsoft não está tentando vencer no reconhecimento de fala apenas com recursos — está tentando tornar a alta precisão tão barata que a categoria deixa de ser um item de despesa. O MAI-Transcribe-2 merece a atenção que está recebendo; basta ler "o mais rápido, mais preciso e mais barato do mundo" com os três asteriscos anexados: segundo lugar em AA-WER, preço promocional até o fim do ano e uma história de streaming que ainda não foi contada.