
MAI-Transcribe-2 está no ar: a aposta de US$ 0,10 por hora da Microsoft para dominar a transcrição de fala
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
MAI-Transcribe-2 é o modelo em que a Microsoft AI aposta para transformar a transcrição de fala em texto em uma commodity, em vez de um recurso premium, e os números com que ele foi lançado foram projetados para reforçar esse argumento. Lançado em 3 de setembro de 2026 em pré-visualização pública no Microsoft Foundry, no MAI Playground e nas próprias superfícies de API da Microsoft, o MAI-Transcribe-2 é o terceiro modelo de fala da Microsoft em cinco meses — depois do MAI-Transcribe-1 em abril, a US$ 0,36 por hora de áudio, e do MAI-Transcribe-1.5 em junho — e o primeiro que supera todos os rivais gerenciados que cita nas duas métricas que as equipes realmente usam para decidir. No ranking de taxa de erro de palavras sem transmissão contínua da Artificial Analysis, ele ocupa o segundo lugar com 2,0% de AA-WER e, com aproximadamente 411× o tempo real, também o segundo, o que, em conjunto, o coloca na fronteira de Pareto de precisão e velocidade: nesse ranking, nenhum modelo é ao mesmo tempo mais preciso e mais rápido. O preço de lançamento é cerca de 72% menor que o do próprio antecessor.
O "modelo de reconhecimento de fala mais rápido, preciso e barato do mundo" é o próprio título da Microsoft para o lançamento, e merece ser lido com os asteriscos do material de origem anexados. Esta é a história do lançamento como realmente aconteceu, com as alegações do fornecedor rotuladas e as partes que ainda precisam de comprovação separadas.
O que a Microsoft realmente lançou
MAI-Transcribe-2 é um modelo de transcrição pré-gravado e orientado a lotes, projetado especificamente para áudio de formato longo — reuniões, chamadas, arquivos de mídia e gravações de contact centers. A Microsoft o posiciona exatamente para as cargas de trabalho em que a taxa de transferência e o custo por minuto são predominantes. Ele transcreve em 60 idiomas com identificação automática do idioma, inclui diarização de falantes que atribui as palavras à pessoa correta, retorna timestamps em nível de palavra e oferece suporte a ajuste de palavras-chave para nomes, abreviações e terminologia de domínio. Dois estilos de transcrição configuráveis cobrem a divisão usual: "verbatim", que mantém hesitações e falsos inícios para transcrições em conformidade regulatória, e "clean", que remove disfluências para legendas e notas. A Microsoft também destaca a alternância de código em discursos multilíngues, como Hinglish e Spanglish, e a robustez em áudio ruidoso do mundo real.

A história da disponibilidade importa tanto quanto a lista de recursos. A Microsoft não está restringindo isso por trás de sua pilha de fala empresarial: o modelo pode ser demonstrado hoje no MAI Playground e servido por meio do Microsoft Foundry em pré-visualização pública, com a documentação do Foundry sob o serviço Azure AI Speech. Essa é uma escolha deliberada de distribuição — colocar o modelo de fronteira onde um desenvolvedor pode acessá-lo com uma chave, e não onde um ciclo de vendas empresarial precisa aprová-lo primeiro. A Microsoft não publicou os pesos, e nada no material de lançamento sugere que o fará.
Lendo a manchete literalmente.
"O mais rápido, o mais preciso e o mais barato do mundo" são três afirmações de diferentes forças, e o próprio post de lançamento rebaixa silenciosamente duas delas. A versão honesta de cada uma:
• Acurácia — No ranking da Artificial Analysis, o MAI-Transcribe-2 fica em segundo lugar com 2,0% de AA-WER, não em primeiro; o próprio texto da Microsoft diz segundo. A frase "mais preciso" só se sustenta se for lida como "entre as APIs de lote gerenciadas que se enquadram nesse nível", e mesmo assim é uma afirmação sobre um modelo com quatro dias de existência, não uma coroa consolidada. A Microsoft relata separadamente que ele fica em primeiro no benchmark multilíngue FLEURS, com média de 5,2% de WER em seus 60 idiomas — esse número vem do post de lançamento da Microsoft, ainda não recalculado de forma independente por idioma.
• Velocidade — De acordo com a Artificial Analysis, o MAI-Transcribe-2 opera a aproximadamente 411× o tempo real, ficando em segundo lugar nesse ranking. Curiosamente, o anúncio da própria Microsoft nunca exibe o número absoluto; em vez disso, ele destaca multiplicadores relativos mais amigáveis — “processamento até 10× mais rápido que os principais concorrentes, especialmente para áudio de longa duração” — e especificamente 10× mais rápido que o GPT-Transcribe da OpenAI, 7× mais rápido que o Scribe v2 da ElevenLabs e 5× mais rápido que o Gemini 3.5 Transcribe. Essas proporções são a forma como a Microsoft enquadra os mesmos dados da Artificial Analysis, e as taxas base importam: “5× mais rápido que o Gemini 3.5 Transcribe” parece uma diferença modesta até você convertê-la em minutos de computação por hora de áudio.
• Mais barato — Verdadeiro apenas dentro de dois limites que a Microsoft declara claramente. A tarifa de $0,10 é uma "oferta por tempo limitado até o final do ano", e nenhum preço padrão pós-promoção é divulgado em lugar algum no material de lançamento. E é o mais barato entre APIs gerenciadas de alta precisão; um modelo aberto auto-hospedado como o Whisper Large v3 Turbo ainda transcreve, na prática, pelo custo da eletricidade. O argumento de commodity é real — ele é apenas mais restrito do que o título sugere.

O que $1,67 por 1.000 minutos compra
Com o preço de US$ 0,10 por hora de áudio, o MAI-Transcribe-2 custa cerca de US$ 1,67 por 1.000 minutos de áudio. A comparação que faz o número ganhar sentido é com as outras APIs de transcrição gerenciadas que competem em precisão. O GPT-Transcribe custa US$ 4,50 por 1.000 minutos; a camada de pré-gravação do Gemini 3.5 Transcribe equivale a cerca de US$ 5 por 1.000 minutos no modelo de preços por tokens do Google; o Scribe v2 da ElevenLabs custa ainda mais caro. Em 1.000 horas de áudio por mês — uma carga de trabalho séria, mas não enorme, de contact center ou mídia — a diferença entre o MAI-Transcribe-2 no preço promocional e o GPT-Transcribe no preço de tabela é de cerca de US$ 170 por mês, todo mês, antes de qualquer diferença de precisão. Essa é a diferença de preço que faz a transcrição deixar de ser um item que as equipes otimizam e passar a ser um item que elas ignoram.
Duas ressalvas devem ser ditas no mesmo fôlego. Primeiro, {{1}}um preço promocional é um experimento de precificação até deixar de ser: equipes que constroem um produto sobre a tarifa de US$ 0,10 devem saber que a tarifa padrão não é divulgada, e o número honesto para planejar um orçamento de 2027 está em algum ponto entre a oferta de lançamento e o que a Microsoft definir quando a oferta expirar.{{/1}} Segundo, {{2}}“mais barato neste nível de precisão” não diz nada sobre o custo total de propriedade — o modelo é exclusivamente via API, portanto a comparação que importa para equipes de alto volume é US$ 1,67 por 1.000 minutos contra o custo completo de operar sua própria stack de modelos de pesos abertos, e não apenas contra outras APIs.{{/2}}
Comprimido em um placar, a posição de lançamento fica assim — cada figura abaixo carrega o rótulo de fonte associado a ela no corpo acima.

O que ainda não foi provado
Por mais específicas que sejam as afirmações do lançamento, três coisas estão genuinamente em aberto. A primeira é o streaming: o MAI-Transcribe-2 é um modelo em lote, a história de velocidade da Microsoft é sobre throughput de arquivos, e nenhum SKU em tempo real foi anunciado ou demonstrado — o “411×” não é um número de latência de transcrição ao vivo. A segunda é a qualidade da diarização: a atribuição de locutores vem incluída no pacote, mas a Microsoft não publica nenhuma taxa de erro de diarização, e esse é o recurso com maior probabilidade de se sair pior em testes independentes do que a WER. A terceira é o detalhamento multilíngue: uma única média de 60 idiomas no FLEURS pode esconder uma ampla variação entre idiomas, e a Microsoft não publicou a tabela por idioma. Cada uma delas é um motivo pelo qual a história não está encerrada no quarto dia.
Onde isso deixa sua stack de transcrição
Nada disso exige escolher o MAI-Transcribe-2 hoje, o que é exatamente o motivo pelo qual o preço merece atenção de equipes que não estão à procura de um novo fornecedor. A conversão de fala em texto raramente é o fim de um pipeline — as transcrições são resumidas, transformadas em ações, pesquisadas e roteadas, e é nessa camada posterior que uma configuração multi-modelo se justifica. Uma plataforma como a OrcaRouter existe para essa metade da pilha: uma única API para mais de 200 modelos, preços de tabela dos provedores repassados com margem de 0%, failover automático e um DSL de roteamento que permite que uma transcrição alimente um modelo diferente por carga de trabalho — atas de reunião para um resumidor, revisão de conformidade para outro — sem uma segunda integração. O próprio MAI-Transcribe-2 não está hoje nessa relação; ele vive na API própria da Microsoft e nas plataformas de terceiros que a Microsoft lista. Mas o preço de commodity que ele acabou de definir é o melhor argumento até agora para construir a parte acima da transcrição de forma agnóstica em relação ao modelo.
O preço de lançamento é o que tudo revela. A Microsoft não está tentando vencer no reconhecimento de fala apenas com recursos — está tentando tornar a alta precisão tão barata que a categoria deixa de ser um item de despesa. O MAI-Transcribe-2 merece a atenção que está recebendo; basta ler "o mais rápido, mais preciso e mais barato do mundo" com os três asteriscos anexados: segundo lugar em AA-WER, preço promocional até o fim do ano e uma história de streaming que ainda não foi contada.
