Card principal de artigo com o título 'MAI-Transcribe-2 vs Muse Voice Transcribe', com o selo 'COMPARAÇÃO DE MODELOS' e o subtítulo 'Na mesma semana, duas apostas opostas em áudio', com chips comparando lote com 2,0% AA-WER versus streaming com 3,1%, US$ 1,67 versus US$ 3,00 por 1.000 minutos e 60 idiomas/lote versus 20+ falantes/tempo real, sobre um gradiente de branco para azul com o logotipo da OrcaRouter no canto inferior direito.
Guides & Insights

MAI-Transcribe-2 vs Muse Voice Transcribe: na mesma semana, duas apostas opostas em áudio

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A semana de 1º de setembro de 2026 produziu dois modelos de fala de dois laboratórios de ponta, e MAI-Transcribe-2 e Muse Voice Transcribe são melhor compreendidos como respostas opostas à pergunta sobre onde a inteligência de áudio deve viver. Muse Voice Transcribe, lançado pela Meta Superintelligence Labs em 1º de setembro, é um modelo de percepção de áudio em tempo real: transcreve, separa mais de vinte falantes e detecta quando um falante terminou de falar, tudo em uma única passagem de streaming sobre blocos de 80 milissegundos de áudio ao vivo, e lidera o ranking de fala-para-texto em streaming em que foi avaliado. MAI-Transcribe-2, lançado pela Microsoft dois dias depois, em 3 de setembro, é a aposta oposta: um mecanismo em lote que não busca latência ao vivo de forma alguma e, em vez disso, concentra tudo em transcrever arquivos pré-gravados com a melhor taxa de erro de palavras no ranking independente não-streaming, cerca de 411× o tempo real, por aproximadamente US$ 1,67 por 1.000 minutos. Compará-los frente a frente como “modelos de transcrição” esconde a decisão real, que diz respeito ao momento na vida do áudio em que você precisa das palavras: enquanto ele está acontecendo ou depois que ele termina.

Dois produtos apontados em momentos diferentes.

O Muse Voice Transcribe foi criado para o momento em que o áudio ainda está acontecendo. É um modelo multimodal autorregressivo da família Muse da Meta que combina três tarefas em uma única passada: reconhecimento automático de fala, diarização de falantes para mais de vinte pessoas e endpointing — a detecção de que um falante parou de falar para que o sistema possa responder. A Meta informa que a transcrição final chega cerca de 0,16 segundo depois que o falante para, com uma taxa de erro de palavras de 3,1% nas transcrições finais e de 3,6% nas primeiras parciais — números publicados pela Meta no dia do lançamento, citando o ranking de streaming da Artificial Analysis, e que não haviam sido reproduzidos de forma independente até o momento em que este texto foi escrito. Ele lida com áudio de mais de uma hora em um único fluxo, troca de idioma no meio da frase e foi treinado com mais de 70 idiomas, dos quais 25 foram extensivamente verificados no lançamento. Seu preço é de US$ 3,00 por 1.000 minutos de áudio, cerca de US$ 0,18 por hora, por meio da Meta Model API. A Meta confirmou que os pesos não serão abertos.

O MAI-Transcribe-2 foi criado para o momento em que o áudio já é um arquivo. O modelo da Microsoft mede 2,0% de AA-WER no leaderboard de não streaming da Artificial Analysis — segundo lugar, e o melhor número entre as APIs de lote gerenciadas — e roda a aproximadamente 411× o tempo real, o que é uma medida de vazão, não uma promessa de latência. Ele transcreve em 60 idiomas com identificação automática de idioma, oferece diarização de falantes, timestamps no nível da palavra, ajuste de palavras-chave (keyword biasing) e estilos verbatim versus limpo (clean), e lida com alternância de código, como Hinglish e Spanglish. Ele está disponível por meio do Microsoft Foundry em preview público e no MAI Playground a US$ 0,10 por hora de áudio como uma oferta de lançamento por tempo limitado até o final do ano, sem produto de streaming anunciado. O post de lançamento da Microsoft o posiciona explicitamente para áudio de longa duração e em lote — os workloads nos quais a baixa latência de um modelo de streaming é inútil, mas o custo por minuto não é.

A two-column scoreboard titled 'MAI-Transcribe-2 vs Muse Voice Transcribe — the scoreboard': left column MAI-Transcribe-2 lists batch pre-recorded type, 2.0% AA-WER (non-streaming), ~411x real time, $1.67 early-bird per 1,000 minutes, 60 languages and bundled diarization with unpublished rate; right column Muse Voice Transcribe lists streaming real-time type, 3.1% streaming WER (Meta-reported), final latency ~0.16s, $3.00 per 1,000 minutes, 25 verified of 70+ languages and 20+ speaker in-stream diarization; footer notes the WER figures are not comparable and Muse figures are Meta-reported.

Por que os dois números de acurácia não se contradizem?

O instinto natural é comparar 2.0% a 3.1% e declarar um vencedor, e isso seria duplamente errado. Primeiro, os números medem tarefas diferentes: os 2.0% do MAI-Transcribe-2 são precisão sem streaming em áudio pré-gravado, onde o modelo pode examinar o arquivo inteiro; os 3.1% do Muse Voice Transcribe são precisão com streaming em transcrições finais, produzidas sob a restrição de transcrever à medida que o áudio chega. O streaming é o problema mais difícil, e é por isso que o ranking de streaming e o ranking sem streaming são rankings separados, com pontuações separadas. Segundo, os rótulos têm pesos diferentes: o valor do MAI-Transcribe-2 é uma medição da Artificial Analysis sobre o modelo, enquanto o do Muse Voice Transcribe é o relatório do dia de lançamento da Meta sobre o que a Artificial Analysis mediu — relatado pelo fornecedor e não reproduzido. A afirmação honesta é que ambos os modelos são alegações credíveis no topo dos seus respectivos rankings, e nenhum dos dois números diz nada sobre a outra modalidade.

É na diarização que a comparação realmente se define, porque é o único recurso que ambos os produtos oferecem e aquele em que suas ambições visivelmente diferem. O Muse Voice Transcribe separa mais de vinte falantes como capacidade central de streaming, com a Meta relatando uma taxa média de erro de diarização de falantes de 17,5% contra uma faixa concorrente que cita de 21,1% a 28,6% — novamente, informação da Meta e não verificada. O MAI-Transcribe-2 também inclui diarização, mas a Microsoft não publica nenhum limite de falantes nem qualquer taxa de erro de diarização. Para uma chamada entre duas partes, ambos os produtos são adequados e a diferença é irrelevante. Para um grupo focal de doze pessoas ou uma gravação de painel, o Muse Voice Transcribe é o único dos dois cujo limite de múltiplos falantes é sequer declarado, e a diarização não medida do MAI-Transcribe-2 é o maior motivo isolado para testá-lo antes de confiar a ele seus áudios mais difíceis.

A comparação de preços que faz sentido

Em termos de preço, os dois estão mais próximos do que o enquadramento lote-versus-streaming sugere, porque US$ 1,67 por 1.000 minutos (MAI-Transcribe-2, early-bird) e US$ 3,00 por 1.000 minutos (Muse Voice Transcribe) estão ambos no extremo barato do reconhecimento de fala gerenciado. A comparação só faz sentido dentro de uma mesma categoria. Para transcrição em lote de áudio pré-gravado, o MAI-Transcribe-2 custa menos da metade do preço do modelo nativo de streaming, ao mesmo tempo em que apresenta o melhor WER não streaming — mas você só rotearia arquivos gravados para o Muse Voice Transcribe se quisesse especificamente o pipeline de streaming dele, que não é a forma eficiente de processar um arquivo. Para áudio de reuniões ao vivo, o Muse Voice Transcribe é o único produto neste artigo que funciona de fato, e sua tarifa de US$ 3,00 fica abaixo das outras APIs de transcrição em tempo real contra as quais ele foi lançado — Gemini 3.5 Transcribe Live a cerca de US$ 9 por 1.000 minutos, GPT Live Transcribe a US$ 17 — além de adicionar diarização de mais de vinte falantes, algo que esses produtos não oferecem. A manchete honesta sobre preço é que a Meta definiu o preço do streaming baixo e a Microsoft definiu o preço do lote ainda mais baixo, e ambos os valores são preços de era promocional que vão mudar assim que cada fornecedor definir sua tarifa padrão.

Screenshot of the Artificial Analysis Speech-to-Text leaderboard summary table showing Word Error Rate and Median Speed Factor columns for models including MAI-Transcribe-2 and MAI-Transcribe-1.5 under Microsoft AI, alongside rows for ElevenLabs Scribe v2 and Gemini 3.5 Transcribe.

Qual deles para qual áudio

Se o seu áudio é ao vivo — reuniões transcritas em tempo real, agentes de voz, legendagem ao vivo, qualquer situação em que as palavras sejam necessárias enquanto estão sendo faladas — o Muse Voice Transcribe é a escolha, e não é nem de perto. É o único modelo de streaming aqui, separa mais de vinte falantes na mesma passada, e foi precificado para vencer nesse segmento desde o primeiro dia. Seus pontos fracos são aqueles a levar em conta na avaliação: os índices de precisão e diarização são informados pela Meta, e um modelo de streaming com uma semana de vida ainda não mostrou como se comporta com o áudio caótico que existe fora dos benchmarks de lançamento.

Se o seu áudio já está em arquivos — arquivos mortos, gravações de chamadas, bibliotecas de mídia, qualquer coisa processada em massa — o MAI-Transcribe-2 é a melhor opção em todos os eixos que importam: WER medido mais baixo, aproximadamente uma ordem de grandeza a mais de throughput e um preço por 1.000 minutos abaixo do modelo de streaming. Seus riscos são a imagem espelhada dos do Muse: quatro dias de existência, sem SKU de streaming, qualidade de diarização não medida e uma tarifa de lançamento com um preço padrão não divulgado por trás.

A página de lançamento da Microsoft que apresenta o MAI-Transcribe-2 lista recursos que a Microsoft oferece em conjunto e que o rival de streaming não oferece no mesmo pacote, sendo o documento a consultar ao decidir quais alegações são superfície do produto e quais ainda são promessas de benchmark.

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2 (dated September 3, 2026), showing the headline 'MAI-Transcribe-2 is the fastest, most accurate and cheapest speech recognition model in the world' and the opening paragraph naming new features — diarization, configurable transcription styles, word-level timestamps — and comparisons against Gemini 3.5 Transcribe, GPT-Transcribe, Whisper V3-Large and Scribe V2.

E se a transcrição é apenas a primeira metade do seu pipeline, a escolha entre esses dois importa menos do que a escolha que você faz acima deles. Áudio de reunião ao vivo transcrito pelo Muse Voice Transcribe ainda precisa de sumarização, extração de itens de ação e elaboração de acompanhamento antes de ser útil; chamadas arquivadas transcritas pelo MAI-Transcribe-2 ainda precisam ser pesquisadas, redigidas ou roteadas para o sistema downstream correto. É nessa camada que uma plataforma multimodelo ganha seu sustento — a API única do OrcaRouter em mais de 200 modelos, com preços de lista do provedor repassados com margem de 0%, permite que esse trabalho downstream chame um modelo diferente por carga de trabalho em uma única integração, então, qualquer que seja o modelo de fala que vença seu piloto, a pilha acima da transcrição não precisa ser reconstruída para mudar. Nem o Muse Voice Transcribe nem o MAI-Transcribe-2 estão nessa lista hoje; ambos vivem nas APIs próprias de seus fornecedores. A aposta que esta semana realmente resolveu é mais restrita e mais útil: a transcrição em tempo real e em lote acabaram de se tornar baratas o suficiente para que o diferencial não sejam mais as palavras — é o que você faz com elas.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube