
MAI-Transcribe-2 vs Muse Voice Transcribe: na mesma semana, duas apostas opostas em áudio
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0455Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0247Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0247Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0157Inteligência82Código
- AlibabaNOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.3 Flash2026-08-2646Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1849Inteligência75Código
- obsidianQwen3.8 27B2026-08-1541Inteligência68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1251Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0547Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0347Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2140Inteligência69Código
A semana de 1º de setembro de 2026 produziu dois modelos de fala de dois laboratórios de ponta, e MAI-Transcribe-2 e Muse Voice Transcribe são melhor compreendidos como respostas opostas à pergunta sobre onde a inteligência de áudio deve viver. Muse Voice Transcribe, lançado pela Meta Superintelligence Labs em 1º de setembro, é um modelo de percepção de áudio em tempo real: transcreve, separa mais de vinte falantes e detecta quando um falante terminou de falar, tudo em uma única passagem de streaming sobre blocos de 80 milissegundos de áudio ao vivo, e lidera o ranking de fala-para-texto em streaming em que foi avaliado. MAI-Transcribe-2, lançado pela Microsoft dois dias depois, em 3 de setembro, é a aposta oposta: um mecanismo em lote que não busca latência ao vivo de forma alguma e, em vez disso, concentra tudo em transcrever arquivos pré-gravados com a melhor taxa de erro de palavras no ranking independente não-streaming, cerca de 411× o tempo real, por aproximadamente US$ 1,67 por 1.000 minutos. Compará-los frente a frente como “modelos de transcrição” esconde a decisão real, que diz respeito ao momento na vida do áudio em que você precisa das palavras: enquanto ele está acontecendo ou depois que ele termina.
Dois produtos apontados em momentos diferentes.
O Muse Voice Transcribe foi criado para o momento em que o áudio ainda está acontecendo. É um modelo multimodal autorregressivo da família Muse da Meta que combina três tarefas em uma única passada: reconhecimento automático de fala, diarização de falantes para mais de vinte pessoas e endpointing — a detecção de que um falante parou de falar para que o sistema possa responder. A Meta informa que a transcrição final chega cerca de 0,16 segundo depois que o falante para, com uma taxa de erro de palavras de 3,1% nas transcrições finais e de 3,6% nas primeiras parciais — números publicados pela Meta no dia do lançamento, citando o ranking de streaming da Artificial Analysis, e que não haviam sido reproduzidos de forma independente até o momento em que este texto foi escrito. Ele lida com áudio de mais de uma hora em um único fluxo, troca de idioma no meio da frase e foi treinado com mais de 70 idiomas, dos quais 25 foram extensivamente verificados no lançamento. Seu preço é de US$ 3,00 por 1.000 minutos de áudio, cerca de US$ 0,18 por hora, por meio da Meta Model API. A Meta confirmou que os pesos não serão abertos.
O MAI-Transcribe-2 foi criado para o momento em que o áudio já é um arquivo. O modelo da Microsoft mede 2,0% de AA-WER no leaderboard de não streaming da Artificial Analysis — segundo lugar, e o melhor número entre as APIs de lote gerenciadas — e roda a aproximadamente 411× o tempo real, o que é uma medida de vazão, não uma promessa de latência. Ele transcreve em 60 idiomas com identificação automática de idioma, oferece diarização de falantes, timestamps no nível da palavra, ajuste de palavras-chave (keyword biasing) e estilos verbatim versus limpo (clean), e lida com alternância de código, como Hinglish e Spanglish. Ele está disponível por meio do Microsoft Foundry em preview público e no MAI Playground a US$ 0,10 por hora de áudio como uma oferta de lançamento por tempo limitado até o final do ano, sem produto de streaming anunciado. O post de lançamento da Microsoft o posiciona explicitamente para áudio de longa duração e em lote — os workloads nos quais a baixa latência de um modelo de streaming é inútil, mas o custo por minuto não é.

Por que os dois números de acurácia não se contradizem?
O instinto natural é comparar 2.0% a 3.1% e declarar um vencedor, e isso seria duplamente errado. Primeiro, os números medem tarefas diferentes: os 2.0% do MAI-Transcribe-2 são precisão sem streaming em áudio pré-gravado, onde o modelo pode examinar o arquivo inteiro; os 3.1% do Muse Voice Transcribe são precisão com streaming em transcrições finais, produzidas sob a restrição de transcrever à medida que o áudio chega. O streaming é o problema mais difícil, e é por isso que o ranking de streaming e o ranking sem streaming são rankings separados, com pontuações separadas. Segundo, os rótulos têm pesos diferentes: o valor do MAI-Transcribe-2 é uma medição da Artificial Analysis sobre o modelo, enquanto o do Muse Voice Transcribe é o relatório do dia de lançamento da Meta sobre o que a Artificial Analysis mediu — relatado pelo fornecedor e não reproduzido. A afirmação honesta é que ambos os modelos são alegações credíveis no topo dos seus respectivos rankings, e nenhum dos dois números diz nada sobre a outra modalidade.
É na diarização que a comparação realmente se define, porque é o único recurso que ambos os produtos oferecem e aquele em que suas ambições visivelmente diferem. O Muse Voice Transcribe separa mais de vinte falantes como capacidade central de streaming, com a Meta relatando uma taxa média de erro de diarização de falantes de 17,5% contra uma faixa concorrente que cita de 21,1% a 28,6% — novamente, informação da Meta e não verificada. O MAI-Transcribe-2 também inclui diarização, mas a Microsoft não publica nenhum limite de falantes nem qualquer taxa de erro de diarização. Para uma chamada entre duas partes, ambos os produtos são adequados e a diferença é irrelevante. Para um grupo focal de doze pessoas ou uma gravação de painel, o Muse Voice Transcribe é o único dos dois cujo limite de múltiplos falantes é sequer declarado, e a diarização não medida do MAI-Transcribe-2 é o maior motivo isolado para testá-lo antes de confiar a ele seus áudios mais difíceis.
A comparação de preços que faz sentido
Em termos de preço, os dois estão mais próximos do que o enquadramento lote-versus-streaming sugere, porque US$ 1,67 por 1.000 minutos (MAI-Transcribe-2, early-bird) e US$ 3,00 por 1.000 minutos (Muse Voice Transcribe) estão ambos no extremo barato do reconhecimento de fala gerenciado. A comparação só faz sentido dentro de uma mesma categoria. Para transcrição em lote de áudio pré-gravado, o MAI-Transcribe-2 custa menos da metade do preço do modelo nativo de streaming, ao mesmo tempo em que apresenta o melhor WER não streaming — mas você só rotearia arquivos gravados para o Muse Voice Transcribe se quisesse especificamente o pipeline de streaming dele, que não é a forma eficiente de processar um arquivo. Para áudio de reuniões ao vivo, o Muse Voice Transcribe é o único produto neste artigo que funciona de fato, e sua tarifa de US$ 3,00 fica abaixo das outras APIs de transcrição em tempo real contra as quais ele foi lançado — Gemini 3.5 Transcribe Live a cerca de US$ 9 por 1.000 minutos, GPT Live Transcribe a US$ 17 — além de adicionar diarização de mais de vinte falantes, algo que esses produtos não oferecem. A manchete honesta sobre preço é que a Meta definiu o preço do streaming baixo e a Microsoft definiu o preço do lote ainda mais baixo, e ambos os valores são preços de era promocional que vão mudar assim que cada fornecedor definir sua tarifa padrão.

Qual deles para qual áudio
Se o seu áudio é ao vivo — reuniões transcritas em tempo real, agentes de voz, legendagem ao vivo, qualquer situação em que as palavras sejam necessárias enquanto estão sendo faladas — o Muse Voice Transcribe é a escolha, e não é nem de perto. É o único modelo de streaming aqui, separa mais de vinte falantes na mesma passada, e foi precificado para vencer nesse segmento desde o primeiro dia. Seus pontos fracos são aqueles a levar em conta na avaliação: os índices de precisão e diarização são informados pela Meta, e um modelo de streaming com uma semana de vida ainda não mostrou como se comporta com o áudio caótico que existe fora dos benchmarks de lançamento.
Se o seu áudio já está em arquivos — arquivos mortos, gravações de chamadas, bibliotecas de mídia, qualquer coisa processada em massa — o MAI-Transcribe-2 é a melhor opção em todos os eixos que importam: WER medido mais baixo, aproximadamente uma ordem de grandeza a mais de throughput e um preço por 1.000 minutos abaixo do modelo de streaming. Seus riscos são a imagem espelhada dos do Muse: quatro dias de existência, sem SKU de streaming, qualidade de diarização não medida e uma tarifa de lançamento com um preço padrão não divulgado por trás.
A página de lançamento da Microsoft que apresenta o MAI-Transcribe-2 lista recursos que a Microsoft oferece em conjunto e que o rival de streaming não oferece no mesmo pacote, sendo o documento a consultar ao decidir quais alegações são superfície do produto e quais ainda são promessas de benchmark.

E se a transcrição é apenas a primeira metade do seu pipeline, a escolha entre esses dois importa menos do que a escolha que você faz acima deles. Áudio de reunião ao vivo transcrito pelo Muse Voice Transcribe ainda precisa de sumarização, extração de itens de ação e elaboração de acompanhamento antes de ser útil; chamadas arquivadas transcritas pelo MAI-Transcribe-2 ainda precisam ser pesquisadas, redigidas ou roteadas para o sistema downstream correto. É nessa camada que uma plataforma multimodelo ganha seu sustento — a API única do OrcaRouter em mais de 200 modelos, com preços de lista do provedor repassados com margem de 0%, permite que esse trabalho downstream chame um modelo diferente por carga de trabalho em uma única integração, então, qualquer que seja o modelo de fala que vença seu piloto, a pilha acima da transcrição não precisa ser reconstruída para mudar. Nem o Muse Voice Transcribe nem o MAI-Transcribe-2 estão nessa lista hoje; ambos vivem nas APIs próprias de seus fornecedores. A aposta que esta semana realmente resolveu é mais restrita e mais útil: a transcrição em tempo real e em lote acabaram de se tornar baratas o suficiente para que o diferencial não sejam mais as palavras — é o que você faz com elas.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
