Cartão de destaque do artigo 'MAI-Transcribe-2-Streaming vs Gemini 3.5 Transcribe Live' com o selo 'FRENTE A FRENTE · FALA PARA TEXTO EM STREAMING' e o subtítulo 'Mesmos US$ 9, troca diferente', com chips mostrando 2,5% alegado versus 4,00% auditado, 0,13s versus 0,40s até o final, 60 idiomas versus 85+, e nenhuma diarização publicada em nenhum dos dois, sobre um gradiente de branco para azul com o logotipo OrcaRouter no canto inferior direito.
Guides & Insights

MAI-Transcribe-2-Streaming vs Gemini 3.5 Transcribe Live: Mesmos US$ 9, troca diferente

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

MAI-Transcribe-2-Streaming e Gemini 3.5 Transcribe Live custam o mesmo e baseiam-se em teorias opostas sobre para que serve um transcritor em streaming. Ambos ficam em cerca de $9,00 por 1.000 minutos de áudio em streaming. O modelo da Microsoft, lançado em 1 de outubro de 2026, é um instrumento de precisão: uma taxa de erro de palavras em streaming declarada de 2,5% a 0,13 segundos até à transcrição final, em primeiro lugar em precisão tanto nas transcrições finais como nas parciais, segundo a própria Microsoft, medido com a metodologia de streaming da Artificial Analysis, mas ainda não representado como uma linha nesse quadro. O outro modelo, em pré-visualização pública desde 26 de agosto de 2026 e servido através da Live API, é um instrumento de cobertura: mais de 85 idiomas com troca a meio do fluxo, um nível gratuito, e uma taxa de erro de palavras em streaming de 4,00% a 0,40 segundos, o valor que a Artificial Analysis mede para ele. Nenhum dos dois é a escolha óbvia, e a razão é que não estão realmente a competir pela mesma carga de trabalho.

Eis o confronto direto conforme os números realmente aparecem — números divulgados pelo fornecedor rotulados, números do rastreador atribuídos, e as partes em que um modelo vence numa dimensão que o outro não disputa de forma alguma.

A versão de uma linha

• Precisão e latência — MAI-Transcribe-2-Streaming, com base nos números publicados. A Microsoft afirma 2,5% de WER em streaming, com 0,13 segundos até à transcrição final, em primeiro lugar na precisão tanto em transcrições finais como parciais, e 2,5% no primeiro parcial a 0,12 segundos. Em contrapartida, a Artificial Analysis coloca o Gemini 3.5 Transcribe Live em 4,00% a 0,40 segundos. A vantagem alegada pela Microsoft é de 1,5 pontos e de ser cerca de três vezes mais rápida a estabilizar. A ressalva é que o rastreador ainda não representou graficamente o próprio MAI-Transcribe-2-Streaming — o atual líder da tabela é o Grok Voice Transcribe 2.0, com 2,73% e 0,49 segundos, e o Muse Voice Transcribe, com 3,06% e 0,16 segundos —, por isso os 2,5% são um valor do fornecedor aferido face a um campo que o rastreador mede efetivamente. Não é uma disputa renhida no eixo que ambos os modelos publicam, mas apenas um dos seus lados é publicado de forma independente.

• Amplitude de idiomas — Gemini 3.5 Transcribe Live. Mais de 85 idiomas com detecção automática e a capacidade de alternar o idioma no meio do fluxo sem reiniciar a sessão, que é a principal alegação do Google para a Live API. O MAI-Transcribe-2-Streaming cobre 60 idiomas com detecção automática e contínua de idioma. O piso da Microsoft é mais alto; o teto do Google é mais amplo, e a lacuna de 25 idiomas está principalmente em idiomas nos quais um modelo de streaming de idioma único não é utilizável de forma alguma.

• Formato da sessão — Gemini 3.5 Transcribe Live, e essa é uma faca de dois gumes. A Live API é uma sessão WebSocket limitada a 10 minutos, o que é adequado para um turno de agente de voz e pouco prático para uma reunião de uma hora; a Microsoft não publica nenhum limite de sessão equivalente para seu modelo de streaming, o que importa se sua unidade de trabalho for uma chamada, e não um turno de conversa.

• Custo de entrada — Gemini 3.5 Transcribe Live. Há um nível gratuito, e a tarifa combinada do Google resulta em cerca de US$ 0,009 por minuto no modelo de preços baseado em tokens. Os US$ 0,54 por hora de áudio da Microsoft são uma tarifa introdutória que a Microsoft afirma vigorar até o final do ano, sem preço padrão divulgado — a mesma estrutura do lançamento em lote de setembro.

Screenshot of the Artificial Analysis Speech-to-Text leaderboard page showing the AA-WER Streaming Index chart, which plots final-transcript word error rate against time to final transcription after end of speech across the streaming field; MAI-Transcribe-2-Streaming does not appear on the chart.

Por que a lacuna de precisão é maior do que parece

Uma diferença de 1,5 ponto na taxa de erro de palavras parece uma diferença de arredondamento até você colocar preço nisso. Com 4,00% de WER em streaming, o Gemini 3.5 Transcribe Live erra aproximadamente 40 palavras a cada 1.000; com os 2,5% alegados pela Microsoft, o MAI-Transcribe-2-Streaming erra 25. Nos volumes que um pipeline em tempo real produz — uma organização de suporte que realiza 5.000 horas de chamadas por mês equivale a 300.000 minutos, mais de 45 milhões de palavras a ritmos de conversação —, essa diferença representa milhões de palavras incorretas por ano, concentradas nas entidades das quais os sistemas a jusante dependem: nomes de contas, números de tickets, dosagens, endereços.

A diferença de latência é a mais difícil de vender. 0,13 segundos versus 0,40 segundos após o fim da fala é perceptível em um fluxo de legendas ao vivo — abaixo de cerca de 0,2 segundos é lido como simultâneo, e um terço de segundo é lido como a transcrição correndo atrás do falante —, mas não é perceptível em um painel de assistência ao agente que é atualizado em uma escala de tempo humana. Se o seu consumidor é uma pessoa lendo junto, a vantagem de latência da Microsoft é o produto. Se o seu consumidor é um modelo que recebe a transcrição final quando o turno termina, é um número.

Os dois números trazem a mesma ressalva, e vale a pena dizê-la uma vez: são números de uma única execução de um painel de acompanhamento com 37 modelos de profundidade, e a diferença entre o primeiro e o terceiro lugar nesse painel é inferior a um ponto. Uma nova execução pode embaralhar o topo do ranking de streaming de uma forma que uma diferença de dois pontos no painel de lote não consegue. Além disso, os 2,5% da Microsoft ainda não estão no painel, de forma alguma — é uma alegação do fornecedor, medida segundo a metodologia do rastreador, o que é diferente de uma linha que o rastreador publica.

Os limites são onde a decisão de fato reside

Os limites de funcionalidades separam esses dois mais rapidamente do que os benchmarks, e eles seguem em direções opostas.

Gemini 3.5 Transcribe Live apresenta três restrições documentadas: um limite de sessão de 10 minutos na Live API, nenhuma diarização de falantes e nenhuma marca temporal ao nível da palavra. A primeira é arquitetural — o streaming numa sessão WebSocket tem um teto por natureza — e significa que a transcrição ao vivo de formato longo tem de ser emendada entre sessões, com o tratamento das emendas deixado a seu cargo. As duas últimas são absolutas: se o seu produto precisa de atribuir a fala a um falante, ou de situar uma palavra numa marca temporal para pesquisa ou sincronização de legendas, o Gemini 3.5 Transcribe Live não o faz a preço nenhum.

As restrições do MAI-Transcribe-2-Streaming são menos documentadas, o que já é informação por si só. A Microsoft não faz nenhuma alegação de diarização para o modelo de streaming, nem de marcas temporais por palavra; o MAI-Transcribe-2 em lote inclui diarização e retorna marcas temporais em nível de palavra, mas esse é o produto em lote, e presumir que o SKU de streaming herde isso é exatamente o tipo de inferência que o material de lançamento existe para evitar. O que a Microsoft afirma é 60 idiomas com detecção contínua de idioma e posicionamento na fronteira de Pareto em precisão versus latência — ambas afirmações do fornecedor com as quais os dados do tracker são consistentes.

Então, a leitura honesta dos recursos é esta: nenhum dos modelos de streaming publica diarização ou timestamps de palavras. O Gemini 3.5 Transcribe Live tem um limite de sessão publicado e um plano gratuito; o MAI-Transcribe-2-Streaming tem um número de idiomas publicado e nenhum limite publicado. Se os seus requisitos incluírem diarização, nenhum desses é a resposta, e você está diante de transcrição em lote com uma camada de streaming acoplada na frente.

O que a paridade de preços está realmente lhe dizendo

O fato de dois fornecedores chegarem aos mesmos US$ 9 por 1.000 minutos vindos de direções opostas é o dado mais interessante desta comparação. O Google chegou a esse valor por meio de preços baseados em tokens em uma sessão da Live API: áudio de entrada a US$ 3,50 por milhão de tokens, texto de saída a US$ 21 por milhão, e um consumo aproximado de 175 tokens de texto por minuto, o que resulta em cerca de US$ 0,009 por minuto. A Microsoft chegou a esse valor ao listar um preço fixo de US$ 0,54 por hora de áudio para um modelo de uma família cujo equivalente em lote custa US$ 0,10. Uma é uma sessão em tempo real cobrada por uso; a outra é uma tarifa fixa por minuto com desconto introdutório.

Essas estruturas comportam-se de forma diferente à medida que você escala. Uma tarifa fixa é previsível e fácil de orçar; uma sessão medida por tokens varia conforme o quanto o modelo responde e por quanto tempo a sessão fica ociosa aberta. Para um pipeline de alto volume, a tarifa fixa é a fatura mais amigável; para um protótipo ou um recurso de baixo volume, o nível gratuito e a cobrança por token são a porta de entrada mais amigável.

A generated bar-comparison card titled 'Two routes to $9.00 per 1,000 minutes' showing MAI-Transcribe-2-Streaming at a flat $0.54 per audio-hour introductory rate and Gemini 3.5 Transcribe Live at roughly $0.009 per minute blended from token pricing, both at $9.00, with MAI-Transcribe-2 (batch sibling) at $1.67, and a note that neither streaming rate has an announced post-promotional successor and that Gemini's blended figure uses $3.50 per million audio-in and $21 per million text-out at about 175 text tokens per minute, with the OrcaRouter logo bottom right.

O que nenhuma das duas estruturas altera é a camada acima da transcrição. Qualquer que seja o modelo que a produza, uma transcrição ao vivo é entrada para sumarização, classificação, redação e roteamento, e essas etapas têm suas próprias curvas de custo e qualidade — geralmente executadas em vários modelos, e não em um só. É essa a camada que o OrcaRouter cobre: uma API para mais de 200 modelos, preços de tabela dos provedores repassados com 0% de margem, failover automático e uma DSL de roteamento que pode encaminhar uma transcrição por modelos diferentes conforme a carga de trabalho. Nem MAI-Transcribe-2-Streaming nem Gemini 3.5 Transcribe Live está nessa lista — eles são servidos pelas próprias pilhas de fala da Microsoft e do Google, respectivamente — e o objetivo não é roteá-los, e sim manter portável tudo o que estiver a jusante deles.

A generated three-axis comparison card titled 'Streaming speech-to-text, on three axes' contrasting MAI-Transcribe-2-Streaming (2.5% streaming WER as a claim, 0.13s to final, 60 languages with automatic detection, no published session cap, diarization not published, word timestamps not published, $9.00 per 1,000 minutes introductory) with Gemini 3.5 Transcribe Live (4.00% streaming WER per Artificial Analysis, 0.40s to final, 85+ languages with mid-stream switching, a 10-minute session cap on the Live API, no diarization, no word timestamps, no session cap published), with the OrcaRouter logo bottom right.

Qual escolher

Escolha o MAI-Transcribe-2-Streaming quando precisão e tempo de estabilização forem o produto: legendas ao vivo que um humano lê, pontuação de conformidade ou qualidade em tempo real em que uma entidade mal interpretada tem um custo, ou sessões longas que o teto de 10 minutos do Gemini forçaria você a costurar. Escolha o Gemini 3.5 Transcribe Live quando a cobertura for o produto: uma implantação global em idiomas que você não pode enumerar antecipadamente, troca de idioma no meio do fluxo, ou um protótipo em que o nível gratuito e a cobrança por token removem o compromisso. Equipes que precisam de ambos não estão presas — as duas são APIs diferentes com modelos de sessão diferentes, e a arquitetura honesta é rotear por carga de trabalho em vez de padronizar em uma.

A conclusão que vale a pena tirar desta comparação não é que a Microsoft venceu. É que a transcrição em streaming agora tem duas opções de fronteira credíveis com preços idênticos, o que significa que a decisão deixou de ser "o que está disponível" para passar a ser "o que esta carga de trabalho específica precisa". Esse é um problema melhor para se ter.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente