
MAI-Transcribe-2-Streaming vs Gemini 3.5 Transcribe Live: Mesmos US$ 9, troca diferente
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 221 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
MAI-Transcribe-2-Streaming e Gemini 3.5 Transcribe Live custam o mesmo e baseiam-se em teorias opostas sobre para que serve um transcritor em streaming. Ambos ficam em cerca de $9,00 por 1.000 minutos de áudio em streaming. O modelo da Microsoft, lançado em 1 de outubro de 2026, é um instrumento de precisão: uma taxa de erro de palavras em streaming declarada de 2,5% a 0,13 segundos até à transcrição final, em primeiro lugar em precisão tanto nas transcrições finais como nas parciais, segundo a própria Microsoft, medido com a metodologia de streaming da Artificial Analysis, mas ainda não representado como uma linha nesse quadro. O outro modelo, em pré-visualização pública desde 26 de agosto de 2026 e servido através da Live API, é um instrumento de cobertura: mais de 85 idiomas com troca a meio do fluxo, um nível gratuito, e uma taxa de erro de palavras em streaming de 4,00% a 0,40 segundos, o valor que a Artificial Analysis mede para ele. Nenhum dos dois é a escolha óbvia, e a razão é que não estão realmente a competir pela mesma carga de trabalho.
Eis o confronto direto conforme os números realmente aparecem — números divulgados pelo fornecedor rotulados, números do rastreador atribuídos, e as partes em que um modelo vence numa dimensão que o outro não disputa de forma alguma.
A versão de uma linha
• Precisão e latência — MAI-Transcribe-2-Streaming, com base nos números publicados. A Microsoft afirma 2,5% de WER em streaming, com 0,13 segundos até à transcrição final, em primeiro lugar na precisão tanto em transcrições finais como parciais, e 2,5% no primeiro parcial a 0,12 segundos. Em contrapartida, a Artificial Analysis coloca o Gemini 3.5 Transcribe Live em 4,00% a 0,40 segundos. A vantagem alegada pela Microsoft é de 1,5 pontos e de ser cerca de três vezes mais rápida a estabilizar. A ressalva é que o rastreador ainda não representou graficamente o próprio MAI-Transcribe-2-Streaming — o atual líder da tabela é o Grok Voice Transcribe 2.0, com 2,73% e 0,49 segundos, e o Muse Voice Transcribe, com 3,06% e 0,16 segundos —, por isso os 2,5% são um valor do fornecedor aferido face a um campo que o rastreador mede efetivamente. Não é uma disputa renhida no eixo que ambos os modelos publicam, mas apenas um dos seus lados é publicado de forma independente.
• Amplitude de idiomas — Gemini 3.5 Transcribe Live. Mais de 85 idiomas com detecção automática e a capacidade de alternar o idioma no meio do fluxo sem reiniciar a sessão, que é a principal alegação do Google para a Live API. O MAI-Transcribe-2-Streaming cobre 60 idiomas com detecção automática e contínua de idioma. O piso da Microsoft é mais alto; o teto do Google é mais amplo, e a lacuna de 25 idiomas está principalmente em idiomas nos quais um modelo de streaming de idioma único não é utilizável de forma alguma.
• Formato da sessão — Gemini 3.5 Transcribe Live, e essa é uma faca de dois gumes. A Live API é uma sessão WebSocket limitada a 10 minutos, o que é adequado para um turno de agente de voz e pouco prático para uma reunião de uma hora; a Microsoft não publica nenhum limite de sessão equivalente para seu modelo de streaming, o que importa se sua unidade de trabalho for uma chamada, e não um turno de conversa.
• Custo de entrada — Gemini 3.5 Transcribe Live. Há um nível gratuito, e a tarifa combinada do Google resulta em cerca de US$ 0,009 por minuto no modelo de preços baseado em tokens. Os US$ 0,54 por hora de áudio da Microsoft são uma tarifa introdutória que a Microsoft afirma vigorar até o final do ano, sem preço padrão divulgado — a mesma estrutura do lançamento em lote de setembro.

Por que a lacuna de precisão é maior do que parece
Uma diferença de 1,5 ponto na taxa de erro de palavras parece uma diferença de arredondamento até você colocar preço nisso. Com 4,00% de WER em streaming, o Gemini 3.5 Transcribe Live erra aproximadamente 40 palavras a cada 1.000; com os 2,5% alegados pela Microsoft, o MAI-Transcribe-2-Streaming erra 25. Nos volumes que um pipeline em tempo real produz — uma organização de suporte que realiza 5.000 horas de chamadas por mês equivale a 300.000 minutos, mais de 45 milhões de palavras a ritmos de conversação —, essa diferença representa milhões de palavras incorretas por ano, concentradas nas entidades das quais os sistemas a jusante dependem: nomes de contas, números de tickets, dosagens, endereços.
A diferença de latência é a mais difícil de vender. 0,13 segundos versus 0,40 segundos após o fim da fala é perceptível em um fluxo de legendas ao vivo — abaixo de cerca de 0,2 segundos é lido como simultâneo, e um terço de segundo é lido como a transcrição correndo atrás do falante —, mas não é perceptível em um painel de assistência ao agente que é atualizado em uma escala de tempo humana. Se o seu consumidor é uma pessoa lendo junto, a vantagem de latência da Microsoft é o produto. Se o seu consumidor é um modelo que recebe a transcrição final quando o turno termina, é um número.
Os dois números trazem a mesma ressalva, e vale a pena dizê-la uma vez: são números de uma única execução de um painel de acompanhamento com 37 modelos de profundidade, e a diferença entre o primeiro e o terceiro lugar nesse painel é inferior a um ponto. Uma nova execução pode embaralhar o topo do ranking de streaming de uma forma que uma diferença de dois pontos no painel de lote não consegue. Além disso, os 2,5% da Microsoft ainda não estão no painel, de forma alguma — é uma alegação do fornecedor, medida segundo a metodologia do rastreador, o que é diferente de uma linha que o rastreador publica.
Os limites são onde a decisão de fato reside
Os limites de funcionalidades separam esses dois mais rapidamente do que os benchmarks, e eles seguem em direções opostas.
Gemini 3.5 Transcribe Live apresenta três restrições documentadas: um limite de sessão de 10 minutos na Live API, nenhuma diarização de falantes e nenhuma marca temporal ao nível da palavra. A primeira é arquitetural — o streaming numa sessão WebSocket tem um teto por natureza — e significa que a transcrição ao vivo de formato longo tem de ser emendada entre sessões, com o tratamento das emendas deixado a seu cargo. As duas últimas são absolutas: se o seu produto precisa de atribuir a fala a um falante, ou de situar uma palavra numa marca temporal para pesquisa ou sincronização de legendas, o Gemini 3.5 Transcribe Live não o faz a preço nenhum.
As restrições do MAI-Transcribe-2-Streaming são menos documentadas, o que já é informação por si só. A Microsoft não faz nenhuma alegação de diarização para o modelo de streaming, nem de marcas temporais por palavra; o MAI-Transcribe-2 em lote inclui diarização e retorna marcas temporais em nível de palavra, mas esse é o produto em lote, e presumir que o SKU de streaming herde isso é exatamente o tipo de inferência que o material de lançamento existe para evitar. O que a Microsoft afirma é 60 idiomas com detecção contínua de idioma e posicionamento na fronteira de Pareto em precisão versus latência — ambas afirmações do fornecedor com as quais os dados do tracker são consistentes.
Então, a leitura honesta dos recursos é esta: nenhum dos modelos de streaming publica diarização ou timestamps de palavras. O Gemini 3.5 Transcribe Live tem um limite de sessão publicado e um plano gratuito; o MAI-Transcribe-2-Streaming tem um número de idiomas publicado e nenhum limite publicado. Se os seus requisitos incluírem diarização, nenhum desses é a resposta, e você está diante de transcrição em lote com uma camada de streaming acoplada na frente.
O que a paridade de preços está realmente lhe dizendo
O fato de dois fornecedores chegarem aos mesmos US$ 9 por 1.000 minutos vindos de direções opostas é o dado mais interessante desta comparação. O Google chegou a esse valor por meio de preços baseados em tokens em uma sessão da Live API: áudio de entrada a US$ 3,50 por milhão de tokens, texto de saída a US$ 21 por milhão, e um consumo aproximado de 175 tokens de texto por minuto, o que resulta em cerca de US$ 0,009 por minuto. A Microsoft chegou a esse valor ao listar um preço fixo de US$ 0,54 por hora de áudio para um modelo de uma família cujo equivalente em lote custa US$ 0,10. Uma é uma sessão em tempo real cobrada por uso; a outra é uma tarifa fixa por minuto com desconto introdutório.
Essas estruturas comportam-se de forma diferente à medida que você escala. Uma tarifa fixa é previsível e fácil de orçar; uma sessão medida por tokens varia conforme o quanto o modelo responde e por quanto tempo a sessão fica ociosa aberta. Para um pipeline de alto volume, a tarifa fixa é a fatura mais amigável; para um protótipo ou um recurso de baixo volume, o nível gratuito e a cobrança por token são a porta de entrada mais amigável.

O que nenhuma das duas estruturas altera é a camada acima da transcrição. Qualquer que seja o modelo que a produza, uma transcrição ao vivo é entrada para sumarização, classificação, redação e roteamento, e essas etapas têm suas próprias curvas de custo e qualidade — geralmente executadas em vários modelos, e não em um só. É essa a camada que o OrcaRouter cobre: uma API para mais de 200 modelos, preços de tabela dos provedores repassados com 0% de margem, failover automático e uma DSL de roteamento que pode encaminhar uma transcrição por modelos diferentes conforme a carga de trabalho. Nem MAI-Transcribe-2-Streaming nem Gemini 3.5 Transcribe Live está nessa lista — eles são servidos pelas próprias pilhas de fala da Microsoft e do Google, respectivamente — e o objetivo não é roteá-los, e sim manter portável tudo o que estiver a jusante deles.

Qual escolher
Escolha o MAI-Transcribe-2-Streaming quando precisão e tempo de estabilização forem o produto: legendas ao vivo que um humano lê, pontuação de conformidade ou qualidade em tempo real em que uma entidade mal interpretada tem um custo, ou sessões longas que o teto de 10 minutos do Gemini forçaria você a costurar. Escolha o Gemini 3.5 Transcribe Live quando a cobertura for o produto: uma implantação global em idiomas que você não pode enumerar antecipadamente, troca de idioma no meio do fluxo, ou um protótipo em que o nível gratuito e a cobrança por token removem o compromisso. Equipes que precisam de ambos não estão presas — as duas são APIs diferentes com modelos de sessão diferentes, e a arquitetura honesta é rotear por carga de trabalho em vez de padronizar em uma.
A conclusão que vale a pena tirar desta comparação não é que a Microsoft venceu. É que a transcrição em streaming agora tem duas opções de fronteira credíveis com preços idênticos, o que significa que a decisão deixou de ser "o que está disponível" para passar a ser "o que esta carga de trabalho específica precisa". Esse é um problema melhor para se ter.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
