Cartão de destaque do artigo com o texto 'Grok Voice Transcribe 2.0 vs MAI Transcribe 2', o selo 'COMPARAÇÃO DE MODELOS' e o subtítulo 'Duas faixas, não dois rivais', com chips lendo 3,4% vs sem SKU de streaming, 2,29% vs 2,04% WER em lote, 162x vs 333x em tempo real e US$ 1,67 por 1.000 minutos cada, sobre um gradiente de branco para azul com o logotipo OrcaRouter no canto inferior direito.
Guides & Insights

Grok Voice Transcribe 2.0 vs MAI Transcribe 2: Duas faixas, não dois rivais

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Esses dois modelos foram lançados com quinze dias de diferença e com o mesmo preço até o centavo, e quase nunca estarão na mesma decisão de compra. Grok Voice Transcribe 2.0, lançado pela SpaceXAI em 18 de setembro de 2026, é o modelo que você aciona quando o áudio ainda está chegando — ele faz streaming via WebSocket, emite resultados provisórios a cada cerca de 500 ms e lidera o ranking AA-WER Streaming da Artificial Analysis, com taxa de erro de palavras de 2,7% para transcrições finais e 3,4% para os primeiros resultados parciais. MAI-Transcribe-2, lançado pela Microsoft AI em 3 de setembro de 2026, é o modelo que você aciona quando o áudio já é um arquivo — ele é apenas em lote e, no ranking de não streaming da Artificial Analysis, é o modelo gerenciado mais preciso medido, com 2,04% de AA-WER, à frente dos 2,29% do Grok Voice Transcribe 2.0 e cerca de 2× mais rápido em vazão. Ambos têm preço de tabela de US$ 0,10 por hora de áudio, cerca de US$ 1,67 por 1.000 minutos. Se seu requisito é tempo real, não há comparação a fazer. Se seu requisito é um arquivo, há.

A linha que nenhum dos dois fornecedores vai traçar para você

O suporte a streaming não é um simples flag de funcionalidade. O Grok Voice Transcribe 2.0 serve o mesmo modelo via REST para arquivos gravados e via `wss://api.x.ai/v1/stt` para áudio ao vivo, de modo que a precisão que você mede no seu arquivo é a precisão que você obtém em uma chamada ao vivo. O MAI-Transcribe-2 não tem nenhum SKU de streaming: os materiais de lançamento da Microsoft o posicionam explicitamente para áudio de formato longo e em lote, e, embora o cartão do modelo liste a legendagem em tempo real entre seus cenários de aplicação, o caminho para isso é segmentar o áudio e enviar cada segmento pela API de lote — que é um pipeline que você constrói e opera, não uma garantia de latência que você compra. A taxa de transferência anunciada pela Microsoft de aproximadamente 411× o tempo real é um número de velocidade de processamento, não de tempo de resposta, e os dois são confundidos constantemente na cobertura deste lançamento.

A consequência prática: se está a desenvolver agentes de voz com alternância de turnos, legendagem em direto, ou qualquer coisa em que um humano ou um modelo reaja à fala em curso, o MAI-Transcribe-2 não é candidato, por muito boa que seja a sua precisão. Se está a transcrever reuniões a posteriori, gravações noturnas de centros de contacto, arquivos de media ou atrasos de conformidade, o streaming é peso morto e os números de processamento em lote são a história completa.

Onde o MAI-Transcribe-2 está genuinamente à frente

Precisão em arquivos, primeiro. A diferença de 2,04% versus 2,29% é medida no mesmo conjunto de testes independente — AA-WER v2 da Artificial Analysis, 50% AA-AgentTalk e 25% cada VoxPopuli e Earnings22 — o que a torna o fato mais claro nesta comparação. É uma diferença de 0,25 pontos, aproximadamente dois erros e meio a menos por mil palavras. Se isso importa depende do que você faz com a transcrição; para um arquivo pesquisável, não; e para um registro legal ou médico, pode importar.

Vazão, em segundo lugar, e por uma margem maior que a diferença de precisão: 333× o tempo real, contra 162× do Grok Voice Transcribe 2.0. Ambos os números são medições da Artificial Analysis de segundos de áudio de entrada transcritos por segundo, e não alegações dos fornecedores. A esse ritmo, um acervo de mil horas é concluído em cerca de três horas de computação no modelo da Microsoft e cerca de seis no da SpaceXAI. Para uma migração pontual, isso é irrelevante; para um pipeline que ingere continuamente, o tempo de relógio reduzido à metade é uma diferença real de capacidade.

Cobertura de idiomas, terceiro. A Microsoft especifica 60 idiomas com detecção automática, alternância de código dentro de uma gravação e uma taxa média de erro de palavra de 5,2% entre eles no FLEURS — um número relatado pelo fornecedor, não reproduzido de forma independente, mas que ao menos descreve o caso multilíngue em uma lista declarada de idiomas. A SpaceXAI documenta dezenas de idiomas com alternância durante a gravação e formatação da forma escrita em 25. Se o seu áudio estiver fora do conjunto bem coberto de inglês e principais línguas europeias, o número do FLEURS é mais informativo do que um ranking ponderado para o inglês e repleto de fala de agentes.

Mais duas diferenças que importam operacionalmente. O MAI-Transcribe-2 oferece estilos de transcrição configuráveis — literal, preservando disfluências, versus limpo, que as remove — enquanto o Grok Voice Transcribe 2.0 lida com o mesmo problema com uma flag de remoção de palavras de preenchimento. E o modelo da Microsoft está em pré-visualização pública no Microsoft Foundry, o que significa ausência de SLA e uma recomendação permanente contra o uso em produção até que ele passe para GA; o modelo da SpaceXAI tem disponibilidade geral, com limites de taxa publicados de 10 solicitações por segundo e 100 sessões de streaming simultâneas por equipe.

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs MAI Transcribe 2 — the scoreboard': the left column gives Grok Voice Transcribe 2.0 WebSocket streaming with 500ms interim results, 2.29% batch WER, 162x real time throughput, $1.67 per 1,000 minutes, included diarization and general availability; the right column gives MAI Transcribe 2 no announced streaming, 2.04%, 333x, a $1.67 launch offer, included diarization and public preview with no SLA.

Onde o Grok Voice Transcribe 2.0 está genuinamente à frente

• Streaming em tempo real — um endpoint WebSocket com resultados intercalares a cada ~500 ms, versus apenas em lote, sem SKU em tempo real anunciado

• Precisão do primeiro transcrito parcial — 3,4% de WER em 0,49 s no AA-WER Streaming, uma categoria em que o MAI-Transcribe-2 não compete

• Acurácia em lote em áudio de conversa com agente — 2,29% no geral, mas, no subconjunto AA-AgentTalk do ranking de não streaming, a ordenação é mais apertada do que a manchete sugere, e, na mistura com muitos agentes do ranking de streaming, o Grok lidera de forma absoluta

• Infraestrutura de agente de voz — a detecção de fim de turno do Smart Turn e a remoção de palavras de preenchimento vêm no modelo, enquanto o MAI-Transcribe-2 deixa a lógica de turno para o chamador

• Áudio multicanal — até 8 canais independentes transcritos em uma única passagem, o que é importante para gravações de chamadas estéreo ou com múltiplas pernas

• Confiança em nível de palavra — os timestamps trazem uma pontuação de confiança por palavra, de modo que trechos com baixa confiança podem ser sinalizados em vez de confiados igualmente

• Termos de disponibilidade — disponibilidade geral com limites de simultaneidade publicados, em comparação com uma pré-visualização pública sem SLA

• Durabilidade de preço — $0,10 por hora é a tarifa vigente tanto para batch quanto para a base do nível de streaming de $0,20, ao passo que o $0,10 idêntico da Microsoft é uma oferta de lançamento por tempo limitado, sem tarifa padrão anunciada para 2027

Esse último ponto é o que a maioria das comparações ignora. Os dois modelos custam o mesmo hoje, e um desses preços tem data de validade; o outro, não. A Microsoft não publicou uma tarifa pós-promoção, e as análises divergem sobre se a oferta vai até o final de 2026 ou se não tem prazo definido. Se você está modelando um orçamento de transcrição de três anos com base em US$ 1,67 por 1.000 minutos da Microsoft, está modelando um número com o qual o fornecedor não se comprometeu.

Screenshot of the Artificial Analysis non-streaming speech-to-text leaderboard, showing MAI-Transcribe-2 at 2.04% AA-WER and 333x real time, Grok Voice Transcribe 2.0 at 2.29% and 161.77x, Gemini 3.5 Transcribe at 2.60%, GPT Transcribe at 3.31% and Whisper Large v3 at 4.07%.

A sobreposição é real, e é a maior parte da lista de recursos

Deixando de lado a questão do streaming, os dois produtos convergem fortemente. Ambos fazem diarização de falantes. Ambos retornam timestamps em nível de palavra. Ambos lidam com normalização inversa de texto — números, datas, moedas, dados de contato apresentados na forma escrita. Ambos aceitam terminologia de domínio, o Grok Voice Transcribe 2.0 como até 100 termos-chave por requisição e o MAI-Transcribe-2 como listas de terminologia de domínio e abreviaturas. Ambos detectam o idioma automaticamente e acompanham um falante que muda de idioma no meio da gravação. Ambos lidam com áudio de telefonia de 8 kHz, que é o caso em que a maioria dos modelos de transcrição falha silenciosamente e contra o qual a SpaceXAI ajustou com mais afinco — seu conjunto interno de telefonia passou de 10,6% para 7,1% de WER entre versões, um número relatado pela empresa em áudio da empresa.

Ambos também trazem limites de entrada que moldam arquiteturas, e não apenas orçamentos. O Grok Voice Transcribe 2.0 aceita arquivos de até 500 MB em 12 formatos de áudio, com taxas de amostragem de 8 kHz a 48 kHz. Os limites do MAI-Transcribe-2 são definidos pelo caminho do Foundry, e não pelo modelo, e as equipes devem consultar a documentação da própria Microsoft para saber o limite atual, em vez de presumir paridade com um serviço de STT dedicado.

O que essa convergência significa é que a decisão se reduz a três perguntas, em ordem: precisa ser em tempo real, quantos idiomas você realmente tem e quanto o diferencial de precisão custa para você. A primeira pergunta é binária e elimina uma opção de imediato. A segunda geralmente pode ser respondida a partir de uma amostra do seu próprio áudio. A terceira é pequena o suficiente para que, na maioria das cargas de trabalho baseadas em arquivos, não decida nada — o diferencial de 0,25 ponto é real, mas também é fato que ambos os modelos estão dentro de meio ponto do melhor número que alguém já mediu.

Screenshot of the Microsoft learn.microsoft.com MAI-Transcribe-2 model page, showing the September 3 2026 launch, the 60-language list with automatic detection and code-switching, the 5.2% FLEURS word error rate, the configurable verbatim and clean transcription styles, and the public-preview availability on Microsoft Foundry.

O que fazer com isto

Trate-os como uma pilha de duas vias, em vez de um confronto direto. Um centro de contactos que executa assistência em tempo real a agentes e um arquivo de conformidade noturno não está a escolher entre Grok Voice Transcribe 2.0 e MAI-Transcribe-2 — está a executar ambos, e a única questão é se isso lhe custa duas relações com fornecedores, dois conjuntos de credenciais, duas faturas e dois limites de taxa. Nenhum dos modelos está no catálogo do OrcaRouter hoje, por isso as próprias chamadas de transcrição vão para a API de cada fornecedor. O que uma única chave do OrcaRouter cobre é tudo o que está a jusante: o sumarizador, o classificador, o agente que raciocina sobre a transcrição e a tarefa de avaliação que compara a saída dos dois fornecedores na mesma gravação. É esta última a razão para prestar atenção — não pode decidir entre estes modelos com base numa tabela de classificação, porque a tabela de classificação são oito horas de conversa de agentes em inglês e o seu áudio não é.

Fique atento a duas coisas. Primeiro, se a Microsoft atribui um preço padrão ao MAI-Transcribe-2 quando a oferta de lançamento terminar; um preço permanente de $1,67 por 1.000 minutos tornaria-o a escolha padrão de lote apenas pelo custo, e uma reversão para os $0,36 por hora do MAI-Transcribe-1 tornaria esta conversa muito mais curta. Segundo, se a Microsoft lança um SKU de streaming. O cartão do modelo já nomeia legendas em tempo real como um cenário alvo, e a única coisa que separa o MAI-Transcribe-2 do segmento de streaming é um endpoint — se isso acontecer, estes dois deixam de ser segmentos e passam a ser rivais.