
Grok Voice Transcribe 2.0 vs MAI Transcribe 2: Duas faixas, não dois rivais
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Esses dois modelos foram lançados com quinze dias de diferença e com o mesmo preço até o centavo, e quase nunca estarão na mesma decisão de compra. Grok Voice Transcribe 2.0, lançado pela SpaceXAI em 18 de setembro de 2026, é o modelo que você aciona quando o áudio ainda está chegando — ele faz streaming via WebSocket, emite resultados provisórios a cada cerca de 500 ms e lidera o ranking AA-WER Streaming da Artificial Analysis, com taxa de erro de palavras de 2,7% para transcrições finais e 3,4% para os primeiros resultados parciais. MAI-Transcribe-2, lançado pela Microsoft AI em 3 de setembro de 2026, é o modelo que você aciona quando o áudio já é um arquivo — ele é apenas em lote e, no ranking de não streaming da Artificial Analysis, é o modelo gerenciado mais preciso medido, com 2,04% de AA-WER, à frente dos 2,29% do Grok Voice Transcribe 2.0 e cerca de 2× mais rápido em vazão. Ambos têm preço de tabela de US$ 0,10 por hora de áudio, cerca de US$ 1,67 por 1.000 minutos. Se seu requisito é tempo real, não há comparação a fazer. Se seu requisito é um arquivo, há.
A linha que nenhum dos dois fornecedores vai traçar para você
O suporte a streaming não é um simples flag de funcionalidade. O Grok Voice Transcribe 2.0 serve o mesmo modelo via REST para arquivos gravados e via `wss://api.x.ai/v1/stt` para áudio ao vivo, de modo que a precisão que você mede no seu arquivo é a precisão que você obtém em uma chamada ao vivo. O MAI-Transcribe-2 não tem nenhum SKU de streaming: os materiais de lançamento da Microsoft o posicionam explicitamente para áudio de formato longo e em lote, e, embora o cartão do modelo liste a legendagem em tempo real entre seus cenários de aplicação, o caminho para isso é segmentar o áudio e enviar cada segmento pela API de lote — que é um pipeline que você constrói e opera, não uma garantia de latência que você compra. A taxa de transferência anunciada pela Microsoft de aproximadamente 411× o tempo real é um número de velocidade de processamento, não de tempo de resposta, e os dois são confundidos constantemente na cobertura deste lançamento.
A consequência prática: se está a desenvolver agentes de voz com alternância de turnos, legendagem em direto, ou qualquer coisa em que um humano ou um modelo reaja à fala em curso, o MAI-Transcribe-2 não é candidato, por muito boa que seja a sua precisão. Se está a transcrever reuniões a posteriori, gravações noturnas de centros de contacto, arquivos de media ou atrasos de conformidade, o streaming é peso morto e os números de processamento em lote são a história completa.
Onde o MAI-Transcribe-2 está genuinamente à frente
Precisão em arquivos, primeiro. A diferença de 2,04% versus 2,29% é medida no mesmo conjunto de testes independente — AA-WER v2 da Artificial Analysis, 50% AA-AgentTalk e 25% cada VoxPopuli e Earnings22 — o que a torna o fato mais claro nesta comparação. É uma diferença de 0,25 pontos, aproximadamente dois erros e meio a menos por mil palavras. Se isso importa depende do que você faz com a transcrição; para um arquivo pesquisável, não; e para um registro legal ou médico, pode importar.
Vazão, em segundo lugar, e por uma margem maior que a diferença de precisão: 333× o tempo real, contra 162× do Grok Voice Transcribe 2.0. Ambos os números são medições da Artificial Analysis de segundos de áudio de entrada transcritos por segundo, e não alegações dos fornecedores. A esse ritmo, um acervo de mil horas é concluído em cerca de três horas de computação no modelo da Microsoft e cerca de seis no da SpaceXAI. Para uma migração pontual, isso é irrelevante; para um pipeline que ingere continuamente, o tempo de relógio reduzido à metade é uma diferença real de capacidade.
Cobertura de idiomas, terceiro. A Microsoft especifica 60 idiomas com detecção automática, alternância de código dentro de uma gravação e uma taxa média de erro de palavra de 5,2% entre eles no FLEURS — um número relatado pelo fornecedor, não reproduzido de forma independente, mas que ao menos descreve o caso multilíngue em uma lista declarada de idiomas. A SpaceXAI documenta dezenas de idiomas com alternância durante a gravação e formatação da forma escrita em 25. Se o seu áudio estiver fora do conjunto bem coberto de inglês e principais línguas europeias, o número do FLEURS é mais informativo do que um ranking ponderado para o inglês e repleto de fala de agentes.
Mais duas diferenças que importam operacionalmente. O MAI-Transcribe-2 oferece estilos de transcrição configuráveis — literal, preservando disfluências, versus limpo, que as remove — enquanto o Grok Voice Transcribe 2.0 lida com o mesmo problema com uma flag de remoção de palavras de preenchimento. E o modelo da Microsoft está em pré-visualização pública no Microsoft Foundry, o que significa ausência de SLA e uma recomendação permanente contra o uso em produção até que ele passe para GA; o modelo da SpaceXAI tem disponibilidade geral, com limites de taxa publicados de 10 solicitações por segundo e 100 sessões de streaming simultâneas por equipe.

Onde o Grok Voice Transcribe 2.0 está genuinamente à frente
• Streaming em tempo real — um endpoint WebSocket com resultados intercalares a cada ~500 ms, versus apenas em lote, sem SKU em tempo real anunciado
• Precisão do primeiro transcrito parcial — 3,4% de WER em 0,49 s no AA-WER Streaming, uma categoria em que o MAI-Transcribe-2 não compete
• Acurácia em lote em áudio de conversa com agente — 2,29% no geral, mas, no subconjunto AA-AgentTalk do ranking de não streaming, a ordenação é mais apertada do que a manchete sugere, e, na mistura com muitos agentes do ranking de streaming, o Grok lidera de forma absoluta
• Infraestrutura de agente de voz — a detecção de fim de turno do Smart Turn e a remoção de palavras de preenchimento vêm no modelo, enquanto o MAI-Transcribe-2 deixa a lógica de turno para o chamador
• Áudio multicanal — até 8 canais independentes transcritos em uma única passagem, o que é importante para gravações de chamadas estéreo ou com múltiplas pernas
• Confiança em nível de palavra — os timestamps trazem uma pontuação de confiança por palavra, de modo que trechos com baixa confiança podem ser sinalizados em vez de confiados igualmente
• Termos de disponibilidade — disponibilidade geral com limites de simultaneidade publicados, em comparação com uma pré-visualização pública sem SLA
• Durabilidade de preço — $0,10 por hora é a tarifa vigente tanto para batch quanto para a base do nível de streaming de $0,20, ao passo que o $0,10 idêntico da Microsoft é uma oferta de lançamento por tempo limitado, sem tarifa padrão anunciada para 2027
Esse último ponto é o que a maioria das comparações ignora. Os dois modelos custam o mesmo hoje, e um desses preços tem data de validade; o outro, não. A Microsoft não publicou uma tarifa pós-promoção, e as análises divergem sobre se a oferta vai até o final de 2026 ou se não tem prazo definido. Se você está modelando um orçamento de transcrição de três anos com base em US$ 1,67 por 1.000 minutos da Microsoft, está modelando um número com o qual o fornecedor não se comprometeu.

A sobreposição é real, e é a maior parte da lista de recursos
Deixando de lado a questão do streaming, os dois produtos convergem fortemente. Ambos fazem diarização de falantes. Ambos retornam timestamps em nível de palavra. Ambos lidam com normalização inversa de texto — números, datas, moedas, dados de contato apresentados na forma escrita. Ambos aceitam terminologia de domínio, o Grok Voice Transcribe 2.0 como até 100 termos-chave por requisição e o MAI-Transcribe-2 como listas de terminologia de domínio e abreviaturas. Ambos detectam o idioma automaticamente e acompanham um falante que muda de idioma no meio da gravação. Ambos lidam com áudio de telefonia de 8 kHz, que é o caso em que a maioria dos modelos de transcrição falha silenciosamente e contra o qual a SpaceXAI ajustou com mais afinco — seu conjunto interno de telefonia passou de 10,6% para 7,1% de WER entre versões, um número relatado pela empresa em áudio da empresa.
Ambos também trazem limites de entrada que moldam arquiteturas, e não apenas orçamentos. O Grok Voice Transcribe 2.0 aceita arquivos de até 500 MB em 12 formatos de áudio, com taxas de amostragem de 8 kHz a 48 kHz. Os limites do MAI-Transcribe-2 são definidos pelo caminho do Foundry, e não pelo modelo, e as equipes devem consultar a documentação da própria Microsoft para saber o limite atual, em vez de presumir paridade com um serviço de STT dedicado.
O que essa convergência significa é que a decisão se reduz a três perguntas, em ordem: precisa ser em tempo real, quantos idiomas você realmente tem e quanto o diferencial de precisão custa para você. A primeira pergunta é binária e elimina uma opção de imediato. A segunda geralmente pode ser respondida a partir de uma amostra do seu próprio áudio. A terceira é pequena o suficiente para que, na maioria das cargas de trabalho baseadas em arquivos, não decida nada — o diferencial de 0,25 ponto é real, mas também é fato que ambos os modelos estão dentro de meio ponto do melhor número que alguém já mediu.

O que fazer com isto
Trate-os como uma pilha de duas vias, em vez de um confronto direto. Um centro de contactos que executa assistência em tempo real a agentes e um arquivo de conformidade noturno não está a escolher entre Grok Voice Transcribe 2.0 e MAI-Transcribe-2 — está a executar ambos, e a única questão é se isso lhe custa duas relações com fornecedores, dois conjuntos de credenciais, duas faturas e dois limites de taxa. Nenhum dos modelos está no catálogo do OrcaRouter hoje, por isso as próprias chamadas de transcrição vão para a API de cada fornecedor. O que uma única chave do OrcaRouter cobre é tudo o que está a jusante: o sumarizador, o classificador, o agente que raciocina sobre a transcrição e a tarefa de avaliação que compara a saída dos dois fornecedores na mesma gravação. É esta última a razão para prestar atenção — não pode decidir entre estes modelos com base numa tabela de classificação, porque a tabela de classificação são oito horas de conversa de agentes em inglês e o seu áudio não é.
Fique atento a duas coisas. Primeiro, se a Microsoft atribui um preço padrão ao MAI-Transcribe-2 quando a oferta de lançamento terminar; um preço permanente de $1,67 por 1.000 minutos tornaria-o a escolha padrão de lote apenas pelo custo, e uma reversão para os $0,36 por hora do MAI-Transcribe-1 tornaria esta conversa muito mais curta. Segundo, se a Microsoft lança um SKU de streaming. O cartão do modelo já nomeia legendas em tempo real como um cenário alvo, e a única coisa que separa o MAI-Transcribe-2 do segmento de streaming é um endpoint — se isso acontecer, estes dois deixam de ser segmentos e passam a ser rivais.
