Cartão de destaque do artigo com o texto 'Grok Voice Transcribe 2.0', o selo 'NOTÍCIAS' e o subtítulo 'A posição n.º 1 em precisão de streaming, a um preço inalterado', com chips exibindo 2,7% de WER na transcrição final, 3,4% na primeira parcial, 0,49s após o fim da fala e US$ 0,20 por hora de streaming, sobre um gradiente de branco para azul com o logotipo OrcaRouter no canto inferior direito.
Engineering & Research

Grok Voice Transcribe 2.0 assume o 1º lugar em precisão de streaming a um preço inalterado

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O Grok Voice Transcribe 2.0 é o modelo de fala para texto que a SpaceXAI lançou em 18 de setembro de 2026, e o único número que importa nele não é aquele com que o post de lançamento abre. É este: a primeira transcrição parcial — o texto sobre o qual um agente de voz de fato consegue agir enquanto ainda se fala por cima de quem está ligando — passou de 18,3% de taxa de erro de palavras no Grok Voice Transcribe 1.0 para 3,4%. Essa é a medição no ranking AA-WER Streaming da Artificial Analysis, onde o novo modelo agora ocupa o primeiro lugar tanto no ranking Final Transcript (2,7% de WER, 0,49 segundos após o fim da fala) quanto no ranking First Partial Transcript (3,4%, 0,49 segundos). A precisão da transcrição final também melhorou, de 3,9% para 2,7%, o que é real, mas modesto. O salto da transcrição parcial é o que muda o que você pode construir.

O que realmente mudou entre a 1.0 e a 2.0

As duas versões são o mesmo produto na mesma API, e a SpaceXAI não fez alterações na interface: o Grok Voice Transcribe 2.0 é selecionado ao passar grok-voice-transcribe-2.0 para /v1/stt em vez de grok-voice-transcribe-1.0, ou ao escolhê-lo quando a conexão WebSocket é criada para streaming. Integrações existentes que omitem o parâmetro model continuam recebendo a 1.0 até que a SpaceXAI inverta o padrão, o que a empresa diz que acontecerá nas próximas semanas, juntamente com a descontinuação da versão mais antiga. Até lá, a 2.0 é opt-in e a 1.0 pode ser fixada deliberadamente, o que é o formato certo para uma mudança como esta: você pode fazer o teste A/B com seu próprio áudio antes que ela se torne seu padrão de produção, quer você tenha pedido ou não.

Os números da Artificial Analysis, lidos lado a lado, contam uma história mais específica do que "duas vezes mais preciso":

• Precisão final da transcrição — Grok Voice Transcribe 2.0 com 2,7% de WER vs Grok Voice Transcribe 1.0 com 3,9% no AA-WER Streaming, ambos medidos após o fim da fala

• Precisão da primeira transcrição parcial — 3,4% de WER vs. 18,3%, a maior diferença isolada entre as duas versões

• Tempo até à transcrição final — 0,49s vs 0,37s, portanto o novo modelo demora mais a confirmar do que aquele que substitui

• Tempo até a primeira parcial — 0,49s vs 0,25s, igualmente mais lento

• Precisão em lote (não streaming) — 2,3% de AA-WER no ranking não streaming da Artificial Analysis, em comparação com 4,07% para o Whisper Large v3 e 3,31% para o GPT Transcribe

• Vazão em lote — aproximadamente 162× o tempo real na mesma placa, atrás dos 333× do MAI-Transcribe-2 e à frente dos 88× do Gemini 3.5 Transcribe

As linhas quatro e cinco são a ressalva honesta deste lançamento. A SpaceXAI comprou precisão ao custo de latência. O novo modelo leva cerca de um terço de segundo a mais para retornar seu primeiro resultado parcial e sua transcrição final do que a versão 1.0 levava. Em um ranking em que o Deepgram Flux retorna um resultado parcial em 0,02 segundo e o Soniox v5 em 0,05, o Grok Voice Transcribe 2.0 não está competindo em velocidade de forma alguma — está competindo por acertar, e vence essa troca por uma margem ampla. Se essa é a troca certa depende inteiramente de sua aplicação ser um agente de voz ao vivo que precisa começar a responder, ou um pipeline de transcrição em que meio segundo é invisível.

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs Grok Voice Transcribe 1.0 — the numbers': the left column gives Grok Voice Transcribe 2.0 a 2.7% final transcript WER, 3.4% first partial WER, 0.49s to final transcript, $1.67 per 1,000 minutes batch, $3.33 per 1,000 minutes streaming and 162x real time throughput; the right column gives Grok Voice Transcribe 1.0 3.9%, 18.3%, 0.37s and the same two prices, with throughput not measured; the footer credits both columns to Artificial Analysis.

A alegação de "duas vezes mais preciso", verificada

A manchete da SpaceXAI é que a 2.0 é duas vezes mais precisa que a 1.0 pelo mesmo preço, e sua própria tabela de avaliação sustenta isso nos conjuntos que ela escolheu. Em chamadas de suporte ao cliente em inglês a 8 kHz, a taxa de erro de palavras caiu de 10,6% para 7,1%. Em conversas com o Grok, de 8,7% para 3,3%. Em credenciais faladas — códigos de conta, números de telefone, endereços de e-mail —, de 7,2% para 3,2%. Em comandos curtos em 19 idiomas, de 20,6% para 6,8%, uma redução de erros de aproximadamente dois terços. Esses quatro conjuntos são retirados do tráfego de produção da SpaceXAI e as comparações são da própria SpaceXAI; ninguém fora da empresa as reproduziu. Trate a tabela como um mapa de onde o modelo foi ajustado, não como uma garantia geral de precisão.

O resultado da Artificial Analysis é a parte que não é relatada pelo fornecedor: uma execução de harness independente contra aproximadamente oito horas de áudio, ponderada 50% para o conjunto privado AA-AgentTalk e 25% cada para VoxPopuli e Earnings22. Ele sustenta uma afirmação mais restrita e mais útil do que "duas vezes mais preciso" — que, nessa mistura específica, este modelo é o transcritor de streaming mais preciso já medido. Uma complicação que vale a pena mencionar: o post da SpaceXAI descreve um primeiro lugar "entre 32 modelos de streaming", enquanto a própria página do leaderboard mostra 27 de 33 modelos. A classificação é real; o tamanho do campo no material de marketing é a contagem da empresa, não a do leaderboard.

Também vale a pena ser preciso sobre o que um primeiro lugar no AA-WER Streaming cobre e o que não cobre. O ranking é ponderado para o inglês e tem muita fala de agente. Ele não mede seu sotaque, seu codec, seu vocabulário de domínio ou seu áudio de call center de oito canais. Um modelo que lidera esse ranking ainda pode se sair muito mal nas suas gravações, e é exatamente por isso que a janela de opt-in importa.

Screenshot of the Artificial Analysis AA-WER Streaming leaderboard, showing Grok Voice Transcribe 2.0 first on both the Final Transcription ranking at 2.728% word error rate and 0.490s and the First Partial Transcription ranking at 3.359% and 0.489s, with Grok Voice Transcribe 1.0 further down at 18.275% on partials.

O preço permanece inalterado, e esse é o segundo fato mais importante aqui.

O Grok Voice Transcribe 2.0 custa o que o 1.0 custava: US$ 0,10 por hora de áudio para lote e arquivos gravados no endpoint REST, US$ 0,20 por hora de áudio para streaming no WebSocket. No quadro de preços da Artificial Analysis, o SKU de streaming fica em US$ 3,33 por 1.000 minutos e o SKU de lote em US$ 1,67 — a mesma tarifa de lote que a Microsoft está cobrando pelo MAI-Transcribe-2, e aproximadamente um terço do que o ElevenLabs Scribe v2 Realtime custa por minuto de streaming.

Diarização, timestamps em nível de palavra com pontuações de confiança e ponderação por termos-chave estão todos incluídos nessa tarifa, em vez de serem cobrados separadamente, o que não é universal neste mercado. O Gemini 3.5 Transcribe Live cobra por token tanto na entrada de áudio quanto na saída de texto, então seu custo varia conforme o quanto o modelo diz, e não apenas conforme a duração do áudio. Uma tarifa fixa por hora é mais fácil de prever e de comparar entre fornecedores — e, como a OrcaRouter repassa os preços de tabela dos provedores com 0% de markup, uma mudança do fornecedor nessa tarifa apareceria do nosso lado no mesmo dia, em vez de depois de um ciclo de reajuste de preços.

O que a API realmente oferece a você

A lista de recursos é ampla e, em grande parte, herdada, e não nova, o que vale a pena saber se você está avaliando a atualização apenas com base nos recursos:

• Processamento em lote e streaming em um único modelo — REST para arquivos gravados de até 500 MB, WebSocket em wss://api.x.ai/v1/stt com resultados parciais emitidos aproximadamente a cada 500 ms

• Diarização de falantes incluída, além de transcrição multicanal de até 8 canais independentes

• Marcações de tempo em nível de palavra que incluem pontuações de confiança, para que você possa aplicar um limite a trechos de baixa confiança em vez de confiar na transcrição inteira igualmente

• Viés de termos-chave de até 100 termos de domínio por solicitação, cada um com até 50 caracteres

• Normalização inversa de texto para números, datas, moedas, números de telefone e endereços de e-mail, com formatação de forma escrita suportada em 25 idiomas

• Remoção de palavras de preenchimento e detecção de fim de turno Smart Turn voltadas diretamente para agentes de voz

• Detecção automática de idioma com troca de idioma no meio da gravação em uma única passagem, em 12 formatos de áudio e taxas de amostragem de 8 kHz a 48 kHz

• Limites de serviço de 10 solicitações por segundo tanto em REST quanto em streaming, e 100 sessões de streaming simultâneas por equipe, hospedadas em us-east-1

A única nota de produção que não consta na lista de recursos: o serviço roda em uma única região. Se seu áudio se origina fora dos Estados Unidos, o trecho de rede agora faz parte do seu orçamento de latência, e o AA-WER Streaming incorpora explicitamente o atraso de rede à sua temporização. A SpaceXAI oferece termos de retenção zero de dados e cita SOC 2 Type II, BAAs e opções de residência de dados na UE, então o quadro de conformidade está mais desenvolvido que o geográfico.

Screenshot of the SpaceXAI docs.x.ai Speech-to-Text page listing the Grok Voice Transcribe 2.0 REST and WebSocket endpoints, the grok-voice-transcribe-2.0 model parameter, the 500 MB file limit, key-term biasing and the published rate limits.

Quem deve se mover, e o que observar

Se você já usa o Grok Voice Transcribe 1.0 e sua aplicação age com base em transcrições parciais — detecção de turno, barge-in, respostas de agente ao vivo —, a diferença de precisão parcial de 18,3% para 3,4% é grande o suficiente para que testar a versão 2.0 não seja opcional. Esse número passar de "geralmente errado" para "geralmente certo" é a diferença entre uma transcrição parcial que você pode usar para rotear e uma que você só pode exibir. Se sua aplicação espera pelas transcrições finais de arquivos gravados, a melhoria é real, mas menor, e o acréscimo de 0,12 segundo de latência de commit é o preço disso.

Se você usa um fornecedor totalmente diferente, o motivo para olhar para este lançamento não é a posição no leaderboard — é que um laboratório de fronteira acabou de melhorar seu modelo de transcrição por uma grande margem sem aumentar o preço, que é o que um mercado parece quando a precisão deixa de ser aquilo pelo que se cobra. O caminho de upgrade também é o mais barato possível: um parâmetro, nenhuma alteração no código, nenhum novo contrato e um pin disponível se der errado.

O que observar a seguir é a mudança do padrão. Quando a SpaceXAI tornar o 2.0 o padrão e começar a descontinuar o 1.0, toda integração que nunca passou um parâmetro de modelo migrará para o novo modelo de uma só vez, incluindo a mudança de latência. Equipes que dependem do antigo timing parcial de 0,25 segundo devem fixar agora, em vez de descobrir a mudança em produção. A segunda coisa a observar é a reprodução independente: a entrada da Artificial Analysis é uma medição real, mas é um único painel em uma única mixagem de áudio, e nenhum terceiro publicou até agora uma execução comparável 1.0 versus 2.0 em áudio de produção.