Cartão de destaque do artigo com o texto 'Grok Voice Transcribe 2.0 vs GPT Transcribe', com o selo 'COMPARAÇÃO DE MODELOS' e o subtítulo 'Mesmo preço de streaming, precisão diferente', com chips exibindo 2,7% vs 3,9% de WER em streaming, 3,4% vs 6,3% na primeira parcial, $1,67 vs $4,50 por 1.000 minutos e 162x vs 41x em tempo real, sobre um gradiente de branco para azul com o logotipo da OrcaRouter no canto inferior direito.
Guides & Insights

Grok Voice Transcribe 2.0 vs GPT Transcribe: Mesmo Preço de Streaming, Precisão Diferente

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A coincidência é quase perfeita demais. No quadro AA-WER Streaming da Artificial Analysis, o Grok Voice Transcribe 2.0 e o GPT Live Transcribe — o endpoint de transcrição em streaming — aparecem ambos exatamente a US$ 3,33 por 1.000 minutos de áudio. O Grok Voice Transcribe 2.0 da SpaceXAI, lançado em 18 de setembro de 2026, retorna uma transcrição final com taxa de erro de palavra de 2,7%, 0,49 segundos após o fim da fala, e uma primeira parcial a 3,4%. O GPT Live Transcribe, lançado junto com o GPT Transcribe em 28 de julho de 2026, retorna sua transcrição final a 3,9% e sua primeira parcial a 6,3%. Mesmo preço, e cerca de 1,2 ponto de precisão na transcrição final mais 2,9 pontos de precisão na transcrição parcial a favor da SpaceXAI. O lado em lote do mesmo confronto não é coincidência alguma: o GPT Transcribe custa US$ 4,50 por 1.000 minutos contra US$ 1,67 do Grok Voice Transcribe 2.0, uma diferença de 63% no caminho de arquivos gravados.

Duas apostas diferentes sobre como a transcrição melhora

A resposta da OpenAI para a precisão é o contexto. GPT Transcribe e GPT Live Transcribe aceitam prompts de forma livre, listas de palavras-chave e listas de idiomas esperados, e, em sessões Realtime, os turnos transcritos anteriormente são realimentados como contexto para os posteriores. No próprio benchmark Context Aware ASR da OpenAI, esse condicionamento elevou a precisão semântica do GPT Live Transcribe de 38,5% para 44,6% — um número informado pelo fornecedor e que mede se o significado sobreviveu, e não se as palavras estavam corretas. A contrapartida que a OpenAI oferece é explícita: dê ao modelo informações sobre o que ele está prestes a ouvir, e ele transcreverá o seu domínio melhor do que um modelo geral com a mesma precisão bruta faria.

A resposta da SpaceXAI é o próprio modelo. O Grok Voice Transcribe 2.0 tem, sim, um mecanismo de enviesamento — até 100 termos-chave por solicitação, cada um com até 50 caracteres —, mas é uma lista de vocabulário, não um prompt. Você pode dizer a ele que "OrcaRouter" e "Kubernetes" são palavras reais; você não pode entregar a ele um parágrafo explicando que esta é uma ligação de suporte sobre um reembolso. A melhoria de precisão na versão 2.0 vem, em vez disso, do retreinamento: nos próprios conjuntos de avaliação derivados da produção da SpaceXAI, a taxa de erro de palavras caiu de 8,7% para 3,3% em áudio de conversação, de 10,6% para 7,1% em telefonia de 8 kHz, de 7,2% para 3,2% em credenciais faladas e de 20,6% para 6,8% em comandos curtos em 19 idiomas. Esses são os números da empresa com o áudio da empresa, não reproduzidos por ninguém fora dela, e descrevem um modelo que ficou melhor no problema acústico, e não um que ficou melhor em ser informado do que esperar.

A diferença prática aparece na segunda hora de trabalho. Um modelo condicionado ao contexto pode ser dramaticamente melhor do que o seu benchmark bruto sugere, porque você forneceu o vocabulário e o domínio. Ele também pode alucinar as palavras-chave que você forneceu: coloque "OrcaRouter" no prompt e um modelo que não consegue ouvir a palavra claramente pode produzi-la mesmo assim. Um modelo com viés para termos-chave degrada de forma mais suave, porque o viés desloca a probabilidade de um termo em vez de afirmar que ele está presente. Nenhum dos modos de falha aparece em um leaderboard, e ambos vão aparecer nos seus logs.

Os números, lado a lado

• Precisão final da transcrição (streaming) — Grok Voice Transcribe 2.0 com 2,7% de WER vs. GPT Live Transcribe com 3,9% no AA-WER Streaming, ambos segundo a Artificial Analysis

• Precisão do primeiro resultado parcial (streaming) — 3,4% vs 6,3%, a maior diferença da comparação e a que decide o comportamento do agente de voz

• Tempo até a transcrição final — 0,49s vs 0,81s após o fim da fala, então o modelo mais preciso também é o mais rápido a confirmar

• Tempo até a primeira parcial — 0,49s vs 0,26s, a única coluna de latência em que a OpenAI vence de forma categórica

• Preço de streaming — US$ 3,33 por 1.000 minutos para ambos, normalizado pela Artificial Analysis a partir dos US$ 0,20/hora do Grok e dos US$ 0,017/minuto da OpenAI

• Acurácia em lote (sem streaming) — Grok Voice Transcribe 2.0 com 2,3% de AA-WER vs GPT Transcribe com 3,31%

• Preço por lote — $1,67 por 1.000 minutos vs. $4,50 por 1.000 minutos, a partir de $0,10/hora contra $0,0045/minuto

• Throughput em lote — cerca de 162× o tempo real vs cerca de 41× na mesma placa

Leia essa lista como duas colunas em vez de um único veredito. O OpenAI vence na latência da primeira parcial por uma margem clara e oferece um mecanismo de contexto que o Grok não tem. O SpaceXAI vence na precisão final nos dois modos, na precisão parcial em streaming, na taxa de transferência e no preço por lote por uma ampla margem. Não há coluna em que o GPT Live Transcribe seja simultaneamente mais rápido e mais preciso que o Grok Voice Transcribe 2.0; há uma coluna em que ele é mais rápido, e é a primeira.

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs GPT Transcribe — the scoreboard': the left column gives Grok Voice Transcribe 2.0 a 2.7% streaming final WER, 3.4% first partial WER, 0.49s to final transcript, $1.67 per 1,000 minutes batch, $3.33 per 1,000 minutes streaming and 162x real time throughput; the right column gives GPT Transcribe 3.9%, 6.3%, 0.81s, $4.50, $3.33 and 41x real time.

Em qual caminho de lote você está realmente

A diferença entre US$ 1,67 e US$ 4,50 é o número menos ambíguo aqui, e vale a pena ser preciso sobre por que ela existe. A OpenAI reduziu os preços dessa linha de produtos em 25% quando lançou o GPT Transcribe, da era GPT-4o Transcribe, e o resultado foi US$ 0,0045 por minuto. A SpaceXAI deixou sua tarifa de lote intacta em US$ 0,10 por hora quando passou da versão 1.0 para a 2.0 — aprimorou o modelo e cobrou o mesmo, o que é algo mais difícil de fazer e um sinal melhor sobre para onde o mercado está indo. O MAI-Transcribe-2 da Microsoft chegou ao idêntico US$ 0,10 por hora como oferta por tempo limitado, então o ponto de US$ 1,67 por 1.000 minutos se tornou o piso dos laboratórios de ponta para transcrição em lote, em vez de um número promocional de um único fornecedor.

A dez mil horas de áudio por mês, essa diferença é de aproximadamente US$ 2.830 contra US$ 450. Para um arquivo de podcast, um acúmulo de gravações de chamadas ou uma biblioteca de mídia sendo transcrita retroativamente, a diferença de preço ofusca qualquer diferença de precisão entre 2,3% e 3,31% de WER. Para um agente de streaming, em que os dois produtos custam o mesmo, precisão e latência são as únicas coisas que restam para discutir.

Há uma diferença estrutural por trás dessas tarifas que vale a pena nomear: o Grok Voice Transcribe 2.0 cobra uma taxa fixa por hora de áudio, e o GPT Live Transcribe cobra por minuto, mas o Gemini 3.5 Transcribe Live cobra por token tanto na entrada de áudio quanto na saída de texto. Apenas um dos três faz sua fatura ser uma função daquilo que o modelo escolhe dizer. Se o seu volume for grande o suficiente para que a previsão de custos seja importante, as taxas fixas são mais fáceis de justificar para quem assina a fatura — e, como a OrcaRouter repassa os preços de tabela dos provedores com 0% de markup, um corte do lado do fornecedor, como os 25% da OpenAI, entraria em vigor do nosso lado no mesmo dia em que fosse anunciado, não na próxima renovação.

Screenshot of the Artificial Analysis AA-WER Streaming leaderboard showing the identical $3.33 per 1,000 minutes streaming price for Grok Voice Transcribe 2.0 and GPT Live Transcribe, next to their 2.728% versus 3.918% final-transcript word error rates and 0.490s versus 0.812s times to final transcript.

O que nenhum dos dois modelos é

GPT Transcribe e GPT Live Transcribe são dois produtos, não um único com um botão de alternância. O modelo em lote dá conta de arquivos concluídos, transcrições de arquivos transmitidos via streaming e turnos confirmados em sessões do Realtime, e processa áudio cerca de 34 vezes mais rápido que o tempo real, segundo os próprios números da OpenAI — a Artificial Analysis mede 41× em seu próprio harness. O modelo de streaming é o mais caro, a US$ 0,017 por minuto, e o que tem a taxa de erro 10× maior nos resultados parciais. Escolher a OpenAI significa escolher qual desses dois problemas você tem, porque o endpoint mais barato não consegue fazer o trabalho do outro.

Grok Voice Transcribe 2.0 é um modelo com dois transportes: os mesmos pesos atendem /v1/stt via REST para arquivos de até 500 MB e wss://api.x.ai/v1/stt via WebSocket para áudio ao vivo, com resultados provisórios emitidos aproximadamente a cada 500 ms. A tarifa de streaming é exatamente o dobro da tarifa em lote, em vez de um produto projetado separadamente, o que significa que a precisão que você mede no seu áudio arquivado é a precisão que deve esperar ao vivo. Também significa que não há um segundo modelo para avaliar — um conjunto de prompts, um conjunto de termos-chave, um conjunto de expectativas.

A paridade de recursos é próxima, mas não idêntica. Ambos retornam timestamps em nível de palavra; o Grok Voice Transcribe 2.0 atribui uma pontuação de confiança a cada palavra, o que permite definir um limite para trechos de baixa confiança em vez de confiar igualmente na transcrição inteira. Ambos fazem diarização de falantes, e a do Grok está incluída sem custo adicional. Ambos lidam com normalização inversa de texto para números, datas, moedas e dados de contato. O Grok Voice Transcribe 2.0 adiciona transcrição multicanal em até 8 canais independentes, remoção de palavras de preenchimento e detecção de fim de turno Smart Turn; os diferenciais do GPT Transcribe são o condicionamento de contexto no nível do prompt e, no lado do Realtime, a continuidade automática de turnos anteriores. A OpenAI não divulgou uma contagem de idiomas suportados para nenhum dos dois modelos; o Grok Voice Transcribe 2.0 documenta dezenas de idiomas, com troca no meio da gravação e formatação de forma escrita em 25.

Screenshot of the OpenAI developers.openai.com GPT Transcribe model page describing the batch and streaming transcription endpoints, the $0.0045 per minute batch and $0.017 per minute streaming rates, the prompt and keyword context conditioning, and the Context Aware ASR accuracy figures.

Como decidir e como testá-lo

Se você está construindo um agente de voz que precisa responder antes que o interlocutor termine, a coluna de transcrição parcial é a sua variável de decisão, e ela separa os dois modelos de forma limpa: o Grok Voice Transcribe 2.0 é 2,9 pontos mais preciso nas parciais, mas leva 0,23 segundo a mais para produzi-las. Escolha o SpaceXAI se uma parcial errada for pior do que uma atrasada — roteamento, escalonamento, respostas acionadas por conformidade. Escolha a OpenAI se uma parcial atrasada for pior do que uma errada, e se você tiver o vocabulário de domínio para alimentar o mecanismo de contexto de modo que a diferença de precisão diminua. Depois, meça os dois, porque o comportamento de transcrição parcial de nenhum dos fornecedores em oito horas de fala de agentes em inglês prevê o que qualquer um deles fará com o seu sotaque, o seu codec e o seu jargão.

Se você estiver transcrevendo arquivos, a decisão fica muito mais fácil: $1,67 contra $4,50 por 1.000 minutos e 2,3% contra 3,31% de WER, ambos apontando no mesmo sentido. A única razão para permanecer no GPT Transcribe para trabalho em lote é se o mecanismo de condicionamento de contexto estiver fazendo algo pelo seu áudio que a diferença de precisão bruta não consegue compensar — o que é uma possibilidade real em gravações altamente específicas de domínio, e uma que pode ser testada.

Nenhum dos dois modelos de transcrição está no catálogo da OrcaRouter hoje, então as chamadas em si vão para a API do próprio fornecedor. O que está por trás de uma única chave da OrcaRouter é tudo o que a transcrição alimenta: o modelo de agente, o sumarizador, o classificador, o código que decide o que fazer com o texto. É aí que o segundo contrato costuma aparecer — um fornecedor para a fala, outro para o modelo que raciocina sobre ela — e não precisa ser assim. Uma chave para mais de 200 modelos, failover automático se um provedor apresentar degradação e a DSL de roteamento se você quiser enviar uma requisição por vários modelos e comparar antes de decidir. É uma afirmação menor do que "roteamos sua transcrição", e é a verdadeira.

O ponto a observar é se a OpenAI responde em precisão, e não em contexto. A empresa já lançou duas gerações de transcrição em um ano e cortou preços uma vez; o mecanismo de contexto é genuinamente diferenciado, mas, no ranking que mede a transcrição bruta, atualmente fica atrás tanto da SpaceXAI quanto da Microsoft. Se um GPT Transcribe 2 chegar com o mecanismo de contexto intacto e a taxa de erro reduzida para a faixa de 2%, essa comparação se inverte no lado do lote da noite para o dia — e o preço do streaming, já idêntico, faz disso uma corrida que vale a pena acompanhar.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente