
Grok Voice Transcribe 2.0 vs GPT Transcribe: Mesmo Preço de Streaming, Precisão Diferente
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
A coincidência é quase perfeita demais. No quadro AA-WER Streaming da Artificial Analysis, o Grok Voice Transcribe 2.0 e o GPT Live Transcribe — o endpoint de transcrição em streaming — aparecem ambos exatamente a US$ 3,33 por 1.000 minutos de áudio. O Grok Voice Transcribe 2.0 da SpaceXAI, lançado em 18 de setembro de 2026, retorna uma transcrição final com taxa de erro de palavra de 2,7%, 0,49 segundos após o fim da fala, e uma primeira parcial a 3,4%. O GPT Live Transcribe, lançado junto com o GPT Transcribe em 28 de julho de 2026, retorna sua transcrição final a 3,9% e sua primeira parcial a 6,3%. Mesmo preço, e cerca de 1,2 ponto de precisão na transcrição final mais 2,9 pontos de precisão na transcrição parcial a favor da SpaceXAI. O lado em lote do mesmo confronto não é coincidência alguma: o GPT Transcribe custa US$ 4,50 por 1.000 minutos contra US$ 1,67 do Grok Voice Transcribe 2.0, uma diferença de 63% no caminho de arquivos gravados.
Duas apostas diferentes sobre como a transcrição melhora
A resposta da OpenAI para a precisão é o contexto. GPT Transcribe e GPT Live Transcribe aceitam prompts de forma livre, listas de palavras-chave e listas de idiomas esperados, e, em sessões Realtime, os turnos transcritos anteriormente são realimentados como contexto para os posteriores. No próprio benchmark Context Aware ASR da OpenAI, esse condicionamento elevou a precisão semântica do GPT Live Transcribe de 38,5% para 44,6% — um número informado pelo fornecedor e que mede se o significado sobreviveu, e não se as palavras estavam corretas. A contrapartida que a OpenAI oferece é explícita: dê ao modelo informações sobre o que ele está prestes a ouvir, e ele transcreverá o seu domínio melhor do que um modelo geral com a mesma precisão bruta faria.
A resposta da SpaceXAI é o próprio modelo. O Grok Voice Transcribe 2.0 tem, sim, um mecanismo de enviesamento — até 100 termos-chave por solicitação, cada um com até 50 caracteres —, mas é uma lista de vocabulário, não um prompt. Você pode dizer a ele que "OrcaRouter" e "Kubernetes" são palavras reais; você não pode entregar a ele um parágrafo explicando que esta é uma ligação de suporte sobre um reembolso. A melhoria de precisão na versão 2.0 vem, em vez disso, do retreinamento: nos próprios conjuntos de avaliação derivados da produção da SpaceXAI, a taxa de erro de palavras caiu de 8,7% para 3,3% em áudio de conversação, de 10,6% para 7,1% em telefonia de 8 kHz, de 7,2% para 3,2% em credenciais faladas e de 20,6% para 6,8% em comandos curtos em 19 idiomas. Esses são os números da empresa com o áudio da empresa, não reproduzidos por ninguém fora dela, e descrevem um modelo que ficou melhor no problema acústico, e não um que ficou melhor em ser informado do que esperar.
A diferença prática aparece na segunda hora de trabalho. Um modelo condicionado ao contexto pode ser dramaticamente melhor do que o seu benchmark bruto sugere, porque você forneceu o vocabulário e o domínio. Ele também pode alucinar as palavras-chave que você forneceu: coloque "OrcaRouter" no prompt e um modelo que não consegue ouvir a palavra claramente pode produzi-la mesmo assim. Um modelo com viés para termos-chave degrada de forma mais suave, porque o viés desloca a probabilidade de um termo em vez de afirmar que ele está presente. Nenhum dos modos de falha aparece em um leaderboard, e ambos vão aparecer nos seus logs.
Os números, lado a lado
• Precisão final da transcrição (streaming) — Grok Voice Transcribe 2.0 com 2,7% de WER vs. GPT Live Transcribe com 3,9% no AA-WER Streaming, ambos segundo a Artificial Analysis
• Precisão do primeiro resultado parcial (streaming) — 3,4% vs 6,3%, a maior diferença da comparação e a que decide o comportamento do agente de voz
• Tempo até a transcrição final — 0,49s vs 0,81s após o fim da fala, então o modelo mais preciso também é o mais rápido a confirmar
• Tempo até a primeira parcial — 0,49s vs 0,26s, a única coluna de latência em que a OpenAI vence de forma categórica
• Preço de streaming — US$ 3,33 por 1.000 minutos para ambos, normalizado pela Artificial Analysis a partir dos US$ 0,20/hora do Grok e dos US$ 0,017/minuto da OpenAI
• Acurácia em lote (sem streaming) — Grok Voice Transcribe 2.0 com 2,3% de AA-WER vs GPT Transcribe com 3,31%
• Preço por lote — $1,67 por 1.000 minutos vs. $4,50 por 1.000 minutos, a partir de $0,10/hora contra $0,0045/minuto
• Throughput em lote — cerca de 162× o tempo real vs cerca de 41× na mesma placa
Leia essa lista como duas colunas em vez de um único veredito. O OpenAI vence na latência da primeira parcial por uma margem clara e oferece um mecanismo de contexto que o Grok não tem. O SpaceXAI vence na precisão final nos dois modos, na precisão parcial em streaming, na taxa de transferência e no preço por lote por uma ampla margem. Não há coluna em que o GPT Live Transcribe seja simultaneamente mais rápido e mais preciso que o Grok Voice Transcribe 2.0; há uma coluna em que ele é mais rápido, e é a primeira.

Em qual caminho de lote você está realmente
A diferença entre US$ 1,67 e US$ 4,50 é o número menos ambíguo aqui, e vale a pena ser preciso sobre por que ela existe. A OpenAI reduziu os preços dessa linha de produtos em 25% quando lançou o GPT Transcribe, da era GPT-4o Transcribe, e o resultado foi US$ 0,0045 por minuto. A SpaceXAI deixou sua tarifa de lote intacta em US$ 0,10 por hora quando passou da versão 1.0 para a 2.0 — aprimorou o modelo e cobrou o mesmo, o que é algo mais difícil de fazer e um sinal melhor sobre para onde o mercado está indo. O MAI-Transcribe-2 da Microsoft chegou ao idêntico US$ 0,10 por hora como oferta por tempo limitado, então o ponto de US$ 1,67 por 1.000 minutos se tornou o piso dos laboratórios de ponta para transcrição em lote, em vez de um número promocional de um único fornecedor.
A dez mil horas de áudio por mês, essa diferença é de aproximadamente US$ 2.830 contra US$ 450. Para um arquivo de podcast, um acúmulo de gravações de chamadas ou uma biblioteca de mídia sendo transcrita retroativamente, a diferença de preço ofusca qualquer diferença de precisão entre 2,3% e 3,31% de WER. Para um agente de streaming, em que os dois produtos custam o mesmo, precisão e latência são as únicas coisas que restam para discutir.
Há uma diferença estrutural por trás dessas tarifas que vale a pena nomear: o Grok Voice Transcribe 2.0 cobra uma taxa fixa por hora de áudio, e o GPT Live Transcribe cobra por minuto, mas o Gemini 3.5 Transcribe Live cobra por token tanto na entrada de áudio quanto na saída de texto. Apenas um dos três faz sua fatura ser uma função daquilo que o modelo escolhe dizer. Se o seu volume for grande o suficiente para que a previsão de custos seja importante, as taxas fixas são mais fáceis de justificar para quem assina a fatura — e, como a OrcaRouter repassa os preços de tabela dos provedores com 0% de markup, um corte do lado do fornecedor, como os 25% da OpenAI, entraria em vigor do nosso lado no mesmo dia em que fosse anunciado, não na próxima renovação.

O que nenhum dos dois modelos é
GPT Transcribe e GPT Live Transcribe são dois produtos, não um único com um botão de alternância. O modelo em lote dá conta de arquivos concluídos, transcrições de arquivos transmitidos via streaming e turnos confirmados em sessões do Realtime, e processa áudio cerca de 34 vezes mais rápido que o tempo real, segundo os próprios números da OpenAI — a Artificial Analysis mede 41× em seu próprio harness. O modelo de streaming é o mais caro, a US$ 0,017 por minuto, e o que tem a taxa de erro 10× maior nos resultados parciais. Escolher a OpenAI significa escolher qual desses dois problemas você tem, porque o endpoint mais barato não consegue fazer o trabalho do outro.
Grok Voice Transcribe 2.0 é um modelo com dois transportes: os mesmos pesos atendem /v1/stt via REST para arquivos de até 500 MB e wss://api.x.ai/v1/stt via WebSocket para áudio ao vivo, com resultados provisórios emitidos aproximadamente a cada 500 ms. A tarifa de streaming é exatamente o dobro da tarifa em lote, em vez de um produto projetado separadamente, o que significa que a precisão que você mede no seu áudio arquivado é a precisão que deve esperar ao vivo. Também significa que não há um segundo modelo para avaliar — um conjunto de prompts, um conjunto de termos-chave, um conjunto de expectativas.
A paridade de recursos é próxima, mas não idêntica. Ambos retornam timestamps em nível de palavra; o Grok Voice Transcribe 2.0 atribui uma pontuação de confiança a cada palavra, o que permite definir um limite para trechos de baixa confiança em vez de confiar igualmente na transcrição inteira. Ambos fazem diarização de falantes, e a do Grok está incluída sem custo adicional. Ambos lidam com normalização inversa de texto para números, datas, moedas e dados de contato. O Grok Voice Transcribe 2.0 adiciona transcrição multicanal em até 8 canais independentes, remoção de palavras de preenchimento e detecção de fim de turno Smart Turn; os diferenciais do GPT Transcribe são o condicionamento de contexto no nível do prompt e, no lado do Realtime, a continuidade automática de turnos anteriores. A OpenAI não divulgou uma contagem de idiomas suportados para nenhum dos dois modelos; o Grok Voice Transcribe 2.0 documenta dezenas de idiomas, com troca no meio da gravação e formatação de forma escrita em 25.

Como decidir e como testá-lo
Se você está construindo um agente de voz que precisa responder antes que o interlocutor termine, a coluna de transcrição parcial é a sua variável de decisão, e ela separa os dois modelos de forma limpa: o Grok Voice Transcribe 2.0 é 2,9 pontos mais preciso nas parciais, mas leva 0,23 segundo a mais para produzi-las. Escolha o SpaceXAI se uma parcial errada for pior do que uma atrasada — roteamento, escalonamento, respostas acionadas por conformidade. Escolha a OpenAI se uma parcial atrasada for pior do que uma errada, e se você tiver o vocabulário de domínio para alimentar o mecanismo de contexto de modo que a diferença de precisão diminua. Depois, meça os dois, porque o comportamento de transcrição parcial de nenhum dos fornecedores em oito horas de fala de agentes em inglês prevê o que qualquer um deles fará com o seu sotaque, o seu codec e o seu jargão.
Se você estiver transcrevendo arquivos, a decisão fica muito mais fácil: $1,67 contra $4,50 por 1.000 minutos e 2,3% contra 3,31% de WER, ambos apontando no mesmo sentido. A única razão para permanecer no GPT Transcribe para trabalho em lote é se o mecanismo de condicionamento de contexto estiver fazendo algo pelo seu áudio que a diferença de precisão bruta não consegue compensar — o que é uma possibilidade real em gravações altamente específicas de domínio, e uma que pode ser testada.
Nenhum dos dois modelos de transcrição está no catálogo da OrcaRouter hoje, então as chamadas em si vão para a API do próprio fornecedor. O que está por trás de uma única chave da OrcaRouter é tudo o que a transcrição alimenta: o modelo de agente, o sumarizador, o classificador, o código que decide o que fazer com o texto. É aí que o segundo contrato costuma aparecer — um fornecedor para a fala, outro para o modelo que raciocina sobre ela — e não precisa ser assim. Uma chave para mais de 200 modelos, failover automático se um provedor apresentar degradação e a DSL de roteamento se você quiser enviar uma requisição por vários modelos e comparar antes de decidir. É uma afirmação menor do que "roteamos sua transcrição", e é a verdadeira.
O ponto a observar é se a OpenAI responde em precisão, e não em contexto. A empresa já lançou duas gerações de transcrição em um ano e cortou preços uma vez; o mecanismo de contexto é genuinamente diferenciado, mas, no ranking que mede a transcrição bruta, atualmente fica atrás tanto da SpaceXAI quanto da Microsoft. Se um GPT Transcribe 2 chegar com o mecanismo de contexto intacto e a taxa de erro reduzida para a faixa de 2%, essa comparação se inverte no lado do lote da noite para o dia — e o preço do streaming, já idêntico, faz disso uma corrida que vale a pena acompanhar.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
