
Grok Voice Transcribe 2.0 vs Gemini 3.5 Transcribe: A faixa de streaming pertence a um deles
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Grok Voice Transcribe 2.0 e Gemini 3.5 Transcribe são os dois modelos de reconhecimento de fala de fronteira mais recentes de laboratórios rivais, e a maneira honesta de compará-los é admitir desde o início que eles não foram criados para a mesma tarefa. O Grok Voice Transcribe 2.0 da SpaceXAI, lançado em 18 de setembro de 2026, é um modelo com foco em streaming com um modo em lote acoplado: ele lidera o ranking AA-WER Streaming com taxa de erro de palavras de 2,7% para transcrições finais e 3,4% para os primeiros parciais, ambos chegando 0,49 segundos após o fim da fala. O Gemini 3.5 Transcribe, lançado em 26 de agosto de 2026, é um modelo com foco em lote com uma SKU de streaming acoplada, e as duas metades dele se comportam de maneira muito diferente — o caminho pré-gravado mede 2,6% de AA-WER no ranking não-streaming da Artificial Analysis, enquanto o gemini-3.5-transcribe-live endpoint separado mede 4,0% no ranking de streaming em 0,40 segundos. Coloque esses quatro números lado a lado e a forma deste confronto fica óbvia: eles ficam próximos em precisão onde o Gemini 3.5 Transcribe é forte, e não ficam próximos onde o Grok Voice Transcribe 2.0 é.
A única rota em que os dois lutam
Ambos os modelos conseguem transcrever áudio ao vivo, então o streaming é a única arena em que uma comparação direta significa algo. Aí, o Grok Voice Transcribe 2.0 lidera o Gemini 3.5 Transcribe Live por 1,3 pontos em precisão da transcrição final — 2,7% contra 4,0% de WER no mesmo aparato de avaliação, nas mesmas aproximadamente oito horas de áudio e com a mesma ponderação 50/25/25 entre AA-AgentTalk, VoxPopuli e Earnings22. Isso não é uma diferença de arredondamento; nessas taxas de erro, é aproximadamente uma palavra errada a mais a cada setenta e cinco transcritas pelo modelo do Google. Nas primeiras transcrições parciais, a diferença é ainda maior: 3,4% contra 5,8%, e as parciais são as transcrições com base nas quais um agente de voz em tempo real precisa agir antes que o falante tenha terminado.
A latência corta no sentido oposto, e essa é a parte da comparação que se perde. O Gemini 3.5 Transcribe Live devolve sua transcrição final 0,40 segundos após o fim da fala, contra 0,49 do Grok, e seu primeiro resultado parcial em 0,25 segundos, contra 0,49 do Grok — cerca de duas vezes mais rápido até a primeira palavra utilizável. Nenhum dos dois modelos disputa com o extremo genuinamente rápido deste quadro, onde o Deepgram Flux registra 0,02 segundos e o Soniox v5, 0,05, mas entre esses dois a troca é explícita: o Google é mais rápido para falar, a SpaceXAI tem mais chance de estar certa quando fala. Para um agente de tomada de turno que não pode falar por cima de um interlocutor, 0,24 segundos de latência parcial extra é um custo real que a vitória em precisão precisa justificar.

Onde o Gemini 3.5 Transcribe realmente vence
A cobertura de idiomas é o ponto mais claro, e não há nem comparação. O modelo do Google lida com mais de 85 idiomas; o Grok Voice Transcribe 2.0 oferece suporte a dezenas de idiomas, com formatação para a forma escrita — a normalização inversa de texto que transforma números, datas, moedas e endereços de e-mail falados em suas formas escritas — documentada em 25 idiomas. Se o seu áudio for em português, vietnamita ou uma mistura com alternância de código entre dois idiomas dentro de uma mesma frase, a questão de qual modelo é mais preciso no ranking da Artificial Analysis é amplamente acadêmica, porque esse ranking é ponderado para o inglês e repleto de discussões sobre agentes. O Google relata WER de 5,50% em streaming e 5,04% em não streaming no FLEURS em sua própria suíte multilíngue, números reportados pelo fornecedor e não reproduzidos de forma independente, mas que ao menos chegam a descrever o caso multilíngue.
A segunda vantagem é o nível gratuito. O Gemini 3.5 Transcribe oferece tokens de entrada e saída gratuitos na API do Google, com a ressalva de que o conteúdo do nível gratuito é usado para melhorar os produtos do Google, enquanto o conteúdo do nível pago não é. Para um protótipo, um projeto paralelo ou uma ferramenta interna que processa áudio que você não pagaria de outra forma para transcrever, essa é uma opção real que nenhum fornecedor que cobra por hora consegue igualar. O Grok Voice Transcribe 2.0 é pago desde a primeira hora de áudio.
E a terceira é que o Gemini 3.5 Transcribe é um modelo multimodal geral com um modo de transcrição, não um serviço de ASR dedicado. Ele pode receber prompts, pode usar texto como contexto e reside na mesma superfície de API que tudo o mais que o Google lança. Se a transcrição é uma etapa em um pipeline que também precisa de raciocínio sobre a transcrição, manter ambos em uma única chamada de modelo vale algo que uma taxa de erro por palavra não captura.
O cálculo do preço, por mil minutos
A Artificial Analysis normaliza ambos os modelos para o custo por 1.000 minutos de áudio, que é a única forma de comparar uma tarifa horária fixa com a cobrança por tokens:
• Em lote, pré-gravado — Grok Voice Transcribe 2.0 a US$ 1,67 por 1.000 minutos (US$ 0,10/hora) vs. Gemini 3.5 Transcribe a US$ 5,00 por 1.000 minutos (US$ 0,30/hora, a partir de US$ 2,00 por 1M de tokens de entrada e US$ 12,00 por 1M de tokens de saída)
• Streaming — Grok Voice Transcribe 2.0 a US$ 3,33 por 1.000 minutos (US$ 0,20/hora) vs. Gemini 3.5 Transcribe Live a aproximadamente US$ 5,40 por 1.000 minutos, resultante da combinação de US$ 3,50 por 1 milhão de tokens de entrada de áudio e US$ 21,00 por 1 milhão de tokens de saída de texto
• Throughput em lote — Grok Voice Transcribe 2.0 a aproximadamente 162× o tempo real vs Gemini 3.5 Transcribe a aproximadamente 88× na mesma placa, então o modelo mais barato também é o mais rápido para trabalho com arquivos
• Limite de sessão ao vivo — Grok Voice Transcribe 2.0 transmite por um WebSocket sem teto de sessão publicado além de 100 sessões simultâneas por equipe vs Gemini 3.5 Transcribe Live limitado a 10 minutos por sessão
Essa última linha é o detalhe operacional que decide mais arquiteturas do que os números de precisão decidem. Um teto de 10 minutos em uma sessão ao vivo significa que chamadas longas, reuniões longas e transmissões longas precisam ser fatiadas e restabelecidas, e cada restabelecimento é uma emenda onde o contexto se perde. O endpoint de streaming do Grok carrega um teto de tamanho de arquivo de 500 MB no caminho em lote e um limite de concorrência por equipe de 100 sessões no caminho de streaming, o que é um tipo diferente de restrição — vazão em vez de duração.
Vale a pena entender a cobrança por token antes de se comprometer com o lado do Google, porque ela faz da sua fatura uma função de duas variáveis em vez de uma só. O Gemini cobra separadamente pela entrada de áudio e pela saída de texto, então um modelo que produz formatação prolixa ou se repete custa mais do que um que não faz isso, e um idioma com palavras mais longas custa mais do que um com palavras mais curtas. A tarifa fixa por hora do Grok não se altera com nada disso. Para cargas de trabalho de alto volume, a tarifa fixa é mais fácil de prever e, como a OrcaRouter repassa os preços de tabela dos provedores com 0% de margem, uma mudança de qualquer um dos fornecedores chega à sua fatura no dia em que acontece, e não na próxima renovação de contrato.

Formas de funcionalidades: o que cada uma se recusa a fazer
As listas de capacidades divergem mais do que os números de precisão sugerem, e as lacunas estão em pontos que importam para aplicações específicas:
• Diarização de falantes — incluída sem custo adicional no Grok Voice Transcribe 2.0; sem suporte no Gemini 3.5 Transcribe Live, portanto transcrições ao vivo com atribuição de falantes não estão disponíveis nesse endpoint de forma alguma
• Marcas temporais ao nível da palavra — Grok Voice Transcribe 2.0 devolve-as com pontuações de confiança por palavra; Gemini 3.5 Transcribe Live não devolve nenhuma, o que exclui a aplicação de limiares de confiança e o alinhamento preciso de legendas
• Áudio multicanal — Grok Voice Transcribe 2.0 transcreve até 8 canais independentes em uma única passagem; Gemini 3.5 Transcribe Live não tem equivalente, portanto gravações de chamadas multicanal exigem sessões por canal
• Viés de termos-chave — Grok Voice Transcribe 2.0 aceita até 100 termos de domínio por solicitação; Gemini 3.5 Transcribe aceita vocabulário personalizado e dicas de idioma opcionais
• Infraestrutura de agente de voz — Grok Voice Transcribe 2.0 inclui remoção de palavras de preenchimento e detecção de fim de turno do Smart Turn; Gemini 3.5 Transcribe Live cobre o caso de streaming, mas deixa a lógica de turno para a aplicação
• Tratamento de entrada — Grok Voice Transcribe 2.0 aceita upload direto de arquivos de até 500 MB em 12 formatos de áudio; o caminho para pré-gravados do Gemini 3.5 Transcribe espera uma URL HTTPS pública com limite de 15 minutos e 300 MB, e não pode combinar seu modo Smart formatting com marcas de tempo de palavras ou rótulos de falante.
O padrão nessa lista é que a SpaceXAI construiu um produto de transcrição e a Google construiu uma capacidade de transcrição. Diarização, carimbos de data e hora, divisão por canais e deteção de turnos são as funcionalidades de que se precisa quando a transcrição é a aplicação inteira; a possibilidade de usar prompts, a amplitude de idiomas e uma única API para tudo são o que se pretende quando a transcrição é apenas uma etapa dentro de algo maior. Nenhuma das listas é melhor em abstrato, e uma equipa que escolha apenas com base na exatidão acabará por ficar sem o conjunto de que não precisava.

Escolher entre eles, e o que muda a resposta
Recorra ao Grok Voice Transcribe 2.0 quando a transcrição tiver de estar correta enquanto o áudio ainda estiver tocando: alternância de turnos de agentes ao vivo, legendagem em tempo real que não pode se dar ao luxo de errar, fluxos de central de contatos em que a atribuição de falante e a separação de canais fazem parte dos requisitos, ou qualquer pipeline em lote em que US$ 1,67 por 1.000 minutos e 162× de throughput sejam ambos importantes. Recorra ao Gemini 3.5 Transcribe quando o áudio for multilíngue em um idioma fora do conjunto documentado do Grok, quando a transcrição alimentar um modelo que também precise raciocinar sobre ela, quando você quiser uma camada gratuita para prototipar, ou quando os 2,6% de AA-WER do caminho em lote forem simplesmente suficientes para o que você está fazendo e a cobertura adicional de idiomas valer mais do que a diferença de preço.
O que a maioria das equipes realmente faz aqui não é escolher. Ambos os modelos são acessíveis por meio de uma única chave de API da OrcaRouter, junto com mais de 200 outros modelos, o que significa que você pode encaminhar o tráfego de agentes ao vivo para o Grok Voice Transcribe 2.0 e arquivos multilíngues longos para o Gemini 3.5 Transcribe sem manter dois contratos com fornecedores, duas relações de cobrança e dois conjuntos de credenciais. É também assim que você resolve a questão da precisão para o seu próprio áudio: rode os dois nas mesmas gravações, compare as transcrições que você realmente obteve e deixe a DSL de roteamento enviar o tráfego para onde ele pertence. O ranking mostra qual modelo vence em oito horas de conversas de agentes em inglês de outra pessoa; só o seu próprio áudio diz qual deles vence no seu.
A questão em aberto é o que acontece com essa lacuna de streaming quando o Google revisar o endpoint Live. O Gemini 3.5 Transcribe Live foi lançado em pré-visualização pública, e seu número de 4,0% foi medido cerca de um dia depois de ele se tornar disponível para chamadas — um forte sinal precoce, mas que teve menos tempo para se estabilizar do que o número do Grok atrás do qual agora se encontra. Se o Google fechar a lacuna de streaming de 1,3 ponto mantendo a latência de 0,25 segundo dos resultados parciais, o trade-off deixa de ser um trade-off e a vantagem do Grok fica reduzida a preço e recursos. Até lá, a divisão é clara: os resultados parciais mais rápidos são do Google, os mais precisos são da SpaceXAI, e nenhum modelo da tabela é as duas coisas.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
