Cartão hero do artigo exibindo 'Grok Voice Transcribe 2.0 vs Whisper Large v3 Turbo', com o selo 'COMPARAÇÃO DE MODELOS' e o subtítulo 'O que a linha de base gratuita ainda faz melhor', com chips exibindo 2,7% vs 4,07% de WER, US$ 0,20 por hora vs pesos MIT, 0,49 s vs 1-5 s auto-hospedado e gerenciado vs próprio, sobre um gradiente de branco para azul com o logotipo da OrcaRouter no canto inferior direito.
Guides & Insights

Grok Voice Transcribe 2.0 vs Whisper Large v3 Turbo: O que a linha de base gratuita ainda faz melhor

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O Whisper Large v3 Turbo tem sido a resposta padrão para “precisamos de transcrição” desde que foi lançado sob a licença MIT em 1º de outubro de 2024, e nada sobre o Grok Voice Transcribe 2.0 muda o motivo disso. O novo modelo da SpaceXAI, lançado em 18 de setembro de 2026, é um transcritor genuinamente melhor por uma ampla margem — taxa de erro de palavras de 2,7% para transcrições finais e 3,4% para parciais iniciais no painel AA-WER Streaming da Artificial Analysis, contra um número da família Whisper de 4,07% no painel não streaming, com o próprio Turbo tipicamente alguns décimos de ponto atrás do Large v3 completo do qual foi destilado. Ele também custa US$ 0,10 por hora de áudio para lote e US$ 0,20 por hora para streaming. O Whisper Large v3 Turbo é um arquivo de 1,6 GB com 809 milhões de parâmetros que roda no seu próprio hardware, não mede nada, não envia áudio para lugar nenhum e não tem limite de taxa, nem limite de concorrência, nem cronograma de descontinuação. A comparação não é entre um modelo melhor e um pior. É entre alugar precisão e possuir um componente.

A janela de trinta segundos é toda a arquitetura

O Whisper Large v3 Turbo herda a estrutura de todos os modelos Whisper: o áudio é processado em janelas fixas de 30 segundos, o codificador é executado uma vez por janela e o decodificador emite texto para esse bloco. O Turbo tornou isso mais barato — quatro camadas de decodificador em vez de trinta e duas, cerca de 8× mais rápido que o Large v3, aproximadamente 6 GB de VRAM em vez de 10 —, mas não mudou a forma. Não existe a noção de "a frase até agora" dentro do modelo, porque não há estado persistente entre janelas.

Esse único fato de design explica tudo o que decorre dele. Não há streaming nativo, porque o streaming exige comprometer-se com a saída parcial no meio do enunciado e o modelo não tem mecanismo para isso. Existem implantações do Whisper em tempo real, mas elas são chunking mais detecção de atividade de voz mais uma camada de costura que alguém escreveu e agora mantém, e a latência que resulta desse pipeline é medida em segundos, em vez do meio segundo que o Grok Voice Transcribe 2.0 atinge. Não há diarização de falantes, porque a diarização é um problema separado sobre quem está falando, e não sobre o que foi dito. E a variante Turbo especificamente retorna texto simples — sem carimbos de data/hora, sem pontuações de confiança, sem normalização inversa de texto transformando números falados e endereços de e-mail em forma escrita.

Grok Voice Transcribe 2.0 foi construído ao contrário. O streaming é o transporte principal, o lote são os mesmos pesos por trás de um endpoint REST, e a lista de recursos parece uma lista de coisas que o Whisper deixou para a aplicação: carimbos de data/hora no nível da palavra com confiança por palavra, diarização de falantes incluída sem custo adicional, transcrição multicanal em até 8 canais independentes, viés de termos-chave de até 100 termos de domínio por solicitação, normalização inversa de texto em 25 idiomas, remoção de palavras de preenchimento e detecção de fim de turno Smart Turn para agentes de voz. Se você vem mantendo um pipeline de fragmentação e junção em torno do Whisper, essa lista é uma descrição do código que você escreveu.

A lacuna de precisão, e por que ela é menor do que parece

• Precisão final da transcrição (streaming) — Grok Voice Transcribe 2.0 com 2,7% de WER no AA-WER Streaming vs. nenhuma entrada do Whisper Large v3 Turbo, porque o modelo não consegue fazer streaming nativamente

• Acurácia em lote — Grok Voice Transcribe 2.0 com 2,29% de AA-WER vs Whisper Large v3 com 4,07% no ranking não-streaming da Artificial Analysis, com o Turbo tipicamente 0,4 a 0,6 pontos atrás do Large v3 completo em testes independentes

• Áudio limpo em inglês — o Whisper Large v3 Turbo atinge cerca de 2,1% de WER no LibriSpeech test-clean e cerca de 4,2% no test-other, então, em fala com qualidade de estúdio, a diferença para a API de ponta se reduz a quase nada

• Áudio do mundo real — os mesmos benchmarks independentes colocam o Turbo em cerca de 4,6% em chamadas de negócios com dois falantes e 8–12% em áudio com ruído, que é onde a margem do modelo de fronteira se amplia

• Taxa de transferência em lote — Grok Voice Transcribe 2.0 a aproximadamente 162× o tempo real vs. Whisper Large v3 Turbo a aproximadamente 80× em uma única GPU de consumidor modesta, com hardware de serving mais rápido alcançando múltiplos desse valor

• Latência de streaming — 0,49 segundos até a primeira parcial no Grok Voice Transcribe 2.0 vs 1–5 segundos para pipelines de streaming do Whisper auto-hospedados, o que é código de integração mais VAD, e não uma capacidade do modelo

A leitura honesta dessa lista é que o argumento de precisão para pagar é real, mas condicional. Em inglês limpo, de um único falante e bem gravado, o Whisper Large v3 Turbo é suficientemente próximo para que a diferença raramente altere um resultado. Em telefonia de 8 kHz, áudio ruidoso de call center, fala com acento e frases curtas específicas de domínio — exatamente os conjuntos contra os quais a SpaceXAI ajustou o 2.0, em que seus próprios números relatados passaram de 10,6% para 7,1% em telefonia e de 20,6% para 6,8% em comandos multilíngues curtos —, a diferença passa a ser a diferença entre uma transcrição na qual você pode basear o roteamento e uma que você precisa ler. Esses são números relatados pela empresa, com áudio da empresa, não reproduzidos por ninguém fora da SpaceXAI, e a direção que apontam é consistente com todos os testes independentes do Whisper em áudio degradado.

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs Whisper Large v3 Turbo — the scoreboard': the left column gives Grok Voice Transcribe 2.0 native streaming with a 0.49s partial, 2.29% batch WER, included diarization, word timestamps with confidence scores, $0.20 per streaming hour and a vendor API data path; the right column gives Whisper Large v3 Turbo self-built chunking only, 4.07% for full v3, no diarization, no timestamps in Turbo, MIT weights where you pay compute, and a data path that stays on your own hardware.

A comparação de custos não é $0,10 versus $0

A licença do Whisper não custa nada; executá-lo, sim. Uma instância de GPU que acomoda um modelo de 1,6 GB em 6 GB de VRAM e transcreve a cerca de 80× o tempo real é o verdadeiro item de custo e, nas tarifas típicas de GPU na nuvem, isso fica na mesma ordem de magnitude das APIs hospedadas para cargas de trabalho contínuas — com a importante exceção de que você paga pela capacidade, esteja o áudio fluindo ou não. Existem endpoints hospedados do Whisper com uma ampla faixa de preços, de menos de US$ 1,20 por 1.000 minutos na ponta mais barata a alguns dólares, e essa variação é um lembrete útil de que "Whisper" é um modelo, não um nível de serviço. O quadro de preços normalizados da Artificial Analysis coloca os endpoints hospedados mais baratos do Whisper Large v3 a US$ 0,50 e US$ 1,15 por 1.000 minutos, ambos abaixo da tarifa de lote de US$ 1,67 do Grok Voice Transcribe 2.0 — mas nenhum desses endpoints é seu, e ambos vêm acompanhados dos limites de taxa e da política de retenção de outra pessoa.

Onde a auto-hospedagem ganha de forma incontestável é em volume com picos intermitentes. Um arquivo de mídia de dez mil horas custa o mesmo na sua própria GPU, quer você o processe em uma semana ou em um ano, e nenhum medidor por hora corre enquanto você decide. Um pipeline de conformidade que nunca deve enviar áudio para fora da rede não tem alternativa hospedada a nenhum preço, porque o requisito é arquitetural, e não financeiro. E o ajuste fino só está disponível para você se você detiver os pesos: a licença MIT do Whisper permite que você pegue o modelo de 809M parâmetros e o adapte a um único locutor, um único sotaque ou um vocabulário de domínio restrito, o que é uma capacidade que nenhuma API expõe a nenhum preço.

O reverso é que o preço de um modelo hospedado pode mudar debaixo dos seus pés. A SpaceXAI manteve sua tarifa inalterada ao passar da versão 1.0 para a 2.0 — uma melhoria de modelo a preço fixo —, e o MAI-Transcribe-2 da Microsoft chegou ao idêntico US$ 0,10 por hora de áudio, o que mostra onde está o piso da fronteira. Se você rotear pelo OrcaRouter, esses preços de tabela são repassados com 0% de markup, então um corte do fornecedor chega à sua fatura no dia em que acontece, e não depois de um ciclo de reprecificação. Essa é uma vantagem genuína do lado alugado desta comparação, e vale a pena pesar isso contra o fato de que o lado gratuito nunca lhe envia uma fatura.

Screenshot of the Artificial Analysis non-streaming speech-to-text leaderboard showing Whisper Large v3 at 4.07% AA-WER and 118.9x real time at $1.15 per 1,000 minutes, alongside the cheaper hosted Whisper endpoints and the frontier rows for comparison.

Para que cada um realmente serve

Mantenha o Whisper Large v3 Turbo quando o áudio já for um arquivo, o volume for alto ou irregular, as gravações forem razoavelmente limpas, e nem os dados puderem sair da sua rede nem o orçamento puder absorver uma cobrança por hora. Ele continua sendo a escolha correta para arquivos offline, transcrição na borda e no dispositivo, onde um modelo de 1,6 GB é quantizado até caber, pipelines em lote em que a restrição é a taxa de transferência e não a latência, e qualquer projeto em que o ajuste fino com o seu próprio áudio seja o caminho para a precisão de que você precisa. O ferramental ao seu redor — whisper.cpp para a borda, faster-whisper para produção, builds GGUF para memória restrita — tem dois anos de amadurecimento pela comunidade por trás dele, o que é uma forma de confiabilidade que nenhuma API com dois dias de existência tem.

Mude para o Grok Voice Transcribe 2.0 quando o áudio ainda está a chegar, quando as gravações estão degradadas, quando precisa de saber quem falou e quando, quando o vocabulário de domínio tem de ser enviesado em vez de afinado, ou quando a aplicação age sobre uma transcrição parcial antes de o orador ter terminado. O caminho de atualização é um parâmetro numa integração existente e um pin de volta para a 1.0 se algo correr mal, o que torna o teste barato. Vale a pena notar que a migração inversa não é barata: código escrito contra uma API de streaming com diarização e deteção de turnos não se degrada graciosamente para um modelo em lote que devolve texto simples, o que é um argumento a favor de provar o caminho alojado numa fatia do seu áudio real antes de comprometer um pipeline com ele.

Screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models, showing the browsable list of routed models and vendors that sit behind a single OrcaRouter API key.

Onde a decisão é realmente tomada

A maioria das equipes que roda Whisper em qualquer escala não está escolhendo entre esses dois modelos, e sim operando um híbrido: Whisper para o arquivo, porque é gratuito e bom o suficiente em áudio limpo; uma API de fronteira para o caminho ao vivo, porque nada mais faz streaming com 3,4% de WER parcial; e um terceiro modelo a jusante que resume, classifica ou age sobre qualquer texto que saia. É nessa terceira etapa que a proliferação costuma acontecer — um segundo contrato com fornecedor para o modelo de raciocínio, um segundo conjunto de credenciais, um segundo limite de taxa para monitorar. O OrcaRouter elimina essa camada: uma única chave para mais de 200 modelos, failover automático quando um provedor degrada, e uma DSL de roteamento se você quiser enviar a mesma transcrição por vários modelos e comparar antes de escolher um. As próprias chamadas de transcrição continuam indo para o fornecedor que você escolheu; o que para de se multiplicar é tudo o que vem depois delas.

O que observar do lado do Whisper não é um novo checkpoint — a família não mudou desde o Turbo, e a atenção da OpenAI foi para a linha GPT Transcribe. É a camada de serviço. A cada ano, as ferramentas auto-hospedadas ficam mais rápidas e o hardware de que precisam fica menor, e cada melhoria aí reduz o argumento para pagar por hora. O que observar do lado do SpaceXAI é a inversão do padrão: quando o 2.0 se tornar o padrão e o 1.0 for descontinuado, toda integração que nunca nomeou um modelo vai migrar de uma vez, incluindo a latência. Nenhum dos dois avanços muda a divisão fundamental. Um modelo que você possui e ajusta, um modelo que você aluga e chama, e a resposta honesta de que a maioria das stacks de produção acaba rodando os dois.