Cartão de destaque do artigo exibindo 'Grok Voice Transcribe 2.0 vs Granite Speech 5.0 470M TurboCTC', com o selo 'COMPARAÇÃO DE MODELOS' e o subtítulo 'vazão versus latência', com chips exibindo 12.600 RTFx, 2,7% de WER em streaming, 470M de parâmetros e $0,20 por hora de streaming, sobre um gradiente de branco para azul com o logotipo da OrcaRouter no canto inferior direito.
Guides & Insights

Grok Voice Transcribe 2.0 vs Granite Speech 5.0 470M TurboCTC: 12.600× de Tempo Real Encontra Meio Segundo

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Granite Speech 5.0 470M TurboCTC transcreve cerca de 3,5 horas de áudio a cada segundo em uma única H200, e o Grok Voice Transcribe 2.0 retorna uma primeira transcrição parcial 0,49 segundos depois que você para de falar. Esses dois números são colocados lado a lado em posts de comparação como se fossem o mesmo tipo de medição, e não são nem de longe o mesmo tipo de medição — um é uma métrica de throughput de datacenter em lote, sem latência associada; o outro é uma métrica de latência de um modelo cujo throughput ninguém publicou. A IBM lançou o Granite Speech 5.0 470M TurboCTC em 25 de agosto de 2026 sob a licença Apache 2.0, eliminando completamente o decodificador do modelo de linguagem e decodificando com uma única passagem CTC não autorregressiva. A SpaceXAI lançou o Grok Voice Transcribe 2.0 em 18 de setembro de 2026 como uma API gerenciada a US$ 0,10 por hora de áudio para lote e US$ 0,20 por hora para streaming. Ambos são excelentes modelos de transcrição que resolvem metades opostas do mesmo problema, e escolher entre eles é mais fácil quando você para de comparar os números diretamente.

12.600× o tempo real, e as palavras que o qualificam

O número do Granite é 12.600 RTFx, medido em uma única NVIDIA H200 com inferência em lote — o número da IBM, divulgado no lançamento e não reproduzido de forma independente desde então. RTFx é uma razão entre a duração do áudio e o tempo de processamento, então 12.600 significa aproximadamente 3,5 horas de áudio por segundo de tempo real. O próprio enquadramento da IBM é que isso é mais de 20× a taxa de transferência das versões anteriores do Granite Speech, e é essa a afirmação que realmente importa aqui: o ganho de velocidade veio da remoção de trabalho, não da adição de hardware.

O que ele não é é um número de latência. Um job em lote que conclui 3,5 horas de áudio por segundo ainda pode levar muito tempo para retornar o primeiro token de qualquer arquivo individual, dependendo de como o lote é montado e de quanto áudio você fornece a ele antes que ele comece. A IBM não publica nenhum número de latência para o TurboCTC. No ranking de campo distante, os dois checkpoints são as duas entradas mais rápidas, mas a taxa de transferência ali foi medida em uma única NVIDIA L4, que é um acelerador próximo de datacenter e não um celular.

O motivo pelo qual isso importa é que o modelo é explicitamente posicionado para laptops, telefones e dispositivos de borda — o próprio enquadramento da IBM — e ninguém publicou desempenho de fluxo único em nenhum deles. Até que alguém o faça, trate “12.600×” como uma afirmação sobre quão barato é processar um backfill em GPUs alugadas, o que é uma alegação genuinamente valiosa e bem fundamentada, e não como uma afirmação sobre quão rápido um usuário recebe uma frase de volta.

O que a IBM removeu, e o que isso lhe custa

TurboCTC é um design apenas com codificador: um codificador acústico Conformer de 16 camadas treinado com CTC, decodificado de forma gulosa em uma única passagem não autorregressiva, com uma camada de saída de subpalavras de 16.384 unidades. Não há modelo de linguagem no fluxo. É daí que vem a velocidade e é também daí que vêm os cortes de capacidade, e eles não são pequenos. Em comparação com modelos Granite Speech anteriores, o TurboCTC elimina a tradução de fala, elimina o viés de palavras-chave e não inclui ferramentas de timestamps ou de pontuação.

Compare isso com o que o modelo gerenciado inclui em seu preço de tabela e a forma da troca se torna concreta:

• Viés de termos-chave — Granite Speech 5.0 470M TurboCTC não tem nenhum, em comparação com até 100 termos-chave por requisição no Grok Voice Transcribe 2.0

• Timestamps em nível de palavra — não disponibilizados com o TurboCTC vs incluídos com pontuações de confiança

• Tradução de fala — presente em modelos Granite Speech anteriores, removida aqui vs. não oferecida de forma alguma

• Cobertura de idiomas — apenas inglês vs. deteção automática num conjunto de entradas amplamente multilingue com suporte de formatação em 25 idiomas

• Diarização — um problema separado que você resolve por conta própria vs incluído no preço da solicitação

• Canais — um fluxo por passagem vs até oito canais de áudio em uma solicitação

• Normalização de texto — nenhuma vs normalização inversa de texto, convertendo datas, moedas e números de telefone falados em forma escrita

• Implantação — pesos que você baixa e executa vs um endpoint gerenciado em us-east-1

Leia essa lista como a descrição de dois produtos diferentes, e não como um quadro de pontuação. Remover a diarização, o viés e a normalização foi o que garantiu a vazão. Um backfill em lote de 40.000 gravações de chamadas para um índice de busca não precisa de timestamps nem de turnos de fala — precisa ser barato e precisa terminar — e, para essa tarefa, os recursos ausentes não estão ausentes: são peso removido.

O contrário vale para qualquer coisa ao vivo. Se você está criando um agente de voz, uma lista de termos-chave é como você faz "Kubernetes", "Granola" e nomes de clientes serem escritos corretamente, e um transcritor sem mecanismo de polarização vai errá-los todas as vezes, sem maneira de corrigir, exceto com ajuste fino, que é um projeto diferente com um orçamento diferente. Esse único recurso ausente desqualifica o TurboCTC para algumas cargas de trabalho e é irrelevante para outras, e é por isso que a comparação de modelos é menos útil do que uma comparação de cargas de trabalho.

Screenshot of the Hugging Face model card for ibm-granite/granite-speech-5.0-470m-turboctc, showing the Apache-2.0 licence tag, the English and automatic-speech-recognition tags, a model summary describing a 470 million parameter conformer acoustic encoder trained with CTC on 60,000 hours of English audio and decoded non-autoregressively, and a bar chart of Open ASR leaderboard WER by test set — LS Clean 1.42, LS Other 2.66, SPGISpeech 3.18, Voxpopuli-Cleaned-AA 4.88, Earnings22-Cleaned-AA-chunked 6.69, AMI-Cleaned 7.52 and Gigaspeech-Cleaned 8.67 — with an average WER of 5.00% and an average RTFx of 13,042.98 measured on one H200.

A comparação de precisão que não pode ser feita de forma limpa

IBM relata uma taxa de erro de palavra agregada de 5,00% para o checkpoint Apache 2.0 e 4,85% para o irmão não comercial no Open ASR Leaderboard, sobre conjuntos públicos de inglês de formato curto. Esses são números de lote em um leaderboard cujas avaliações incluem AMI e Earnings22 e conjuntos conversacionais de formato longo, e são relatados pelo fornecedor — passaram pelas ferramentas do leaderboard, mas ainda não foram absorvidos na tabela oficial, que também inclui conjuntos de teste privados. O detalhamento por conjunto publicado no cartão do modelo vale a pena ler, porque a média esconde muito: LS Clean 1,42%, LS Other 2,66%, SPGISpeech 3,18%, Voxpopuli-Cleaned-AA 4,88%, Earnings22-Cleaned-AA-chunked 6,69%, AMI-Cleaned 7,52% e Gigaspeech-Cleaned 8,67%, resultando em uma média de exatamente 5,00%. O mesmo cartão cita uma média de RTFx de 13.042,98 medida em um H200 — superior à cifra de 12.600 usada no post de lançamento da IBM, e os dois números são ambos da empresa, da mesma semana, no mesmo hardware.

O número de 2,7% de transcrição final do Grok Voice Transcribe 2.0 não é uma medida comparável. Ele vem do painel AA-WER Streaming da Artificial Analysis, um composto ponderado de AA-AgentTalk a 50%, VoxPopuli a 25% e Earnings22 a 25% — cerca de oito horas de áudio conversacional em inglês ponderado por agente, medido por meio de uma interface de streaming. Conjuntos diferentes, ponderação diferente, modo de operação diferente. Colocar 2,7% ao lado de 5,00% e concluir que o modelo gerenciado é aproximadamente duas vezes mais preciso é o erro mais comum disponível nesta comparação.

O que pode ser dito com honestidade é mais restrito e ainda assim útil. Ambos os modelos são fortes no áudio em que cada um foi medido. O Grok Voice Transcribe 2.0 lidera um leaderboard de streaming administrado de forma independente no qual outros modelos também são medidos, o que torna sua classificação verificável mesmo que seu valor exato não seja transferível. O Granite Speech 5.0 470M TurboCTC tem um WER agregado nos conjuntos abertos padrão de ASR e, separadamente, um resultado de campo distante em que o checkpoint não comercial fica em quinto lugar em precisão e o do Apache, em nono — medido em fala ruidosa e reverberante, que é a condição mais difícil do conjunto e, possivelmente, a coisa mais honesta nos números de qualquer um dos modelos.

Se o seu áudio for fala limpa de leitura em inglês, a diferença de precisão entre esses dois provavelmente será menor do que as posições no ranking sugerem. Se for ruidoso, com sotaque, telefônico ou em outro idioma que não o inglês, nenhum dos rankings lhe diz muita coisa, e o seu próprio conjunto de testes é o único instrumento que diz.

Pesos livres contra $1,67 por hora

A comparação de custos é o único ponto em que esses dois modelos são genuinamente fáceis de separar, e o número que as pessoas costumam citar está errado nas duas direções.

• Transcrição em lote — Grok Voice Transcribe 2.0 a US$ 0,10 por hora de áudio, ou cerca de US$ 1,67 por 1.000 minutos vs. Granite Speech 5.0 470M TurboCTC sem custo de licença, além de tempo de GPU

• Streaming — $0,20 por hora de áudio, cerca de $3,33 por 1.000 minutos vs. nenhum caminho de streaming hospedado publicado pela IBM

• Licença — uma API comercial sem pesos vs. Apache 2.0 para o checkpoint principal e CC-BY-NC-SA-4.0 para o mais preciso de uso não comercial

"Grátis" está fazendo muito trabalho naquela primeira linha. Um modelo somente encoder de 470M é pequeno o bastante para rodar em hardware modesto — esse é o ponto do design, e a razão pela qual a IBM o treinou em dez dias em oito H100s e o lançou para `transformers>=5.16.0` com uma demonstração de WebGPU —, mas alguém ainda paga pela GPU, pela pilha de serving, pelo autoscaling, pelas retentativas e pelo plantão. Em volumes pequenos, o preço do serviço gerenciado costuma ser mais barato que o tempo de engenharia. Em volumes grandes e constantes, o caminho do hardware alugado vence, e o ponto de virada é uma função da sua utilização, não do seu volume de áudio: uma GPU que você mantém ocupada é barata por hora, e uma que você mantém aquecida para o tráfego de pico não é.

Vale a pena sinalizar um detalhe de licenciamento antes que alguém projete uma arquitetura em torno dele. O mais preciso dos dois checkpoints, o que tem 4,85% de WER, é o não comercial sob CC-BY-NC-SA-4.0. O checkpoint Apache 2.0 é o de 5,00%, e é o que você pode embarcar em um produto. Trata-se de uma diferença de precisão de 0,15 ponto trocada pelo direito de usar o modelo de qualquer forma, e também significa que qualquer comparação que cite 4,85% para "Granite Speech 5.0" e depois discuta implantação comercial está citando o checkpoint errado.

A two-column generated scoreboard titled 'Grok Voice Transcribe 2.0 vs Granite Speech 5.0 470M TurboCTC — the scoreboard'. The left column gives Grok Voice Transcribe 2.0 the rows: release September 18 2026, final WER 2.7% streaming, first partial 0.49s, 100 key terms included, diarization included, $0.20 per streaming hour. The right column gives Granite Speech 5.0 470M TurboCTC the rows: release August 25 2026, mean WER 5.00% Apache, speed 12,600 RTFx batched, no key terms, timestamps not shipped, Apache-2.0 weights where you pay compute. A footer reads 'Granite figures IBM-reported; Grok figures per Artificial Analysis.'

A regra de decisão

Três perguntas separam esses dois modelos mais rápido do que qualquer tabela de benchmark.

A transcrição é consumida ao vivo, enquanto o falante ainda está falando? Se sim, o TurboCTC não é o candidato — não porque seja lento, mas porque não tem interface de streaming nem saída parcial, e uma transcrição parcial é um compromisso arquitetural diferente de uma decodificação em lote rápida. Se não, a vantagem de throughput passa a ser a história toda, e o modelo da IBM é muito difícil de superar em custo por hora de áudio processado.

O trabalho precisa de vocabulário de domínio? Se sim, um modelo com enviesamento vence por padrão, e a ausência de enviesamento de termos-chave no TurboCTC é desqualificadora, e não apenas inconveniente. Se não, você está pagando por um recurso que não usará no lado gerenciado.

O áudio é fala lida em inglês em hardware decente? Se sim, ambos são fortes e a escolha se resume a aspectos operacionais. Se não, ambas as placas são pouco informativas e só a sua própria avaliação importa.

Não importa como isso se resolva, a camada operacional é onde essa decisão fica barata. O OrcaRouter coloca mais de 200 modelos atrás de uma única chave compatível com OpenAI, com failover automático entre provedores, então um endpoint gerenciado de fala em uma única região ter uma tarde ruim deixa de ser a sua indisponibilidade, e o preço de tabela do provedor é repassado com 0% de markup — o que significa que uma mudança de preço do fornecedor ou um novo checkpoint entra no ar do nosso lado no mesmo dia. Para uma carga de trabalho em que a resposta certa é genuinamente incerta, isso elimina o custo de errar: compare os dois com o seu próprio áudio por trás de um único endpoint, fique com o que vencer e troque a string do modelo quando o próximo for lançado.

Screenshot of the SpaceXAI Speech to Text API documentation page showing the Quick Start section with a Python example posting an audio file to https://api.x.ai/v1/stt with the model parameter set to grok-voice-transcribe-2.0, alongside the API console navigation and an on-this-page index listing Supported Audio Formats, Limits, Streaming Speech-to-Text and Smart Turn.

A versão resumida: o Granite Speech 5.0 470M TurboCTC é a melhor resposta para "transcrever tudo o que já gravamos, a baixo custo, em hardware que controlamos", e o Grok Voice Transcribe 2.0 é a melhor resposta para "transcrever isto à medida que acontece, com precisão, sem que sejamos nós a executar a pilha de serviço". A manchete dos 12.600× e a manchete dos 0,49 segundos são ambas verdadeiras e nenhuma delas é evidência sobre a outra.