
Grok Voice Transcribe 2.0 vs NVIDIA Parakeet TDT 0.6B: Duas tabelas de classificação, uma comparação enganosa
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
NVIDIA Parakeet TDT 0.6B é um transdutor FastConformer-TDT de 600 milhões de parâmetros lançado em 14 de agosto de 2025 sob CC-BY-4.0, e tem sido a recomendação padrão para quem quer executar a transcrição por conta própria há mais de um ano. Grok Voice Transcribe 2.0 é o modelo gerenciado de conversão de fala em texto da SpaceXAI, lançado em 18 de setembro de 2026, com preço de US$ 0,10 por hora de áudio para lote e US$ 0,20 por hora para streaming, com uma taxa de erro de palavra final de 2,7% no leaderboard de streaming da Artificial Analysis. Se você procurar uma comparação entre eles, encontrará o Parakeet citado com 13,7% de WER e o Grok Voice Transcribe 2.0 com 2,7%, o que faz o modelo gerenciado parecer cinco vezes mais preciso e é uma coisa genuinamente enganosa de se ler. Esses dois números vêm de índices diferentes da Artificial Analysis, construídos sobre conjuntos de dados diferentes, publicados com anos de diferença, e um deles foi superado pelas próprias medições mais recentes do fornecedor. A comparação real é mais interessante, e é sobre o que 600 megabytes de pesos lhe proporcionam que uma API não consegue.
O número de 13,7%, e por que você não deve usá-lo
O relatório State of AI do terceiro trimestre de 2025 da Artificial Analysis colocou o NVIDIA Parakeet TDT em terceiro lugar em seu índice AA-WER, com 13,7%, atrás do Chirp 2, do Google, com 11,6%, e do Canary Qwen, da própria NVIDIA, com 13,2%. Esse índice era uma média ponderada pela duração do áudio, calculada sobre aproximadamente duas horas de cada um de VoxPopuli, Earnings-22 e AMI-SDM — fala do mundo real com sotaques variados, vocabulário de domínio e condições de canal difíceis, e é por isso que todos os números nele são altos. Um WER de 13,7% no AMI-SDM, que é áudio de reunião em campo distante gravado em salas reverberantes, não é um resultado ruim; é um teste difícil.
Esse índice não existe mais nessa forma. A Artificial Analysis o reconstruiu como AA-WER v2, atribuindo peso de 50% ao AA-AgentTalk e de 25% a VoxPopuli-Cleaned-AA e Earnings22-Cleaned-AA, com cerca de oito horas de áudio, e a limpeza e a reponderação alteraram substancialmente o número de cada modelo. No ranking atual de non-streaming, o Parakeet TDT 0.6B V3 fica na casa dos poucos por cento — a mesma faixa de outros líderes de pesos abertos — em vez de em algum ponto próximo de 13,7%, e o topo do ranking está em torno de 2%. Qualquer pessoa que ainda cite 13,7% para o Parakeet está citando uma medição descontinuada, e, se estiver comparando isso com um número de streaming de 2026, também está comparando dois rankings diferentes.
O que pode honestamente ser colocado lado a lado é mais restrito. A avaliação da própria NVIDIA no Open ASR Leaderboard — os conjuntos padrão públicos de inglês de formato curto, executados com as ferramentas desse leaderboard — relata um WER médio de 6,32% para o Parakeet TDT 0.6B V3 com um RTFx de 3.332,74, e uma média de 6,05% para a v2 somente em inglês. Os 2,7% do Grok Voice Transcribe 2.0 são um valor de transcrição final no leaderboard de streaming, medido após o término da fala, em áudio conversacional em inglês ponderado por agente. Conjuntos diferentes, leaderboard diferente, modo diferente. O modelo gerenciado é muito provavelmente mais preciso no áudio que os dois leaderboards compartilham; a magnitude dessa vantagem não é 5×, e ninguém publicou a medição que resolveria isso.
Qual é a forma real dos dois modelos
A diferença arquitetural explica a maior parte da diferença prática. O Parakeet TDT 0.6B é um codificador FastConformer com um decodificador transducer de token e duração — ele prevê tanto um token quanto quantos frames avançar, o que lhe permite pular em vez de emitir blanks, e essa é a principal fonte de sua eficiência. Ele vem com detecção automática de idioma em 25 idiomas europeus, timestamps em nível de palavra e de segmento, pontuação e capitalização, e lida com áudio longo — até 24 minutos com atenção completa, ou cerca de três horas com atenção local. Ele é servido por meio do NeMo 2.2, tem um caminho MLX para Apple Silicon, e há builds ONNX INT8 que rodam em CPUs comuns.
O Grok Voice Transcribe 2.0 é um serviço gerenciado, então a comparação é entre um modelo e um produto. O que o produto inclui pelo preço de tabela:
• Streaming — Grok Voice Transcribe 2.0 nativo via WebSocket, primeira parcial em 0,49 segundos, em comparação com as abordagens em blocos ou em buffer do Parakeet TDT 0.6B, sem uma interface de transcrição parcial de primeira classe
• Viés de termos-chave — até 100 termos-chave por requisição vs não ser um recurso do Parakeet
• Diarização — incluída no preço da solicitação vs. um sistema separado que você mesmo adiciona
• Canais — até oito canais de áudio em uma única solicitação vs. um stream por passagem
• Normalização inversa de texto — incluída em 25 idiomas vs. apenas pontuação e capitalização
• Implantação — um endpoint gerenciado em us-east-1 vs pesos que você baixa, executa e opera em qualquer lugar
• Licença — termos comerciais de API vs CC-BY-4.0 com atribuição
• Tamanho do modelo — não divulgado vs cerca de 600 milhões de parâmetros, aproximadamente 2,4 GB em fp32 ou 1,2 GB em fp16
A última linha é a que decide muitas implantações. O Parakeet TDT 0.6B cabe em alguns gigabytes, roda de forma aceitável em uma CPU de laptop pelo caminho INT8 ONNX e cabe confortavelmente em qualquer GPU de consumidor. Isso não é uma versão menor do que a API faz — é uma capacidade diferente, porque é a diferença entre um recurso de transcrição que funciona offline, em um dispositivo, sem rede e sem custo por hora, e um que não funciona.

A aritmética de custos que ninguém faz corretamente
A comparação que é publicada é "US$ 0,10 por hora versus gratuito", e está errada nos dois sentidos — a API não é a única coisa pela qual você paga, e os pesos não são a única coisa em que você economiza.
• Transcrição em lote — Grok Voice Transcribe 2.0 a US$ 0,10 por hora de áudio, cerca de US$ 1,67 por 1.000 minutos, em comparação com Parakeet TDT 0.6B sem taxa de licença, mais tempo de GPU ou CPU
• Streaming — US$ 0,20 por hora de áudio, cerca de US$ 3,33 por 1.000 minutos, em comparação com a hospedagem própria, onde a restrição é o seu próprio teto de simultaneidade, e não uma tarifa publicada
• Limites de serviço — 10 solicitações por segundo e 100 sessões de streaming simultâneas por equipe, em comparação com o que seu hardware permitir, sem limite de taxa e sem limite de simultaneidade
• O custo que não está em nenhuma das duas planilhas — sem engenharia, sem stack de serving, sem escalonamento automático vs. a escala de plantão, sem lógica de retentativas, sem atualizações do modelo e sem a GPU que você mantém aquecida para o pico
Em volumes pequenos, o lado gerenciado é quase sempre mais barato, porque o custo fixo do caminho auto-hospedado é uma pessoa. Em volumes grandes e constantes, o lado auto-hospedado vence decisivamente, e o ponto de equilíbrio é uma função da utilização, e não do volume de áudio: uma GPU que você mantém ocupada é muito barata por hora de áudio, e uma que você mantém aquecida para picos de tráfego não é. Uma equipe que processa 20.000 horas por mês paga US$ 2.000 pelo caminho de lote gerenciado e aproximadamente um mês de GPU de médio porte mais tempo de engenharia pelo auto-hospedado, o que não chega nem perto.
A razão pela qual os cálculos são feitos mal é que o lado auto-hospedado é normalmente comparado a zero, e o lado gerenciado é normalmente comparado ao preço de tabela. Nenhum dos dois é um número real. O que é real é que os 3.332 RTFx do Parakeet TDT 0.6B — valor da NVIDIA, com processamento em lote, em hardware de datacenter, e que deve ser tratado como um limite superior, e não como uma promessa — significam que uma única GPU modesta consegue processar mais áudio do que a maioria das organizações gera.
Onde o Parakeet deixa de ser a resposta correta
Três coisas levam uma equipe a abandonar o modelo aberto e migrar para um gerenciado, e nenhuma delas é a acurácia.
A primeira é o viés de termos-chave. Se as suas transcrições estão repletas de nomes de produtos, sobrenomes, símbolos de ticker ou jargão específico do domínio, um modelo sem mecanismo de viés vai transcrevê-los incorretamente, sem qualquer remédio que não seja o ajuste fino. O Grok Voice Transcribe 2.0 aceita até 100 termos-chave por requisição. O Parakeet TDT 0.6B não possui esse recurso. Para centrais de contacto, saúde e trabalho jurídico, essa única lacuna é eliminatória, independentemente do que diga qualquer ranking.
O segundo é a diarização. O Parakeet fornece palavras com carimbos de data/hora; ele não diz quem as disse. A transcrição com vários falantes significa executar um modelo de diarização separado e alinhar a saída, o que é um projeto, e não uma opção de configuração. O modelo gerenciado retorna texto atribuído ao falante na mesma solicitação.
O terceiro é a própria interface de streaming. O Parakeet é rápido o suficiente para que as pessoas construam sistemas em tempo real sobre ele — dividindo o áudio em blocos, executando o modelo em cada bloco, costurando a saída —, mas o comportamento de transcrição parcial, a detecção de fim de turno e a semântica de compromisso são todas coisas que você escreve e mantém. O Grok Voice Transcribe 2.0 retorna uma primeira transcrição parcial 0,49 segundos depois de você parar de falar, como um recurso do produto.
Há também um detalhe de licenciamento que às vezes surpreende as equipes: o Parakeet TDT 0.6B V3 é CC-BY-4.0, o que permite uso comercial, mas exige atribuição, e alguns modelos de fala da NVIDIA desde então migraram para a própria Open Model License do fornecedor. Se a atribuição for um problema para o seu produto, leia o card do checkpoint específico em vez de presumir que os termos da família se aplicam.

Por que a API geralmente vence mesmo assim, e quando não deveria
O padrão ao longo do último ano tem sido consistente: equipes começam com um modelo aberto como o Parakeet TDT 0.6B porque ele é gratuito e controlável, entregam a funcionalidade, depois descobrem que o custo contínuo não é a GPU, mas a manutenção, e migram para um endpoint gerenciado. A migração inversa também acontece, geralmente quando o volume ultrapassa um limiar em que a cobrança por hora começa a parecer aluguel de algo que você poderia possuir.
Ambas as direções são caras de executar se o modelo estiver conectado diretamente à sua aplicação, e é esse o argumento para manter o local de chamada descomplicado. O OrcaRouter expõe mais de 200 modelos por trás de uma única chave compatível com o OpenAI, com failover automático entre provedores e 0% de margem sobre o preço de tabela do provedor, de modo que uma implantação auto-hospedada e uma gerenciada podem ficar atrás da mesma interface e ser trocadas com uma string de modelo. Isso importa mais do que o habitual em fala, onde o ranking muda de mãos a cada poucas semanas e um serviço gerenciado de região única é uma interrupção de região única — o caminho de failover é o que impede que um recurso de transcrição se torne uma interrupção de transcrição.
Para equipes que querem a vazão do modelo aberto sem a stack de serving, esse também é o formato da decisão: faça benchmark do Parakeet TDT 0.6B no seu próprio áudio, faça benchmark do Grok Voice Transcribe 2.0 no mesmo áudio, e deixe o vencedor ficar com o tráfego enquanto você para de se importar com qual logotipo de fornecedor está nele.

Se você quer a versão de uma linha: o Parakeet TDT 0.6B continua sendo a melhor resposta para "transcrever qualquer coisa, em qualquer lugar, sem custo por hora, em hardware que eu já tenho", e o Grok Voice Transcribe 2.0 é a resposta para "transcrever com precisão, com rótulos de falante e meu próprio vocabulário, sem executar nada". O número de 13,7% que faz a diferença parecer enorme é uma medição descontinuada, e a diferença honesta — em algum lugar entre um e três pontos de WER em áudio sobreposto — é pequena o suficiente para que a questão operacional decida.
