Cartão de destaque do artigo com o texto 'Grok Voice Transcribe 2.0 vs Muse Voice Transcribe', com o selo 'COMPARAÇÃO DE MODELOS' e o subtítulo 'um reinado de 17 dias e um quarto de segundo', com chips exibindo 2,7% vs 3,1% de WER final, 0,49s vs 0,16s após a fala, $0,20 vs $0,18 por hora de streaming e em lote pela metade do preço, sobre um gradiente de branco para azul com o logotipo OrcaRouter no canto inferior direito.
Guides & Insights

Grok Voice Transcribe 2.0 vs Muse Voice Transcribe: Um Reinado de 17 Dias e um Quarto de Segundo

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Em 1 de setembro de 2026, a Meta afirmou que o Muse Voice Transcribe tinha conquistado o primeiro lugar na avaliação de reconhecimento de fala em streaming da Artificial Analysis, com uma taxa final de erro de palavras de 3,1%, e essa alegação permaneceu incontestada durante dezassete dias. Em 18 de setembro, a SpaceXAI lançou o Grok Voice Transcribe 2.0 com 2,7% no mesmo ranking e assumiu a posição. Dois modelos, um ranking, com dezassete dias de diferença — e a comparação mais interessante não é a diferença de 0,4 pontos na precisão, porque o modelo da Meta ainda é cerca de três vezes mais rápido a finalizar uma frase: 0,16 segundos após o fim da fala, contra 0,49 segundos do Grok Voice Transcribe 2.0. O Muse Voice Transcribe é um modelo de perceção áudio em tempo real criado pela Meta Superintelligence Labs para funcionar dentro dos próprios produtos da Meta, onde um quarto de segundo é a diferença entre um assistente que parece presente e um que parece lento. O Grok Voice Transcribe 2.0 é uma API de transcrição criada para ser chamada por qualquer pessoa, a um preço que torna o trabalho em lote viável. Ambos os números foram comunicados pelos fornecedores no dia do lançamento, e apenas um dos dois foi, desde então, colocado de forma independente num ranking público.

O que a tabela de classificação realmente diz agora

O ranking AA-WER Streaming é um composto ponderado — AA-AgentTalk com 50%, VoxPopuli com 25%, Earnings22 com 25%, aproximadamente oito horas de áudio em inglês majoritariamente em formato de agente — e ambos os modelos são avaliados nele, o que faz deste um dos raros confrontos diretos em que os números são ao menos comensuráveis. Lado a lado, incluindo os números reportados pelos fornecedores:

• Precisão final da transcrição — Grok Voice Transcribe 2.0 com 2,7% de WER vs Muse Voice Transcribe com 3,1%

• Precisão do primeiro transcrito parcial — 3,4% vs 3,6%

• Tempo até o primeiro resultado parcial — 0,49 segundos vs. 0,13 segundos

• Tempo após o término da fala até a transcrição final — 0,49 segundos vs 0,16 segundos

• Taxa de erro de diarização de falantes — incluída, nenhum valor publicado vs uma média de 17,5% na avaliação da Meta

Leia as linhas de acurácia e as linhas de latência separadamente, porque elas apontam em direções opostas e ambas são verdadeiras. Na acurácia, os dois modelos ficam dentro de quatro décimos de ponto um do outro para transcrições finais e dois décimos para primeiras parciais — uma diferença pequena o bastante para se inverter no próximo lançamento de qualquer uma das empresas, e pequena o bastante para que nenhuma pessoa razoável escolha entre eles com base nisso. Na latência, eles não estão próximos. O modelo da Meta retorna uma parcial em cerca de um oitavo de segundo e finaliza em cerca de um sexto de segundo, contra aproximadamente meio segundo em ambos os sentidos para o da SpaceXAI.

Toda a comparação se resume a uma linha: Grok Voice Transcribe 2.0 gastou latência para comprar precisão, e Muse Voice Transcribe fez o oposto. A SpaceXAI reduziu sua taxa de erro do primeiro resultado parcial de 18,3% na versão 1.0 para 3,4% na 2.0, e o preço disso foi passar de 0,25 segundo para 0,49 segundo na mesma métrica. O modelo da Meta foi projetado na direção oposta, com trechos de áudio de 80 milissegundos e um atraso adaptativo aprendido por reforço que decide quanto tempo esperar antes de se comprometer com o texto — um mecanismo cujo único propósito é manter a precisão enquanto mantém a confirmação rápida. Nenhuma das escolhas é um erro. São respostas a perguntas diferentes.

Qual pergunta você está fazendo?

Se a transcrição alimenta um agente de voz que precisa responder dentro de uma pausa conversacional, 0,16 segundo e 0,49 segundo são produtos diferentes. A alternância de turnos humana tolera um intervalo de algumas centenas de milissegundos antes que a interação comece a parecer errada, e o orçamento de latência é compartilhado — transcrição, depois raciocínio, depois síntese de fala. Um modelo que devolve uma transcrição final em um sexto de segundo deixa margem para o resto do pipeline; um que leva meio segundo consome a maior parte do orçamento antes que o modelo tenha pensado em qualquer coisa. É para isso que a Meta o construiu, e é por isso que o modelo roda dentro do Meta AI no Mac e dentro do Muse Code, em vez de ser oferecido principalmente como endpoint para os pipelines de outras pessoas.

Se a transcrição é um documento — uma gravação de chamada, uma reunião, uma videoteca, um arquivo de conformidade —, então meio segundo não é nada, a diferença de precisão também não é nada, e o único número que importa é quanto custa uma hora de áudio. E é aí que esses dois divergem drasticamente, e numa direção que surpreende quem só olha a taxa de streaming.

Metade do preço em lote, um décimo a mais em streaming

A Meta lista o Muse Voice Transcribe a $0,18 por hora de áudio, ou $3,00 por 1.000 minutos. O Grok Voice Transcribe 2.0 está listado a $0,10 por hora para batch e $0,20 por hora para streaming. Então:

• Streaming — Grok Voice Transcribe 2.0 a US$ 0,20 por hora vs Muse Voice Transcribe a US$ 0,18, então a Meta é cerca de 10% mais barata

• Em lote ou gravado — $0,10 por hora vs $0,18, portanto a SpaceXAI é 44% mais barata

• Incluído no preço de tabela — diarização, carimbos de data/hora por palavra com confiança, enviesamento de termos-chave e normalização inversa de texto do lado da SpaceXAI vs. transcrição em streaming, diarização e deteção de endpoint como um único modelo do lado da Meta

• Plano gratuito ou auto-hospedagem — nenhum dos dois, em ambos os casos

Uma equipe que só faz streaming deve ser indiferente entre as duas quanto a preço e deve escolher com base na latência, o que significa optar pela Meta. Uma equipe com qualquer volume significativo de áudio gravado deve olhar para a linha de processamento em lote, porque US$ 0,08 por hora se acumula: 5.000 horas por mês custam US$ 500 em uma e US$ 900 na outra, e a diferença de precisão entre elas é menor do que o arredondamento de qualquer um dos números.

A situação de licenciamento é idêntica naquilo que importa e diferente naquilo que não importa. Ambos têm pesos fechados — Muse Voice Transcribe é proprietário e está disponível apenas por meio da API hospedada da Meta, e Grok Voice Transcribe 2.0 é uma API comercial sem download. Nenhum dos dois é uma opção se o seu requisito for que o áudio nunca deixe a infraestrutura que você controla, e ambos deixam você exposto a que um fornecedor mude o preço, a versão do modelo ou o cronograma de descontinuação debaixo dos seus pés. Isso é uma consideração real, e não hipotética: o Grok Voice Transcribe 1.0 já está em um caminho de descontinuação menos de duas semanas depois que seu sucessor foi lançado.

Screenshot of the Meta AI research post titled 'Introducing Muse Voice Transcribe', dated September 1, 2026 and marked a four minute read, showing the headline and an interactive demo card labelled 'Click to start transcribing' with the caption 'Experience Muse Voice Transcribe in real time', above the opening line describing the model as Meta's first real-time audio perception model.

Diarização, que é o recurso com o qual nenhum dos dois lidera

Ambos os modelos fazem atribuição de falante em uma única passagem, o que, dois anos atrás, era um sistema separado acoplado depois, e a comparação aqui é incomumente concreta porque a Meta publicou um número e a SpaceXAI não.

A Meta relata uma taxa média de erro de diarização de 17,5% em sua avaliação, lida com 20 ou mais falantes sem pós-processamento e os trata como parte do modelo de streaming, e não como uma etapa posterior — o "quem disse o quê" chega com o texto, e não depois dele. Isso é genuinamente difícil de fazer em um contexto de streaming, em que um turno de fala só é identificável depois que se ouviu o suficiente dele, e 17,5% é um número real com uma ressalva real: é da própria Meta, calculado pela média sobre um conjunto de avaliação escolhido pela Meta.

O modelo da SpaceXAI inclui diarização sem custo adicional e também suporta até oito canais de áudio independentes num único pedido, o que é uma forma diferente de resolver o mesmo problema — se o seu áudio chega como canais separados por participante, como frequentemente acontece na telefonia de centros de contacto, a separação de canais é mais fiável do que a diarização e não precisa de qualquer taxa de erro. Se o seu áudio chega como um único fluxo misto, depende da qualidade da diarização, e apenas um destes dois fornecedores lhe disse qual é.

Há uma diferença de segunda ordem que vale a pena notar: o Muse Voice Transcribe trata a diarização, a transcrição e a detecção de endpoint como um único modelo que produz uma única saída, o que significa que os componentes não podem falhar independentemente. O Grok Voice Transcribe 2.0 permite que você trate canais, termos-chave e diarização como alavancas separadas. Um único modelo é mais simples de executar e mais difícil de depurar.

A two-column generated scoreboard titled 'Grok Voice Transcribe 2.0 vs Muse Voice Transcribe — the scoreboard'. The left column gives Grok Voice Transcribe 2.0 the rows: final WER 2.7%, first partial 3.4%, time after speech 0.49s, diarization included with no figure published, streaming $0.20 per hour, batch $0.10 per hour. The right column gives Muse Voice Transcribe the rows: final WER 3.1%, first partial 3.6%, time after speech 0.16s, diarization error 17.5% average, streaming $0.18 per hour, no batch tier published. A footer reads 'Both sets of figures vendor-reported at launch; Grok accuracy independently placed on Artificial Analysis.'

Idiomas, e onde os dois cartões de modelo deixam de ser comparáveis

A Meta treinou o Muse Voice Transcribe em mais de 70 idiomas e verificou 25 deles extensivamente no lançamento, com code-switching nativo dentro e entre frases e suporte para áudio com mais de uma hora. O Grok Voice Transcribe 2.0 lida com deteção automática de idioma com mudança a meio da gravação e aplica normalização inversa de texto — datas, moedas, números de telefone e endereços de e-mail falados apresentados na forma escrita — em 25 idiomas.

A sobreposição é formada pelos 25 idiomas extensivamente verificados de um lado e pelos 25 idiomas de normalização do outro, e os dois conjuntos não são os mesmos 25, além de nenhum dos fornecedores ter publicado a lista. "70+ idiomas treinados" e "25 idiomas com suporte a formatação" não são alegações comparáveis e não devem ser subtraídas uma da outra. O que se pode dizer é que a Meta está fazendo uma alegação multilíngue mais ampla, e a SpaceXAI está fazendo uma mais restrita, porém mais operacional: detectar o idioma é o mínimo necessário, e formatar o que o modelo ouviu em algo que um sistema downstream consiga analisar é a parte que quebra integrações quando está ausente.

A escolha, e a razão pela qual talvez não seja você a fazê-la.

Tire o marketing e a decisão se resume a três frases. Escolha o Muse Voice Transcribe se a transcrição for consumida ao vivo dentro de uma conversa, porque 0,16 segundo não é um detalhe. Escolha o Grok Voice Transcribe 2.0 se você tiver áudio gravado em volume, porque metade do preço do lote também não é um detalhe. Se você não precisa de nenhum dos extremos, escolha com base em qualquer outra coisa que o restrinja — região, contrato, integração existente —, porque a diferença de precisão não vai resolver isso.

A complicação é que um desses dois modelos não está realmente à venda no sentido usual. O Muse Voice Transcribe existe para fazer o assistente da própria Meta parecer rápido, e está disponível por meio da Meta Model API em grande parte porque a Meta decidiu que o valor ecossistêmico da exposição supera o valor da exclusividade. Isso pode mudar, e pode mudar rapidamente: a Meta passou a mesma semana abrindo a plataforma de conectores da Muse para desenvolvedores terceiros, o que representa uma empresa investindo em seu próprio canal de distribuição, em vez de ser uma fornecedora neutra para todos os demais. Construir uma dependência de produção em relação ao modelo interno de um concorrente é uma aposta de que os termos não mudarão, e essa aposta tem um histórico ruim.

Essa assimetria é o argumento para não fixar em código nenhum dos dois. O OrcaRouter expõe mais de 200 modelos por trás de uma única chave compatível com a OpenAI, com failover automático entre provedores e 0% de markup sobre o preço de tabela do provedor — então, quando a SpaceXAI mudar o padrão para 2.0 e descontinuar a 1.0, ou quando a Meta reposicionar sua API de fala, a mudança será uma string de modelo em vez de um projeto de migração. Numa categoria em que a liderança trocou de mãos duas vezes em três semanas, a camada de roteamento é a parte da pilha que deveria ser estável, e o modelo é a parte que não deveria ser.

Screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models, showing the browsable list of routed models and vendors that sit behind a single OrcaRouter API key.

Uma coisa a acompanhar no próximo mês: se a Artificial Analysis vai voltar a medir o Muse Voice Transcribe no quadro de streaming agora que o Grok Voice Transcribe 2.0 tomou seu lugar. Os 3,1% da Meta e os 2,7% da SpaceXAI foram ambos reportados no lançamento, mas apenas o da SpaceXAI foi posicionado de forma independente. Se o número da Meta se sustentar quando alguém o rodar novamente, a diferença de precisão é tão pequena quanto parece, e a diferença de latência decide tudo. Se não se sustentar, o reinado de dezessete dias foi a história inteira.