Cartão de destaque do artigo exibindo 'Resumo Diário de IA — 19 de setembro', com o selo 'NOTÍCIAS' e o subtítulo 'Grok Voice Transcribe 2.0 é lançado, e a Meta abre o Muse', com chips exibindo US$ 0,10 por hora de lote, WER de streaming de 2,7%, 3,4% no primeiro parcial e conectores do Muse ativos, sobre um gradiente de branco para azul com o logotipo da OrcaRouter no canto inferior direito.
Engineering & Research

Resumo Diário de IA, 19 de setembro: Grok Voice Transcribe 2.0 entra no ar e Meta abre o Muse para desenvolvedores

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O Grok Voice Transcribe 2.0 está disponível na Grok Voice API desde 18 de setembro de 2026, a US$ 0,10 por hora de áudio para transcrição de gravações e US$ 0,20 por hora para streaming — as mesmas tarifas que a SpaceXAI cobrava pela versão 1.0. Na mesma semana, a Meta abriu a plataforma de conectores Muse para desenvolvedores externos, permitindo que qualquer serviço exponha sua API existente e faça o agente Muse da Meta chamá-la em nome de um usuário. Essas parecem manchetes sem relação, de duas empresas diferentes sobre dois produtos diferentes, e, durante a maior parte dos últimos dois anos, teriam sido. Lidas em conjunto, elas são a mesma história: a transcrição está se tornando uma entrada, e a disputa passou a ser sobre quem é dono da chamada que a consome.

Comece pelos preços, porque são a parte sobre a qual o leitor pode agir hoje. Depois, a precisão, que é real, mas mais restrita do que sugere o enquadramento do lançamento. Em seguida, a parte da Meta, que é a que importará daqui a seis meses.

Preço fixo, e o que isso significa se você já paga por transcrição

Grok Voice Transcribe 2.0 custa o mesmo que a versão 1.0. Não é um "a partir de" igual, nem uma tarifa promocional que expira — é idêntico: US$ 0,10 por hora de áudio para processamento em lote e US$ 0,20 por hora para streaming, o que equivale a US$ 1,67 e US$ 3,33 por 1.000 minutos. Diarização de falantes, marcações de tempo em nível de palavra com pontuações de confiança, normalização inversa de texto, remoção de palavras de preenchimento e viés de termos-chave estão todos incluídos nesse preço, em vez de serem vendidos à parte como complementos, o que não é a norma da categoria.

O efeito prático é aritmético, e não dramático. Uma equipe que transcreve 5.000 horas de áudio de contact center por mês paga US$ 500 pela via de processamento em lote de qualquer forma, e o novo modelo entrega o mesmo volume com uma taxa de erro substancialmente menor. Nada na migração altera o que você paga, e é exatamente por isso que a migração é fácil de justificar: não há decisão de custo a tomar, apenas uma decisão de qualidade — e a qualidade aumentou.

Integrações existentes migram passando grok-voice-transcribe-2.0 como o parâmetro de modelo em /v1/stt, ou selecionando-o quando a sessão WebSocket é aberta para streaming. Nenhuma alteração de esquema, nenhum novo endpoint, nenhuma recodificação do seu pipeline de áudio. A SpaceXAI deixou a 1.0 como padrão por enquanto, então uma integração que nunca toca no parâmetro de modelo continua recebendo a versão antiga até que a empresa faça a troca — o que ela diz que acontecerá nas próximas semanas, junto com a descontinuação da 1.0. Vale a pena usar essa janela de forma deliberada: aponte uma cópia sombra do áudio da sua produção para a 2.0 e compare as transcrições com o que você entrega hoje, porque, assim que o padrão mudar, você estará executando-a, tenha você testado ou não.

O restante da ficha técnica permanece inalterado em formato e vale a pena conhecer se você está dimensionando uma implantação em vez de apenas avaliar a precisão: 12 formatos de áudio de entrada, de áudio telefônico de 8 kHz até 48 kHz, até oito canais de áudio independentes em uma única solicitação, 100 termos-chave por solicitação para vocabulário de domínio, detecção automática de idioma com troca no meio da gravação e normalização inversa de texto em 25 idiomas, para que datas, moedas, números de telefone e endereços de e-mail falados voltem escritos como um humano os escreveria. Os limites do serviço são de 10 solicitações por segundo e 100 sessões de streaming simultâneas por equipe, e o serviço é executado em uma única região — us-east-1 —, que é a única linha da ficha que deveria fazer uma equipe de produção parar para pensar, porque uma API de fala em uma única região é uma indisponibilidade em uma única região.

Onde a precisão realmente mudou

A alegação de lançamento é “duas vezes mais precisa”, e os números subjacentes são mais específicos e menos uniformes do que essa frase. No painel AA-WER Streaming da Artificial Analysis, que é a medição independente aqui, as duas versões se separam assim:

• Precisão final da transcrição — Grok Voice Transcribe 2.0 com taxa de erro de palavras de 2,7% em comparação com Grok Voice Transcribe 1.0 com 3,9%, ambas medidas após o falante parar

• Precisão do primeiro transcrito parcial — 3,4% de WER contra 18,3%, que é, com ampla margem, a maior diferença individual entre as duas versões

• Tempo até à transcrição final — 0,49 segundos contra 0,37 segundos, pelo que a 2.0 é mais lenta nessa medida, em vez de mais rápida

• Tempo até o primeiro parcial — 0,49 segundos contra 0,25 segundos, o mesmo trade na direção oposta

Esse último par é a coisa mais interessante da tabela. O Grok Voice Transcribe 2.0 comprou sua precisão ao custo de cerca de um quarto de segundo de latência, em ambas as direções. Para um agente de voz, isso é um custo real — é a diferença entre uma pausa natural e uma pausa que o interlocutor percebe —, e para um pipeline em lote é invisível. A melhoria no primeiro parcial é a que muda o que você pode construir, porque um transcrito parcial é o texto sobre o qual um agente pode raciocinar enquanto o interlocutor ainda está falando. Passar de 18,3% para 3,4% nesse número é a diferença entre um parcial ser uma dica aproximada e um parcial ser utilizável. O transcrito final ir de 3,9% para 2,7% é uma boa melhoria que nenhum usuário vai perceber.

Screenshot of the SpaceXAI Speech to Text API documentation page showing the 'Speech to Text' heading, the line 'Transcribe audio files into text with a single API call, or stream audio in real time over WebSocket', and a Python quick-start code block that posts an audio file to https://api.x.ai/v1/stt with the model parameter set to grok-voice-transcribe-2.0 alongside a keyterm parameter.

A SpaceXAI também publicou quatro avaliações internas, e vale a pena lê-las com a ressalva devidamente anexada — são os números da própria empresa sobre seu próprio áudio, não reproduzidos de forma independente:

• Chamadas de suporte ao cliente de 8 kHz — WER de 10,6% na 1.0, caindo para 7,1% na 2.0

• Conversas com o Grok — 8,7% caiu para 3,3%

• Credenciais faladas, ou seja, nomes, e-mails e dados da conta lidos em voz alta — de 7,2% para 3,2%

• Frases curtas em 19 idiomas — de 20,6% a 6,8%

A linha de 8 kHz é a que deve ser levada em conta. O áudio telefônico é a entrada comum mais difícil nesta categoria e a que a maioria dos compradores de contact centers realmente tem, e uma queda de 10,6% para 7,1% nela é mais importante para esses compradores do que o número principal do painel.

A alegação do ranking, lida com honestidade

A SpaceXAI diz que o modelo ocupa o primeiro lugar entre 32 modelos de streaming em precisão. O leaderboard da Artificial Analysis coloca-o de facto em primeiro lugar tanto no ranking de transcrição final como no de primeira parcial — mas a página do leaderboard apresenta 27 dos 33 modelos, portanto o “32” é a contagem da própria empresa, e o ranking é sobre um conjunto cuja forma o leitor deve compreender. O AA-WER Streaming é um compósito ponderado de três conjuntos em língua inglesa: AA-AgentTalk com 50%, VoxPopuli com 25% e Earnings22 com 25%, aproximadamente oito horas de áudio no total, e tem um peso fortemente inclinado para fala conversacional ao estilo de agente. Não mede sotaques, codecs de telefonia, vocabulário de domínio ou áudio multicanal de call center de forma estruturada.

Nada disso torna o número errado. Torna-o específico. Um modelo que lidera um ranking de inglês ponderado por conversas de agente é a escolha certa para áudio em inglês no formato de conversas de agente, e a razão honesta para acreditar no resultado de 8 kHz é a avaliação interna do fornecedor, e não o ranking público. Compradores com um perfil de áudio diferente devem testar com o próprio áudio, em vez de ler o ranking como um veredito geral — o que era verdade antes deste lançamento e continuará sendo verdade depois do próximo.

A generated infographic titled 'Grok Voice Transcribe 2.0 — what changed from 1.0', showing two columns of four rows: final transcript 3.9% to 2.7% WER, first partial 18.3% to 3.4% WER, time to first partial 0.25s to 0.49s, and streaming price $0.20 per hour unchanged, with a footer reading 'Board figures per Artificial Analysis AA-WER Streaming; internal evaluations vendor-reported.'

Meta abre conectores do Muse para desenvolvedores

A segunda notícia da semana é da Meta. O Muse, o agente pessoal que a Meta lançou em 8 de setembro no iOS, Android, muse.ai e WhatsApp, agora aceita conectores de terceiros: um serviço expõe sua API, e o Muse fornece o agente, o navegador e o contexto do usuário que transformam essa API em algo que uma pessoa pode invocar pedindo por ele. O enquadramento que a Meta deu a isso é uma divisão de trabalho — você traz a API, nós trazemos a intenção e o usuário. Os primeiros conectores citados foram o Notion e a ferramenta de anotações de reuniões Granola, além dos que a própria Meta lançou.

Vale a pena ser preciso sobre o que isto é e o que não é. Não é um protocolo aberto entre agentes. Criar um conector dá a você distribuição dentro da própria base de usuários da Muse e em nenhum outro lugar; criar para um protocolo aberto dá a você alcance em todos os agentes compatíveis e nenhuma base de usuários em particular. A Meta também não publicou as partes que um desenvolvedor precisaria considerar ao planejar — o processo de revisão de conectores, a superfície de integração técnica, como a Muse escolhe entre dois conectores que se sobrepõem, ou como um desenvolvedor mede se um conector de fato gerou algum uso.

O que não está em dúvida é a direção. A Muse executa o agente de cada usuário em sua própria máquina virtual, com seu próprio navegador e uma camada de revisão separada diante das ações de saída, e mantém tokens substitutos em vez de chaves de API reais. Essa arquitetura só faz sentido se o plano for que o agente chame muitas coisas. As APIs de transcrição estão entre as coisas que um agente chama, e a Meta tem a sua própria — Muse Voice Transcribe, o modelo em tempo real que a Meta lançou no início de setembro a US$ 0,18 por hora de áudio. Uma plataforma que possui tanto o agente quanto um modelo de fala tem um motivo óbvio para encaminhar seu próprio tráfego ao seu próprio modelo, e desenvolvedores que constroem sobre conectores devem presumir que esse é o padrão, a menos que algo faça com que não seja o padrão.

Screenshot of the Artificial Analysis Speech to Text AI Model and Provider Leaderboard with the Streaming filter selected, showing the WER Index - Final Transcription, Latency and Price highlight cards, the 'See Non-streaming Benchmarks' toggle, and the AA-WER Streaming Index versus Time to Final Transcription chart.

O que uma equipe que está lançando voz este mês deveria realmente fazer

Ambas as histórias apontam no mesmo sentido. A precisão do reconhecimento de fala está a convergir — três modelos a menos de um ponto e meio uns dos outros na mesma tabela de classificação, no espaço de três semanas — e os fatores de diferenciação que restam são o preço, a latência, a licença e quem controla o roteamento. Isso torna a escolha de para onde vai a sua chamada de transcrição mais determinante do que a escolha de qual modelo a responde, porque vai querer mudar essa resposta várias vezes ao longo do próximo ano.

Esta é a camada em que o OrcaRouter se encontra. Uma única chave de API cobre mais de 200 modelos por trás de endpoints compatíveis com OpenAI, com failover automático entre provedores, de modo que um serviço de fala de uma única região passando por uma tarde ruim deixa de ser a sua indisponibilidade. Repassamos o preço de tabela do provedor com 0% de markup, o que significa que uma redução de preço do fornecedor ou uma nova versão de modelo entra no ar do nosso lado no mesmo dia, em vez de esperar por um reajuste de preço. E, como todo modelo está sob um único contrato, mover uma carga de trabalho de transcrição de um modelo para outro é uma mudança de string de modelo, em vez de uma segunda aquisição.

Três ações concretas para esta semana. Se você está no Grok Voice Transcribe 1.0, faça um teste-sombra do 2.0 com seu próprio áudio agora, enquanto o 1.0 ainda é o padrão e você ainda controla a troca. Se você está avaliando fala em streaming para um agente, meça o tempo até o primeiro resultado parcial no seu próprio orçamento de latência, em vez de confiar no placar de qualquer um — o quarto de segundo que este modelo gastou para comprar precisão ou não é nada ou é fatal, dependendo do que seu agente faz com o texto. E se você está construindo qualquer coisa que um agente pessoal possa um dia chamar, acompanhe de perto o programa de conectores Muse, porque o argumento de distribuição que ele apresenta é mais forte do que o detalhe técnico com que foi lançado.