Cartão de título hero para o Muse Voice Transcribe, o primeiro modelo de percepção de áudio em tempo real da Meta Superintelligence Labs, mostrando uma forma de onda em streaming com ASR, diarização de 20+ falantes e endpointing identificados, e um chip de preço indicando $0.18 por hora de áudio.
Guides & Insights

Muse Voice Transcribe Está no Ar: O Primeiro Modelo de Percepção de Áudio em Tempo Real da Meta

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Muse Voice Transcribe, o primeiro modelo de percepção de áudio em tempo real da Meta Superintelligence Labs, lançado em 1º de setembro de 2026, e tem um preço que é um spoiler: $3.00 por 1,000 minutos de áudio — cerca de $0.18 por hora — na Meta Model API. Em uma única passagem de streaming, ele faz o que a maioria das pilhas de transcrição divide entre três sistemas: reconhecimento automático de fala, diarização de falantes em mais de 20 vozes e endpointing, a tarefa de decidir quando um falante realmente terminou em vez de fazer uma pausa no meio do pensamento. A Meta afirma que o modelo lidera o ranking de fala-para-texto em streaming da Artificial Analysis, com uma taxa de erro de palavras de 3.1% em transcrições finais, entregue 0.16 segundos após o falante parar de falar.

Esse último número precisa receber seu rótulo honesto antes de fazer qualquer trabalho: é a afirmação de lançamento da Meta, apontando para um ranking independente, sobre um modelo que estava acessível há menos de um dia quando o anúncio foi divulgado. Ninguém fora do laboratório reproduziu os 3,1% ainda, e a alegação de precisão é uma coisa, enquanto o resto do discurso — 70+ idiomas treinados, alternância de código nativa, "atraso adaptativo" aprendido por reforço — é um conjunto separado de declarações do fornecedor no mesmo barco. Tudo neste post é o estado do modelo no primeiro dia, com números do fornecedor rotulados como números do fornecedor.

Os números que importam no primeiro dia

• Preço — US$ 3,00 por 1.000 minutos de áudio (cerca de US$ 0,18 por hora de áudio) na API Meta Model, subcotando todas as principais APIs de transcrição por streaming que monitoramos.

• Alegação de precisão — 3.1% WER em transcrições finais a 0.16 segundos após o fim da fala; 3.6% WER em primeiras transcrições parciais a 0.13 segundos. Relatado pelo fornecedor, citando o leaderboard de streaming da Artificial Analysis.

• Diarização — 20+ locutores, emitida em streaming sem etapa separada de pós-processamento (a Meta relata uma taxa média de erro de diarização de 17,5%).

• Idiomas — treinado em mais de 70; 25 "extensivamente verificados" no lançamento; alternância de código perfeita dentro e entre frases.

• Contexto — lida com áudio de mais de uma hora; viés de idioma, palavras-chave e contexto para domínios com muitos jargões.

A screenshot of the Meta AI Research announcement post for Muse Voice Transcribe (captured September 2, 2026), showing the headline 'Introducing Muse Voice Transcribe', the September 1, 2026 publication date, and an interactive real-time transcription demo at the top of the page.

O que "modelo de percepção auditiva" significa aqui

{{1}}A arquitetura é a história.{{/1}} O Muse Voice Transcribe consome áudio em blocos de 80 milissegundos e transmite as palavras à medida que elas se estabilizam — é isso que {{2}}"tempo real"{{/2}} significa na prática. O interessante é como ele decide quando confirmar uma palavra. Em vez de um orçamento de latência fixo — a troca padrão em que um reconhecedor ou se compromete cedo e dá um palpite, ou espera mais e adia a decisão — o modelo usa o que a Meta chama de {{3}}"atraso adaptativo"{{/3}}: ele avança rapidamente por trechos de fala fáceis e retém mais contexto de áudio para as palavras sobre as quais tem menos certeza. A própria política de atraso foi aprendida por meio de aprendizado por reforço, então o modelo está efetivamente equilibrando velocidade e precisão palavra por palavra, em vez de aplicar uma configuração global única.

Essa distinção é o motivo pelo qual a Meta chama o Muse Voice Transcribe de "modelo de percepção de áudio" em vez de um modelo ASR. O fluxo de saída é uma transcrição única ao vivo que também carrega quem está falando e quando a fala está completa — três rótulos que os sistemas de streaming geralmente montam ao conectar um reconhecedor a um detector de atividade de voz e a um modelo de diarização, cada um adicionando sua própria latência e seus próprios modos de falha.

A screenshot of the Artificial Analysis Speech to Text leaderboard showing the WER Index (non-streaming), Speed Factor, Streaming, and Price in USD per 1,000 minutes of audio sections.

Diarização e endpointing integrados

A diarização de falantes é a parte que mais merece escrutínio, porque é o recurso em que os produtos de streaming mais frequentemente exageram. A Meta afirma que o modelo separa mais de 20 falantes em uma única gravação e reporta uma taxa média de erro de diarização de 17,5%, que ela contrasta com uma faixa de 21,1–28,6% que atribui a sistemas concorrentes. Ambos os números são publicados pelo fornecedor no dia do lançamento, e nenhuma avaliação independente confirmou os 17,5% até agora. O que é estruturalmente real é que a diarização ocorre na mesma passada de streaming que o reconhecimento — não há uma segunda etapa de "envie o áudio, espere, receba os falantes de volta", que é a escolha de design que torna o rastreamento de mais de 20 falantes plausível em um ambiente ao vivo.

A detecção de fim de fala é a capacidade mais discreta e indiscutivelmente a mais útil. APIs de transcrição que expõem ASR de streaming bruto forçam o chamador a implementar a detecção de fim de fala por conta própria, e é por isso que os agentes de voz com tanta frequência interrompem as pessoas ou deixam silêncio no ar. O Muse Voice Transcribe decide quando um turno está completo e emite esse limite como parte do fluxo, para que um aplicativo receba um sinal claro de "este falante terminou" sem construir uma camada de VAD.

A afirmação multilíngue, leia com atenção.

A Meta treinou o modelo em mais de 70 idiomas, mas valida 25 no lançamento. São coisas diferentes: "treinado em" significa que os dados os incluíam; "extensivamente verificado" é o subconjunto que a Meta realmente respalda com testes internos. Para uso em produção, a lista dos 25 verificados é a cobertura real, e a diferença entre 70 e 25 vale a pena conhecer antes de rotear 40 idiomas por meio dele. O que é genuinamente incomum é a questão da alternância de código — o modelo é projetado para alternar idiomas no meio da frase e no meio do enunciado sem que seja instruído, o que é um ponto real de dor em regiões multilíngues e algo que a maioria dos produtos de ASR monolíngues simplesmente não consegue fazer. O viés de idioma, palavras-chave e contexto completa a história da personalização: você pode enviesar o reconhecimento em direção a um vocabulário de domínio, que é o recurso que torna o ASR de streaming utilizável em filas de atendimento médico, jurídico e de suporte.

Três superfícies, um modelo

Muse Voice Transcribe chega a três superfícies ao mesmo tempo. A paga é a Meta Model API a US$ 3,00 por 1.000 minutos de áudio. A de consumo é a Meta AI para Mac, onde manter a tecla Fn pressionada dita texto em qualquer aplicativo — a resposta da Meta à ditação integrada da Apple, e a implantação mais visível do modelo no mundo real logo no primeiro dia. A de desenvolvedores é a Muse Code, o agente de codificação da Meta, onde comandos de voz conduzem sessões multiagentes e fluxos de refatoração. Um único modelo alimentando um recurso de ditado e um agente de codificação é a versão transformada em produto da proposta "um modelo de streaming, muitas superfícies".

O que o preço prejudica

A US$ 0,18 por hora de áudio, o Muse Voice Transcribe subcotiza o campo de transcrição em streaming no preço de tabela. O conjunto de comparação, conforme o acompanhamos: o Gemini 3.5 Transcribe Live, do Google, custa cerca de US$ 9 por 1.000 minutos; o Scribe v2 Realtime, da ElevenLabs, está listado a US$ 6,50 por 1.000 minutos; o Ink-2, da Cartesia, a US$ 4,00; e o GPT Live Transcribe, da OpenAI, a US$ 17,00. Esses são os números publicados pelos fornecedores, e vários desses modelos têm evidências independentes de precisão que o Muse ainda não tem — a liderança de preço no primeiro dia não é o mesmo que um ranking consolidado. Mas um modelo de streaming com diarização e detecção de fim de fala integradas, entrando com um preço de cerca de um quinto a um décimo do valor das APIs de streaming já estabelecidas, é o tipo de número que redefine expectativas, independentemente disso.

A generated price-comparison infographic titled 'Streaming transcription — list price per 1,000 minutes' showing Muse Voice Transcribe at $3.00 against Cartesia Ink-2 at $4.00, ElevenLabs Scribe v2 Realtime at $6.50, Gemini 3.5 Transcribe Live at $9.00, and GPT Live Transcribe at $17.00, with a footer noting these are vendor list prices as published in September 2026, and the OrcaRouter logo in the bottom-right corner.

As advertências honestas

Muse Voice Transcribe é proprietário e os pesos não são publicados — a opção de "executar você mesmo" não existe, e não há caminho de pesos abertos para auditoria ou ajuste fino. A alegação de precisão é do dia do lançamento e não foi reproduzida. Os 25 idiomas verificados podem não corresponder ao número de 70+ "treinados" para cobertura de recursos de baixa disponibilidade. E o benchmark de diarização, por mais promissor que seja, é uma medição do fornecedor até que uma execução independente o confirme. Para equipes cujo único requisito é transcrição em lote precisa de áudio pré-gravado, opções mais baratas e melhor auditadas ainda existem — a proposta de streaming é sobre interação em tempo real, não sobre superar o mundo da transcrição em lote em custo por hora de áudio.

O que assistir em seguida

Quatro coisas decidirão se este lançamento é um momento ou uma tendência. Primeiro: se o leaderboard de streaming da Artificial Analysis realmente listar o Muse Voice Transcribe em #1 após verificação independente — a alegação do dia do lançamento precisa de uma entrada consolidada no ranking. Segundo: se a diarização de 20+ falantes sobrevive ao contato com reuniões reais e ruidosas. Terceiro: se a superfície de ditado para Mac da Meta se converte em adoção da API por desenvolvedores. Quarto: como os incumbentes respondem em relação ao preço, porque um modelo de streaming com diarização e endpointing a US$ 0,18 por hora pressiona visivelmente todos os que estão acima dele. Quando a Meta abrir o modelo para parceiros de hospedagem adicionais, um gateway de repasse como o OrcaRouter — que repassa os preços de tabela do provedor com margem de 0% — exibiria o mesmo valor de US$ 3,00 por 1.000 minutos, sem acréscimo de revendedor, no dia em que isso acontecer. Até lá, o único lugar para usar o Muse Voice Transcribe é a própria API da Meta.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube