
Muse Voice Transcribe: o modelo de conversão de fala em texto em streaming da Meta, explicado
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 1009 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 195 tok/s
- OrcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- xAISpaceXAI: Grok 4.62026-08-1244Inteligência77Código
O Muse Voice Transcribe é o modelo de fala para texto em streaming da Meta. Ele roda na Meta Model API a US$ 0,18 por hora de áudio, sob o id de modelo muse-voice-transcribe-1.0, e custa o mesmo preço quer você transmita áudio ao vivo, quer entregue uma gravação pronta. O que faz valer uma página de referência em vez de uma simples consulta de preço de uma linha é onde o trabalho acontece: a atribuição de falante para mais de vinte vozes e a detecção de fim de fala rodam dentro do modelo de reconhecimento, e não em uma passagem em lote acoplada ao final do stream. É somente fala para texto — a documentação para desenvolvedores da Meta diz isso com todas as letras: ele não sintetiza fala e não oferece uma API de conversa de fala para fala.
Esta é a página em que um leitor aterra depois de pesquisar o nome do próprio modelo, pelo que foi construída para ser a resposta estável a duas perguntas — o que é este modelo e quanto custa uma hora de áudio —, e não um anúncio. Uma data deve ficar registada antes de tudo o resto, porque é um facto sobre o modelo e não a razão pela qual a página existe: a Meta Superintelligence Labs apresentou o Muse Voice Transcribe em 2026-09-01, na publicação de anúncio datada Apresentamos o Muse Voice Transcribe — a publicação que um leitor ainda pode alcançar através do índice do blogue da Meta, embora já não responda no seu próprio URL. Tudo o que se segue foi lido nas próprias páginas da Meta em 2026-09-29, sobretudo na página do modelo e na documentação de conversão de fala em texto e de visão geral da API. Quando a Meta não publica qualquer valor, esta página di-lo em vez de recorrer a um substituto.
O que é, nos termos da Meta
A própria documentação da Meta abre sua descrição de forma direta: "Muse Voice Transcribe é o modelo de fala para texto da Meta na Meta Model API. Transcreva áudio ao vivo ou uma gravação existente, com detecção de turnos de fala, rótulos de falante e viés de vocabulário." A página de visão geral comprime a mesma coisa em uma única frase — diarização de falantes em streaming, endpointing nativo e detecção de atividade de voz, viés contextual e por palavras-chave, e 25 idiomas avaliados com alternância de código. Portanto, a saída é um único fluxo de transcrição que carrega três rótulos ao mesmo tempo: as palavras, quem está falando e se o enunciado foi concluído. Essa é a combinação que a maioria dos stacks de produção atualmente monta a partir de um reconhecedor, mais um detector de atividade de voz separado, mais um modelo de diarização separado, cada um com seu próprio orçamento de latência.
A página do modelo da Meta apresenta isso como "latência competitiva e precisão de transcrição em streaming com atribuição ao vivo para mais de 20 falantes", e a documentação para desenvolvedores descreve o campo de saída como "texto da transcrição com timing por turno e rótulos opcionais de falante". Duas coisas decorrem disso, e ambas importam mais do que o enquadramento:
• É um modelo de entrada de áudio e saída de texto. Não é de entrada nem de saída de texto, e a Meta é explícita ao afirmar que não é um gerador de fala.
• É um modelo de streaming em primeiro lugar. O caminho em tempo real não é um wrapper em torno do caminho de arquivo; é uma sessão WebSocket com seus próprios eventos, modos e limites, descritos abaixo.
Quanto custa uma hora de áudio
A página do modelo da Meta para Muse Voice Transcribe declara o preço como "Crie com um único modelo a $0.18/hora", e sua tabela de especificações lista muse-voice-transcribe-1.0 a $0.18 por hora de áudio e $3.00 por 1.000 minutos. Essas são duas maneiras de expressar uma mesma tarifa em unidades diferentes, e ambas estão impressas na própria página da Meta conforme lida em 2026-09-29. A documentação do desenvolvedor declara a mesma tarifa de uma terceira forma: "O preço é $0.18 por hora de áudio processado." Nenhum número nesta página é proveniente de uma página de preços da Meta, porque não há uma página de preços da Meta legível para consultar: a documentação direciona a tarifa para uma página "Preços e limites de taxa" que responde Esta página não está disponível conforme lida em 2026-09-29, então a página do modelo é a fonte de referência oficial da tarifa, e é a única usada aqui.
O detalhe de faturamento está na documentação para desenvolvedores e vale a pena conhecer antes de dimensionar uma carga de trabalho:
• Streaming e não-streaming custam o mesmo. Não há custo adicional para o endpoint em tempo real.
• O processamento com retenção zero de dados tem preço equivalente ao do nível Standard, conforme a documentação — não se trata de uma linha de sobretaxa.
• A cobrança é arredondada para baixo em segundos inteiros, portanto um turno de dois segundos é cobrado como dois segundos, e não três.
• Falhas que ocorrem antes que uma transcrição seja produzida não são cobradas, e nem 429 respostas de limite de taxa.
• Existem créditos gratuitos no nível da plataforma, e não no nível do modelo. A documentação de fala para texto da Meta encerra seu parágrafo sobre preços com a frase "Aplicam-se os créditos da camada gratuita da plataforma". Essa é a única menção a algo gratuito nas páginas deste modelo, e é deliberadamente inespecífica: aponta para um programa de créditos da plataforma em vez de prometer uma franquia gratuita para transcrição, e não informa nenhum valor, duração ou regra de elegibilidade. Interprete-a como um crédito que pode reduzir uma fatura, e não como uma camada gratuita do modelo. A declaração da Meta voltada ao consumidor de que seu agente pessoal é "gratuito para a maior parte do que as pessoas precisam" é uma frase separada sobre o aplicativo Muse e não se estende à Model API.
Exemplo prático, porque o valor por hora é difícil de sentir: uma entrevista gravada de duas horas custa $0,36 de transcrição. Mil horas de áudio de chamadas — aproximadamente o volume mensal de um centro de contato de médio porte — custam $180. Nessa escala, a tarifa é todo o argumento, e uma tarifa é também a única coisa que pode mudar debaixo dos seus pés: a página da Meta é a autoridade sobre isso, e se o valor mudar lá, ele muda aqui.
A interface de streaming, endpoint por endpoint
This is the part a reference page owes a reader that a launch write-up cannot carry, so here it is in the order you meet it. Base URL for Model API is https://api.meta.ai/v1 with a Bearer token, and Muse Voice Transcribe adds two endpoints on top of it.
• Áudio ao vivo — wss://api.meta.ai/v1/asr/realtime. O transporte é WebSocket, e o detalhe de autenticação é uma armadilha: você se autentica no frame de handshake, e o cabeçalho Authorization é ignorado. O handshake deve ser o primeiro frame de texto JSON e deve chegar em até 10 segundos. Uma sessão dura até 60 minutos, um novo WebSocket cria uma nova sessão, e não há token de retomada.
• Gravações — POST https://api.meta.ai/v1/asr/transcribe. Upload multipart e este de fato se autentica com o Authorization cabeçalho. A entrada é restrita: apenas WAV PCM mono de 16 bits a 16 ou 24 kHz. Os limites são 32 MB por corpo e 10 minutos de áudio por requisição.
Dentro da sessão em tempo real, três modos alteram o que você recebe. PUSH_TO_TALK é o padrão e faz transcrição de turno único. ENDPOINTING fornece limites de turno detectados pelo modelo, um turno por segmento de fala detectado, emitindo speechStart, repetido transcript, speechEnd e speechComplete eventos — com o aviso de que speechEnd não é a transcrição. DIARIZATION adiciona detecção e atribuição automática de falante, emitindo speaker eventos com rótulos como A e B. Transcrições parciais vêm de forma cumulativa, onde cada parcial substitui a anterior, ou como deltas.
Dois detalhes operacionais da mesma documentação são fáceis de passar despercebidos e caros de descobrir em produção:
• A diarização marca um possível novo locutor, em vez de um endpoint de fala limpo, e a Meta afirma que ela não foi ajustada para uso de comandos de voz com baixa latência. Trate os rótulos como identificadores com escopo de sessão — A em uma sessão não é a mesma pessoa que A na próxima.
• Os turnos podem se sobrepor, portanto o estado de cada turno deve ser indexado pelo identificador do turno, e não pela ordem de chegada.
• Os limites publicados por locatário são 128 streams simultâneos e 16.000 streams por hora.
O que roda dentro do modelo, e o que ele substitui
A página do modelo da Meta faz uma afirmação específica sobre a arquitetura, e não sobre as pontuações: "A atribuição de locutor para 20+ locutores e a deteção de fim de fala acontecem dentro do modelo de reconhecimento" — e contrasta isso explicitamente com uma passagem em lote no final do fluxo de áudio. A diferença prática é que não há um segundo estágio pelo qual esperar. Os rótulos de locutor e os limites de turno chegam no mesmo fluxo que as palavras, de modo que um agente de voz a jusante ou uma interface de legendagem ao vivo recebe um turno concluído e uma identidade sem uma etapa de pós-processamento.
As outras capacidades que a Meta documenta como residentes no modelo:
• Endpointing e detecção de atividade de voz nativos, então você não precisa executar seu próprio VAD na frente da API. Na formulação da documentação, você recebe uma transcrição completa por enunciado sem executar sua própria detecção de atividade de voz, e um fim de fala detectado não encerra a sessão.
• Viés contextual e de palavras-chave, sem ajuste fino. A página do modelo da Meta descreve a precisão mantida "por meio de viés contextual e de palavras-chave, sem ajuste fino", que é o recurso que torna o ASR em streaming utilizável em vocabulário de domínio — nomes de medicamentos, símbolos de ticker, SKUs de produtos — em vez da média da linguagem geral. A documentação é precisa sobre os limites: as palavras-chave enviesam o reconhecimento, mas não garantem uma grafia exata, e tanto as palavras-chave quanto o viés de idioma são fixados no início da sessão.
• 25 idiomas avaliados com alternância de código. A documentação os lista: árabe, bengali, holandês, inglês, francês, alemão, hebraico, híndi, indonésio, italiano, japonês, canarês, coreano, malaio, chinês mandarim, marata, polonês, português, espanhol, tagalo, tâmil, telugo, tailandês, turco e vietnamita. A alternância de código — no meio da frase e no meio do enunciado, sem que se diga qual idioma virá — é a capacidade que reconhecedores de um único idioma estruturalmente não podem oferecer. Uma ressalva que vale manter: o viés de idioma é uma lista de idiomas, não um contexto de formato livre, e não obriga o modelo a usá-los.
A postagem de anúncio datada vai além: ela diz que o modelo foi treinado em mais de 70 idiomas, com 25 “amplamente verificados” — segundo o fornecedor —, e a lista dos 25 verificados é o subconjunto que a Meta endossa. É com essa cobertura que se deve planejar, não com os 70.
Os limites documentados
Uma página de referência só é tão boa quanto as restrições que ela imprime, e a Meta imprime várias.
• Timestamps em nível de turno, não em nível de palavra. Tanto a página do modelo quanto a documentação afirmam claramente: "Ele retorna timestamps em nível de turno, mas não timestamps em nível de palavra." Os turnos contêm horários de início e fim em milissegundos. Se o seu produto precisa de clique para posicionar por palavra — destaque estilo karaokê, roteamento de confiança por palavra, alinhamento forçado — este é o modelo errado e nenhuma quantidade de engenharia de prompt muda isso.
• Sem pontuações de confiança, sem detecção de eventos sonoros, sem detecção de emoções, sem reformatação da transcrição. A Meta lista todos os quatro como indisponíveis. Você recebe palavras, turnos, tempos e rótulos de falante, e nada sobre o quão confiante o modelo está.
• Sem síntese de fala e sem API de conversa fala a fala. É apenas uma direção.
• Os formatos de áudio são limitados no caminho do ficheiro. WAV PCM mono de 16 bits, 16 ou 24 kHz. Qualquer outra coisa tem de ser convertida antes de ser carregada.
Pesos abertos, e a confusão do Muse Glimmer
O Muse Voice Transcribe é proprietário e fornecido através da API — não é um lançamento de pesos abertos, e a documentação da Meta nunca afirma o contrário. Isto é importante porque os leitores atribuem o caminho de pesos abertos da família Muse ao nome errado. Muse Glimmer é esse caminho: a documentação da Meta descreve-o como um modelo multimodal de pesos abertos destilado do Muse Spark, distribuído sob uma licença permissiva Apache 2.0, que você baixa e executa no seu próprio hardware através de um runtime como vLLM, SGLang, llama.cpp ou ExecuTorch. O Muse Voice Transcribe é agrupado na mesma página com o Muse Spark, Muse Image e SAM como modelos que você chama em vez de baixar.
Então: sem pesos para o Muse Voice Transcribe, sem opção de auto-hospedagem, sem caminho para auditá-lo ou ajustá-lo. Se uma página diz o contrário, ela o confundiu com o Muse Glimmer. Quando os pesos de um modelo não são publicados, a plataforma de serviço é toda a história — e é disso que trata a próxima seção.
Como um cliente chega até ele
A Model API da Meta foi criada para ser incorporada diretamente aos clientes que você já tem. A afirmação do fornecedor, impressa na página de visão geral da API, é que a Model API "é compatível de forma drop-in com as bibliotecas de cliente compatíveis com OpenAI e com Anthropic, e com CLIs de agente compatíveis com OpenAI. Defina a URL base do seu cliente, adicione sua chave e mantenha o restante do seu código". De modo geral, a Model API oferece três formatos de requisição — a Responses API, a Chat Completions API e a Messages API —, de modo que uma integração existente normalmente tem uma superfície correspondente sem precisar ser reescrita. Uma ressalva sobre o escopo: essa frase de compatibilidade e esses três formatos são capacidades da Model API como um todo, não linhas impressas na própria página do modelo do Muse Voice Transcribe. O próprio guia de início rápido da página do modelo é mais restrito — ele diz apenas que você "aponte seu cliente compatível com OpenAI existente para a Meta Model API", e que você terá uma primeira requisição funcional em menos de cinco minutos.
Uma lacuna honesta que vale a pena sinalizar em uma página de referência: a documentação da Meta para este modelo não nomeia nenhuma biblioteca de cliente oficial para o Muse Voice Transcribe, e sua página "Client libraries" fica na seção SAM, e não na de Voice. O que o guia de conversão de fala em texto oferece, em vez disso, é uma lista concreta de dependências — Python 3.9 ou posterior com os websockets e sounddevice na lista de pacotes — além de um manual de fundamentos da API de voz. Portanto, a alegação de drop-in descreve a superfície de requisição da Model API em geral; o próprio endpoint de ASR em tempo real é um WebSocket com suas próprias regras de handshake e nenhum wrapper documentado.

O que a Meta não publicou
Um benchmark ausente é um fato sobre a documentação, então aqui ele é declarado como tal. A página do modelo da Meta para o Muse Voice Transcribe não traz nenhuma tabela de precisão impressa: suas evidências de precisão são entregues como três recursos de imagem — um ranking de taxa de erro de palavra em streaming, uma comparação de taxa de erro de diarização e um índice de precisão em streaming — sem números no texto extraível. A própria página do modelo não fornece taxa de erro de palavra, nem taxa de erro de diarização, nem detalhamento por idioma.
O post de anúncio de fato traz números reportados pelo fornecedor, incluindo uma taxa de erro de palavras em streaming e uma taxa média de erro de diarização, e esses são os números que escrevemos quando o modelo foi lançado; são medições da própria Meta e permanecem não reproduzidas por terceiros. Esta página não refaz essa comparação, porque refazer um benchmark de fornecedor do dia de lançamento em uma página de referência vestiria um número não reproduzido como um número consolidado. O que pode ser dito claramente é mais restrito: a Meta não publica nenhuma avaliação comparativa direta contra um concorrente nomeado com esforço e harness correspondentes para este modelo, então qualquer comparação que você leia em qualquer lugar é uma comparação de números de fornecedores coletados sob condições diferentes.
Uma data também permanece indefinida de propósito. A página do modelo não traz data de lançamento alguma — seu único marcador de versão é o -1.0 no id do modelo. A data 2026-09-01 neste texto vem daquele post de anúncio datado, e é usada aqui para datar o modelo, e não para relatar um evento.


Quem deve optar por isto, e quem não deve
O argumento a favor do Muse Voice Transcribe é específico e forte: áudio ao vivo em que você precisa de palavras, identidade do locutor e fins de turno no mesmo fluxo, a um preço baixo o suficiente para rodar continuamente, em vez de sob demanda. Agentes de voz, legendagem ao vivo, inteligência de reuniões e chamadas, ditado e transcrição em alto volume são as cargas de trabalho que a Meta nomeia, e são as cargas de trabalho para as quais a interface foi de fato moldada — um WebSocket de 60 minutos com modos de endpointing e rótulos de locutor no escopo da sessão.
A objeção a ele é igualmente específica. Se você precisa de marcações de tempo no nível da palavra, confiança por palavra, detecção de eventos sonoros ou emoções, ou reformatação de transcrição, este modelo não os possui, e isso é uma ausência documentada, não um bug. Se o seu áudio chega em formatos diferentes de WAV mono de 16 bits a 16 ou 24 kHz e você está usando o endpoint de arquivo, você paga uma etapa de conversão que não pagaria em outro lugar. E se o seu requisito for a transcrição em lote de gravações arquivadas em que a precisão é o único eixo, o argumento de venda do streaming não lhe traz nada — o preço é o mesmo nos dois caminhos, então você está pagando por uma capacidade em tempo real que não vai usar.
A única coisa a verificar antes de você se comprometer com um caminho de produção é o valor que esta página existe para responder, e é o único valor que pode mudar sem que o modelo mude em nada: US$ 0,18 por hora de áudio, conforme impresso na própria página do modelo da Meta hoje. A página da Meta é a autoridade sobre isso. Quando ele muda, tudo o que é dimensionado a partir dele — o mês de mil horas, o custo por entrevista, a conta de construir versus comprar — muda junto.
