Um cartão hero gerado para 'Muse Realtime Avatar', com a linha superior 'Meta AI Research - 23 de setembro de 2026', o título e três cartões rotulados com os textos 'Muse Realtime Voice - a camada conversacional, transmitindo tokens de fala', 'Muse Realtime Avatar - a camada de corporificação construída sobre ela, apenas para pesquisa' e 'Muse Spark 1.2 - o modelo Muse roteável no OrcaRouter hoje'. O logotipo do OrcaRouter está composto no canto inferior direito.
Engineering & Research

Muse Realtime Avatar: o que a Meta construiu, em que ele roda e por que você ainda não pode ligar para ele

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Muse Realtime Avatar é a tecnologia de corporificação da Meta. Ela recebe o fluxo de fala que Muse Realtime Voice produz e renderiza a performance correspondente: aponte-o para um retrato fotográfico e o rosto responde com pequenas mudanças de expressão; aponte-o para uma ilustração de corpo inteiro e a figura gesticula e muda sua postura enquanto fala. A Meta AI Research o apresentou em 23 de setembro de 2026 em um post chamado “Dando vida ao seu Muse”. É um resultado de pesquisa, e não um produto — a própria página da Meta não oferece API, nem preço, nem lista de espera, nem data de publicação para ele —, então a resposta honesta à pergunta “posso usá-lo hoje?” é não. O modelo Muse que você pode chamar hoje é outro, Meta Muse Spark 1.2.

Vale a pena apresentar essa resposta no primeiro parágrafo, em vez de no último, porque um leitor que pesquisa esse nome geralmente está decidindo se deve planejar em torno dele. Planeje em torno da pesquisa, não em torno de um endpoint.

Uma coisa a dizer sem rodeios antes de mais nada, porque esta página quebra uma regra que deveria admitir. Este blogue escreve habitualmente sobre modelos na semana em que são lançados. O Muse Realtime Avatar foi anunciado uma semana antes de esta página ser publicada, pelo que, numa leitura estrita da janela de atualidade, o item seria omitido. Isto não é um artigo noticioso sobre um evento datado. É a página de referência de um modelo que está ativo hoje na conversa do catálogo: a página a que um leitor chega depois de escrever o próprio nome do modelo, cuja justificação é a procura de pesquisa constante que nós próprios medimos, e não a atualidade de um lançamento. O anúncio de setembro é aqui referido como um facto que situa o modelo no tempo, não como um evento a noticiar, e nada abaixo constitui um segundo anúncio. A nossa cobertura desse dia é uma peça separada e mantém-se separada.

Onde se encaixa na família Muse

A Meta deixa explícito que estas são duas camadas de um único sistema, não dois produtos. Nas palavras da Meta, "Muse Realtime Voice e Muse Realtime Avatar formam um único sistema de streaming que conecta inteligência, voz e corporificação." A camada de voz fornece a inteligência conversacional e emite um fluxo de tokens de fala — a Meta os chama de VQs — que carregam tanto o que é dito quanto a forma como é entregue. Um decodificador de áudio transforma esses tokens em som, e a camada de avatar consome o mesmo fluxo para gerar a imagem. Compartilhar um único fluxo de tokens é o que mantém voz, movimento labial e expressão em sincronia; não há uma etapa separada de sincronização labial acrescentada depois.

Então: o Muse Realtime Voice é a camada conversacional. O Muse Realtime Avatar é a camada de corporificação construída sobre ele. Nenhum dos dois é a coisa que você pode chamar.

Tenha o mesmo cuidado com um nome vizinho, porque é o que tem maior probabilidade de ser confundido com um ou com outro. Muse Voice Transcribe é um endpoint de transcrição e é um produto genuinamente diferente. A documentação para programadores da Meta é inequívoca: "É apenas conversão de fala em texto; não sintetiza fala nem fornece uma API de conversação de fala para fala." Devolve marcas temporais ao nível do turno e não ao nível da palavra, e a Meta indica-o a 0,18 dólares por hora nessa página. É um endpoint real, com preço definido. Não é uma voz e certamente não é um avatar.

O modelo Muse que é realmente invocável é o Meta Muse Spark 1.2, o modelo de raciocínio que a Meta disponibiliza com um contexto de um milhão de tokens e entrada de texto, imagem, vídeo, ficheiro e áudio. Esse pode ser encaminhado aqui hoje, ao preço de tabela do fornecedor, sem qualquer margem, com a mesma chave que tudo o resto no catálogo, e a sua ficha em direto inclui a especificação completa. Não disponibilizamos o Muse Realtime Avatar. Voltámos a verificar a lista de modelos em direto enquanto escrevíamos isto e as únicas entradas Muse nela são os dois checkpoints Spark, o 1.2 e o seu antecessor 1.1. Dizer algo mais suave do que isso — que a família está "parcialmente disponível" — implicaria que encaminhamos algo que não encaminhamos.

A screenshot of Meta's research post 'Bringing Your Muse to Life' as published, showing the headline, the reading time of 10 minutes, a vertical portrait video player, and the opening paragraph introducing Muse Realtime Avatar as an embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.

A tecnologia, nos termos da própria Meta

A descrição da arquitetura feita pela Meta é compacta o suficiente para citar em vez de parafrasear. O Muse Realtime Avatar é "um Diffusion Transformer orientado por áudio, condicionado por um fluxo de tokens de fala, mídia de referência e uma janela deslizante de latentes de vídeo recentes", e "gera vídeo em pequenos blocos causais". A segunda metade dessa frase é a parte essencial: conforme cada bloco é concluído, seus latentes gerados mais recentes se tornam o contexto de movimento para o próximo. A razão declarada pela Meta é a continuidade — a aparência e os maneirismos do avatar se mantêm ao longo dos turnos enquanto a computação permanece limitada, e é isso que permite que a geração continue pelo tempo que durar a conversa, em vez de se desviar ou ficar sem orçamento.

O mecanismo de proveniência pertence ao mesmo parágrafo porque a Meta o apresenta como parte do sistema, e não como um elemento pensado posteriormente: o vídeo gerado carrega uma marca d'água invisível e durável aplicada por meio do Meta Video Seal, que, segundo a Meta, não acrescenta latência ao caminho em tempo real.

A Meta mediu essa coisa e publicou quatro números para ela. Esses números — e as ressalvas específicas que cada um exige, incluindo a que soa como um ganho de velocidade e não é — pertencem ao texto de lançamento, que os apresenta com seu contexto intacto. Não vamos repetir aqui os números crus, porque um número cru é exatamente o que a versão com ressalvas existe para evitar.

Cobrimos o anúncio no dia em nosso texto sobre o lançamento do Muse Realtime Avatar, e ele continua sendo o lugar para ler as afirmações ponderadas na íntegra.

O que o nome não é

Vale a pena descartar três falsos vizinhos um de cada vez, porque cada um deles é um palpite razoável apenas pelo nome.

• Não é o Muse Voice Transcribe. Esse endpoint converte fala em texto e, segundo a própria descrição da Meta, não faz nada na direção oposta. Se o que você precisa é de uma transcrição, a Meta vende uma, e é uma coisa diferente com um preço diferente.

• Não é um serviço de clonagem de voz. Nada nas páginas da Meta descreve a síntese da voz de uma pessoa específica, a venda de um modelo de voz ou a aceitação de uma amostra de voz fornecida por um utilizador. A camada de voz é descrita como produtora de um fluxo de tokens; a camada de avatar é descrita como consumidora desse fluxo. O formato de produto que essa expressão costuma implicar — carregar uma amostra, obter um clone — não é o que aqui se descreve, e o material de demonstração que a Meta efetivamente publica é apresentado como ilustração da capacidade do modelo.

• Não é um avatar de consumidor no aplicativo da própria Meta. A Meta acompanha seus exemplos com uma ressalva fácil de passar despercebida e que vale a pena manter: as demonstrações "ilustram a capacidade do modelo e nem todas refletem os avatares disponíveis no aplicativo Muse", e o Muse é para usuários de 18 anos ou mais. Leia isso ao pé da letra. Parte do que a publicação mostra é capacidade, não inventário.

Um quarto nome vale a pena separar por um motivo diferente. Muse Realtime Avatar não é o Muse Video, o modelo de geração de vídeo que passou a maior parte deste ano em um ranking público sem ser lançado. Nossa própria página sobre essa situação — Muse Video: Data de Lançamento, Acesso à API e O Que o Meta Connect Pode Mudar — traz uma restrição que repetiremos aqui literalmente, em vez de tentar melhorá-la: qualquer página que cite um dia específico de lançamento ou um preço para o Muse Video sem um anúncio mais recente da Meta está especulando. A mesma disciplina se aplica ao assunto desta página, portanto esta página não cita nenhum dos dois. Esse texto também fornece a data que não nos cabe confundir: o Muse Video está em prévia em 7 de julho de 2026 e não foi lançado, e é por isso que uma busca por esta família revela datas que pertencem a um modelo diferente.

A generated reference card titled 'Muse Realtime Avatar - what is reachable' with six rows: 'Muse Realtime Avatar: research result, no API, no price, no waitlist, no published date'; 'Muse Realtime Voice: the conversational layer it renders, no API announced'; 'Muse Voice Transcribe: a different product, speech-to-text only'; 'Muse Spark 1.2: the Muse model callable today'; 'Muse Video: previewed, not released'; and 'Routable on OrcaRouter: Muse Spark 1.2 and 1.1 only'. A footer reads 'Status per Meta's own pages, read September 29, 2026.' The OrcaRouter logo is composited in the bottom-right corner.

Para que serve esta página, e o que a mudaria

A razão pela qual uma página de referência é o formato certo aqui é mensurável. Nos 28 dias até 25 de setembro de 2026, o termo exato gerou 164 impressões na nossa propriedade de pesquisa e nenhum clique, com a melhor posição em 9,3. Mais de cinquenta das nossas páginas mencionam o fragmento em algum lugar, e quase todo esse tráfego vai parar em um único post de anúncio. Um termo com demanda real e sustentada, posicionado logo abaixo da primeira página e que não converte ninguém, não é um problema de demanda nem de qualidade — é um problema de página. Não havia nenhuma página cujo assunto fosse o próprio modelo. Esta é essa página.

A postura também é a razão pela qual nada aqui é disfarçado de notícia. Um leitor que chega por uma busca de nome quer três coisas, nesta ordem: o que isto é, se está disponível e no que se baseia. Elas são respondidas acima, nessa ordem, sem datas inventadas e sem nomear concorrentes.

A screenshot of our own model list filtered to the search term 'muse', showing two results, both under the Meta provider: meta/muse-spark-1.2 and meta/muse-spark-1.1, with Muse Spark 1.2 marked as having a 4M-token context window at $1.25 per million input tokens and $4.25 per million output tokens.

O que mudaria a página é um único anúncio. Se a Meta publicar um endpoint, um preço, uma lista de espera ou uma data para o Muse Realtime Avatar, a seção de disponibilidade deixa de ser um "não" e passa a ser uma especificação, e esta página será reescrita em vez de apenas receber acréscimos. Se a Meta lançar o Muse Video, o parágrafo acima muda junto. Até que qualquer uma dessas coisas aconteça, a atitude útil para um desenvolvedor é a pouco glamourosa: mantenha a interface que você já tem apontada para o modelo que consegue realmente acessar. Todo modelo do catálogo, incluindo o Meta Muse Spark 1.2, fica atrás de um endpoint compatível com OpenAI e uma chave, o que significa que experimentar a parte desta família que existe custa a você uma mudança na string do modelo, em vez de um novo contrato. Quando a camada de corporificação se tornar chamável, o custo de troca também deve ser uma string.