
Muse Realtime Avatar: Meta dá um rosto ao seu agente Muse, a 870 milissegundos por turno
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 180 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
O número que a Meta escolheu destacar é 870 milissegundos. Esse é o tempo queMuse Realtime Avatar leva, segundo a própria medição da Meta, desde o momento em que você para de falar até o momento em que chega o primeiro byte de uma resposta sincronizada de voz e vídeo. É um número genuinamente agressivo para um sistema que precisa gerar vídeo, e vale a pena interpretá-lo com precisão — porque quase tudo o que há de interessante no novo modelo de corporificação da Meta está na lacuna entre o que esse número mede e o que as pessoas vão supor que ele mede.
O Muse Realtime Avatar foi anunciado em 23 de setembro de 2026 na Meta Connect e detalhado no mesmo dia pelos Meta Superintelligence Labs em uma publicação de pesquisa intitulada "Dando Vida ao Seu Muse". Ele estende Muse Realtime Voice, a camada conversacional dentro do agente Muse da Meta, ao lhe dar um corpo. Não é um chatbot com um avatar genérico: você entrega a ele uma imagem de referência — uma fotografia, uma ilustração de corpo inteiro, um animal, um objeto doméstico — e ele renderiza essa coisa falando, gesticulando e mudando de postura em vídeo contínuo durante toda a conversa. Zuckerberg disse no palco que o avatar associado ao seu próprio Muse se chama Jolly.
Um fluxo de tokens compartilhado, não uma passagem de lip-sync
A arquitetura é a parte que vale a pena entender, porque explica por que a Meta continua dizendo “embodiment” em vez de “avatar”. O Muse Realtime Voice produz um fluxo de tokens de fala — a publicação os chama de VQs — que carregam tanto o conteúdo do que está sendo dito quanto sua prosódia: o ritmo, a ênfase, a ascensão e a queda. O Muse Realtime Avatar consome esse mesmo fluxo. Ele é um Diffusion Transformer guiado por áudio, condicionado a esses tokens de fala, à mídia de referência que você forneceu e a uma janela deslizante de latentes de vídeo recentes, e gera vídeo em pequenos blocos causais, alimentando cada novo latente adiante como contexto de movimento para o próximo.
Compartilhar um único fluxo de tokens é o que mantém voz, movimento labial e expressão sincronizados entre si. A alternativa — gerar o áudio e depois executar um modelo separado de sincronização labial sobre ele — é como funciona a maior parte da indústria de avatares, e é por isso que tantos desses avatares parecem estar sendo dublados. O design da Meta elimina essa emenda por construção. A janela latente deslizante é a segunda metade da ideia: sem ela, um gerador baseado em blocos sofre deriva e, aos três minutos, seu personagem silenciosamente se tornou outra pessoa.

Quatro números publicados, e o que cada um realmente mede
A Meta publicou mais números do que é habitual para uma publicação de pesquisa vinculada a um recurso voltado ao consumidor. Todos os quatro abaixo são relatados pela empresa, medidos pela Meta em relação a linhas de base escolhidas pela própria Meta; nenhum deles foi reproduzido fora da empresa.
• 870 ms do fim do turno até o primeiro byte. Este é um valor de início de resposta. Não é o tempo até uma resposta completa, nem é a latência contínua de entrega pelo restante da chamada. Um sistema pode atingir 870 ms até o primeiro byte e ainda parecer lento no décimo segundo. A publicação da Meta é explícita de que esta é a medida do primeiro byte; a cobertura que omite o qualificador está interpretando isso como responsividade ponta a ponta, o que não é.
• Vídeo vertical de 448×768 a 25 quadros por segundo. Essa é uma moldura alta em formato de telefone, não horizontal, e 25 fps é cinematográfico em vez de fluido — a taxa de quadros padrão do cinema, abaixo dos 30 ou 60 fps que um feed de câmera nativo ofereceria. A Meta afirma que as demonstrações são marcadas com uma sobreposição transparente para que o destinatário possa perceber que não está vendo um feed de câmera normal.
• 60× menos avaliações de modelo. Abordado devidamente abaixo, porque este é o número com maior probabilidade de ser mal interpretado.
• 12 sessões simultâneas em tempo real em uma única NVIDIA GB200.A Meta relata que seu trabalho de serving — caches KV persistentes, roteamento ciente de cache, batching dinâmico ciente de latência, treinamento ciente de quantização de quatro bits, kernels fusionados e captura de CUDA Graph, desenvolvidos com a NVIDIA — aumentou a capacidade em 8× em relação à sua própria linha de base BF16 de duas etapas. A aritmética por trás disso é clara: cada etapa de geração produz oito quadros, o que equivale a 320 ms de reprodução, em 20 ms de tempo de modelo, ou 2,5 ms por quadro. Tanto o 12 quanto o 8× são em relação à linha de base especificada pela Meta, não ao hardware de outro fornecedor.
Por que 60× não é 60× mais rápido
A alegação de compressão é a que será mais repetida e menos compreendida. O modelo professor da Meta era um modelo de difusão de 40 etapas com orientação livre de classificador em três vias — três passagens por etapa, portanto 120 avaliações do modelo para produzir um trecho de vídeo. O estudante é um modelo causal de duas etapas sem orientação, com cache KV de comprimento fixo, treinado por destilação e self-forcing, e precisa de duas avaliações para o mesmo trecho. Isso representa uma redução de 60× nas avaliações por trecho, com, nas palavras da Meta, qualidade próxima à do professor.
É uma redução de computação por bloco. Uma quantidade sessenta vezes menor de avaliações não significa que o usuário espere um sexagésimo do tempo, porque a latência tinha outros fatores antes da destilação e continua a tê-los depois. O gráfico na própria publicação da Meta mostra o que a redução rendeu em termos de qualidade: a preferência humana subindo de 45% para 55%. Essa é a versão honesta da história — o objetivo da destilação era criar um sistema que conseguisse, de fato, rodar em tempo real, e o custo de qualidade foi mantido em cerca de dez pontos de preferência, em vez de ser eliminado.
A avaliação, incluindo o resultado que foi no sentido oposto
A Meta testou em comparação com dois sistemas comerciais de avatar, Runway Characters e HeyGen LiveAvatar, usando identidades de avatar correspondentes, para que os avaliadores comparassem a animação e não o design do personagem. Os avaliadores realizaram conversas ao vivo de dois a três minutos com cada sistema e depois compararam qualidade visual, sincronização, consistência do personagem e maneirismos.
A Meta relata ter sido preferida em 78% contra 22% em relação ao Runway Characters e em 88% contra 12% em relação ao HeyGen LiveAvatar, além de ser preferida em todas as dimensões avaliadas. Em seguida, o post faz algo que a maioria das avaliações de fornecedores não faz: divulga que a comparação de maneirismos com o Runway Characters não era estatisticamente distinguível da paridade. Um empate dentro de uma varredura é algo pequeno, mas é o detalhe que mostra que a varredura está sendo relatada com honestidade, e não escolhida a dedo.
Os limites do teste importam mais do que o empate. Dois a três minutos é uma conversa curta. Os avaliadores eram da Meta. E a própria publicação adverte que suas demonstrações "ilustram a capacidade do modelo e nem todos refletem os avatares disponíveis no aplicativo Muse" — o que é uma equipe de pesquisa dizendo, claramente, que o vídeo que você assistiu não é necessariamente o produto que você receberá.
O que você não pode fazer com isso
Não há API para o Muse Realtime Avatar. Não há preço, tabela de tarifas, lista de espera nem data de lançamento. A Meta não disse quando usuários ou desenvolvedores poderão usá-lo. O app Muse para maiores de 18 anos é a única superfície para a qual ele está direcionado, e o avatar está chegando junto com um conjunto de outros recursos do Muse — personalização de voz, um endereço de e-mail Muse, controle do computador Mac, integração com óculos — que têm seus próprios cronogramas, alguns deles declarados como "próximos meses".
A comparação que importa aqui não é com a Runway nem com a HeyGen. É com o resto da stack Muse. O Muse Spark, o modelo de raciocínio no qual o agente é executado, está disponível para desenvolvedores desde que a Meta o abriu por meio da Meta Model API, e o Muse Spark 1.2 é servido pelo OrcaRouter como meta/muse-spark-1.2 a US$ 1,25 por milhão de tokens de entrada e US$ 4,25 por milhão de tokens de saída, preço de lista do provedor sem markup, dentro de uma janela de contexto de um milhão de tokens que já aceita texto, imagens, vídeo, áudio e arquivos. Essa é a parte do Muse que você pode chamar hoje. A face é a parte que você não pode.
Vale a pena ponderar essa assimetria se você estiver planejando alguma coisa. Um agente que raciocina durante uma chamada de vídeo e um agente que aparece nela são produtos diferentes, com restrições diferentes, e apenas um deles consta em uma tabela de preços.

O que assistir em seguida
Três coisas transformariam isto de um anúncio numa decisão. A primeira é uma data de lançamento para o avatar dentro do Muse, porque tudo o que a Meta publicou diz respeito a um modelo, e nada do que publicou diz respeito a um produto que se possa usar numa quinta-feira. A segunda é uma medição de latência feita ao longo de uma conversa longa em vez de no primeiro byte — 870 ms é um tiro de partida, e a pergunta que uma chamada real faz é o que acontece ao décimo minuto. A terceira é se o sistema mantém o personagem sob condições adversas: um utilizador que muda deliberadamente de assunto, avança depressa, ou lhe fornece uma imagem de referência concebida para parecer uma pessoa real.
Até então, o resumo honesto é aquele que o post de pesquisa insinua sem dizer. Muse Realtime Avatar é uma obra de engenharia de verdade, com um resultado de compressão real por trás, demonstrado em um ambiente controlado, avaliado pela empresa que o criou, em conversas que duraram o mesmo que um pedido de café. Não é vaporware. Também não é algo que você possa comprar, rotear ou benchmarkar — e essas são afirmações diferentes.

