Um cartão hero gerado para o artigo 'Muse Realtime Avatar vs Realtime-Venus', mostrando dois cartões arredondados de cada lado do título. O cartão da esquerda exibe 'Muse Realtime Avatar' acima de um ícone de quadro de vídeo de saída e as linhas 'gera o vídeo' e '448x768 a 25 fps, fechado'; o cartão da direita exibe 'Realtime-Venus' acima de um ícone de câmera de entrada e as linhas 'lê o vídeo' e '2 x 9B, Apache-2.0, baixável'. Um subtítulo diz 'Um renderiza um rosto. O outro observa um.' O logotipo da OrcaRouter é composto no canto inferior direito.
Guides & Insights

Muse Realtime Avatar vs Realtime-Venus: Saída de Vídeo contra Entrada de Vídeo

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Dois sistemas anunciados com nove dias de diferença entre si se autodenominam em tempo real e ambos reivindicam o rótulo audiovisual, e apontam em direções opostas ao longo do mesmo eixo. Muse Realtime Avatar, anunciado pela Meta em 23 de setembro de 2026, recebe uma fotografia e gera vídeo dela falando — seu vídeo é a saída, quadros retrato de 448×768 a 25 por segundo, produzidos por um Diffusion Transformer guiado por áudio que compartilha um fluxo de tokens com o Muse Realtime Voice. Realtime-Venus, enviado ao arXiv em 12 de setembro de 2026 pela Venus Team do Ant Group com a Universidade de Tsinghua, consome vídeo: o checkpoint Realtime-Venus-Omni transmite quadros da câmera por meio de um codificador SigLIP2 e fala sobre o que vê, enquanto o checkpoint Realtime-Venus-Audio é o mesmo backbone com a visão desativada no momento do carregamento. Um renderiza um rosto. O outro observa um. Nenhum dos dois pode ser chamado, e apenas um deles pode ser baixado — o que acaba sendo a diferença mais consequente.

Vale a pena declarar claramente a inversão de disponibilidade antes de qualquer outra coisa, porque contraria todas as expectativas sobre um produto da Meta e o lançamento de um laboratório de investigação. O sistema da Meta é fechado: anunciado no Connect, demonstrado num artigo de investigação, integrado no agente Muse, sem API, sem pesos, sem preço e sem data. O sistema da Ant Group é aberto: dois checkpoints de 9B em safetensors BF16 sob Apache-2.0 em inclusionAI/Realtime-Venus no Hugging Face, com código Transformers personalizado, um ficheiro de requisitos, uma voz de referência, uma página de projeto e um repositório GitHub complementar. A empresa com o produto de consumo não lançou nada que se possa segurar. A equipa de investigação lançou tudo.

O que cada um faz com um frame

A direção do vídeo é toda a diferença arquitetural, e não é uma questão de ênfase.

Vídeo — o Muse Realtime Avatar gera-o, condicionado por tokens de fala, uma imagem de referência e uma janela deslizante de latentes de vídeo recentes; o Realtime-Venus-Omni perceciona-o, com um codificador visual SigLIP2 a transmitir fotogramas para o modelo a par do áudio.

Áudio — O Muse Realtime Avatar conduz a geração a partir dos tokens de fala do Muse Realtime Voice, que carregam conteúdo e prosódia juntos; o Realtime-Venus gera fala como tokens S3 discretos decodificados por um decodificador de flow matching em streaming, em vez de acoplar um modelo separado de conversão de texto em fala ao final.

Backbone — A arquitetura da Meta é um Diffusion Transformer orientado por áudio, de tamanho não divulgado; o Realtime-Venus é construído sobre um backbone de linguagem Qwen3-8B com um codificador de áudio Whisper-Medium, e seu model card afirma que o checkpoint Omni é adaptado do MiniCPM-o 4.5.

Pesos — os do Muse Realtime Avatar não são publicados e não há indicação de que serão; Realtime-Venus disponibiliza dois checkpoints de 9B, BF16, contexto de 40.960 tokens em ambos, sob Apache-2.0.

Acesso — O Muse Realtime Avatar não tem API nem data; o Realtime-Venus também não tem API, e seu card declara claramente que não é implantado por nenhum provedor de inferência.

Onde é executado — O Muse Realtime Avatar é executado dentro do aplicativo Muse, para usuários que a Meta não enumerou, sob termos 18+; o Realtime-Venus é executado nas suas próprias GPUs, hoje mesmo, se você tiver o hardware e o apetite.

Leia as duas últimas linhas em conjunto e a diferença prática surge. Nenhum dos dois sistemas pode ser chamado. Um deles pode ser executado.

O download de 9B é real, e o que ele te custa também é.

O Realtime-Venus não é um stub de repositório. Os pesos estão lá, o código de carregamento personalizado está lá, e a licença no nível superior é Apache-2.0. Há duas coisas sobre ele que vale a pena saber antes de planear em torno dele.

O primeiro é o que não está nos pesos. O runtime de laço duplo que torna a arquitetura distinta — o laço de interação de um segundo mais um agendador em segundo plano que o artigo chama de Realtime-Venus-Harness, que executa tarefas delegadas contra um snapshot isolado do estado da conversa, de modo que um trabalho de longa duração não possa ser corrompido pelo avanço da conversa — vive no repositório do GitHub como um componente separado. O design de delegação, que é a ideia genuinamente nova no relatório, é a parte que você mesmo monta e em que confia.

O segundo é a linhagem. O card afirma que o checkpoint Omni foi adaptado do MiniCPM-o 4.5, o modelo omni-modal de 9B que a OpenBMB abriu em código aberto no início de 2026. Isso não é uma nota de rodapé. Significa que a contribuição do Ant Group é o pós-treinamento, o runtime e o design de delegação sobrepostos ao backbone de streaming de outra empresa, o que é uma alegação mais estreita e específica do que "um novo modelo omni de 9B" — e mais útil, porque indica onde procurar se algo no codificador visual apresentar mau funcionamento.

Os números, e exatamente de quem eles são

É aqui que os dois sistemas convergem de uma forma que não ajuda: nenhum dos dois tem sequer uma avaliação independente. Os quatro números da Meta são reportados pela própria empresa, com base em baselines escolhidos pela Meta. Os da Realtime-Venus são reportados pelos autores em um relatório técnico, sem que nenhum terceiro tenha publicado uma execução e sem nenhuma entrada em um ranking para comparar. Não há nenhuma medição pública de nenhum dos dois sistemas feita por alguém que não os tenha construído.

Os quatro números da Meta, conforme publicados: 870 ms do fim da sua vez até o primeiro byte de uma resposta sincronizada de voz e vídeo; vídeo retrato de 448×768 a 25 quadros por segundo; 60× menos avaliações de modelo do que sua própria linha de base; e 12 sessões simultâneas em tempo real em um único NVIDIA GB200, um ganho de capacidade de 8× em relação à linha de base BF16 de duas etapas da Meta. A Meta também divulga resultados de preferência em relação a dois sistemas comerciais de avatar, um dos quais ela relata como não estatisticamente distinguível da paridade em maneirismos — uma divulgação que merece crédito, já que é o tipo de resultado que a maioria das publicações de lançamento omite.

Ant Group, conforme publicado: melhor pontuação em seis dos oito benchmarks de vídeo que o relatório utiliza, incluindo StreamingBench 70.2, OVO-Bench 64.7 e Daily-Omni 81.3 para o checkpoint Omni; e para o checkpoint de Áudio, MMAU 78.0, MMAU-Pro 63.2, Llama Questions 83.8, Speech CMMLU 67.8 e uma pontuação de 4.81 no VoiceBench AlpacaEval que o relatório descreve como igualando o melhor valor de comparação.

Uma assimetria nas evidências merece ser nomeada. Os números do Ant Group são pontuações de benchmark com conjuntos de testes nomeados — reproduzíveis, em princípio, por qualquer pessoa disposta a baixar os pesos e executar a suíte. O número de destaque da Meta é uma medição de latência na própria stack de serving da Meta, que ninguém fora da Meta consegue reproduzir porque ninguém fora da Meta tem o sistema. O lançamento aberto, em outras palavras, também é o mais verificável.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs Realtime-Venus — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'Realtime-Venus'. Rows read: Video — generated output vs perceived input; Weights — not published vs 2 x 9B, BF16, Apache-2.0; Context — undisclosed vs 40,960 tokens; Access — no API, no date vs no API, self-host only; Headline figure — 870 ms to first byte of voice + video vs StreamingBench 70.2 and Daily-Omni 81.3; Independent runs — none vs none. A footer line reads 'Meta and Ant Group figures both author-reported; neither system independently evaluated.'A screenshot of the Hugging Face model card for inclusionAI/Realtime-Venus, showing the repository name, the Apache-2.0 licence and arXiv 2609.13814 tags, the tagline 'A full-duplex interaction system with asynchronous delegation', the Project Page, GitHub, ModelScope and Licence links, the three-panel overview figure covering proactive response, delegated tool work and audio interruption, and an Inference Providers panel stating the model is not deployed by any inference provider.

Por que esses dois são um problema de roteamento disfarçado

Nenhum dos sistemas é um agente completo, e isso é verdade da mesma forma para ambos. O Muse Realtime Avatar é uma camada de renderização acoplada ao Muse Realtime Voice, que é a camada conversacional de um agente cujo raciocínio roda no Muse Spark. O Realtime-Venus delega tudo o que ultrapassa aquilo que consegue fazer inline — recuperação, chamadas de ferramentas, raciocínio difícil — para um harness que executa o trabalho em segundo plano com base em um snapshot da conversa. Em ambos os designs, aquilo com que o usuário conversa é um front end, e o pensamento acontece em um modelo de texto separado.

Esse modelo de texto separado é a parte que você pode rotear. No OrcaRouter, é um único endpoint para 196 modelos em 15 provedores, ao preço de tabela do provedor, repassado sem nenhuma margem, com failover automático quando um modelo apresenta erro ou atinge o tempo limite — o que importa mais do que o normal quando o que está do outro lado é um checkpoint auto-hospedado que ninguém avaliou de forma independente. Não hospedamos o Realtime-Venus: ele é um download, e não o servimos. Também não hospedamos o Muse Realtime Avatar, porque ninguém hospeda. O que oferecemos é a camada à qual ambas as arquiteturas entregam seu trabalho pesado, de modo que um componente não comprovado em qualquer um dos lados da conversa seja uma linha de configuração, e não uma aposta de produção.

Qual destes está realmente mais adiantado?

O instinto é dizer que é o da Meta, porque a Meta tem o produto e o vídeo de demonstração. As evidências dizem algo mais interessante. O sistema da Meta tem melhor engenharia de produção — 12 sessões simultâneas num GB200 é um resultado de serving, e os testes de preferência divulgados contra produtos de avatar já lançados são os únicos números de comparação direta que qualquer um dos sistemas tem. O sistema da Ant Group tem melhor verificabilidade: benchmarks nomeados, pesos publicados, uma licença Apache-2.0 e um relatório que qualquer pessoa pode tentar reproduzir.

O que nenhum dos dois tem é uma forma de pagar por isso. E o que está mais perto de ser utilizável não é o que tem o aplicativo para consumidor — é o que você pode baixar hoje à noite e descobrir por conta própria, no seu próprio hardware, com os seus próprios dados, e sem precisar de anúncio.

Se você está escolhendo, a questão não é qual modelo é melhor. É se você quer um rosto que você não pode chamar ou uma câmera que você pode rodar.

A screenshot of Meta's research post 'Bringing Your Muse to Life', dated September 23, 2026, showing the headline, the reading time, a vertical portrait video player showing a white furry character, and the opening paragraph introducing Muse Realtime Avatar as embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.