
Muse Realtime Avatar vs Realtime-Venus: Saída de Vídeo contra Entrada de Vídeo
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 180 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
Dois sistemas anunciados com nove dias de diferença entre si se autodenominam em tempo real e ambos reivindicam o rótulo audiovisual, e apontam em direções opostas ao longo do mesmo eixo. Muse Realtime Avatar, anunciado pela Meta em 23 de setembro de 2026, recebe uma fotografia e gera vídeo dela falando — seu vídeo é a saída, quadros retrato de 448×768 a 25 por segundo, produzidos por um Diffusion Transformer guiado por áudio que compartilha um fluxo de tokens com o Muse Realtime Voice. Realtime-Venus, enviado ao arXiv em 12 de setembro de 2026 pela Venus Team do Ant Group com a Universidade de Tsinghua, consome vídeo: o checkpoint Realtime-Venus-Omni transmite quadros da câmera por meio de um codificador SigLIP2 e fala sobre o que vê, enquanto o checkpoint Realtime-Venus-Audio é o mesmo backbone com a visão desativada no momento do carregamento. Um renderiza um rosto. O outro observa um. Nenhum dos dois pode ser chamado, e apenas um deles pode ser baixado — o que acaba sendo a diferença mais consequente.
Vale a pena declarar claramente a inversão de disponibilidade antes de qualquer outra coisa, porque contraria todas as expectativas sobre um produto da Meta e o lançamento de um laboratório de investigação. O sistema da Meta é fechado: anunciado no Connect, demonstrado num artigo de investigação, integrado no agente Muse, sem API, sem pesos, sem preço e sem data. O sistema da Ant Group é aberto: dois checkpoints de 9B em safetensors BF16 sob Apache-2.0 em inclusionAI/Realtime-Venus no Hugging Face, com código Transformers personalizado, um ficheiro de requisitos, uma voz de referência, uma página de projeto e um repositório GitHub complementar. A empresa com o produto de consumo não lançou nada que se possa segurar. A equipa de investigação lançou tudo.
O que cada um faz com um frame
A direção do vídeo é toda a diferença arquitetural, e não é uma questão de ênfase.
• Vídeo — o Muse Realtime Avatar gera-o, condicionado por tokens de fala, uma imagem de referência e uma janela deslizante de latentes de vídeo recentes; o Realtime-Venus-Omni perceciona-o, com um codificador visual SigLIP2 a transmitir fotogramas para o modelo a par do áudio.
• Áudio — O Muse Realtime Avatar conduz a geração a partir dos tokens de fala do Muse Realtime Voice, que carregam conteúdo e prosódia juntos; o Realtime-Venus gera fala como tokens S3 discretos decodificados por um decodificador de flow matching em streaming, em vez de acoplar um modelo separado de conversão de texto em fala ao final.
• Backbone — A arquitetura da Meta é um Diffusion Transformer orientado por áudio, de tamanho não divulgado; o Realtime-Venus é construído sobre um backbone de linguagem Qwen3-8B com um codificador de áudio Whisper-Medium, e seu model card afirma que o checkpoint Omni é adaptado do MiniCPM-o 4.5.
• Pesos — os do Muse Realtime Avatar não são publicados e não há indicação de que serão; Realtime-Venus disponibiliza dois checkpoints de 9B, BF16, contexto de 40.960 tokens em ambos, sob Apache-2.0.
• Acesso — O Muse Realtime Avatar não tem API nem data; o Realtime-Venus também não tem API, e seu card declara claramente que não é implantado por nenhum provedor de inferência.
• Onde é executado — O Muse Realtime Avatar é executado dentro do aplicativo Muse, para usuários que a Meta não enumerou, sob termos 18+; o Realtime-Venus é executado nas suas próprias GPUs, hoje mesmo, se você tiver o hardware e o apetite.
Leia as duas últimas linhas em conjunto e a diferença prática surge. Nenhum dos dois sistemas pode ser chamado. Um deles pode ser executado.
O download de 9B é real, e o que ele te custa também é.
O Realtime-Venus não é um stub de repositório. Os pesos estão lá, o código de carregamento personalizado está lá, e a licença no nível superior é Apache-2.0. Há duas coisas sobre ele que vale a pena saber antes de planear em torno dele.
O primeiro é o que não está nos pesos. O runtime de laço duplo que torna a arquitetura distinta — o laço de interação de um segundo mais um agendador em segundo plano que o artigo chama de Realtime-Venus-Harness, que executa tarefas delegadas contra um snapshot isolado do estado da conversa, de modo que um trabalho de longa duração não possa ser corrompido pelo avanço da conversa — vive no repositório do GitHub como um componente separado. O design de delegação, que é a ideia genuinamente nova no relatório, é a parte que você mesmo monta e em que confia.
O segundo é a linhagem. O card afirma que o checkpoint Omni foi adaptado do MiniCPM-o 4.5, o modelo omni-modal de 9B que a OpenBMB abriu em código aberto no início de 2026. Isso não é uma nota de rodapé. Significa que a contribuição do Ant Group é o pós-treinamento, o runtime e o design de delegação sobrepostos ao backbone de streaming de outra empresa, o que é uma alegação mais estreita e específica do que "um novo modelo omni de 9B" — e mais útil, porque indica onde procurar se algo no codificador visual apresentar mau funcionamento.
Os números, e exatamente de quem eles são
É aqui que os dois sistemas convergem de uma forma que não ajuda: nenhum dos dois tem sequer uma avaliação independente. Os quatro números da Meta são reportados pela própria empresa, com base em baselines escolhidos pela Meta. Os da Realtime-Venus são reportados pelos autores em um relatório técnico, sem que nenhum terceiro tenha publicado uma execução e sem nenhuma entrada em um ranking para comparar. Não há nenhuma medição pública de nenhum dos dois sistemas feita por alguém que não os tenha construído.
Os quatro números da Meta, conforme publicados: 870 ms do fim da sua vez até o primeiro byte de uma resposta sincronizada de voz e vídeo; vídeo retrato de 448×768 a 25 quadros por segundo; 60× menos avaliações de modelo do que sua própria linha de base; e 12 sessões simultâneas em tempo real em um único NVIDIA GB200, um ganho de capacidade de 8× em relação à linha de base BF16 de duas etapas da Meta. A Meta também divulga resultados de preferência em relação a dois sistemas comerciais de avatar, um dos quais ela relata como não estatisticamente distinguível da paridade em maneirismos — uma divulgação que merece crédito, já que é o tipo de resultado que a maioria das publicações de lançamento omite.
Ant Group, conforme publicado: melhor pontuação em seis dos oito benchmarks de vídeo que o relatório utiliza, incluindo StreamingBench 70.2, OVO-Bench 64.7 e Daily-Omni 81.3 para o checkpoint Omni; e para o checkpoint de Áudio, MMAU 78.0, MMAU-Pro 63.2, Llama Questions 83.8, Speech CMMLU 67.8 e uma pontuação de 4.81 no VoiceBench AlpacaEval que o relatório descreve como igualando o melhor valor de comparação.
Uma assimetria nas evidências merece ser nomeada. Os números do Ant Group são pontuações de benchmark com conjuntos de testes nomeados — reproduzíveis, em princípio, por qualquer pessoa disposta a baixar os pesos e executar a suíte. O número de destaque da Meta é uma medição de latência na própria stack de serving da Meta, que ninguém fora da Meta consegue reproduzir porque ninguém fora da Meta tem o sistema. O lançamento aberto, em outras palavras, também é o mais verificável.


Por que esses dois são um problema de roteamento disfarçado
Nenhum dos sistemas é um agente completo, e isso é verdade da mesma forma para ambos. O Muse Realtime Avatar é uma camada de renderização acoplada ao Muse Realtime Voice, que é a camada conversacional de um agente cujo raciocínio roda no Muse Spark. O Realtime-Venus delega tudo o que ultrapassa aquilo que consegue fazer inline — recuperação, chamadas de ferramentas, raciocínio difícil — para um harness que executa o trabalho em segundo plano com base em um snapshot da conversa. Em ambos os designs, aquilo com que o usuário conversa é um front end, e o pensamento acontece em um modelo de texto separado.
Esse modelo de texto separado é a parte que você pode rotear. No OrcaRouter, é um único endpoint para 196 modelos em 15 provedores, ao preço de tabela do provedor, repassado sem nenhuma margem, com failover automático quando um modelo apresenta erro ou atinge o tempo limite — o que importa mais do que o normal quando o que está do outro lado é um checkpoint auto-hospedado que ninguém avaliou de forma independente. Não hospedamos o Realtime-Venus: ele é um download, e não o servimos. Também não hospedamos o Muse Realtime Avatar, porque ninguém hospeda. O que oferecemos é a camada à qual ambas as arquiteturas entregam seu trabalho pesado, de modo que um componente não comprovado em qualquer um dos lados da conversa seja uma linha de configuração, e não uma aposta de produção.
Qual destes está realmente mais adiantado?
O instinto é dizer que é o da Meta, porque a Meta tem o produto e o vídeo de demonstração. As evidências dizem algo mais interessante. O sistema da Meta tem melhor engenharia de produção — 12 sessões simultâneas num GB200 é um resultado de serving, e os testes de preferência divulgados contra produtos de avatar já lançados são os únicos números de comparação direta que qualquer um dos sistemas tem. O sistema da Ant Group tem melhor verificabilidade: benchmarks nomeados, pesos publicados, uma licença Apache-2.0 e um relatório que qualquer pessoa pode tentar reproduzir.
O que nenhum dos dois tem é uma forma de pagar por isso. E o que está mais perto de ser utilizável não é o que tem o aplicativo para consumidor — é o que você pode baixar hoje à noite e descobrir por conta própria, no seu próprio hardware, com os seus próprios dados, e sem precisar de anúncio.
Se você está escolhendo, a questão não é qual modelo é melhor. É se você quer um rosto que você não pode chamar ou uma câmera que você pode rodar.

