
Muse Realtime Avatar vs SeedRealtime: Dois modelos que você só pode assistir
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 180 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
Nenhum dos dois tem tabela de preços. Muse Realtime Avatar, anunciado pela Meta em 23 de setembro de 2026 na Meta Connect, não tem API, nem endpoint, nem preço e nem data — é uma capacidade do agente Muse da Meta, demonstrada em um post de pesquisa intitulado "Bringing Your Muse to Life". SeedRealtime, lançado pela ByteDance Seed em 5 de agosto de 2026, não tem API, nem pesos, nem relatório técnico e nem contagem de parâmetros — ele existe dentro do próprio app Doubao da ByteDance, e o post da ByteDance diz apenas que ele foi "fully rolled out". Duas das maiores empresas de IA de consumo do mundo lançaram sistemas audiovisuais em tempo real com sete semanas de diferença uma da outra e nenhum dos dois está à venda. Essa é a comparação, e é uma comparação mais interessante do que a tabela de benchmarks que ninguém consegue montar.
O que os separa é a direção em que o vídeo flui. SeedRealtime observa, escuta e fala sobre o que vê — áudio, vídeo e texto em uma única rede ponta a ponta, com a alternância de turnos transferida de um detector externo de atividade de voz para o próprio modelo. Muse Realtime Avatar gera: você lhe entrega uma imagem de referência, uma fotografia, uma ilustração ou um objeto, e ele renderiza essa coisa falando e gesticulando em vídeo contínuo durante toda a conversa. O vídeo do SeedRealtime é entrada. O vídeo do Muse Realtime Avatar é saída. Ambos são descritos como full-duplex, ambos são audiovisuais, e estão fazendo trabalhos opostos com o rótulo.
O que cada um é, e onde ele fica
Seis linhas, e as duas últimas são as que decidem alguma coisa.
• Vídeo — O Muse Realtime Avatar gera-o, a uma resolução de retrato de 448×768 e 25 fotogramas por segundo, com marca de água através de uma sobreposição transparente, para que quem vê possa perceber que não se trata de uma transmissão de câmara; o SeedRealtime perceciona-o, transmitindo fotogramas para a mesma rede que processa o áudio.
• A aposta arquitetural — O Muse Realtime Avatar compartilha um único fluxo de tokens entre voz e vídeo, de modo que um Diffusion Transformer orientado por áudio consome diretamente os tokens de fala do Muse Realtime Voice e nada é sincronizado labialmente depois; o SeedRealtime incorpora a alternância de turnos ao modelo, de modo que quem fala e quando deixa de ser uma decisão de um detector externo de atividade de voz.
• Onde funciona — Muse Realtime Avatar é um recurso dentro do agente Muse da Meta; SeedRealtime está dentro do app Doubao da ByteDance.
• Acesso de desenvolvedor — nenhum dos dois tem API. Nenhum dos dois publica os pesos. Não há opção serverless, nem endpoint hospedado, nem plataforma de terceiros que ofereça qualquer um deles.
• Preço — não divulgado para ambos, porque não há oferta comercial de nenhum dos lados.
• Avaliação independente — nenhuma para nenhum dos sistemas. Todos os números que qualquer das empresas publicou sobre o seu próprio modelo são de primeira mão, e nenhum avaliador externo testou nenhum dos dois.
Duas bases de evidências, ambas primárias, e uma delas é muito mais ténue
Aqui a comparação deixa de ser simétrica. A Meta publicou quatro números para o Muse Realtime Avatar, todos reportados pela empresa, medidos contra linhas de base escolhidas pela Meta, nenhum deles reproduzido fora da empresa: 870 ms desde o fim da sua vez até o primeiro byte de uma resposta sincronizada de voz e vídeo; vídeo em retrato 448×768 a 25 quadros por segundo; 60× menos avaliações de modelo do que sua própria linha de base; e 12 sessões em tempo real simultâneas em uma única NVIDIA GB200, um ganho de capacidade de 8× em relação à linha de base BF16 de duas etapas da Meta, proveniente de treinamento ciente de quantização de quatro bits e batching dinâmico ciente de latência. A Meta também publicou uma comparação de preferência contra dois sistemas comerciais de avatar — 78/22 contra um, 88/12 contra o outro — e divulgou que, no quesito maneirismos, o resultado contra um deles não é estatisticamente distinguível da paridade. Essa divulgação vale mais do que as vitórias; é o tipo de resultado que a maioria dos posts de lançamento deixa de fora.
As evidências publicadas da SeedRealtime consistem em uma única avaliação humana ponta a ponta. A ByteDance afirma que, em comparação com sistemas em cascata — um modelo de visão conectado a um modelo de ASR conectado a um LLM conectado a uma voz de conversão de texto em fala —, a SeedRealtime reduz pela metade os problemas de ritmo da conversa audiovisual, com menos interrupções, menos falsos disparos e respostas mais lentas e mais naturais. O que a ByteDance não publicou é um tamanho de amostra, uma metodologia, um número de anotadores, um dado de latência em milissegundos, um nome de benchmark ou uma pontuação. Um relatório secundário cita um ganho de 12% em fluência conversacional em relação aos modelos anteriores da equipe. Essa é toda a base de evidências públicas.
Então, a classificação honesta da verificabilidade é esta: nenhuma das duas tem uma execução independente; a da Meta é um conjunto de medições com linhas de base declaradas e um resultado negativo divulgado; a da ByteDance é uma única alegação de preferência cujo desenho não é descrito. Nenhuma das duas é reproduzível, mas apenas uma delas é específica o suficiente para se argumentar a respeito.

O movimento que cada um fez
Ambos os sistemas são respostas ao mesmo problema, e vale a pena constatar que as duas respostas são diferentes.
Para um sistema que observa, a parte difícil é saber quando falar. Um modelo que recebe continuamente fotogramas de câmara e áudio tem de decidir, sem um gatilho externo, se a pessoa à sua frente terminou, se lhe foi dirigida a palavra e se o objeto que acabou de entrar no enquadramento é relevante. Esse é o problema que a SeedRealtime moveu para dentro do modelo, e a ByteDance fez essa mudança em três modalidades em vez de duas — uma versão mais difícil do que aquilo que a Google, a OpenAI e a NVIDIA fizeram cada uma apenas com áudio. Os comportamentos da demonstração decorrem daí: associar uma voz a um rosto numa conversa de grupo, falar sem ser solicitado quando algo entra no enquadramento, orientar alguém através de um museu ou de uma reparação.
Para um sistema que renderiza, a parte difícil é manter a coerência. Gerar vídeo em pequenos blocos causais significa que cada bloco é condicionado ao anterior, e o modo de falha é a deriva — no terceiro minuto, a personagem silenciosamente se tornou outra pessoa. A janela deslizante da Meta de latentes de vídeo recentes é a resposta para isso, e o fluxo de tokens compartilhado é a resposta para uma falha diferente, o visual dublado que você obtém quando o áudio é gerado primeiro e um modelo de sincronização labial é executado sobre ele depois.
Nenhum dos movimentos está disponível no outro sistema. O SeedRealtime não tem imagem de referência à qual se manter fiel, porque não está renderizando ninguém. O Muse Realtime Avatar não tem mundo externo para rastrear, porque seu trabalho inteiro é produzir um rosto que corresponda a uma voz.

Por que um modelo não chamável ainda é uma questão de roteamento
Ambos esses sistemas delegam. O Muse Realtime Avatar fica sobre o Muse Realtime Voice, que é a camada conversacional de um agente cujo raciocínio roda no Muse Spark — o modelo faz a renderização, não o pensamento. O design do SeedRealtime mantém a conversa fluindo enquanto o trabalho em segundo plano acontece, o que significa que o trabalho que excede o que ele consegue fazer inline vai para outro lugar e volta. Em ambas as arquiteturas, aquilo com que o usuário interage é um front-end, e a inteligência é um modelo de texto separado por trás dele.
Esse modelo de texto separado é inferência comum, e é a parte da stack que você realmente pode comprar. No OrcaRouter, ele é um único endpoint que cobre 196 modelos de 15 provedores, pelo preço de tabela do provedor repassado sem nenhuma margem, com failover automático quando o modelo que você escolheu apresenta erro ou atinge o tempo limite. Não hospedamos o SeedRealtime — ele é da ByteDance, dentro do Doubao, e não há nada para rotear. Também não hospedamos o Muse Realtime Avatar, e ninguém mais hospeda. O que oferecemos é a camada para a qual ambos os sistemas entregam seu trabalho pesado, que é a camada que muda quando você quer um modelo diferente fazendo o trabalho de raciocínio.
O que mudaria a resposta
Para o SeedRealtime, a peça que falta não é um recurso — é a evidência. Um relatório técnico com contagem de parâmetros, uma suíte de benchmarks e uma avaliação humana descrita o moveria de "uma demonstração dentro de um aplicativo" para algo sobre o qual uma equipe poderia raciocinar. O post da ByteDance também vincula destinos genéricos "Try Dola" e "Try in Playground" sem reivindicar pesos ou uma API documentada, o que é o padrão de um recurso de produto em vez de um lançamento de modelo.
Para o Muse Realtime Avatar, a peça que falta é comercial: uma tabela de preços, um endpoint, uma data e os termos de região e idade que a Meta não detalhou por completo. O post da Meta observa que suas demos não refletem todos os avatares disponíveis no app Muse, e é essa a frase que deve reger qualquer plano construído em torno disso.
Até que uma dessas coisas mude, a comparação tem uma forma extraordinariamente curta. Ambos os modelos são audiovisuais, ambos são full-duplex, ambos são engenharia genuinamente impressionante, e nenhum deles pode ser chamado a partir de um terminal por qualquer pessoa que esteja lendo isto. A diferença está no que você faria com eles se pudesse: um lhe dá um personagem que fala, e o outro lhe dá um sistema que percebe.

