Cartão de título principal para 'Tavus Griffin vs Muse Realtime Avatar' com o subtítulo 'Dois rostos de 2026, dois problemas diferentes', acima de quatro chips: Griffin 48% acreditaram que era humano; Griffin 0,43 s de áudio para vídeo; Muse Realtime Avatar 870 ms até o primeiro byte; Muse Realtime Avatar 448x768 a 25 fps.
Engineering & Research

Tavus Griffin vs Muse Realtime Avatar: Duas Caras de 2026, Dois Problemas Diferentes

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Tanto o Tavus Griffin quanto o Muse Realtime Avatar existem para resolver o mesmo problema embaraçoso — um modelo de linguagem que consegue falar, mas não tem rosto — e atacam-no por extremos opostos. O Griffin é um Modelo de Interação Humana de vídeo para vídeo que observa um participante através de uma câmara e gera o outro lado da conversa em tempo real, e foi anunciado pela Tavus em outubro de 2026 como uma pré-visualização de investigação para testadores selecionados. O Muse Realtime Avatar é a camada de corporização da Meta para o seu agente Muse, anunciada na Meta Connect a 23 de setembro de 2026, e recebe áudio e transforma-o num retrato falante sincronizado. Nenhum dos dois pode ser comprado. A diferença está naquilo que cada um está a tentar acertar, e torna-se evidente no momento em que perguntas o que cada modelo está realmente a receber como entrada.

A versão curta

• A entrada de Griffin é a pessoa do outro lado — vídeo e áudio de um participante ao vivo, que ele deve ler, responder e pelo qual deve ser interrompido.

• A entrada do Muse Realtime Avatar é a própria fala do agente — um fluxo de tokens do Muse Realtime Voice que ele converte em um rosto correspondente.

• A Tavus mede o Griffin por as pessoas acreditarem nele, e publica um número de 48% a partir de uma chamada de vídeo de um minuto.

• A Meta mede o Muse Realtime Avatar por sua capacidade de acompanhar, e publica 870 milissegundos do fim do turno até o primeiro byte.

• Nenhum dos dois tem uma API pública, um preço publicado ou uma data de disponibilidade geral.

Leia essas quatro linhas em conjunto e a forma da discordância é óbvia. A Tavus está otimizando para a crença da outra pessoa. A Meta está otimizando para o relógio.

Board titled 'Two Faces, Two Measurements'. Tavus Griffin column: input the live participant, video and audio; optimises for whether the other person believes it; headline figure 48% of 54 participants in a one-minute video call; output 720p duplex video at 25 fps; latency 0.43 s average audio to video on H100s; access research preview, selected testers only. Muse Realtime Avatar column: input Muse Realtime Voice's own speech tokens; optimises for the clock, end of turn to first frame; headline figure 870 ms from end of turn to first byte; output 448x768 portrait at 25 fps; capacity 12 concurrent sessions on one NVIDIA GB200; access research post only, no API.

Griffin: o modelo em que é preciso acreditar

A premissa da Tavus é que o Griffin é o primeiro Modelo de Interação Humana, e a arquitetura por trás dessa afirmação é um sistema de duas partes que combina Modelagem Conversacional Contínua com Geração Audiovisual. A primeira parte é comportamental: ela decide o que a persona deve estar fazendo de um momento para o outro, usando o que consegue ver e ouvir. A segunda parte é a renderização, e a Tavus divide isso novamente em geração de fala em streaming e geração de vídeo em streaming.

Os números que a Tavus apresenta como destaque não são números de throughput. Num estudo que a empresa realizou com a Queen Mary University of London, 26 de 54 participantes — 48% — acreditaram que Griffin era uma pessoa real depois de uma chamada de vídeo de um minuto, contra 1 de 41 (2,4%) do seu conjunto anterior de geração de rostos Phoenix-4.5, alternância de turnos Sparrow-2 e visão Raven-1. Os participantes que não foram enganados normalmente duvidaram nos primeiros 20 segundos. No benchmark VideoFDB da NVIDIA, avaliado em setembro de 2026, a Tavus relata que Griffin ficou em primeiro lugar em IA cara a cara, com uma pontuação de geração de 3,83 contra 2,80 da linha de base mais forte relatada e 3,92 de referência humana, e uma pontuação de percepção de 3,73 contra 3,44 da melhor linha de base relatada e 4,20 de referência humana. Esses números são relatados pelo fornecedor e específicos do benchmark, mas os pontos de comparação humana são os interessantes.

A engenharia por trás desses números é um codec chamado Tavec e um transformer de difusão autorregressivo. O Tavec opera a 48 kHz com 40 valores por quadro a 100 quadros por segundo, sem codebooks, um decodificador totalmente causal e pacotes de apenas 10 milissegundos — projetado para que um rosto possa começar a se mover antes de uma frase terminar. O caminho de vídeo entrega 720p em blocos de 320 milissegundos, onde um latente equivale a oito quadros a 25 fps, três etapas de difusão por latente e uma compressão temporal de 8× no VAE. Um processo de destilação em três estágios (correspondência de distribuição, depois autorregressivo com teacher-forcing, depois self-forcing) é o que permite executar essas três etapas em tempo real. A alegação de latência em destaque é uma média de 0,43 segundos de áudio para vídeo em H100s, o que a Tavus diz ser cerca da metade do próximo método mais rápido que ela mediu. A clonagem de voz requer aproximadamente uma amostra de 10 segundos.

O preço de tudo isso é que a Tavus não pode lançá-lo. O Griffin-Lite, a prévia de pesquisa, está disponível apenas para um grupo seleto de primeiros testadores; ao escrever sobre o lançamento, a empresa afirma claramente que o Griffin-Lite não estará disponível para uso por clientes no momento e que espera lançar o Griffin muito em breve, depois que certas preocupações de segurança forem resolvidas. O Griffin não está na plataforma Tavus, e chegará lá "assim que tivermos descoberto como lançá-lo com segurança". Um modelo que convence 48% das vezes em uma chamada de um minuto é, do ponto de vista de implantação, um modelo que convence 48% das vezes em uma chamada de um minuto.

Screenshot of the Tavus website's Griffin announcement, captured 2 October 2026: the headline 'The First Human Interaction Model' under 'Introducing Griffin', a paragraph describing a video-to-video system that listens while the other person talks, and three statistic tiles reading 48% of people believed Griffin was a real person after a one-minute video call, #1 on NVIDIA's independent test of face-to-face AI, and 37% ahead of the next best AI at reacting in the moment, dated October 1st, 2026.

Muse Realtime Avatar: o modelo que tem de acompanhar

Muse Realtime Avatar foi anunciado em 23 de setembro de 2026 no Meta Connect e foi tema de um texto no mesmo dia pela Meta Superintelligence Labs sob o título "Dando Vida à Sua Muse". O enquadramento da Meta é mais estreito e mais mecânico do que o da Tavus: o agente Muse já tinha uma voz, graças ao Muse Realtime Voice, e o avatar é a camada que dá corpo a essa voz.

A cifra publicada é de 870 milissegundos do fim do turno até o primeiro byte — ou seja, do momento em que o usuário para de falar até o momento em que chega o primeiro byte de vídeo do avatar. A demonstração da empresa mostra um retrato de 448×448 a 25 quadros por segundo. A Meta afirma que o sistema realiza aproximadamente 60× menos avaliações por bloco do que sua linha de base, e que uma única NVIDIA GB200 pode suportar 12 sessões em tempo real simultâneas, com um ganho de capacidade de 8× em relação a uma implementação BF16 de duas etapas.

A diferença arquitetural em relação ao Griffin está em de onde vêm as informações. O Muse Realtime Avatar estende o Muse Realtime Voice e compartilha seu fluxo de tokens de fala — a mesma representação VQ que o modelo de voz produz é o que impulsiona o rosto, em vez de uma compreensão visual separada de um participante. Isso o torna uma camada de corporificação DiT orientada por áudio: eficiente, fortemente acoplada ao seu próprio modelo de voz e que não tenta de forma alguma ler o humano do outro lado da chamada. É uma boca e um rosto para um agente, não um parceiro conversacional que observa você.

A Meta não publicou nenhuma API, nenhum preço e nenhuma data de lançamento para o Muse Realtime Avatar. O post de pesquisa é a totalidade do registro público.

Onde os dois designs genuinamente divergem

A maneira mais clara de ver a divisão é perguntar o que acontece quando o usuário interrompe.

Griffin é full duplex e foi projetado para ser interrompido no meio de uma fala — ele consegue observar e ouvir enquanto fala, e é por isso que o marketing da Tavus se apoia na ideia de que Griffin aprende comportamento conversacional, e não vídeo. É também por isso que sua suíte de benchmarks é construída em torno de percepção e reação, e por que a vantagem de 37% sobre o próximo melhor sistema ao reagir no momento é uma afirmação que a empresa faz questão de fazer.

O número de fim de turno de 870 milissegundos do Muse Realtime Avatar conta a história oposta: é um pipeline em que o turno termina, os tokens de áudio se resolvem e só então o rosto acompanha. É rápido — 870 ms é um bom número para um renderizador de retratos — mas a própria medição pressupõe que existe uma fronteira de turno, que é precisamente a suposição que um modelo duplex foi construído para descartar.

Isso não é uma crítica a nenhum dos dois designs. A Meta está construindo um rosto para um agente que vive dentro das próprias superfícies de assistente da Meta, onde um limite claro de turno é um modelo razoável da interação. A Tavus está construindo algo que tem de sobreviver a um estranho decidindo, em vinte segundos, se a pessoa na tela é real.

Nenhum dos dois está em uma lista de preços — e apenas uma parte do Muse pode ser chamada

Nem o Tavus Griffin nem o Muse Realtime Avatar podem entrar em produção hoje. O Griffin está limitado a testadores selecionados; o Muse Realtime Avatar não tem API, nem preço, nem data. Se você está planejando uma implementação, ambos esses fatos devem constar do plano.

O que vale a pena destacar é a parte do stack Muse que é acessível. A família Muse da Meta inclui o Muse Spark, e um checkpoint dele — meta/muse-spark-1.2 — está disponível no nosso catálogo a US$ 1,25 por milhão de tokens de entrada e US$ 4,25 por milhão de tokens de saída, com margem zero sobre o preço de tabela da Meta. Não é o avatar: aceita entrada de texto, imagem, vídeo, áudio e PDF e retorna texto, com uma janela de contexto de 1M de tokens e esforço de raciocínio configurável. Mas é a parte da linha Muse que você pode realmente chamar, e se você está construindo o agente que um dia ficará atrás de um avatar, a metade da linguagem é a metade com que você pode começar. A OrcaRouter repassa os preços de tabela dos provedores com 0% de margem, então uma mudança de preço da Meta é refletida no nosso card no mesmo dia, em vez de no próximo ciclo de faturamento, e uma requisição que falha em um provedor é tentada novamente em um provedor saudável, em vez de aparecer como um timeout.

Screenshot of the OrcaRouter model page for Muse Spark 1.2, showing the model id meta/muse-spark-1.2, a 1M-token context window, text, image, video, file and audio inputs producing text output, a p50 time to first token of 10.00 s, input pricing of $1.25 per million tokens and output pricing of $4.25 per million tokens, and 6.2M tokens of traffic over seven days.

A mesma lógica se aplica ao lado de vídeo do mundo. Não roteamos o Muse Realtime Avatar e não roteamos o Tavus Griffin, e não afirmaremos o contrário. O que roteamos é um catálogo de mais de duzentos modelos nas mesmas modalidades, de modo que um protótipo que alterna entre um agente de texto, um modelo de voz e um gerador de vídeo permanece em uma única chave enquanto os dois modelos neste artigo permanecem não lançados.

Qual deles está mais longe de ser enviado?

No registro público, o Muse Realtime Avatar está mais distante. Ele tem um post de pesquisa e nenhuma API, nenhum preço e nenhuma data. O Griffin também não tem API nem preço, mas tem uma intenção explícita de lançamento — "muito em breve, depois que essas preocupações de segurança forem resolvidas" — um nível de prévia nomeado que existe hoje para testadores selecionados, e uma pilha de resultados de benchmark publicados de um harness de testes independente. Essa é uma posição mais avançada, mesmo que venha com a admissão de que o modelo não é seguro o suficiente para ser entregue aos clientes.

A armadilha ao compará-los é tratar o número de 870 milissegundos como diretamente comparável ao número de 0,43 segundo. Eles medem coisas diferentes: a Meta mede do fim de um turno até o primeiro byte de um retrato, e a Tavus mede a latência de áudio para vídeo dentro de um fluxo duplex contínuo em que os turnos não são eventos limpos. Os números são ambos reais e não são a mesma medição, e quem os apresenta em uma única coluna está prestando um desserviço ao leitor.

Conclusão

O Muse Realtime Avatar é uma camada de corporificação: áudio na entrada, retrato na saída, 870 milissegundos do fim do turno ao primeiro byte, 448×768 a 25 fps, sem API e sem data. O Tavus Griffin é um Human Interaction Model duplex: o participante na entrada, um rosto que reage na saída, 0,43 segundos de latência média de áudio para vídeo em H100s, e um fornecedor disposto a publicar que 48% das pessoas acharam que era humano enquanto também afirma que os clientes não podem usá-lo. A Meta está construindo algo que acompanha. A Tavus está construindo algo que passa por humano. Nenhum dos dois está à venda, o que significa que a única decisão disponível hoje é por qual metade do problema começar — e, para a maioria das equipes, essa metade é o modelo de linguagem subjacente.