
Tavus Griffin vs Muse Realtime Avatar: Duas Caras de 2026, Dois Problemas Diferentes
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 223 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Tanto o Tavus Griffin quanto o Muse Realtime Avatar existem para resolver o mesmo problema embaraçoso — um modelo de linguagem que consegue falar, mas não tem rosto — e atacam-no por extremos opostos. O Griffin é um Modelo de Interação Humana de vídeo para vídeo que observa um participante através de uma câmara e gera o outro lado da conversa em tempo real, e foi anunciado pela Tavus em outubro de 2026 como uma pré-visualização de investigação para testadores selecionados. O Muse Realtime Avatar é a camada de corporização da Meta para o seu agente Muse, anunciada na Meta Connect a 23 de setembro de 2026, e recebe áudio e transforma-o num retrato falante sincronizado. Nenhum dos dois pode ser comprado. A diferença está naquilo que cada um está a tentar acertar, e torna-se evidente no momento em que perguntas o que cada modelo está realmente a receber como entrada.
A versão curta
• A entrada de Griffin é a pessoa do outro lado — vídeo e áudio de um participante ao vivo, que ele deve ler, responder e pelo qual deve ser interrompido.
• A entrada do Muse Realtime Avatar é a própria fala do agente — um fluxo de tokens do Muse Realtime Voice que ele converte em um rosto correspondente.
• A Tavus mede o Griffin por as pessoas acreditarem nele, e publica um número de 48% a partir de uma chamada de vídeo de um minuto.
• A Meta mede o Muse Realtime Avatar por sua capacidade de acompanhar, e publica 870 milissegundos do fim do turno até o primeiro byte.
• Nenhum dos dois tem uma API pública, um preço publicado ou uma data de disponibilidade geral.
Leia essas quatro linhas em conjunto e a forma da discordância é óbvia. A Tavus está otimizando para a crença da outra pessoa. A Meta está otimizando para o relógio.

Griffin: o modelo em que é preciso acreditar
A premissa da Tavus é que o Griffin é o primeiro Modelo de Interação Humana, e a arquitetura por trás dessa afirmação é um sistema de duas partes que combina Modelagem Conversacional Contínua com Geração Audiovisual. A primeira parte é comportamental: ela decide o que a persona deve estar fazendo de um momento para o outro, usando o que consegue ver e ouvir. A segunda parte é a renderização, e a Tavus divide isso novamente em geração de fala em streaming e geração de vídeo em streaming.
Os números que a Tavus apresenta como destaque não são números de throughput. Num estudo que a empresa realizou com a Queen Mary University of London, 26 de 54 participantes — 48% — acreditaram que Griffin era uma pessoa real depois de uma chamada de vídeo de um minuto, contra 1 de 41 (2,4%) do seu conjunto anterior de geração de rostos Phoenix-4.5, alternância de turnos Sparrow-2 e visão Raven-1. Os participantes que não foram enganados normalmente duvidaram nos primeiros 20 segundos. No benchmark VideoFDB da NVIDIA, avaliado em setembro de 2026, a Tavus relata que Griffin ficou em primeiro lugar em IA cara a cara, com uma pontuação de geração de 3,83 contra 2,80 da linha de base mais forte relatada e 3,92 de referência humana, e uma pontuação de percepção de 3,73 contra 3,44 da melhor linha de base relatada e 4,20 de referência humana. Esses números são relatados pelo fornecedor e específicos do benchmark, mas os pontos de comparação humana são os interessantes.
A engenharia por trás desses números é um codec chamado Tavec e um transformer de difusão autorregressivo. O Tavec opera a 48 kHz com 40 valores por quadro a 100 quadros por segundo, sem codebooks, um decodificador totalmente causal e pacotes de apenas 10 milissegundos — projetado para que um rosto possa começar a se mover antes de uma frase terminar. O caminho de vídeo entrega 720p em blocos de 320 milissegundos, onde um latente equivale a oito quadros a 25 fps, três etapas de difusão por latente e uma compressão temporal de 8× no VAE. Um processo de destilação em três estágios (correspondência de distribuição, depois autorregressivo com teacher-forcing, depois self-forcing) é o que permite executar essas três etapas em tempo real. A alegação de latência em destaque é uma média de 0,43 segundos de áudio para vídeo em H100s, o que a Tavus diz ser cerca da metade do próximo método mais rápido que ela mediu. A clonagem de voz requer aproximadamente uma amostra de 10 segundos.
O preço de tudo isso é que a Tavus não pode lançá-lo. O Griffin-Lite, a prévia de pesquisa, está disponível apenas para um grupo seleto de primeiros testadores; ao escrever sobre o lançamento, a empresa afirma claramente que o Griffin-Lite não estará disponível para uso por clientes no momento e que espera lançar o Griffin muito em breve, depois que certas preocupações de segurança forem resolvidas. O Griffin não está na plataforma Tavus, e chegará lá "assim que tivermos descoberto como lançá-lo com segurança". Um modelo que convence 48% das vezes em uma chamada de um minuto é, do ponto de vista de implantação, um modelo que convence 48% das vezes em uma chamada de um minuto.

Muse Realtime Avatar: o modelo que tem de acompanhar
Muse Realtime Avatar foi anunciado em 23 de setembro de 2026 no Meta Connect e foi tema de um texto no mesmo dia pela Meta Superintelligence Labs sob o título "Dando Vida à Sua Muse". O enquadramento da Meta é mais estreito e mais mecânico do que o da Tavus: o agente Muse já tinha uma voz, graças ao Muse Realtime Voice, e o avatar é a camada que dá corpo a essa voz.
A cifra publicada é de 870 milissegundos do fim do turno até o primeiro byte — ou seja, do momento em que o usuário para de falar até o momento em que chega o primeiro byte de vídeo do avatar. A demonstração da empresa mostra um retrato de 448×448 a 25 quadros por segundo. A Meta afirma que o sistema realiza aproximadamente 60× menos avaliações por bloco do que sua linha de base, e que uma única NVIDIA GB200 pode suportar 12 sessões em tempo real simultâneas, com um ganho de capacidade de 8× em relação a uma implementação BF16 de duas etapas.
A diferença arquitetural em relação ao Griffin está em de onde vêm as informações. O Muse Realtime Avatar estende o Muse Realtime Voice e compartilha seu fluxo de tokens de fala — a mesma representação VQ que o modelo de voz produz é o que impulsiona o rosto, em vez de uma compreensão visual separada de um participante. Isso o torna uma camada de corporificação DiT orientada por áudio: eficiente, fortemente acoplada ao seu próprio modelo de voz e que não tenta de forma alguma ler o humano do outro lado da chamada. É uma boca e um rosto para um agente, não um parceiro conversacional que observa você.
A Meta não publicou nenhuma API, nenhum preço e nenhuma data de lançamento para o Muse Realtime Avatar. O post de pesquisa é a totalidade do registro público.
Onde os dois designs genuinamente divergem
A maneira mais clara de ver a divisão é perguntar o que acontece quando o usuário interrompe.
Griffin é full duplex e foi projetado para ser interrompido no meio de uma fala — ele consegue observar e ouvir enquanto fala, e é por isso que o marketing da Tavus se apoia na ideia de que Griffin aprende comportamento conversacional, e não vídeo. É também por isso que sua suíte de benchmarks é construída em torno de percepção e reação, e por que a vantagem de 37% sobre o próximo melhor sistema ao reagir no momento é uma afirmação que a empresa faz questão de fazer.
O número de fim de turno de 870 milissegundos do Muse Realtime Avatar conta a história oposta: é um pipeline em que o turno termina, os tokens de áudio se resolvem e só então o rosto acompanha. É rápido — 870 ms é um bom número para um renderizador de retratos — mas a própria medição pressupõe que existe uma fronteira de turno, que é precisamente a suposição que um modelo duplex foi construído para descartar.
Isso não é uma crítica a nenhum dos dois designs. A Meta está construindo um rosto para um agente que vive dentro das próprias superfícies de assistente da Meta, onde um limite claro de turno é um modelo razoável da interação. A Tavus está construindo algo que tem de sobreviver a um estranho decidindo, em vinte segundos, se a pessoa na tela é real.
Nenhum dos dois está em uma lista de preços — e apenas uma parte do Muse pode ser chamada
Nem o Tavus Griffin nem o Muse Realtime Avatar podem entrar em produção hoje. O Griffin está limitado a testadores selecionados; o Muse Realtime Avatar não tem API, nem preço, nem data. Se você está planejando uma implementação, ambos esses fatos devem constar do plano.
O que vale a pena destacar é a parte do stack Muse que é acessível. A família Muse da Meta inclui o Muse Spark, e um checkpoint dele — meta/muse-spark-1.2 — está disponível no nosso catálogo a US$ 1,25 por milhão de tokens de entrada e US$ 4,25 por milhão de tokens de saída, com margem zero sobre o preço de tabela da Meta. Não é o avatar: aceita entrada de texto, imagem, vídeo, áudio e PDF e retorna texto, com uma janela de contexto de 1M de tokens e esforço de raciocínio configurável. Mas é a parte da linha Muse que você pode realmente chamar, e se você está construindo o agente que um dia ficará atrás de um avatar, a metade da linguagem é a metade com que você pode começar. A OrcaRouter repassa os preços de tabela dos provedores com 0% de margem, então uma mudança de preço da Meta é refletida no nosso card no mesmo dia, em vez de no próximo ciclo de faturamento, e uma requisição que falha em um provedor é tentada novamente em um provedor saudável, em vez de aparecer como um timeout.

A mesma lógica se aplica ao lado de vídeo do mundo. Não roteamos o Muse Realtime Avatar e não roteamos o Tavus Griffin, e não afirmaremos o contrário. O que roteamos é um catálogo de mais de duzentos modelos nas mesmas modalidades, de modo que um protótipo que alterna entre um agente de texto, um modelo de voz e um gerador de vídeo permanece em uma única chave enquanto os dois modelos neste artigo permanecem não lançados.
Qual deles está mais longe de ser enviado?
No registro público, o Muse Realtime Avatar está mais distante. Ele tem um post de pesquisa e nenhuma API, nenhum preço e nenhuma data. O Griffin também não tem API nem preço, mas tem uma intenção explícita de lançamento — "muito em breve, depois que essas preocupações de segurança forem resolvidas" — um nível de prévia nomeado que existe hoje para testadores selecionados, e uma pilha de resultados de benchmark publicados de um harness de testes independente. Essa é uma posição mais avançada, mesmo que venha com a admissão de que o modelo não é seguro o suficiente para ser entregue aos clientes.
A armadilha ao compará-los é tratar o número de 870 milissegundos como diretamente comparável ao número de 0,43 segundo. Eles medem coisas diferentes: a Meta mede do fim de um turno até o primeiro byte de um retrato, e a Tavus mede a latência de áudio para vídeo dentro de um fluxo duplex contínuo em que os turnos não são eventos limpos. Os números são ambos reais e não são a mesma medição, e quem os apresenta em uma única coluna está prestando um desserviço ao leitor.
Conclusão
O Muse Realtime Avatar é uma camada de corporificação: áudio na entrada, retrato na saída, 870 milissegundos do fim do turno ao primeiro byte, 448×768 a 25 fps, sem API e sem data. O Tavus Griffin é um Human Interaction Model duplex: o participante na entrada, um rosto que reage na saída, 0,43 segundos de latência média de áudio para vídeo em H100s, e um fornecedor disposto a publicar que 48% das pessoas acharam que era humano enquanto também afirma que os clientes não podem usá-lo. A Meta está construindo algo que acompanha. A Tavus está construindo algo que passa por humano. Nenhum dos dois está à venda, o que significa que a única decisão disponível hoje é por qual metade do problema começar — e, para a maioria das equipes, essa metade é o modelo de linguagem subjacente.
