
Tavus Griffin: O Primeiro Modelo de Interação Humana e os 48% que Passaram no Teste de Turing de Vídeo
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 223 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Vinte e seis de cinquenta e quatro pessoas concluíram uma chamada de vídeo de um minuto e disseram que seu parceiro tinha sido uma pessoa real. Esse é o número que a Tavus está usando como principal argumento para Tavus Griffin, anunciado em 1º de outubro de 2026, e é um resultado genuinamente impressionante: no mesmo protocolo, o stack anterior da empresa — Phoenix-4.5 renderizando o rosto, Raven-1 fazendo a percepção, Sparrow-2 gerenciando a dinâmica de turnos — produziu uma pessoa que acreditou entre quarenta e uma, ou 2,4%. As duas leituras óbvias desse salto estão ambas erradas, e separá-las é a maior parte do que segue. Griffin não é um motor de avatar melhor, e não é um produto que se possa comprar. É uma prévia de pesquisa chamada Griffin-Lite, aberta a testadores de confiança selecionados, sem preço, sem API pública e sem constar em nenhum ranking independente de vídeo. O fato de ambas essas coisas serem verdadeiras ao mesmo tempo é a verdadeira história.
O que os 48% medem, e o que não medem
O estudo é um teste de Turing presencial, e não uma pesquisa de preferência, e vale a pena enunciar o protocolo com precisão exatamente porque é a alegação que sustenta o argumento. Cinquenta e quatro participantes foram recrutados por meio de uma plataforma de pesquisa independente e informados de que seriam emparelhados com outro participante para uma chamada de vídeo de um minuto sobre o que estavam ansiosos para este ano. O parceiro deles era um PAL executando o Griffin-Lite, gerando rosto, voz e respostas em tempo real. Somente ao final da pesquisa lhes foi perguntado se passou pela cabeça deles que o parceiro poderia não ser uma pessoa real, e então todos os participantes foram informados de que era uma IA. A rodada de comparação usou o mesmo protocolo na pilha mais antiga, com quarenta e um participantes.
Os números de apoio importam tanto quanto a manchete. Os que acreditavam estavam confiantes — 79% em média — e os que duvidavam também, com 81%, que é o que um estudo deseja: ninguém estava adivinhando. Mais da metade dos participantes disse que a possibilidade não lhes passou pela cabeça em momento algum durante a chamada, e quase todos desse grupo passaram a dizer que o parceiro era real. Os participantes que de fato suspeitaram tenderam a suspeitar nos primeiros vinte segundos. Essa é a passagem menos confortável do relatório e a que deve moldar a forma como você lê a seção de segurança mais adiante.
Numa escala de sete pontos, o modelo obteve uma média de 5,4 para parecer natural, 5,6 para parecer confiável, 5,8 para se os participantes gostariam de conversar com ele novamente — uma pontuação que se manteve em 5,4 mesmo entre os participantes que o identificaram corretamente como uma IA — e 5,5 para se sentiam que o parceiro estava realmente ouvindo. A pontuação mais baixa foi 4,9, para se a conversa fluía naturalmente. Lido em conjunto, isso é um perfil específico: o Griffin-Lite é convincente momento a momento e um pouco menos convincente como um arco.
O benchmark independente, e como ler suas duas trilhas
Os números de qualidade vêm do VideoFDB da NVIDIA, um benchmark para conversas audiovisuais full-duplex que avalia um modelo em duas trilhas separadas — geração, ou seja, se o modelo produz o comportamento correto, e percepção, ou seja, se ele entende o momento —, cada uma com sua própria rubrica e seu próprio leaderboard. A NVIDIA criou o benchmark, conduz a avaliação com seu próprio juiz segundo as métricas publicadas e pontua a resposta numa escala de zero a cinco. A Tavus não o executou, e é justamente por isso que vale a pena citá-lo.
• Geração — Griffin-Lite obteve 3,83, o sistema publicado com a segunda maior pontuação obteve 2,80 (Gemini 2.5 with Anam), e a referência humana ground truth é 3,92. Isso é 1,03 à frente do melhor sistema comparável e 0,09 abaixo do humano.
• Percepção — 3,73 contra uma referência humana de 4,20, com 3,44 para o baseline mais forte entre os relatados, o MiniCPM-o 4.5 em sua configuração somente áudio. O Gemini 2.5 Flash Native obteve 3,17 e o gpt-realtime da OpenAI obteve 2,97.
Alinhamento da taxa de tomada de palavra — 62,8% na geração e 73,8% na percepção. Isso mede o quão próximas as decisões do modelo sobre quando falar estão do timing das conversas de referência, e a Tavus descreve ambos como os mais altos de qualquer sistema no ranking.
Duas ressalvas devem acompanhar esses números antes que alguém os repita. A diferença de geração em relação ao humano é de 0,09 numa escala de cinco pontos avaliada por um modelo de linguagem, o que é melhor interpretado como "próximo do humano neste critério" do que como "no nível humano". E a comparação de percepção não é de igual para igual: MiniCPM-o 4.5 e gpt-realtime são pontuados em configurações apenas de áudio, enquanto Griffin também lê vídeo. A vantagem de 0,29 ponto sobre uma linha de base apenas de áudio é real, mas parte do que ela mede é o valor de ter olhos.
A própria linha de resumo do fornecedor — em primeiro lugar no teste independente da NVIDIA de IA face a face, 37% à frente da próxima melhor IA no que diz respeito a reagir no momento — é uma caracterização dos mesmos dados, e não uma constatação separada. Mantenha as pontuações subjacentes das faixas, não o enquadramento.

Dois motores, funcionando ao mesmo tempo
A afirmação arquitetural é mais fácil de avaliar do que o marketing em torno dela, porque é uma afirmação sobre o que é executado simultaneamente. Griffin é descrito como dois sistemas trabalhando em paralelo, em vez de um pipeline que passa o trabalho entre estágios.
O primeiro é um motor de Modelagem Conversacional Contínua. Ele ingere o áudio e o vídeo da pessoa e reavalia a interação em intervalos regulares de menos de um segundo — a Tavus chama isso de mini-turnos — decidindo em cada um se permanece em silêncio, se sinaliza, se faz backchannel ou se assume o turno. A saída não é apenas as palavras, mas um conjunto de controles expressivos que carregam timing, postura, expressão facial e gesto. O objetivo do design é que uma decisão tomada no meio da frase apareça na voz e no rosto dentro do mesmo mini-turno, em vez de depois de uma transferência de turno, e é isso que permite ao modelo parar quando é interrompido, assentir enquanto ouve e tratar uma pausa para pensar como algo que não é o fim de um turno.
O segundo é um motor de geração audiovisual que transforma esses controles em som e pixels ao mesmo tempo: um gerador de fala em streaming e um gerador de vídeo em streaming acionados pelos mesmos sinais, para que uma mudança de tom e uma mudança de expressão caiam no mesmo compasso.
Uma nota de transparência sobre o material que a Tavus publicou junto com isso, porque seria fácil confundi-lo com medição. O diagrama interativo de uma troca de nove segundos está anotado no próprio texto da página como ilustrativo e explicitamente não medido a partir de uma sessão real. A mesma ressalva se aplica à figura de temporização turn-based versus full-duplex. O que é medido é o número de latência mais abaixo.
Por dentro da stack de streaming
O lado do áudio é construído em torno de um codec chamado Tavec, um autoencoder convolucional que mapeia áudio de 48 kHz para uma representação latente contínua de 40 valores por quadro a 100 quadros por segundo, sem codebooks. Seu decodificador é totalmente causal, portanto mantém estado entre blocos e emite pacotes de áudio de apenas 10 ms sem lookahead. Um minuto de fala corresponde a 6.000 quadros latentes em vez de 2,88 milhões de amostras brutas, o que torna a sequência barata o suficiente para o transformer de fala prever mais rápido do que em tempo real. O próprio gerador de fala é um transformer de difusão autorregressivo que se condiciona a um prefixo de falante codificado — uma voz pode ser clonada a partir de cerca de dez segundos de áudio — e gera um bloco latente por vez à medida que os controles chegam, de modo que a reprodução começa antes de o enunciado terminar.
O lado do vídeo parte da mesma premissa: uma forte compressão temporal é o que torna um modelo de difusão suficientemente rápido para manter uma conversa. Um gerador autorregressivo de poucos passos recebe uma fotografia de referência, o áudio em streaming e os controlos em streaming, e produz um latente por passo, com três passos de difusão por latente. Um VAE comprime o tempo oito vezes, por isso, a 25 fps, um latente corresponde a oito fotogramas, ou 320 ms de vídeo em 720p. Os latentes mais antigos são mantidos numa resolução progressivamente mais baixa para que rollouts longos continuem a ser viáveis. O resultado é um gerador que emite 720p em blocos de 320 ms em tempo real.
Chegar a esse ponto exigiu uma destilação em três estágios a partir de um grande professor de difusão bidirecional de muitos passos: Distribution Matching Distillation para um aluno de poucos passos, teacher forcing para converter esse aluno em um modelo autorregressivo que gera um latente por vez e, por fim, treinamento com self-forcing sobre o histórico gerado pelo próprio modelo, além de um mecanismo adicional que atua sobre os quadros do histórico para que rollouts longos não sofram deriva. Esse terceiro estágio é o que aborda o modo de falha que essa classe de modelo costuma ter — um rosto que se degrada, ou um fundo que vagarosamente se desvia, ao longo de uma conversa que dura minutos.
O número de latência, que é a verdadeira promessa do produto.
Em comparação com quatro modelos de difusão em streaming publicados num cenário de áudio para vídeo, em que cada modelo recebe fala e uma imagem de referência e deve produzir o rosto falante, o gerador do Griffin-Lite teve uma média de 0,43 segundos de latência real de áudio para vídeo em H100s — o tempo desde a chegada de um trecho de áudio até o vídeo mostrar seu efeito. A Tavus descreve isso como metade do tempo do segundo método mais rápido. Também relata o primeiro lugar no DOVER e no FID de qualidade perceptual e no THEval, um framework de avaliação de cabeças falantes, e o segundo lugar na confiança de sincronia labial LSE-C, com 7,27, atrás de um baseline — com o fornecedor observando que o LSE-C recompensa movimentos labiais pronunciados, inclusive movimentos além do ponto em que parecem naturais.
Todas essas são medições da própria Tavus em relação a bases de comparação que ela selecionou. São úteis porque são específicas e porque o número de 0,43 segundo é o tipo de número que ou se sustenta num teste ao vivo, ou não. Não são independentes, e as únicas pontuações independentes neste artigo são as duas faixas do VideoFDB acima.

Por que não há preço para comparar?
O Griffin-Lite está disponível hoje para um grupo seleto de primeiros testadores como uma prévia de pesquisa, com o lançamento mais amplo de um modelo mais capaz na sequência. Ele não estará disponível para uso por clientes neste momento. O acesso é por formulário de solicitação. Ele não está na plataforma Tavus, e a própria frase de encerramento da empresa no anúncio diz isso claramente: o Griffin ainda não está na plataforma Tavus e chegará quando a Tavus tiver descoberto como lançá-lo com segurança. Tudo o que um comprador normalmente compararia — preço por segundo ou por solicitação, um identificador de modelo, limites de taxa, um SLA, uma lista de regiões — ainda não existe. A Tavus direciona quem quiser construir hoje para os modelos que 150.000 desenvolvedores e empresas já usam, que são os três antecessores, não o Griffin.
Isso não é um detalhe técnico para se colocar em nota de rodapé. Isso muda para que serve este modelo neste momento. É um alvo de avaliação para equipes cujo produto depende de uma pessoa conseguir perceber, e um sinal sobre para onde o roadmap do fornecedor está indo. Não é algo sobre o que construir um caminho voltado ao cliente neste trimestre.
O portão de segurança é o plano de lançamento.
A coisa mais interessante que a Tavus escreveu sobre o Griffin não é sobre o modelo. É a admissão de que as mesmas propriedades que fazem de um modelo de interação humana uma interface melhor também o tornam melhor em enganar alguém, fazendo-o acreditar que não é uma IA, que mais trabalho de alinhamento e segurança é necessário antes de um lançamento seguro, e que a empresa está trabalhando em recursos de divulgação e com organizações em avaliações de segurança de IA. Dado que quase metade de uma amostra ao vivo não conseguiu perceber, e que os que conseguiram, na maioria, descobriram em menos de vinte segundos, um mecanismo de divulgação que sobreviva a uma conversa casual não é um mero extra.
Duas coisas mudariam este artigo de forma substancial. Um model card publicado, com um endpoint e um preço, tiraria o Griffin da categoria de resultado de pesquisa e o colocaria na de questão de procurement. E uma entrada num quadro independente de vídeo — com a ressalva de que esses quadros pontuam clipes curtos por preferência em pares e não foram concebidos para pontuar uma conversa ao vivo, de modo que a incompatibilidade pode ser permanente, e não temporária — daria às alegações de latência e qualidade uma verificação externa. Até que uma dessas coisas se concretize, as tracks do VideoFDB são a evidência mais forte disponível, e elas vêm com uma lacuna humana de 0,09 e 0,47 pontos, respetivamente.
O contra-argumento que vale a pena ponderar é que uma execução de benchmark não é uma implantação. O protocolo da NVIDIA dá a todos os sistemas a mesma tarefa de alternância de turnos e o mesmo juiz; ele não diz nada sobre como a nona hora de uma chamada se comporta, o que acontece quando duas pessoas falam uma por cima da outra por um minuto inteiro, ou se os controles expressivos se degradam em um rosto que a fotografia de referência reproduziu mal. A Tavus relata o treinamento específico para deriva — o estágio de self-forcing e o mecanismo de histórico — como a correção exatamente para isso, e relatos são tudo o que um leitor tem até que alguém de fora da Tavus realize uma sessão longa e a publique. Trate o benchmark como a melhor evidência disponível, e não como um resultado de implantação.
O que construir ao redor disso nesse meio-tempo
A questão prática para uma equipe que deseja algo assim hoje é quais partes da pilha já podem ser compradas. Uma interface de vídeo conversacional é uma cadeia — reconhecimento de fala, um modelo de linguagem, síntese de fala e, no caso da Tavus, um modelo de renderização — e as três primeiras são commodities. Elas ficam atrás de um endpoint compatível com OpenAI no OrcaRouter, com mais de 200 modelos na mesma chave e preço de tabela do provedor repassado com 0% de markup, então um corte de preço de um fornecedor passa a valer aqui no mesmo dia, e não depois de um ciclo de contrato. Se você está montando um pipeline de interação e quer manter a camada de geração aberta até que o Griffin ou algo parecido se torne um produto de verdade, é aí que a troca custa uma mudança de configuração em vez de uma migração. O próprio Tavus Griffin não é um modelo roteado aqui, e não será enquanto for uma prévia atrás de um formulário de solicitação.
O que vale a pena acompanhar não é mais um vídeo de demonstração. É se as ferramentas de divulgação que a Tavus está desenvolvendo serão publicadas, e se um segundo grupo de pesquisa vai reproduzir o protocolo face a face. Uma aprovação desse porte em um teste de Turing é exatamente o tipo de resultado que exige um segundo laboratório para executá-lo.

