Cartão de título principal de 'Tavus Griffin vs Seedance 2.5' com o subtítulo 'Um gera trinta segundos, o outro espera que você termine a sua frase', acima de quatro chips: Seedance 2.5 30 s em uma única passada; Seedance 2.5 cerca de US$ 0,51 a cada 5 s em 480p; Griffin 0,43 s de áudio para vídeo; Griffin ainda não pode ser vendido a clientes.
Guides & Insights

Tavus Griffin vs Seedance 2.5: Um Gera Trinta Segundos, o Outro Espera Você Terminar Sua Frase

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A maneira mais rápida de entender a diferença entre Tavus Griffin e Seedance 2.5 é observar o que cada um faz quando você para de falar. O Seedance 2.5, lançado pela equipe Seed da ByteDance em 31 de julho de 2026, continua: entregue a ele um prompt e ele produzirá até trinta segundos de vídeo em uma única passagem, com áudio conjunto, na resolução e taxa de quadros que você escolheu antes de pressionar Enter. O Tavus Griffin, anunciado pela Tavus em outubro de 2026 como uma prévia de pesquisa, para — e então começa de novo, porque ficou ouvindo o tempo todo e tem algo a dizer de volta. Um modelo é um motor de produção que funciona sem supervisão. O outro é um participante que só funciona se você estiver lá.

Trinta segundos em uma única tomada

O principal destaque do Seedance 2.5 é a duração. Enquanto seu antecessor tinha um limite de quinze segundos, o 2.5 gera trinta segundos em uma única geração — o dobro da janela, que é a diferença entre um plano e uma cena. Além disso, ele oferece suporte a extensão em várias rodadas, e a ByteDance demonstrou um modo ultralongo em beta, no qual se pede ao modelo que continue sua própria saída em vez de começar do zero.

A superfície de entrada é ampla mesmo para os padrões de 2026. Uma única solicitação pode carregar até cerca de trinta imagens, dez clipes de vídeo e dez clipes de áudio como referências, com vídeo e áudio de referência durando aproximadamente trinta segundos cada. Isso é material suficiente para especificar um personagem, um local, um movimento e uma trilha sonora de uma só vez. O modelo também vem com um conjunto de modos nomeados que se parecem mais com uma suíte de composição do que com uma caixa de prompt: um modo de modelo branco e argila para previz, tela verde, referência de movimento e referência criativa. Além disso, há controle em nível de timestamp e edição em nível de região, que é onde a janela de trinta segundos deixa de ser apenas uma duração e começa a ser uma linha do tempo.

Áudio e vídeo saem da mesma passagem em vez de serem multiplexados depois, em mais de dez idiomas de diálogo, e a lista de parceiros de lançamento — XCMG, XPeng, Lingchu Intelligence, Weifen Zhifei, Qiongche Intelligence — parece mais uma base de clientes industrial e automotiva do que uma de ferramentas criativas. O próprio enquadramento da ByteDance é que o Seedance 2.5 é para pessoas que precisam de uma filmagem finalizada, não de uma interação.

Screenshot of Artificial Analysis's 'AA-Video-T2V v2.0' leaderboard filtered to models with audio, captured 2 October 2026: Wan 3.0 first at Elo 1,157, Utopai X (based on MiniMax H3) second at 1,150, Dreamina Seedance 2.5 third at 1,144 with 7,526 votes and $34.12 per minute, MiniMax H3 (768p) fourth at 1,139 and MiniMax H3 Max fifth at 1,134, with samples, release month and per-minute API pricing columns.

O modelo que só existe enquanto você está falando

Griffin é o tipo oposto de sistema, e a Tavus é incomumente explícita sobre esse formato. Ela chama o Griffin de primeiro Human Interaction Model: um sistema de vídeo para vídeo que observa e escuta um participante durante uma conversa e gera o outro lado dela em tempo real. A arquitetura se divide em Continuous Conversational Modeling, que decide o que a persona deve estar fazendo momento a momento, e Audio-Visual Generation, que faz streaming da fala e do rosto correspondentes. É full duplex, então pode ser interrompido, e não precisa de um sinal limpo de fim de turno para responder.

Tudo na implementação é ajustado para a próxima fração de segundo, e não para o próximo plano. O codec de áudio Tavec opera a 48 kHz com 40 valores por quadro a 100 quadros por segundo, sem codebooks, um decodificador totalmente causal e pacotes de apenas 10 milissegundos. O vídeo é transmitido em 720p em blocos de 320 milissegundos, um latente a cada oito quadros a 25 fps, três etapas de difusão por latente, com uma compressão temporal de 8× no VAE. Uma destilação em três estágios — correspondência de distribuição, depois teacher-forcing autorregressivo, depois self-forcing — é o que torna três etapas de difusão viáveis em tempo real. A latência de áudio para vídeo é, em média, de 0,43 segundos em H100s, o que, segundo a Tavus, é cerca de metade do segundo método mais rápido que ela mediu. A clonagem de voz precisa de aproximadamente uma amostra de dez segundos.

E então a frase que determina como você planeja em torno disso: a Tavus afirma que o Griffin-Lite, a prévia de pesquisa, está disponível para um grupo seleto de testadores iniciais, que o Griffin-Lite não estará disponível para uso por clientes no momento, que um lançamento mais amplo de um modelo mais poderoso se seguirá, e que o Griffin ainda não está na plataforma Tavus — ele chegará assim que a empresa descobrir como lançá-lo com segurança.

As alegações que cada um faz, e quanto valem.

As evidências do Seedance 2.5 são principalmente sobre capacidade: o que ele pode aceitar, por quanto tempo pode funcionar, quanto custa. As evidências do Griffin são principalmente sobre efeito. Em um estudo com a Queen Mary University of London, a Tavus relata que 26 de 54 participantes — 48% — acreditaram que Griffin era uma pessoa real após uma chamada de vídeo de um minuto, contra 1 de 41 (2,4%) em seu stack anterior Phoenix-4.5, Sparrow-2 e Raven-1, com os céticos geralmente desconfiando dentro dos primeiros vinte segundos. O benchmark VideoFDB da NVIDIA, pontuado em setembro de 2026, coloca Griffin em primeiro lugar em IA face a face, segundo os cálculos da Tavus: geração 3,83 contra 2,80 do baseline mais forte relatado e 3,92 para um humano; percepção 3,73 contra 3,44 e 4,20; e uma vantagem de 37% sobre o próximo melhor sistema ao reagir no momento. Relatado pelo fornecedor, em um benchmark criado pela NVIDIA — mas os pontos de comparação com humanos são os que têm peso.

Não existe um teste independente comparável para "o público acreditou nisso" no Seedance 2.5, porque não é para isso que ele serve. Os dois modelos estão respondendo a perguntas diferentes, e nenhum dos conjuntos de números se transfere para o outro.

O que você pode realmente comprar

Seedance 2.5 é um produto com tabela de preços. Na plataforma ModelArk da ByteDance, seu preço é de US$ 10,70 por milhão de tokens sem entrada de vídeo e US$ 6,40 por milhão com entrada de vídeo, o que equivale a aproximadamente US$ 0,51 para um clipe de cinco segundos em 16:9 a 480p e aproximadamente US$ 1,16 para o mesmo clipe a 720p. O acesso ocorre por meio dos aplicativos para consumidores da ByteDance e pela API no Volcano Engine Ark na China e no BytePlus ModelArk internacionalmente. Pelo menos um distribuidor afirma que ele não está disponível nos Estados Unidos, e as fontes divergem sobre se a resolução máxima é 720p ou 1080p — dois pontos que vale a pena saber antes de incluir isso em uma especificação.

A Griffin não tem tabela de tarifas, API pública nem data. É nisso que se resume a decisão de compra, e isso reduz a questão mais do que a maioria dos artigos de comparação admite.

Board titled 'Seconds versus Sentences'. Seedance 2.5 card: what it reads a prompt plus up to 30 images, 10 video clips and 10 audio clips; what it returns up to 30 seconds of video in one pass; audio joint audio and video over 10 languages; latency batch generation, no real-time mode; price about $0.51 per five-second 480p clip on ModelArk; availability shipped 31 July 2026, live on ModelArk. Tavus Griffin card: what it reads the live participant, video and audio; what it returns the other side of the conversation in real time; audio streaming speech with a voice cloned from a ten-second sample; latency 0.43 s average audio to video on H100s; price none published; availability research preview, selected testers only.

Onde um roteador conquista o seu lugar

Se você está construindo qualquer coisa que precise dos dois — um agente que mantém uma conversa e também produz vídeos finalizados — você está lidando com dois fornecedores, dois consoles, dois sistemas de cobrança e duas noções diferentes do que é uma requisição. É nessa costura que o OrcaRouter é genuinamente útil, e não decorativo: uma chave para mais de duzentos modelos, com os preços de tabela dos provedores repassados com 0% de margempara que um corte de preço do fornecedor chegue ao cartão no mesmo dia, failover automáticopara que um provedor saturado não se torne a sua indisponibilidade, e uma DSL de roteamento para fixar trabalhos críticos a um backend específico enquanto os rascunhos vão para onde a capacidade for mais barata. A fusão de modelos também importa nas margens aqui — para um gerador cobrado por token ou por segundo, gastar com um modelo de texto barato para aprimorar um prompt antes de gastar com a geração cara costuma ser a linha de maior retorno no pipeline.

Para ser preciso sobre os dois modelos no título: nem o Seedance 2.5 nem o Griffin são uma rota do OrcaRouter. O Seedance é acessado através das próprias plataformas da ByteDance e de distribuidores terceiros; o Griffin não é acessível de forma alguma. O que o catálogo oferece no lado de vídeo é minimax/minimax-h3, o gerador omni-modal da MiniMax, a $0,08 por segundo de saída em 768P e $0,13 por segundo em 2K, vendido nas mesmas unidades por segundo que o Seedance e disponível agora.

Screenshot of the OrcaRouter model page for MiniMax-H3, showing the model id minimax/minimax-h3, the description 'omni-modal video generation model (the Hailuo 3 generation), released July 31, 2026', a price of $0.08 per second, p50 time to first token of 375 ms and p95 of 416 ms over seven days.

Perguntas frequentes, resumidamente

Eu poderia executar o Seedance 2.5 e o Griffin no mesmo produto?Em termos de arquitetura, sim, e é a divisão óbvia: Seedance para tudo o que puder ser pré-renderizado, Griffin para a superfície ao vivo. Comercialmente, não, porque o Griffin ainda não pode ser vendido para você.

O Griffin é apenas um gerador de vídeos de pessoas falando? Não, e a Tavus faz questão de deixar clara a diferença — um gerador de vídeos de pessoas falando recebe texto e retorna vídeo, enquanto o Griffin recebe como entrada o vídeo e o áudio do participante e é pontuado por sua capacidade de reagir no momento.

O Seedance 2.5 funciona em tempo real? Não. É um gerador em lote com um teto de trinta segundos e um modo de extensão em várias rodadas; a latência não é o eixo no qual ele compete.

Conclusão

Seedance 2.5 é um motor de produção já lançado: trinta segundos em uma única passagem, áudio conjunto, até trinta imagens e dez referências de vídeo e áudio, controle de timestamp e em nível de região, cerca de US$ 0,51 por um clipe de cinco segundos em 480p e cerca de US$ 1,16 em 720p no ModelArk, disponível agora por meio das próprias plataformas da ByteDance e não, até onde se tem confirmação, nos Estados Unidos. Tavus Griffin não é um produto: é um Modelo de Interação Humana duplex cujos resultados publicados incluem 48% dos participantes que acreditaram que ele era humano em uma chamada de um minuto e uma latência média de áudio para vídeo de 0,43 segundos em H100s, e cujo fornecedor declarou por escrito que os clientes ainda não podem usá-lo. Se você precisa de filmagens hoje, o Seedance é a resposta e tem preço público. Se você precisa de um rosto que reaja enquanto você fala, a resposta é que ninguém está vendendo um ainda.