
Tavus Griffin vs Seedance 2.5: Um Gera Trinta Segundos, o Outro Espera Você Terminar Sua Frase
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 223 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
A maneira mais rápida de entender a diferença entre Tavus Griffin e Seedance 2.5 é observar o que cada um faz quando você para de falar. O Seedance 2.5, lançado pela equipe Seed da ByteDance em 31 de julho de 2026, continua: entregue a ele um prompt e ele produzirá até trinta segundos de vídeo em uma única passagem, com áudio conjunto, na resolução e taxa de quadros que você escolheu antes de pressionar Enter. O Tavus Griffin, anunciado pela Tavus em outubro de 2026 como uma prévia de pesquisa, para — e então começa de novo, porque ficou ouvindo o tempo todo e tem algo a dizer de volta. Um modelo é um motor de produção que funciona sem supervisão. O outro é um participante que só funciona se você estiver lá.
Trinta segundos em uma única tomada
O principal destaque do Seedance 2.5 é a duração. Enquanto seu antecessor tinha um limite de quinze segundos, o 2.5 gera trinta segundos em uma única geração — o dobro da janela, que é a diferença entre um plano e uma cena. Além disso, ele oferece suporte a extensão em várias rodadas, e a ByteDance demonstrou um modo ultralongo em beta, no qual se pede ao modelo que continue sua própria saída em vez de começar do zero.
A superfície de entrada é ampla mesmo para os padrões de 2026. Uma única solicitação pode carregar até cerca de trinta imagens, dez clipes de vídeo e dez clipes de áudio como referências, com vídeo e áudio de referência durando aproximadamente trinta segundos cada. Isso é material suficiente para especificar um personagem, um local, um movimento e uma trilha sonora de uma só vez. O modelo também vem com um conjunto de modos nomeados que se parecem mais com uma suíte de composição do que com uma caixa de prompt: um modo de modelo branco e argila para previz, tela verde, referência de movimento e referência criativa. Além disso, há controle em nível de timestamp e edição em nível de região, que é onde a janela de trinta segundos deixa de ser apenas uma duração e começa a ser uma linha do tempo.
Áudio e vídeo saem da mesma passagem em vez de serem multiplexados depois, em mais de dez idiomas de diálogo, e a lista de parceiros de lançamento — XCMG, XPeng, Lingchu Intelligence, Weifen Zhifei, Qiongche Intelligence — parece mais uma base de clientes industrial e automotiva do que uma de ferramentas criativas. O próprio enquadramento da ByteDance é que o Seedance 2.5 é para pessoas que precisam de uma filmagem finalizada, não de uma interação.

O modelo que só existe enquanto você está falando
Griffin é o tipo oposto de sistema, e a Tavus é incomumente explícita sobre esse formato. Ela chama o Griffin de primeiro Human Interaction Model: um sistema de vídeo para vídeo que observa e escuta um participante durante uma conversa e gera o outro lado dela em tempo real. A arquitetura se divide em Continuous Conversational Modeling, que decide o que a persona deve estar fazendo momento a momento, e Audio-Visual Generation, que faz streaming da fala e do rosto correspondentes. É full duplex, então pode ser interrompido, e não precisa de um sinal limpo de fim de turno para responder.
Tudo na implementação é ajustado para a próxima fração de segundo, e não para o próximo plano. O codec de áudio Tavec opera a 48 kHz com 40 valores por quadro a 100 quadros por segundo, sem codebooks, um decodificador totalmente causal e pacotes de apenas 10 milissegundos. O vídeo é transmitido em 720p em blocos de 320 milissegundos, um latente a cada oito quadros a 25 fps, três etapas de difusão por latente, com uma compressão temporal de 8× no VAE. Uma destilação em três estágios — correspondência de distribuição, depois teacher-forcing autorregressivo, depois self-forcing — é o que torna três etapas de difusão viáveis em tempo real. A latência de áudio para vídeo é, em média, de 0,43 segundos em H100s, o que, segundo a Tavus, é cerca de metade do segundo método mais rápido que ela mediu. A clonagem de voz precisa de aproximadamente uma amostra de dez segundos.
E então a frase que determina como você planeja em torno disso: a Tavus afirma que o Griffin-Lite, a prévia de pesquisa, está disponível para um grupo seleto de testadores iniciais, que o Griffin-Lite não estará disponível para uso por clientes no momento, que um lançamento mais amplo de um modelo mais poderoso se seguirá, e que o Griffin ainda não está na plataforma Tavus — ele chegará assim que a empresa descobrir como lançá-lo com segurança.
As alegações que cada um faz, e quanto valem.
As evidências do Seedance 2.5 são principalmente sobre capacidade: o que ele pode aceitar, por quanto tempo pode funcionar, quanto custa. As evidências do Griffin são principalmente sobre efeito. Em um estudo com a Queen Mary University of London, a Tavus relata que 26 de 54 participantes — 48% — acreditaram que Griffin era uma pessoa real após uma chamada de vídeo de um minuto, contra 1 de 41 (2,4%) em seu stack anterior Phoenix-4.5, Sparrow-2 e Raven-1, com os céticos geralmente desconfiando dentro dos primeiros vinte segundos. O benchmark VideoFDB da NVIDIA, pontuado em setembro de 2026, coloca Griffin em primeiro lugar em IA face a face, segundo os cálculos da Tavus: geração 3,83 contra 2,80 do baseline mais forte relatado e 3,92 para um humano; percepção 3,73 contra 3,44 e 4,20; e uma vantagem de 37% sobre o próximo melhor sistema ao reagir no momento. Relatado pelo fornecedor, em um benchmark criado pela NVIDIA — mas os pontos de comparação com humanos são os que têm peso.
Não existe um teste independente comparável para "o público acreditou nisso" no Seedance 2.5, porque não é para isso que ele serve. Os dois modelos estão respondendo a perguntas diferentes, e nenhum dos conjuntos de números se transfere para o outro.
O que você pode realmente comprar
Seedance 2.5 é um produto com tabela de preços. Na plataforma ModelArk da ByteDance, seu preço é de US$ 10,70 por milhão de tokens sem entrada de vídeo e US$ 6,40 por milhão com entrada de vídeo, o que equivale a aproximadamente US$ 0,51 para um clipe de cinco segundos em 16:9 a 480p e aproximadamente US$ 1,16 para o mesmo clipe a 720p. O acesso ocorre por meio dos aplicativos para consumidores da ByteDance e pela API no Volcano Engine Ark na China e no BytePlus ModelArk internacionalmente. Pelo menos um distribuidor afirma que ele não está disponível nos Estados Unidos, e as fontes divergem sobre se a resolução máxima é 720p ou 1080p — dois pontos que vale a pena saber antes de incluir isso em uma especificação.
A Griffin não tem tabela de tarifas, API pública nem data. É nisso que se resume a decisão de compra, e isso reduz a questão mais do que a maioria dos artigos de comparação admite.

Onde um roteador conquista o seu lugar
Se você está construindo qualquer coisa que precise dos dois — um agente que mantém uma conversa e também produz vídeos finalizados — você está lidando com dois fornecedores, dois consoles, dois sistemas de cobrança e duas noções diferentes do que é uma requisição. É nessa costura que o OrcaRouter é genuinamente útil, e não decorativo: uma chave para mais de duzentos modelos, com os preços de tabela dos provedores repassados com 0% de margempara que um corte de preço do fornecedor chegue ao cartão no mesmo dia, failover automáticopara que um provedor saturado não se torne a sua indisponibilidade, e uma DSL de roteamento para fixar trabalhos críticos a um backend específico enquanto os rascunhos vão para onde a capacidade for mais barata. A fusão de modelos também importa nas margens aqui — para um gerador cobrado por token ou por segundo, gastar com um modelo de texto barato para aprimorar um prompt antes de gastar com a geração cara costuma ser a linha de maior retorno no pipeline.
Para ser preciso sobre os dois modelos no título: nem o Seedance 2.5 nem o Griffin são uma rota do OrcaRouter. O Seedance é acessado através das próprias plataformas da ByteDance e de distribuidores terceiros; o Griffin não é acessível de forma alguma. O que o catálogo oferece no lado de vídeo é minimax/minimax-h3, o gerador omni-modal da MiniMax, a $0,08 por segundo de saída em 768P e $0,13 por segundo em 2K, vendido nas mesmas unidades por segundo que o Seedance e disponível agora.

Perguntas frequentes, resumidamente
Eu poderia executar o Seedance 2.5 e o Griffin no mesmo produto?Em termos de arquitetura, sim, e é a divisão óbvia: Seedance para tudo o que puder ser pré-renderizado, Griffin para a superfície ao vivo. Comercialmente, não, porque o Griffin ainda não pode ser vendido para você.
O Griffin é apenas um gerador de vídeos de pessoas falando? Não, e a Tavus faz questão de deixar clara a diferença — um gerador de vídeos de pessoas falando recebe texto e retorna vídeo, enquanto o Griffin recebe como entrada o vídeo e o áudio do participante e é pontuado por sua capacidade de reagir no momento.
O Seedance 2.5 funciona em tempo real? Não. É um gerador em lote com um teto de trinta segundos e um modo de extensão em várias rodadas; a latência não é o eixo no qual ele compete.
Conclusão
Seedance 2.5 é um motor de produção já lançado: trinta segundos em uma única passagem, áudio conjunto, até trinta imagens e dez referências de vídeo e áudio, controle de timestamp e em nível de região, cerca de US$ 0,51 por um clipe de cinco segundos em 480p e cerca de US$ 1,16 em 720p no ModelArk, disponível agora por meio das próprias plataformas da ByteDance e não, até onde se tem confirmação, nos Estados Unidos. Tavus Griffin não é um produto: é um Modelo de Interação Humana duplex cujos resultados publicados incluem 48% dos participantes que acreditaram que ele era humano em uma chamada de um minuto e uma latência média de áudio para vídeo de 0,43 segundos em H100s, e cujo fornecedor declarou por escrito que os clientes ainda não podem usá-lo. Se você precisa de filmagens hoje, o Seedance é a resposta e tem preço público. Se você precisa de um rosto que reaja enquanto você fala, a resposta é que ninguém está vendendo um ainda.
