
Tavus Griffin vs Alibaba Wan 2.7: Um Modelo Conversacional Contra um Generativo
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 223 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
A forma tentadora de comparar Tavus Griffin e Alibaba Wan 2.7 é por segundo de vídeo, e essa comparação não pode ser feita. O Wan 2.7 tem uma tabela de preços publicada — US$ 9,00 por minuto em 1080p nos endpoints internacionais de Singapura da Alibaba Cloud, com um nível mais barato em Pequim e Tóquio — e o Tavus Griffin não tem tabela de preços alguma, porque o Griffin-Lite foi lançado em 1º de outubro de 2026 como uma prévia de pesquisa para testadores confiáveis selecionados, por trás de um formulário de solicitação. O que os dois compartilham é uma palavra: vídeo. Além disso, eles são respostas para perguntas diferentes. A um pergunta-se o que deve acontecer em seguida numa conversa; ao outro, com que se parece uma cena descrita. A comparação interessante não é de qualidade, mas sim o que cada um exige de você antes de produzir qualquer coisa, e o que você recebe de volta.
A diferença está no loop, não na resolução
Wan 2.7 gera clipe por clipe a partir de um prompt. Você escreve uma descrição, recebe um trecho de filmagem, olha para ele, escreve outro. Wan 2.7 é um conjunto de quatro modelos — texto para vídeo, imagem para vídeo, referência para vídeo e edição de vídeo — e a interação é fundamentalmente transacional: uma entrada, uma saída renderizada e uma decisão sobre se deve mantê-la. Nada nele é executado enquanto você ainda está decidindo o que pedir.
Griffin é construído ao contrário. É um sistema full-duplex: um motor de Modelagem Conversacional Contínua que ingere áudio e vídeo e reavalia a conversa em intervalos de menos de um segundo, decidindo se permanece em silêncio, sinaliza, dá backchannel ou assume o turno, e emitindo controles expressivos que acionam um gerador de fala em streaming e um gerador de vídeo em streaming em paralelo. Ele gera 720p em blocos de 320 ms a partir de uma única fotografia de referência, e a afirmação que importa é que uma decisão tomada no meio da frase aparece na voz e no rosto dentro do mesmo mini-turno. O benchmark para isso não é um ranking de clipes. É se você consegue interrompê-lo.
Falando claramente: o Wan 2.7 responde à pergunta "como é que esta cena se parece em movimento?" O Griffin responde "o que é que este rosto e esta voz devem fazer nos próximos duzentos milissegundos, dado que a pessoa acabou de fazer uma pausa."
Preço, no lado em que houver um.
As tarifas publicadas do Wan 2.7 são por segundo de vídeo gerado, e os níveis não são uniformes em toda a suíte, que é o detalhe que a maioria das páginas de comparação omite.
• wan2.7-t2v e wan2.7-i2v — cobrados apenas pela duração da saída. Singapura (internacional): $0,10/s em 720p e $0,15/s em 1080p, que é o valor de $9,00/min que aparece nas tabelas de classificação. Pequim e Tóquio informam $0,086/s e $0,143/s para o mesmo trabalho.
• wan2.7-r2v (referência para vídeo) — cobrado pela duração do vídeo de entrada, com limite de cinco segundos, além da saída. Insira uma referência de cinco segundos em uma geração de quinze segundos e você será cobrado por vinte segundos.
• wan2.7-videoedit — cobrado apenas pela saída, com o material de entrada gratuito.
Dois fatos de ciclo de vida devem acompanhar esses números. A Alibaba aplicou um desconto de lançamento por tempo limitado de 30% em suas próprias superfícies Bailian e Qwen Cloud, válido até 23 de setembro de 2026, data que agora já passou. E o aviso de aposentadoria do Model Studio da Alibaba Cloud (ID 118434) desativa vários modelos mais antigos em 10 de outubro de 2026, incluindo wan2.7-r2v e wan2.7-image. Isso é no nível da variante, e não uma aposentadoria da geração — wan2.7-t2v e wan2.7-i2v permanecem listados com taxas ativas e páginas atualizadas já em 11 de setembro —, mas, se reference-to-video é o motivo pelo qual você estava olhando para o 2.7, essa rota tem uma data marcada.
A comparação com o Griffin tem uma frase honesta: não há preço para colocar ao lado do preço do Wan 2.7, porque a Tavus não publicou nenhum. O Griffin-Lite não está na plataforma da Tavus, o anúncio diz que ele não estará disponível para uso por clientes no momento, e a própria frase de encerramento da empresa é que o Griffin chegará quando ela tiver descoberto como lançá-lo com segurança. Não há tarifa por segundo, nem tarifa por solicitação, nem plano gratuito, nem plano empresarial. Qualquer pessoa que cite um preço para o Griffin está inventando.
Pontuações de qualidade: duas placas que não atendem
Os dois modelos foram pontuados em instrumentos completamente diferentes, e é por isso que não existe nenhuma comparação de Elo entre eles.
Wan 2.7 tem duas entradas na arena de vídeo da Artificial Analysis, e elas não estão no mesmo lugar — que é a armadilha de citar um único número para ele. O Elo ali é derivado de votos cegos de preferência humana em comparações pareadas, uma metodologia criada para clipes gerados curtos, e ambas as leituras abaixo vêm de rankings consultados em 2 de outubro de 2026.
• Wan2.7-260612 (a versão de junho) em texto para vídeo (com áudio) — 13º–14º, Elo 1.032 (±10) em mais de 4.645 votos, $9,00/min.
• Wan 2.7 (versão de abril) em imagem para vídeo (com áudio) — 12º de 34, Elo 1.077 em 4.571 votos, $9,00/min, um ranking que tem aproximadamente a mesma contagem de votos, mas o coloca significativamente mais alto.
• Wan 3.0, o irmão mais recente — 1.º no Elo 1.157 em texto para vídeo e 6.º em 1.164 em imagem para vídeo, ambos a $12,00/min. Esse é o número que vale a pena saber antes de comparar o Wan 2.7 com qualquer outra coisa: a própria próxima geração da Alibaba lidera a tabela, e a 2.7 é uma versão de meio de tabela.

O Griffin está no VideoFDB da NVIDIA, um benchmark para conversa audiovisual full-duplex que a NVIDIA criou e pontuou independentemente em setembro de 2026, usando um juiz de modelo de linguagem com base em uma rubrica de zero a cinco. O Griffin-Lite obteve 3,83 na trilha de geração, contra uma referência humana de 3,92, e 2,80 para o sistema publicado com a segunda maior pontuação, além de 3,73 na trilha de percepção, contra uma referência humana de 4,20. A Tavus também relata 0,43 segundos de latência real de áudio para vídeo para o gerador, contra quatro baselines publicadas de difusão em streaming em H100s.
Os dois conjuntos de números são legítimos e nenhum dos dois viaja. O Elo na arena é uma contagem de votos sobre preferência de clipes; o VideoFDB é a pontuação de um juiz segundo uma rubrica sobre comportamento conversacional. Não há ponte entre eles, e a armadilha da amostra pequena também funciona no sentido inverso: a faixa de ±10 da arena sobre o Wan 2.7 é larga o suficiente para que sua posição em relação aos vizinhos não esteja firmemente resolvida, e a diferença de geração de 0,09 ponto da NVIDIA em relação ao humano é pequena o bastante, numa rubrica de cinco pontos, para que "próximo da referência humana" seja a leitura honesta, e não "no nível humano". A comparação de percepção também não é equivalente — vários dos sistemas à frente dos quais Griffin é colocado, incluindo o gpt-realtime da OpenAI e o MiniCPM-o 4.5, são avaliados em configurações apenas de áudio, enquanto Griffin também percebe vídeo. Parte da vantagem de 0,29 ponto mede o fato de ter olhos.
O que cada um precisa de você
É aqui que a comparação se torna útil, porque as entradas são os produtos.
• Entrada — O Wan 2.7 recebe texto, uma imagem, um vídeo e áudio. O Griffin capta uma pessoa ao vivo pela câmera e pelo microfone e não gera clipe algum quando solicitado.
• Saída — Wan 2.7 produz um arquivo de vídeo, de 2 a 15 segundos por geração, até 1080p, com áudio nativo. Griffin produz uma conversa contínua: vídeo em 720p a 25 fps em blocos de 320 ms, gerado em tempo real e reproduzido à medida que é decodificado.
• O que o orienta — Wan 2.7 é guiado pelo prompt e por até cinco imagens de sujeito e cinco clipes de referência, dentro de um limite máximo de dez ativos de referência por solicitação. Griffin é guiado pelo que a pessoa faz: uma pausa, um olhar para o lado, um gesto, uma interrupção.
• Horizonte temporal — a unidade de trabalho do Wan 2.7 é um clipe de no máximo quinze segundos, que você depois monta. A unidade de trabalho do Griffin é uma conversa, e é por isso que a arquitetura teve de resolver a deriva — a destilação em três estágios para um gerador autorregressivo, treinado em seu próprio histórico gerado para que execuções longas permaneçam estáveis — em vez de tentar obter uma única geração mais longa.
• Contêiner de saída — Wan 2.7 devolve um arquivo que é seu e que você pode editar, fazer correção de cor e distribuir. Griffin devolve uma sessão renderizada. Não há arquivo para editar, porque os pixels são gerados por bloco a partir de uma foto de referência e do próprio histórico do modelo, e o fundo, as sombras e a cadeira em que a pessoa se senta fazem parte da geração.
Uma diferença estrutural que vale a pena mencionar: os custos do Wan 2.7 aumentam conforme a duração da saída, e sua qualidade varia conforme quão específico é o seu prompt. Os custos do Griffin não são mensurados, e sua qualidade varia conforme quão natural é a pessoa do outro lado. Você pode melhorar um escrevendo briefings melhores, e o outro apenas usando-o com pessoas reais.

Referência e consistência, onde os dois designs colidem
O Wan 2.7 controla a consistência do sujeito por meio de referências fornecidas: cinco imagens do sujeito, cinco clipes de referência, dez ativos no total. É uma abordagem fotográfica — você mostra a ele como o sujeito se parece e ele mantém essa aparência ao longo da geração.
Griffin controla a mesma coisa de maneira oposta. Ele gera cada pixel de cada quadro a partir de uma única imagem de referência em tempo real, e o anúncio deixa explícito que ele controla a cena inteira, e não o rosto: os braços e dedos, o movimento da cadeira, as sombras projetadas e o fundo atrás. A consistência ali é obtida ao transformar o ambiente em um alvo de geração, em vez de um plate composto.
Nenhuma das abordagens é estritamente melhor, e elas falham de maneiras diferentes. A geração condicionada por referência falha ao se afastar do sujeito fornecido ao longo de um clipe longo. A geração por bloco com um histórico autorregressivo falha ao divagar ao longo de uma sessão longa se o tratamento de deriva estiver errado, que é exatamente a falha que o terceiro estágio de destilação existe para evitar. Wan 2.7 é a escolha mais segura quando o entregável é uma pessoa específica com um visual específico. Griffin não está competindo por esse briefing.
Segurança, proveniência e a postura de lançamento
Wan 2.7 não traz nenhum sistema de proveniência publicado comparável a uma marca d'água que sobrevive à compressão — o anúncio cita a qualidade de áudio e a precisão do texto na tela como áreas que ainda precisam de melhorias, o que é uma ressalva de fidelidade, e não de segurança.
A narrativa de segurança do Griffin está invertida: o motivo declarado pela Tavus para mantê-lo em pré-visualização é que as mesmas propriedades que o tornam uma interface melhor também o tornam melhor em persuadir alguém de que está a falar com um ser humano, e os números sustentam essa preocupação. No próprio estudo ao vivo da empresa, 26 de 54 participantes acreditaram que o parceiro era uma pessoa real, contra 1 de 41 na stack anterior Phoenix-4.5 / Raven-1 / Sparrow-2. Os participantes que suspeitaram tendiam a fazê-lo nos primeiros vinte segundos. A Tavus diz que é necessário mais trabalho de alinhamento e divulgação antes do lançamento, que está a construir funcionalidades de divulgação e que está a trabalhar com organizações em avaliações de segurança. Essa é a coisa mais substancial que alguém publicou sobre este modelo, e é também por isso que não há um produto para comprar.
Para quem compara os dois como ferramentas, a consequência prática é simples: um pode ser gerado sob demanda e entregue hoje, e o outro é um alvo de avaliação cujo lançamento está condicionado a um problema que o fornecedor ainda não resolveu.
Qual deles, para quê?
• Escolha o Wan 2.7 se o entregável for filmagem. A edição baseada em instruções de material existente é a carga de trabalho em que é invulgarmente forte e invulgarmente barata, porque a variante de edição fatura apenas com base na saída e trata o material filmado de entrada como gratuito. Vale a pena verificar a sua variante de referência para vídeo face à descontinuação de 10 de outubro antes de se comprometer com ela.
• Não escolha Griffin para nada neste trimestre, porque você não pode. Solicite acesso se precisar saber se uma pessoa consegue perceber, ou se o seu roadmap depende da camada de interação em vez da camada de filmagem.
Fique atento à lacuna, não a nenhum dos modelos. A chegada do Griffin faz com que a comparação mais interessante seja uma futura: um sistema que gera toda a conversa versus uma suíte que gera toda a cena. O primeiro produto que fizer as duas coisas será aquele contra o qual valerá a pena reler isto.
Onde um router se encaixa e onde não
Nem um destes modelos está no catálogo do OrcaRouter, e vale a pena afirmar isso antes de qualquer outra coisa nesta seção. O Wan 2.7 pode ser acessado pelas próprias plataformas da Alibaba — Model Studio na Alibaba Cloud e Qwen Cloud — e por ferramentas criativas de terceiros que o integraram após o lançamento; o Tavus Griffin só pode ser acessado por formulário de solicitação. Se qualquer um deles se tornar roteável, aparecerá pelo preço de tabela do provedor.
A parte de um pipeline de vídeo que é um problema de roteamento é o texto ao seu redor. Listas de planos, expansão de prompts, geração de legendas, resumos de revisão de qualidade e o trabalho de transcrição ou diálogo que alimenta uma passagem de referência para vídeo são todas chamadas de texto, e elas rodam no mesmo endpoint compatível com OpenAI no OrcaRouter que mais de 200 outros modelos ao preço de tabela do provedor com 0% de margem adicionada, então um corte de preço de um fornecedor entra em vigor no mesmo dia, em vez de após um ciclo de contrato. Dividir um modelo barato em uma passagem em massa e um modelo de fronteira na passagem final é uma mudança de configuração lá, em vez de um segundo relacionamento com fornecedor — que é o mesmo argumento que se aplica à camada de geração, uma vez que a camada de geração seja algo que você possa chamar.
O que observar: se as variantes de referência e de edição do conjunto Wan 2.7 sobrevivem inalteradas à descontinuação do Model Studio em 10 de outubro, e se a barreira de segurança do Griffin produz um cartão de modelo publicado com um endpoint nele. Esses dois eventos são o que transformaria esta comparação de um ensaio de design em uma decisão de compra.

