
Tavus Griffin vs Seedance 2.5 : l’un génère trente secondes, l’autre attend que vous terminiez votre phrase
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 223 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
La façon la plus rapide de comprendre l'écart entre Tavus Griffin et Seedance 2.5 est de regarder ce que chacun fait lorsque vous arrêtez de parler. Seedance 2.5, publié par l'équipe Seed de ByteDance le 31 juillet 2026, continue : donnez-lui un prompt et il produira jusqu'à trente secondes de vidéo en une seule passe, avec audio conjoint, à la résolution et à la fréquence d'images que vous avez choisies avant d'appuyer sur Entrée. Tavus Griffin, annoncé par Tavus en octobre 2026 comme aperçu de recherche, s'arrête — puis reprend, parce qu'il vous a écouté tout du long et a quelque chose à vous répondre. Un modèle est un moteur de production qui fonctionne sans surveillance. L'autre est un participant qui ne fonctionne que si vous êtes là.
Trente secondes en une seule prise
Le principal atout de Seedance 2.5 est la durée. Là où son prédécesseur plafonnait à quinze secondes, la version 2.5 produit trente secondes en une seule génération — soit le double de la fenêtre, ce qui correspond à la différence entre un plan et une scène. Au-delà de cela, il prend en charge l’extension sur plusieurs tours, et ByteDance a démontré en version bêta un mode ultra-long dans lequel on demande au modèle de poursuivre sa propre sortie plutôt que de repartir de zéro.
La surface d’entrée est vaste, même selon les standards de 2026. Une seule requête peut transporter jusqu’à environ trente images, dix clips vidéo et dix clips audio comme références, les vidéos et l’audio de référence pouvant atteindre chacun environ trente secondes. C’est suffisamment de matière pour spécifier à la fois un personnage, un lieu, un mouvement et une bande-son. Le modèle embarque également un ensemble de modes nommés qui ressemblent davantage à une suite de compositing qu’à une boîte de prompt : un mode modèle blanc et argile pour la prévisualisation, l’écran vert, la référence de mouvement et la référence créative. À cela s’ajoutent le contrôle au niveau de l’horodatage et l’édition au niveau des régions, et c’est là que la fenêtre de trente secondes cesse d’être une simple durée pour devenir une timeline.
L'audio et la vidéo sortent de la même passe plutôt que d'être multiplexés par la suite, sur plus de dix langues de dialogue, et la liste des partenaires de lancement — XCMG, XPeng, Lingchu Intelligence, Weifen Zhifei, Qiongche Intelligence — ressemble à une base de clients industriels et automobiles plutôt qu'à celle d'outils créatifs. La propre présentation de ByteDance est que Seedance 2.5 s'adresse aux personnes qui ont besoin d'une séquence finie, et non d'une interaction.

Le modèle qui n’existe que pendant que vous parlez
Griffin est un système de forme opposée, et Tavus est inhabituellement explicite quant à sa forme. Il qualifie Griffin de premier Human Interaction Model : un système vidéo à vidéo qui observe et écoute un participant pendant une conversation et génère l'autre côté en temps réel. L'architecture se divise en Modélisation conversationnelle continue, qui décide de ce que la persona doit faire d'un moment à l'autre, et en Génération audiovisuelle, qui diffuse la parole et le visage correspondants. Il est full duplex, donc il peut être interrompu, et il n'a pas besoin d'un signal de fin de tour net pour répondre.
Tout, dans l’implémentation, est optimisé pour la fraction de seconde suivante plutôt que pour le plan suivant. Le codec audio Tavec fonctionne à 48 kHz avec 40 valeurs par trame à 100 images par seconde, sans dictionnaires de codes, avec un décodeur entièrement causal et des paquets d’aussi peu que 10 millisecondes. La vidéo est diffusée en 720p par blocs de 320 millisecondes, un latent toutes les huit images à 25 fps, trois étapes de diffusion par latent, avec une compression temporelle 8× dans le VAE. Une distillation en trois étapes — appariement de distribution, puis autorégressif avec teacher forcing, puis self-forcing — est ce qui rend viables trois étapes de diffusion en temps réel. La latence audio-vers-vidéo est en moyenne de 0,43 seconde sur des H100, ce qui, selon Tavus, représente environ la moitié de la prochaine méthode la plus rapide qu’il a mesurée. Le clonage vocal nécessite un échantillon d’environ dix secondes.
Et ensuite, la phrase qui détermine la façon dont vous planifiez en fonction de cela : Tavus déclare que Griffin-Lite, l’aperçu de recherche, est disponible pour un groupe restreint de premiers testeurs, que Griffin-Lite ne sera pas disponible pour une utilisation par les clients pour le moment, qu’une diffusion plus large d’un modèle plus puissant suivra, et que Griffin n’est pas encore sur la plateforme Tavus — il arrivera une fois que l’entreprise aura trouvé comment le publier en toute sécurité.
Les affirmations que chacun fait, et ce qu’elles valent
Les preuves de Seedance 2.5 portent principalement sur la capacité : ce qu'il peut accepter, combien de temps il peut fonctionner, ce qu'il coûte. Les preuves de Griffin portent principalement sur l'effet. Dans une étude menée avec Queen Mary University of London, Tavus rapporte que 26 participants sur 54 — 48 % — croyaient que Griffin était une personne réelle après un appel vidéo d'une minute, contre 1 sur 41 (2,4 %) sur son précédent stack Phoenix-4.5, Sparrow-2 et Raven-1, les sceptiques soupçonnant généralement la supercherie dans les vingt premières secondes. Le benchmark VideoFDB de NVIDIA, évalué en septembre 2026, place Griffin premier pour l'IA en face-à-face selon les chiffres de Tavus : génération 3,83 contre 2,80 pour la meilleure référence rapportée et 3,92 pour un humain, perception 3,73 contre 3,44 et 4,20, et une avance de 37 % sur le meilleur système suivant pour la réaction en temps réel. Rapporté par le fournisseur, sur un benchmark construit par NVIDIA — mais ce sont les points de comparaison avec l'humain qui pèsent.
Il n'existe pas de test indépendant pour « le public y a-t-il cru » sur Seedance 2.5, car ce n'est pas ce à quoi il sert. Les deux modèles répondent à des questions différentes et aucun des deux ensembles de chiffres ne se transpose à l'autre.
Ce que vous pouvez réellement acheter
Seedance 2.5 est un produit doté d'une grille tarifaire. Sur la plateforme ModelArk de ByteDance, il est facturé 10,70 $ par million de tokens sans entrée vidéo et 6,40 $ par million avec, ce qui revient à environ 0,51 $ pour un clip de cinq secondes en 16:9 à 480p et à environ 1,16 $ pour le même clip en 720p. L'accès passe par les applications grand public de ByteDance et par l'API sur Volcano Engine Ark en Chine et BytePlus ModelArk à l'international. Au moins un distributeur indique qu'il n'est pas disponible aux États-Unis, et les sources divergent quant à savoir si la résolution maximale est 720p ou 1080p — deux points qu'il vaut mieux connaître avant de les inscrire dans un cahier des charges.
Griffin n’a pas de grille tarifaire, pas d’API publique et pas de date. C’est là toute la décision d’achat, et cela réduit la question plus que ne le font la plupart des articles comparatifs.

Là où un routeur mérite sa place
Si vous construisez quoi que ce soit qui a besoin des deux — un agent qui tient une conversation et produit aussi des séquences finies — vous avez affaire à deux fournisseurs, deux consoles, deux systèmes de facturation et deux notions différentes de ce qu'est une requête. C'est là la jointure où OrcaRouter est réellement utile plutôt que décoratif : une seule clé pour plus de deux cents modèles, avec les prix catalogue des fournisseurs répercutés à 0 % de marge afin qu'une baisse de prix d'un fournisseur atteigne la carte le jour même, un basculement automatique pour qu'un fournisseur saturé ne devienne pas votre panne, et un DSL de routage permettant d'épingler les tâches critiques sur un backend précis tandis que les brouillons partent là où la capacité est la moins chère. La fusion de modèles compte aussi à la marge ici — pour un générateur facturé au token ou à la seconde, dépenser un modèle texte bon marché pour affiner un prompt avant de dépenser la génération coûteuse est généralement la ligne la plus rentable du pipeline.
Pour être précis au sujet des deux modèles cités dans le titre : ni Seedance 2.5 ni Griffin n'est une route OrcaRouter. Seedance est accessible via les plateformes propres de ByteDance et des distributeurs tiers ; Griffin n'est accessible d'aucune manière. Ce que le catalogue propose du côté vidéo, c'est minimax/minimax-h3, le générateur omni-modal de MiniMax, à 0,08 $ par seconde de sortie en 768P et 0,13 $ par seconde en 2K, vendu dans les mêmes unités à la seconde que Seedance et disponible dès maintenant.

Questions fréquentes, en bref
Puis-je faire tourner Seedance 2.5 et Griffin dans le même produit ?Sur le plan architectural, oui, et c'est la répartition évidente : Seedance pour tout ce qui peut être pré-rendu, Griffin pour la surface en direct. Sur le plan commercial, non, car Griffin ne peut pas encore vous être vendu.
Griffin n'est-il qu'un générateur de têtes parlantes ? Non, et Tavus tient à faire la distinction — un générateur de têtes parlantes prend du texte et renvoie une vidéo, tandis que Griffin prend en entrée la vidéo et l'audio du participant et est évalué sur sa capacité à réagir sur le moment.
Seedance 2.5 fonctionne-t-il en temps réel ? Non. C'est un générateur par lots avec un plafond de trente secondes et un mode d'extension multi-tours ; la latence n'est pas l'axe sur lequel il se mesure.
L'essentiel
Seedance 2.5 est un moteur de production déjà livré : trente secondes en une seule passe, audio conjoint, jusqu'à trente images et dix références vidéo et audio, un contrôle au niveau de l'horodatage et de la région, environ 0,51 $ pour un clip de cinq secondes en 480p et environ 1,16 $ en 720p sur ModelArk, disponible dès maintenant via les plateformes propres de ByteDance et, pour autant que quiconque ait pu le confirmer, pas aux États-Unis. Tavus Griffin n'est pas un produit : c'est un modèle d'interaction humaine duplex dont les résultats publiés sont que 48 % des participants ont cru qu'il était humain lors d'un appel d'une minute et une latence moyenne audio-vers-vidéo de 0,43 seconde sur des H100, et dont le fournisseur a déclaré par écrit que les clients ne peuvent pas encore l'utiliser. Si vous avez besoin de séquences vidéo aujourd'hui, Seedance est la réponse et son prix est public. Si vous avez besoin d'un visage qui réagit pendant que vous parlez, la réponse est que personne n'en vend encore.
