
Tavus Griffin vs Alibaba Wan 2.7 : un modèle conversationnel face à un modèle génératif
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 223 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
La façon tentante de comparer Tavus Griffin et Alibaba Wan 2.7 est de le faire à la seconde de vidéo, et cette comparaison ne peut pas être faite. Wan 2.7 dispose d'une grille tarifaire publiée — 9,00 $ par minute en 1080p sur les points de terminaison internationaux d'Alibaba Cloud à Singapour, avec un palier moins cher à Pékin et Tokyo — et Tavus Griffin n'a aucune grille tarifaire du tout, car Griffin-Lite a été lancé le 1er octobre 2026 comme aperçu de recherche réservé à quelques testeurs de confiance sélectionnés, sur demande via un formulaire. Ce que les deux ont en commun, c'est un mot : vidéo. Au-delà de cela, ils répondent à des questions différentes. On demande à l'un ce qui devrait se passer ensuite dans une conversation ; on demande à l'autre à quoi ressemble une scène décrite. La comparaison intéressante n'est pas la qualité, mais ce dont chacun a besoin de votre part avant de produire quoi que ce soit, et ce que vous obtenez en retour.
La différence, c'est la boucle, pas la résolution
Wan 2.7 génère clip par clip à partir d'un prompt. Vous écrivez une description, vous obtenez une séquence, vous la regardez, vous en écrivez une autre. Wan 2.7 est une suite de quatre modèles — texte-vers-vidéo, image-vers-vidéo, référence-vers-vidéo et édition vidéo — et l'interaction est fondamentalement transactionnelle : une entrée, une sortie générée et une décision quant à savoir si on la conserve. Rien ne s'exécute tant que vous êtes encore en train de décider ce que vous allez demander.
Griffin est construit à l'inverse. C'est un système full-duplex : un moteur de modélisation conversationnelle continue qui ingère l'audio et la vidéo et réévalue la conversation à des intervalles inférieurs à la seconde, décidant de rester silencieux, d'émettre un signal, de faire du backchannel ou de prendre la parole, et émettant des contrôles expressifs qui pilotent en parallèle un générateur de parole en flux et un générateur vidéo en flux. Il génère de la 720p par blocs de 320 ms à partir d'une seule photographie de référence, et l'affirmation qui compte, c'est qu'une décision prise en pleine phrase se manifeste dans la voix et sur le visage au cours du même mini-tour. Le point de référence ici n'est pas un classement de clips. C'est de savoir si vous pouvez l'interrompre.
Pour le dire simplement : Wan 2.7 répond à la question « à quoi ressemble cette scène en mouvement ? » Griffin répond à « que devraient faire ce visage et cette voix dans les deux cents prochaines millisecondes, étant donné que la personne vient de marquer une pause. »
Prix, du côté où il y en a un
Les tarifs publiés de Wan 2.7 sont exprimés par seconde de vidéo générée, et les paliers ne sont pas uniformes au sein de la suite, un détail que la plupart des pages de comparaison passent sous silence.
• wan2.7-t2v et wan2.7-i2v — facturés uniquement sur la durée de sortie. Singapour (international) : 0,10 $/s en 720p et 0,15 $/s en 1080p, soit le montant de 9,00 $/min qui figure dans les classements. Pékin et Tokyo affichent 0,086 $/s et 0,143 $/s pour le même travail.
• wan2.7-r2v (reference-to-video) — facturé sur la durée de la vidéo d’entrée, plafonnée à cinq secondes, plus la sortie. Fournissez une référence de cinq secondes pour une génération de quinze secondes et vous serez facturé pour vingt secondes.
• wan2.7-videoedit — facturé uniquement sur la sortie, les séquences d'entrée étant gratuites.
Deux faits liés au cycle de vie vont de pair avec ces chiffres. Alibaba a appliqué une remise de lancement de 30 % à durée limitée sur ses propres plateformes Bailian et Qwen Cloud, valable jusqu'au 23 septembre 2026, date désormais dépassée. Et l'avis de mise hors service de Model Studio d'Alibaba Cloud (ID 118434) retire plusieurs modèles plus anciens le 10 octobre 2026, notamment wan2.7-r2v et wan2.7-image. Il s'agit d'un retrait au niveau des variantes, et non d'un retrait de la génération — wan2.7-t2v et wan2.7-i2v restent listés avec des tarifs en vigueur et des pages mises à jour pas plus tard que le 11 septembre — mais si c'est le reference-to-video qui vous a amené à vous intéresser à la 2.7, cette voie a désormais une date butoir.
La comparaison avec Griffin comporte une seule ligne honnête : il n'y a aucun prix à mettre en face de celui de Wan 2.7, car Tavus n'en a publié aucun. Griffin-Lite n'est pas sur la plateforme Tavus, l'annonce indique qu'il ne sera pas disponible pour une utilisation par les clients pour le moment, et la conclusion de l'entreprise elle-même est que Griffin arrivera lorsqu'elle aura trouvé comment le publier en toute sécurité. Il n'y a pas de tarif à la seconde, pas de tarif par requête, pas d'offre gratuite, pas d'offre entreprise. Quiconque cite un prix pour Griffin l'invente.
Scores de qualité : deux conseils qui ne se réunissent pas
Les deux modèles ont été évalués à l’aide d’instruments entièrement différents, c’est pourquoi aucune comparaison Elo entre eux n’existe.
Wan 2.7 a deux entrées dans l'arène vidéo d'Artificial Analysis, et elles ne se trouvent pas au même endroit — c'est là le piège lorsqu'on cite un seul chiffre à son sujet. L'Elo y est dérivé de votes de préférence humaine en aveugle par paires, une méthodologie conçue pour de courts clips générés, et les deux relevés ci-dessous proviennent de tableaux consultés le 2 octobre 2026.
• Wan2.7-260612 (la version de juin) en texte-vers-vidéo (avec audio) — 13e–14e, Elo 1 032 (±10) sur 4 645 votes, 9,00 $/min.
• Wan 2.7 (version d’avril) en image-vers-vidéo (avec audio) — 12e sur 34, Elo 1 077 sur 4 571 votes, 9,00 $/min, un classement qui affiche à peu près le même nombre de votes mais le place sensiblement plus haut.
• Wan 3.0, le petit nouveau — 1er à l'Elo 1 157 en text-to-video et 6e à 1 164 en image-to-video, les deux à 12,00 $/min. C'est le chiffre à connaître avant de comparer Wan 2.7 à quoi que ce soit : la propre nouvelle génération d'Alibaba est en tête du classement et 2.7 est une version de milieu de tableau.

Griffin s'appuie sur VideoFDB de NVIDIA, un benchmark pour la conversation audiovisuelle en duplex intégral que NVIDIA a construit et noté indépendamment en septembre 2026, en utilisant un modèle de langage comme juge selon une grille d'évaluation de zéro à cinq. Griffin-Lite a obtenu 3,83 sur le volet génération par rapport à une référence humaine de 3,92 et 2,80 pour le système publié le mieux classé suivant, et 3,73 sur le volet perception par rapport à une référence humaine de 4,20. Tavus rapporte également 0,43 seconde de latence réelle audio vers vidéo pour le générateur, face à quatre bases de référence de diffusion en streaming publiées sur des H100.
Les deux ensembles de chiffres sont légitimes, et ni l’un ni l’autre ne se transpose. L’Elo sur l’arène est un décompte de votes portant sur la préférence entre clips ; VideoFDB est le score de grille d’évaluation d’un juge portant sur le comportement conversationnel. Il n’y a pas de passerelle entre eux, et le piège du faible échantillon joue aussi dans l’autre sens : la bande de ±10 de l’arène sur Wan 2.7 est suffisamment large pour que son positionnement par rapport à ses voisins ne soit pas résolu avec précision, et l’écart de génération de 0,09 point de NVIDIA par rapport à l’humain est suffisamment faible sur une grille de cinq points pour que « proche de la référence humaine » soit la lecture honnête, et non « au niveau humain ». La comparaison de perception n’est pas non plus à armes égales — plusieurs des systèmes devant lesquels Griffin est placé, notamment gpt-realtime d’OpenAI et MiniCPM-o 4.5, sont évalués dans des configurations audio uniquement, alors que Griffin perçoit aussi la vidéo. Une partie de l’avance de 0,29 point mesure le fait d’avoir des yeux.
Ce que chacun requiert de vous
C’est ici que la comparaison devient utile, car les entrées sont les produits.
• Entrée — Wan 2.7 prend en entrée du texte, une image, une vidéo et de l'audio. Griffin capte une personne en direct via la caméra et le microphone, et ne génère pas du tout de clip sur demande.
• Sortie — Wan 2.7 produit un fichier vidéo, de 2 à 15 secondes par génération, jusqu'à 1080p, avec audio natif. Griffin produit une conversation continue : vidéo 720p à 25 i/s par blocs de 320 ms, générée en temps réel et lue au fur et à mesure de son décodage.
• Ce qui le guide — Wan 2.7 est guidé par le prompt et par jusqu'à cinq images de sujet et cinq clips de référence, dans une limite de dix ressources de référence par requête. Griffin est guidé par ce que fait la personne : une pause, un regard détourné, un geste, une interruption.
• Horizon temporel — l'unité de travail de Wan 2.7 est un clip de quinze secondes au maximum, que vous assemblez ensuite. L'unité de travail de Griffin est une conversation, c'est pourquoi l'architecture a dû résoudre la dérive — la distillation en trois étapes vers un générateur autorégressif, entraîné sur son propre historique généré afin que les longs déroulés restent stables — plutôt que de se battre pour une génération unique plus longue.
• Conteneur de sortie — Wan 2.7 renvoie un fichier qui vous appartient et que vous pouvez modifier, étalonner et distribuer. Griffin renvoie une session rendue. Il n’y a aucun fichier à modifier, car les pixels sont générés par bloc à partir d’une photo de référence et de l’historique propre du modèle, et l’arrière-plan, les ombres et la chaise sur laquelle la personne est assise font partie de la génération.
Une différence structurelle qu’il vaut la peine de nommer : les coûts de Wan 2.7 évoluent avec la durée de sortie et sa qualité évolue avec la précision de votre prompt. Les coûts de Griffin ne sont pas mesurés et sa qualité évolue avec le naturel de la personne à l’autre bout. Vous pouvez améliorer l’un en rédigeant de meilleurs briefs et l’autre uniquement en l’utilisant avec de vraies personnes.

Référence et cohérence, là où les deux designs se heurtent
Wan 2.7 contrôle la cohérence du sujet grâce à des références fournies : cinq images de sujet, cinq clips de référence, dix éléments au total. C'est une approche photographique — vous lui montrez à quoi ressemble le sujet et elle conserve cette apparence tout au long de la génération.
Griffin contrôle la même chose, mais de manière opposée. Il génère chaque pixel de chaque image à partir d'une seule image de référence, en temps réel, et l'annonce indique explicitement qu'il contrôle toute la scène plutôt que le visage : les bras et les doigts, le mouvement de la chaise, les ombres projetées et l'arrière-plan. La cohérence y est obtenue en faisant de l'environnement une cible de génération plutôt qu'une plaque composite.
Aucune des deux approches n’est strictement meilleure et elles échouent différemment. La génération conditionnée par référence échoue en s’éloignant du sujet fourni au fil d’un long clip. La génération par blocs avec un historique autorégressif échoue en divaguant sur une longue session si la gestion de la dérive est incorrecte, ce qui est exactement l’échec que la troisième étape de distillation a pour but de prévenir. Wan 2.7 est le choix le plus sûr lorsque le livrable est une personne précise à un moment précis. Griffin n’est pas en concurrence pour ce brief.
Sécurité, provenance et la publication
Wan 2.7 ne comporte aucun système de provenance publié comparable à un filigrane qui survit à la compression — l'annonce désigne la qualité audio et l'exactitude du texte à l'écran comme des domaines nécessitant encore des améliorations, ce qui relève d'une réserve liée à la fidélité plutôt qu'à la sécurité.
Le récit de sécurité de Griffin est inversé : la raison déclarée par Tavus pour le maintenir en preview est que les mêmes propriétés qui en font une meilleure interface le rendent plus efficace pour persuader quelqu'un qu'il s'adresse à un être humain, et les chiffres étayent cette préoccupation. Dans l'étude en direct menée par l'entreprise elle-même, 26 des 54 participants croyaient que leur interlocuteur était une personne réelle, contre 1 sur 41 avec l'ancienne pile Phoenix-4.5 / Raven-1 / Sparrow-2. Les participants qui ont bel et bien eu des soupçons avaient tendance à commencer à douter dans les vingt premières secondes. Tavus affirme qu'un travail supplémentaire d'alignement et de divulgation est nécessaire avant la sortie, qu'elle développe des fonctionnalités de divulgation et qu'elle travaille avec des organisations sur des évaluations de sécurité. C'est la chose la plus substantielle que quiconque ait publiée à propos de ce modèle, et c'est aussi pourquoi il n'y a pas de produit à acheter.
Pour quiconque compare les deux en tant qu’outils, la conséquence pratique est simple : l’un peut être généré à la demande et livré dès aujourd’hui, tandis que l’autre est une cible d’évaluation dont la publication dépend d’un problème que le fournisseur n’a pas encore résolu.
Lequel, pour quoi
• Choisissez Wan 2.7 si le livrable est constitué de séquences vidéo. Le montage par instructions de matériel existant est la charge de travail où il est inhabituellement performant et inhabituellement bon marché, car la variante d’édition ne facture que la sortie et considère les séquences d’entrée comme gratuites. Sa variante reference-to-video mérite d’être vérifiée au regard du retrait du 10 octobre avant de vous engager.
• Ne choisissez pas Griffin pour quoi que ce soit ce trimestre, car vous ne le pouvez pas. Demandez l’accès si vous avez besoin de savoir si une personne peut s’en apercevoir, ou si votre feuille de route dépend de la couche d’interaction plutôt que de la couche de séquences.
• Surveillez l’écart, et non l’un ou l’autre des modèles. L’arrivée de Griffin transforme la comparaison la plus intéressante en une comparaison à venir : un système qui génère toute la conversation face à une suite qui génère toute la scène. Le premier produit qui fera les deux sera celui par rapport auquel il vaudra la peine de relire ceci.
Là où un routeur a sa place, et où il ne l'a pas
Aucun de ces modèles ne figure dans le catalogue OrcaRouter, et cela mérite d’être précisé avant toute autre chose dans cette section. Wan 2.7 est accessible via les propres plateformes d’Alibaba — Model Studio sur Alibaba Cloud et Qwen Cloud — ainsi que via des outils créatifs tiers qui l’ont intégré après son lancement ; Tavus Griffin n’est accessible que par formulaire de demande. Si l’un ou l’autre devient routable, ils apparaîtront au prix catalogue du fournisseur.
La partie d'un pipeline vidéo qui relève du routage, c'est le texte qui l'entoure. Les listes de plans, l'expansion de prompts, la génération de légendes, les résumés de revue qualité, et le travail de transcription ou de dialogue qui alimente une passe référence-vers-vidéo sont tous des appels texte, et ceux-ci tournent sur le même endpoint compatible OpenAI chez OrcaRouter que 200+ autres modèles au prix catalogue du fournisseur, avec 0 % de marge ajoutée, donc une baisse de prix d'un fournisseur est effective le jour même plutôt qu'après un cycle contractuel. Répartir un modèle bon marché sur une passe en masse et un modèle de pointe sur la passe finale est là un changement de configuration plutôt qu'une seconde relation fournisseur — ce qui est le même argument qui s'applique à la couche de génération, une fois que la couche de génération est quelque chose que vous pouvez appeler.
À surveiller : si les variantes de référence et d’édition de la suite Wan 2.7 survivent inchangées au retrait de Model Studio du 10 octobre, et si le garde-fou de sécurité de Griffin produit une fiche modèle publiée comportant un point de terminaison. Ces deux événements sont ce qui ferait passer cette comparaison d’un essai de conception à une décision d’approvisionnement.

