Une carte héro pour « Tavus Griffin vs HeyGen Video 1 » avec trois pastilles indiquant « HeyGen Video — 0,01 $ par seconde », « Griffin — aucun prix, demander l’accès » et « HeyGen Video — 5 à 15 secondes en 768p », au-dessus de six lignes : Lancement de HeyGen : 30 septembre 2026 ; Annonce de Griffin : 1er octobre 2026 ; Prix de HeyGen : 0,01 $ par seconde ; Prix de Griffin : non publié ; Sortie de HeyGen : clips de 5 à 15 secondes ; Sortie de Griffin : une session en direct. Pied de page : « HeyGen Video a été lancé le 30 septembre 2026 ; Griffin a été annoncé le 1er octobre 2026 en tant qu’aperçu. »
Guides & Insights

Tavus Griffin vs HeyGen Video 1 : trente-six heures d'écart, et un seul est achetable

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Deux lancements ont eu lieu à moins de trente-six heures d'intervalle dans le même coin du marché, et le calendrier est l'élément le plus intéressant de ce duo. HeyGen Video a été mis en ligne le 30 septembre 2026 au tarif de 0,01 $ par seconde pendant tout le mois d'octobre, ajusté à partir de MiniMax H3 et livré sous l'identifiant heygen-video-1 Tavus Griffin a été annoncé le 1er octobre 2026 avec une étude en face à face en direct dans laquelle 26 des 54 participants croyaient que leur interlocuteur était une personne réelle, et il n'est disponible que pour une sélection de testeurs de confiance, sur demande via un formulaire, sans identifiant, sans endpoint et sans prix. Les deux visent à générer un être humain convaincant. La raison honnête de comparer Tavus Griffin et HeyGen Video 1 n'est pas qu'un acheteur choisirait entre eux — aujourd'hui, un seul des deux peut être acheté — mais que la différence explique à quoi chacun a été conçu, et ce que vaut réellement une seconde d'humain généré.

L'un vend un clip, l'autre vend une conversation

HeyGen Video est un modèle vidéo polyvalent qui se trouve être exceptionnellement doué pour les personnes. Il accepte un prompt, ou un prompt plus une image, ou un prompt plus jusqu'à neuf images de référence, trois vidéos de référence et trois clips audio de référence, et renvoie un clip d'une durée de 5 à 15 secondes en 480p ou 768p, à 24 fps, avec un audio AAC en stéréo à 32 kHz transportant des dialogues, une ambiance et des effets générés. Trois modes couvrent le conditionnement — text_to_video, image_to_video et reference_to_video, qui est le mode par défaut — et l'ordre de la liste devient le libellé auquel vous vous référez dans le prompt, donc la première entrée de reference_images est <Picture 1>. Les champs inconnus de la requête sont rejetés plutôt qu'ignorés, et une graine est un entier 32 bits non signé qui rend un plan reproductible lorsque vous la fixez et modifiez une clause à la fois. C'est un outil de production avec une enveloppe déterministe.

Griffin inverse presque chacune de ces propriétés. Il génère du 720p par segments de 320 ms à 25 fps à partir d'une seule photographie de référence et lit chaque segment au fur et à mesure qu'il le décode, de sorte qu'il n'y a ni durée de clip à spécifier ni fichier à renvoyer. Un moteur de modélisation conversationnelle continue ingère l'audio et la vidéo et réévalue l'échange à des intervalles inférieurs à la seconde, en choisissant de rester silencieux, de signaler, de backchanneller ou de prendre la parole, et ses contrôles expressifs pilotent en parallèle un générateur de parole en flux et un générateur vidéo en flux. Une décision prise en milieu de phrase se manifeste dans la voix et le visage au cours du même mini-tour. Vous n'écrivez pas de prompt ; vous lui parlez, et il réagit à une pause, à un regard détourné ou à une interruption.

C'est pourquoi les deux ne sont pas des substituts, même si tous deux génèrent un humain. On demande à HeyGen Video à quoi ressemble un moment décrit. On demande à Griffin ce qui doit se passer ensuite.

Ce que coûte chaque seconde, sur celle où l'on peut acheter des secondes

Le prix de lancement de HeyGen Video est de 0,01 $ par seconde jusqu'en octobre, et la propre communication de HeyGen présente cela comme une réduction de 50 % par rapport à un tarif standard de 0,02 $. Le tableau des coûts figurant sur la même page, avec une note de bas de page indiquant qu'il s'agit du prix catalogue par seconde en 768p avec audio avant les promotions de lancement, l'établit à 0,03 $. Cela représente un écart de 50 % entre le texte et le tableau au sein même du support de lancement d'un fournisseur, et tant que HeyGen ne publie pas de page de tarification API, l'interprétation prudente est que 0,01 $ est confirmé puisqu'il s'agit du tarif en vigueur, et que le montant après octobre se situe quelque part entre 0,02 $ et 0,03 $.

Faites le calcul sur mille secondes — cent clips de dix secondes —, l’unité dans laquelle une équipe travaillant en volume pense réellement :

• Vidéo HeyGen en octobre — 10 $ à 0,01 $ par seconde.

• HeyGen Video après octobre — 20 $ à 0,02 $, ou 30 $ au 0,03 $ du graphique.

• MiniMax H3, le modèle de base à partir duquel il a été affiné — 80 $ au prix catalogue de MiniMax, soit 0,08 $ par seconde.

• Kling 3.0 Pro — 168 $ à 0,168 $ par seconde.

• Veo 3.1 — 400 $ à 0,40 $ par seconde.

La raison pour laquelle l’arithmétique est l’argument phare du lancement de HeyGen, c’est le taux de rejet. Les équipes qui produisent des versions courtes pour les réseaux sociaux, des variantes publicitaires et des boucles produit génèrent bien plus qu’elles ne livrent, et à dix cents la tentative de dix secondes, l’économie du rejet des candidats change entièrement de nature. Le hic, c’est le plafond : du 768p à 24 i/s n’est pas un format de livraison 2K, et MiniMax H3 atteint la 2K via un module de régénération distinct sur l’API hébergée de MiniMax, à 0,13 $ par seconde, sans équivalent sur HeyGen Video. Si votre cible de livraison dépasse 768p, la seconde bon marché n’est pas celle qu’il vous faut.

La colonne de Griffin dans cette liste est vide, et pas de manière encourageante. Tavus n’a pas publié de tarif, car Griffin-Lite est un aperçu de recherche dont sa propre annonce indique qu’il ne sera pas disponible pour une utilisation par les clients pour le moment et qu’il ne figure pas sur la plateforme Tavus. Dans le cadre d’un modèle par millier de secondes, il n’y a rien à inscrire. Quiconque cite un chiffre pour Griffin l’invente.

Les chiffres de qualité, et qui évalue

Aucun de ces deux modèles ne dispose d’un score indépendant, ce qu’il vaut la peine de préciser d’emblée, car les deux fournisseurs ont des graphiques.

Celui de HeyGen est un tableau Elo, avec HeyGen Video normalisé à 1000, puis Dreamina Seedance 2.0 à 955, la famille H3 Max s'étendant de 952 à 860, Kling 3.0 Pro à 857 et Veo 3.1 à 744. La note de bas de page fait l'essentiel : les scores proviennent d'un ensemble d'évaluation interne de requêtes d'Artificial Analysis Arena avec 4 800 votes, et le score de HeyGen lui-même est normalisé à 1000 pour simplifier la comparaison. Qu'un fournisseur se normalise au sommet de son propre graphique est un choix de présentation, pas une preuve qu'il est en tête. L'espacement relatif en dessous est la partie informative.

Plus utile est le comparatif direct, le seul endroit où HeyGen se mesure à quelque chose qu'elle n'a pas développé. HeyGen affirme que des testeurs en aveugle ont préféré son modèle au H3 Max post-train répertorié dans 55,8 % des comparaisons sur 650 votes, avec une fourchette de 49 à 62 %. Cette fourchette est le détail honnête : à l'extrémité basse, elle est à cheval sur 50 %, donc, d'après les chiffres mêmes du fournisseur, la préférence sur ce rival n'est pas clairement distinguée du bruit. La ventilation par axe est mitigée d'une manière qui ressemble à un profil d'échec précis — 65 % pour la fidélité à l'image source et 66 % pour le timing, contre 43 % pour la cohérence et 45 % pour la musique.

Les chiffres de Griffin proviennent d’un instrument construit par quelqu’un d’autre, et c’est là la différence qui compte. VideoFDB de NVIDIA est un benchmark pour la conversation audio-visuelle en duplex intégral, noté sur deux axes, et NVIDIA l’a construit et conduit l’évaluation avec son propre juge selon une grille d’évaluation publiée. Griffin-Lite a obtenu 3,83 sur 5 en génération face à une référence humaine de 3,92 et 2,80 pour le système publié le mieux classé suivant, et 3,73 en perception face à une référence humaine de 4,20. Tavus rapporte aussi 0,43 seconde de latence réelle audio-vers-vidéo pour le générateur face à quatre références publiées de diffusion en streaming sur H100s. Les réserves s’appliquent toujours — un écart de 0,09 point avec l’humain sur une grille de cinq points jugée par un modèle de langage est « proche », pas « égal », et une partie de l’avance en perception est mesurée par rapport à des systèmes fonctionnant sans entrée vidéo — mais l’évaluateur n’est pas le fournisseur.

• Des scores de qualité indépendants — aucun des deux n’en a. HeyGen Video n’apparaît sur aucun des trois tableaux vidéo d’Artificial Analysis au 2 octobre 2026, et Griffin non plus. Griffin pourrait bien ne jamais en avoir : le vote de préférence par paires sur de courts extraits ne peut pas évaluer une conversation en direct.

Les mêmes classements comportent bel et bien le modèle de base. MiniMax H3 occupe la 4e place en texte-vers-vidéo (avec audio) avec un score Elo de 1 139 et la 2e place en image-vers-vidéo avec 1 181, les deux à 4,80 $/min — le post-entraînement de HeyGen entre donc en compétition sur un substrat qu’une arène indépendante classe déjà près du sommet, ce qui constitue l’argument le plus fort en sa faveur : HeyGen ne l’a pas publié elle-même.

A screenshot of the top of Artificial Analysis's text-to-video-with-audio board, captured 2 October 2026: Wan 3.0 first at Elo 1,157 and $12.00/min, Utopai X (based on MiniMax H3) second at 1,150, Dreamina Seedance 2.5 third at 1,144, MiniMax H3 (768p) fourth at Elo 1,139 with 7,496 votes and $4.80/min, MiniMax H3 Max (based on MiniMax H3) fifth at 1,134 with 5,510 votes, and FLUX 3 sixth at 1,127, with release months and per-minute API pricing columns visible.

Les deux sont bon marché ou sans prix pour la même raison.

Le fait structurel qui sous-tend les deux lancements, c'est qu'il est devenu bon marché de fabriquer un humain convaincant, et l'avantage de coût d'aucune des deux entreprises ne vient de ce qu'elle vend.

HeyGen Video est un post-entraînement de MiniMax H3, que MiniMax a publié avec des poids disponibles sous sa propre licence communautaire. Cela a transformé H3 en un substrat que d'autres entreprises peuvent spécialiser et revendre, et HeyGen est le deuxième produit à le faire en cinq semaines pour un secteur différent — la vidéo d'entreprise, les démonstrations de produits, la formation, les visites immobilières. Ce schéma explique pourquoi HeyGen peut pratiquer un prix inférieur à celui de la base : il ne supporte pas le coût du modèle de base, et la base est la publication open-weights de quelqu'un d'autre.

Griffin est le pari inverse. Tavus a construit tout le système — le codec, le générateur de parole en flux, le générateur vidéo en flux, le modèle conversationnel — autour de l’interaction elle-même, en distillant un grand enseignant de diffusion bidirectionnelle en un générateur autorégressif à quelques étapes, en trois phases, afin que les longs déroulements ne dérivent pas. C’est de la recherche coûteuse, sans base ouverte sur laquelle s’appuyer, et c’est plausiblement l’une des raisons pour lesquelles la sortie est à accès restreint : il n’y a pas de substrat bon marché en dessous pour amortir.

Les deux entreprises arrivent elles aussi au même point inconfortable, mais par des chemins différents. La documentation de HeyGen elle-même énumère ce dans quoi le modèle est le moins bon, ce qui est rare et vaut la peine d’être lu : les longs textes à l’écran, les mouvements organiques doux comme ceux des pétales, du papier et des cheveux, et le travail des mains en gros plan, comme l’assemblage ou la manipulation d’équipements. Il est meilleur sur des plans courts et contenus — un sujet, un lieu, une action, une caméra fixe ou à peine en mouvement. La limitation de Griffin n’est pas une liste de modes de défaillance, mais un problème de sécurité non résolu : Tavus déclare sans détour que les propriétés qui font d’un modèle d’interaction humaine une meilleure interface le rendent aussi meilleur pour persuader quelqu’un qu’il parle à un humain, et qu’elle retient l’aperçu pendant qu’elle développe des mécanismes de divulgation.

Ce qu’un acheteur peut réellement faire aujourd’hui

HeyGen Video est désormais appelable. Il s'exécute via POST /v3/models/videos avec un en-tête x-api-key, uniquement sur les clés API payantes, avec des liens de téléchargement signés et expirants — le polling les rafraîchit donc — et des callbacks tentés une seule fois par job, ce que HeyGen vous indique lui-même de considérer comme une optimisation de latence plutôt qu'une garantie. Si vous le testez ce mois-ci, la seconde promotionnelle à 0,01 $ est en vigueur, le plafond de sortie est de 768p, et le mode d'amélioration du prompt est un véritable levier de coût : turbo par défaut, quality pour une passe plus longue, disabled pour envoyer votre texte tel quel.

Griffin n'est pas appelable. L'accès passe par un formulaire de demande et prend la forme d'un aperçu de recherche. Il n'existe ni clé, ni identifiant, ni point de terminaison, ni SLA, et la seule déclaration publiée concernant sa disponibilité est qu'elle viendra une fois que Tavus aura trouvé comment le publier en toute sécurité.

Un point commun entre les deux, c’est qu’aucun des deux n’est un modèle qu’un routeur peut vous aider à atteindre, et dans le cas de Griffin, il s’agit d’un problème de catégorie plutôt que d’un problème temporaire — une session en temps réel en duplex intégral n’est pas un appel requête-réponse. Ce à quoi un routeur aide dans l’un ou l’autre pipeline, c’est la couche autour de la vidéo. L’expansion de prompt, l’inventaire d’images de référence, les descriptions de plans, la génération de légendes et la synthèse des retours sont tous des appels texte, et ceux d’OpenAI, Google et des autres se trouvent sur le catalogue OrcaRouter derrière un point de terminaison compatible OpenAI, avec plus de 200 modèles sur la même clé, au prix catalogue du fournisseur, avec 0 % de marge ajoutée, donc un changement de prix d’un fournisseur est effectif le jour même. En ce qui concerne le modèle vidéo lui-même, il y a un fait utile : MiniMax H3 — le modèle de base à partir duquel HeyGen Video a été affiné, et dont le prix par seconde est cassé par les 0,01 $ de HeyGen — est routé ici sous minimax/minimax-h3 à 0,08 $ par seconde, avec la 2K à 0,13 $. HeyGen Video lui-même n’est pas dans notre catalogue, et Griffin non plus ; les deux sont servis via les API de leurs propres fournisseurs et plusieurs plateformes tierces.

A screenshot of OrcaRouter's own model page for MiniMax-H3, captured 2 October 2026, showing the model id minimax/minimax-h3 labelled "text + image + video + audio", an Output type of video, a p50 time-to-first-token of 375 ms, and the OrcaRouter navigation and pricing panels alongside.

Lequel, et pour qui ?

• Utilisez HeyGen Video si le livrable est une séquence courte, contenue, centrée sur la personne, avec son intégré, et que vous pouvez vous contenter de 768p à 24 fps. Budgétisez le tarif post-octobre quelque part entre 0,02 $ et 0,03 $ par seconde plutôt que le tarif promotionnel de dix cents, et testez longuement le texte à l'écran et le travail des mains en gros plan avant d'y engager un flux de travail, car HeyGen vous a déjà dit que c'est là que ça casse.

• Ne faites pas de plans en fonction de Griffin. Demandez l’accès si votre question est de savoir si une personne peut distinguer un humain généré d’un humain réel lors d’un appel d’une minute, ou si vous avez besoin de voir où se dirige une couche d’interaction en temps réel avant d’engager une feuille de route sur des clips rendus.

• Surveillez la question de la divulgation, car c'est la seule chose qui fera bouger les deux. Les clients de HeyGen Video ont une réponse simple à disposition — le modèle est un post-entraînement d'une base à poids ouverts et la sortie est un fichier à la provenance connue — tandis que Tavus retient un modèle précisément parce qu'elle n'en dispose pas encore. L'entreprise qui publiera le meilleur mécanisme de divulgation aura réglé le problème le plus précieux.

A two-column scoreboard titled "Tavus Griffin vs HeyGen Video 1 — the scoreboard". Left column "Tavus Griffin": Status: research preview; Price: none published; Output: live session; Resolution: 720p at 25 fps; Clip length: none - a session; Independent score: none. Right column "HeyGen Video 1": Status: live 30 September 2026; Price: $0.01 per second; Output: video file; Resolution: 768p at 24 fps; Clip length: 5 to 15 seconds; Independent score: none yet. Footer: "HeyGen price per HeyGen's launch page, October 2026. Neither has an independent score."