Carte de titre principale pour « Tavus Griffin vs MiniMax H3 » avec le sous-titre « Un modèle conversationnel duplex rencontre un générateur vidéo livré », au-dessus de quatre puces : Tavus Griffin, aperçu de recherche, testeurs uniquement ; MiniMax H3, poids ouverts, livré ; MiniMax H3, 0,08 $/s en 768P ; Griffin : pas d'API, pas de prix.
Guides & Insights

Tavus Griffin vs MiniMax H3 : un modèle conversationnel duplex rencontre un générateur vidéo déjà déployé

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Tavus Griffin et MiniMax H3 placent tous deux un humain en mouvement et qui parle à l'écran, et au-delà de cette première impression, ils n'appartiennent guère à la même catégorie de produits. Griffin est un Human Interaction Model — un système vidéo-vers-vidéo conçu pour tenir une conversation bidirectionnelle en temps réel, annoncé par Tavus en octobre 2026 et actuellement limité à un groupe restreint de premiers testeurs. MiniMax H3 est un générateur vidéo omni-modal : vous lui donnez un prompt ainsi que des références optionnelles d'image, de vidéo et d'audio, et il renvoie un clip terminé. L'un est évalué à huis clos ; l'autre est téléchargeable, sous licence et facturable depuis des mois. Cette différence — et non la résolution ou la fréquence d'images — est ce qui détermine lequel des deux a sa place dans votre stack.

Ce que chacun est réellement

Griffin est la tentative de Tavus de construire un modèle qui se comporte comme un participant plutôt que comme un moteur de rendu. L’entreprise le présente comme le premier Human Interaction Model, et l’architecture qu’elle a publiée scinde la tâche en deux : Continuous Conversational Modeling, qui décide ce que le persona devrait faire à chaque instant, et Audio-Visual Generation, qui diffuse la parole et le visage correspondants. Point crucial : il est full duplex — il regarde et écoute pendant qu’il parle, de sorte qu’il peut être interrompu, réagir au milieu d’une prise de parole et ne pas attendre un signal propre de fin de tour avant de répondre. Tavus le formule ainsi : les systèmes précédents apprenaient à générer des visages ; Griffin a été conçu pour apprendre le comportement conversationnel à partir des personnes.

MiniMax H3 est la génération Hailuo 3, publiée le 31 juillet 2026 et ouverte en source le 3 août 2026 sous la licence MiniMax H3 Community License, avec les variantes H3-Base-FL2VA et H3-Base-Ref2VA rendues publiques au grand jour. Il lit des références de texte, d'image, de vidéo et d'audio comme un contexte unifié et renvoie un clip de 4 à 15 secondes en 768P ou 2K avec audio stéréo natif, généré via un pipeline en trois étapes (H3-Context-IR, puis H3-Base en 768p, puis H3-Regenerate-2K). C'est un générateur doté d'une surface d'entrée inhabituellement large et d'une licence véritablement permissive — tout ce que Griffin n'est pas actuellement.

Les spécifications, côte à côte

Two-card board titled 'One Is a Product'. Left card, MiniMax H3: omni-modal video generator, Hailuo 3 generation; released 31 July 2026 with open weights on 3 August 2026; 4 to 15 seconds at 768P or 2K with native stereo audio; text, image, video and audio inputs in one context; $0.08 per second at 768P and $0.13 at 2K; hosted and billable today. Right card, Tavus Griffin: duplex Human Interaction Model, video to video; announced October 2026 as a research preview; 720p at 25 fps in 320-millisecond chunks; the live participant's video and audio as input; no published price; selected testers only, not for customer use.

Pourquoi « duplex » est le mot intéressant

Tout générateur vidéo, H3 compris, est jugé sur ce à quoi ressemble un clip une fois celui-ci terminé. Griffin, lui, est jugé sur ce qu’un clip ne peut pas montrer : ce qui se passe dans les 200 millisecondes qui suivent le moment où vous l’interrompez. C’est le problème que le cadre du Human Interaction Model pointe, et c’est pourquoi les chiffres phares de Tavus sont comportementaux plutôt que visuels.

Le chiffre le plus cité est que 48 % des personnes croyaient que Griffin était une personne réelle après un appel vidéo d'une minute — 26 participants sur 54 — contre 2,4 % pour la précédente pile de Tavus composée de Phoenix-4.5, Sparrow-2 et Raven-1, qui n'a convaincu qu'une personne sur 41. Tavus rapporte également que les personnes qui n'étaient pas convaincues avaient tendance à avoir des soupçons dans les 20 premières secondes, ce qui est un détail plus utile que le titre : cela signifie que l'illusion soit tient d'entrée de jeu, soit s'effondre d'entrée de jeu.

Le deuxième ensemble de chiffres provient du benchmark VideoFDB de NVIDIA, noté en septembre 2026, où Tavus affirme que Griffin s'est classé premier à un test indépendant d'IA en face-à-face. Du côté de la génération, Griffin a obtenu 3,83 contre 2,80 pour la référence la plus solide rapportée (une configuration Gemini 2.5 plus Anam), avec une référence humaine de 3,92 et un taux d'objectif de tâche de 62,8 %. En matière de perception, il a obtenu 3,73 contre 3,44 pour MiniCPM-o 4.5, 3,17 pour Gemini 2.5 Flash Native et 2,97 pour une configuration OpenAI gpt-realtime audio uniquement, contre une référence humaine de 4,20 et un taux d'objectif de tâche de 73,8 %, sur quinze modèles évalués. Tavus affirme également que Griffin devance de 37 % le meilleur système suivant pour ce qui est de réagir dans l'instant. Ce sont des chiffres rapportés par le fournisseur, reposant sur un benchmark construit par NVIDIA, et ils doivent être lus comme tels — mais les points de comparaison humains sont ceux qu'il faut retenir, car un score de 3,83 face à un score humain de 3,92 représente un écart bien plus faible que ce que la génération vidéo a historiquement montré.

Ce que vous pouvez acheter aujourd’hui

Ici, les deux modèles cessent complètement d'être comparables.

MiniMax H3 est un produit. Il est hébergé, facturé à la seconde de sortie générée, et ses variantes ouvertes se trouvent sur un hub de modèles, prêtes à être téléchargées. Si vous voulez un clip de quinze secondes, en 2K, avec audio stéréo, de quelque chose qui n’existe pas, vous pouvez en avoir un cet après-midi, et vous pouvez exécuter les poids vous-même si vous préférez ne pas les louer.

Tavus Griffin n’est pas un produit. Tavus est explicite dans sa note sur Griffin : Griffin-Lite, l’aperçu de recherche, est disponible dès aujourd’hui pour un groupe restreint de premiers testeurs ; une diffusion plus large d’un modèle plus puissant suivra ; et Griffin n’est pas encore sur la plateforme Tavus et n’arrivera que lorsque l’entreprise aura trouvé comment le publier en toute sécurité. C’est une franchise inhabituelle de la part d’un fournisseur au sujet de son propre résultat le plus spectaculaire, et cela compte pour la planification : vous ne pouvez pas inscrire Griffin dans une feuille de route produit comme dépendance, et vous ne pouvez pas lui attribuer un prix, parce qu’il n’y en a pas.

Donc, la question de planification honnête n'est pas « lequel est meilleur » mais « lequel existe à la couche dont j'ai besoin ».

Screenshot of Artificial Analysis's 'AA-Video-T2V v2.0' leaderboard, the Overall board for text-to-video, captured 2 October 2026: Wan 3.0 first at Elo 1,157, Utopai X (based on MiniMax H3) second at 1,150, Dreamina Seedance 2.5 third at 1,144, MiniMax H3 (768p) fourth at 1,139 and MiniMax H3 Max fifth at 1,134, with samples, release month and per-minute API pricing columns. The board lists MiniMax H3 and MiniMax H3 Max fourth and fifth with audio, though the with-audio filter itself is not applied in this capture.

Où OrcaRouter s'intègre

MiniMax H3 figure dans notre catalogue. La page du modèle se trouve à minimax/minimax-h3, et il est facturé comme le fournisseur le facture : 0,08 $ par seconde de sortie générée en 768P et 0,13 $ par seconde en 2K. OrcaRouter répercute les prix de liste du fournisseur avec 0 % de marge, ainsi, un changement de prix MiniMax apparaît sur notre fiche le jour même de son annonce, plutôt qu'au cycle de facturation suivant. Griffin ne figure pas au catalogue et n'y figurera pas tant que Tavus ne l'aura pas livré aux clients — nous n'hébergeons pas un modèle que nous ne pouvons pas servir, et un aperçu de recherche limité à des testeurs sélectionnés n'est pas quelque chose vers quoi un routeur peut router.

La conséquence pratique, c'est que l'un de ces deux modèles se trouve à une ligne de code de votre application, tandis que l'autre est un article de recherche accompagné d'un numéro de téléphone. Si vous acheminez déjà plusieurs modèles vidéo et de langage, la facturation à la seconde de H3 en fait aussi le genre de route qu'il vaut la peine de placer derrière un basculement automatique : une requête qui tombe sur un fournisseur saturé est réessayée auprès d'un fournisseur sain au lieu de remonter un délai d'attente, et un DSL de routage vous permet d'épingler les tâches 2K sur un fournisseur précis tout en laissant les brouillons 768P atterrir là où la capacité est la moins chère. La fusion de modèles est l'autre levier qui mérite d'être mentionné ici — le prix à la seconde de H3 est assez bas pour que le coût d'un modèle de texte chargé de réécrire et de redécouper un prompt avant la génération soit souvent inférieur aux secondes perdues lors d'une première tentative ratée.

Screenshot of the OrcaRouter model page for MiniMax-H3, showing the model id minimax/minimax-h3, the description 'omni-modal video generation model (the Hailuo 3 generation), released July 31, 2026', a price of $0.08 per second, p50 time to first token of 375 ms and p95 of 416 ms over seven days.

Là où la comparaison pourrait basculer

Trois choses changeraient cette comparaison, et seulement trois.

Premièrement, si Tavus met Griffin sur une API commerciale avec un tarif publié, tout le conversation versus clipcadre devient une véritable décision d'achat plutôt qu'une décision de planification, et le chiffre de 48 % en face-à-face commence à rivaliser directement avec la qualité de la production générative. Deuxièmement, si l'histoire en temps réel de H3 s'améliore — et MiniMax a multiplié les lancements avec agressivité — un générateur à la seconde capable de diffuser en continu émousserait l'avantage principal de Griffin. Troisièmement, si NVIDIA ou une autre partie neutre réexécute VideoFDB en y incluant H3 ou son successeur, l'affirmation selon laquelle Griffin est le premier en IA face-à-face cesse d'être infalsifiable. Tavus dit qu'il prévoit de publier Griffin très bientôt après que ses préoccupations de sécurité auront été traitées ; cette phrase constitue tout le calendrier.

L'essentiel

MiniMax H3 et Tavus Griffin ne sont pas rivaux pour l’instant, car un seul d’entre eux est achetable. H3 est un générateur omni-modal livré, à poids ouverts et facturé à la seconde, avec un prix publié et une fenêtre de sortie de 4 à 15 secondes ; Griffin est un modèle conversationnel duplex avec les meilleurs chiffres en face-à-face jamais publiés, aucune API, aucun prix, et une déclaration explicite de son propre fournisseur selon laquelle les clients ne peuvent pas encore l’utiliser. Si vous avez besoin de génération vidéo aujourd’hui, H3 est la réponse et elle se mesure en centimes par seconde. Si vous avez besoin d’un visage en temps réel qui peut être interrompu, surveillez Tavus — mais construisez d’abord le reste du produit, car la date de sortie est une phrase, pas une date.