
Tavus Griffin vs MiniMax H3 : un modèle conversationnel duplex rencontre un générateur vidéo déjà déployé
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 223 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Tavus Griffin et MiniMax H3 placent tous deux un humain en mouvement et qui parle à l'écran, et au-delà de cette première impression, ils n'appartiennent guère à la même catégorie de produits. Griffin est un Human Interaction Model — un système vidéo-vers-vidéo conçu pour tenir une conversation bidirectionnelle en temps réel, annoncé par Tavus en octobre 2026 et actuellement limité à un groupe restreint de premiers testeurs. MiniMax H3 est un générateur vidéo omni-modal : vous lui donnez un prompt ainsi que des références optionnelles d'image, de vidéo et d'audio, et il renvoie un clip terminé. L'un est évalué à huis clos ; l'autre est téléchargeable, sous licence et facturable depuis des mois. Cette différence — et non la résolution ou la fréquence d'images — est ce qui détermine lequel des deux a sa place dans votre stack.
Ce que chacun est réellement
Griffin est la tentative de Tavus de construire un modèle qui se comporte comme un participant plutôt que comme un moteur de rendu. L’entreprise le présente comme le premier Human Interaction Model, et l’architecture qu’elle a publiée scinde la tâche en deux : Continuous Conversational Modeling, qui décide ce que le persona devrait faire à chaque instant, et Audio-Visual Generation, qui diffuse la parole et le visage correspondants. Point crucial : il est full duplex — il regarde et écoute pendant qu’il parle, de sorte qu’il peut être interrompu, réagir au milieu d’une prise de parole et ne pas attendre un signal propre de fin de tour avant de répondre. Tavus le formule ainsi : les systèmes précédents apprenaient à générer des visages ; Griffin a été conçu pour apprendre le comportement conversationnel à partir des personnes.
MiniMax H3 est la génération Hailuo 3, publiée le 31 juillet 2026 et ouverte en source le 3 août 2026 sous la licence MiniMax H3 Community License, avec les variantes H3-Base-FL2VA et H3-Base-Ref2VA rendues publiques au grand jour. Il lit des références de texte, d'image, de vidéo et d'audio comme un contexte unifié et renvoie un clip de 4 à 15 secondes en 768P ou 2K avec audio stéréo natif, généré via un pipeline en trois étapes (H3-Context-IR, puis H3-Base en 768p, puis H3-Regenerate-2K). C'est un générateur doté d'une surface d'entrée inhabituellement large et d'une licence véritablement permissive — tout ce que Griffin n'est pas actuellement.
Les spécifications, côte à côte

Pourquoi « duplex » est le mot intéressant
Tout générateur vidéo, H3 compris, est jugé sur ce à quoi ressemble un clip une fois celui-ci terminé. Griffin, lui, est jugé sur ce qu’un clip ne peut pas montrer : ce qui se passe dans les 200 millisecondes qui suivent le moment où vous l’interrompez. C’est le problème que le cadre du Human Interaction Model pointe, et c’est pourquoi les chiffres phares de Tavus sont comportementaux plutôt que visuels.
Le chiffre le plus cité est que 48 % des personnes croyaient que Griffin était une personne réelle après un appel vidéo d'une minute — 26 participants sur 54 — contre 2,4 % pour la précédente pile de Tavus composée de Phoenix-4.5, Sparrow-2 et Raven-1, qui n'a convaincu qu'une personne sur 41. Tavus rapporte également que les personnes qui n'étaient pas convaincues avaient tendance à avoir des soupçons dans les 20 premières secondes, ce qui est un détail plus utile que le titre : cela signifie que l'illusion soit tient d'entrée de jeu, soit s'effondre d'entrée de jeu.
Le deuxième ensemble de chiffres provient du benchmark VideoFDB de NVIDIA, noté en septembre 2026, où Tavus affirme que Griffin s'est classé premier à un test indépendant d'IA en face-à-face. Du côté de la génération, Griffin a obtenu 3,83 contre 2,80 pour la référence la plus solide rapportée (une configuration Gemini 2.5 plus Anam), avec une référence humaine de 3,92 et un taux d'objectif de tâche de 62,8 %. En matière de perception, il a obtenu 3,73 contre 3,44 pour MiniCPM-o 4.5, 3,17 pour Gemini 2.5 Flash Native et 2,97 pour une configuration OpenAI gpt-realtime audio uniquement, contre une référence humaine de 4,20 et un taux d'objectif de tâche de 73,8 %, sur quinze modèles évalués. Tavus affirme également que Griffin devance de 37 % le meilleur système suivant pour ce qui est de réagir dans l'instant. Ce sont des chiffres rapportés par le fournisseur, reposant sur un benchmark construit par NVIDIA, et ils doivent être lus comme tels — mais les points de comparaison humains sont ceux qu'il faut retenir, car un score de 3,83 face à un score humain de 3,92 représente un écart bien plus faible que ce que la génération vidéo a historiquement montré.
Ce que vous pouvez acheter aujourd’hui
Ici, les deux modèles cessent complètement d'être comparables.
MiniMax H3 est un produit. Il est hébergé, facturé à la seconde de sortie générée, et ses variantes ouvertes se trouvent sur un hub de modèles, prêtes à être téléchargées. Si vous voulez un clip de quinze secondes, en 2K, avec audio stéréo, de quelque chose qui n’existe pas, vous pouvez en avoir un cet après-midi, et vous pouvez exécuter les poids vous-même si vous préférez ne pas les louer.
Tavus Griffin n’est pas un produit. Tavus est explicite dans sa note sur Griffin : Griffin-Lite, l’aperçu de recherche, est disponible dès aujourd’hui pour un groupe restreint de premiers testeurs ; une diffusion plus large d’un modèle plus puissant suivra ; et Griffin n’est pas encore sur la plateforme Tavus et n’arrivera que lorsque l’entreprise aura trouvé comment le publier en toute sécurité. C’est une franchise inhabituelle de la part d’un fournisseur au sujet de son propre résultat le plus spectaculaire, et cela compte pour la planification : vous ne pouvez pas inscrire Griffin dans une feuille de route produit comme dépendance, et vous ne pouvez pas lui attribuer un prix, parce qu’il n’y en a pas.
Donc, la question de planification honnête n'est pas « lequel est meilleur » mais « lequel existe à la couche dont j'ai besoin ».

Où OrcaRouter s'intègre
MiniMax H3 figure dans notre catalogue. La page du modèle se trouve à minimax/minimax-h3, et il est facturé comme le fournisseur le facture : 0,08 $ par seconde de sortie générée en 768P et 0,13 $ par seconde en 2K. OrcaRouter répercute les prix de liste du fournisseur avec 0 % de marge, ainsi, un changement de prix MiniMax apparaît sur notre fiche le jour même de son annonce, plutôt qu'au cycle de facturation suivant. Griffin ne figure pas au catalogue et n'y figurera pas tant que Tavus ne l'aura pas livré aux clients — nous n'hébergeons pas un modèle que nous ne pouvons pas servir, et un aperçu de recherche limité à des testeurs sélectionnés n'est pas quelque chose vers quoi un routeur peut router.
La conséquence pratique, c'est que l'un de ces deux modèles se trouve à une ligne de code de votre application, tandis que l'autre est un article de recherche accompagné d'un numéro de téléphone. Si vous acheminez déjà plusieurs modèles vidéo et de langage, la facturation à la seconde de H3 en fait aussi le genre de route qu'il vaut la peine de placer derrière un basculement automatique : une requête qui tombe sur un fournisseur saturé est réessayée auprès d'un fournisseur sain au lieu de remonter un délai d'attente, et un DSL de routage vous permet d'épingler les tâches 2K sur un fournisseur précis tout en laissant les brouillons 768P atterrir là où la capacité est la moins chère. La fusion de modèles est l'autre levier qui mérite d'être mentionné ici — le prix à la seconde de H3 est assez bas pour que le coût d'un modèle de texte chargé de réécrire et de redécouper un prompt avant la génération soit souvent inférieur aux secondes perdues lors d'une première tentative ratée.

Là où la comparaison pourrait basculer
Trois choses changeraient cette comparaison, et seulement trois.
Premièrement, si Tavus met Griffin sur une API commerciale avec un tarif publié, tout le conversation versus clipcadre devient une véritable décision d'achat plutôt qu'une décision de planification, et le chiffre de 48 % en face-à-face commence à rivaliser directement avec la qualité de la production générative. Deuxièmement, si l'histoire en temps réel de H3 s'améliore — et MiniMax a multiplié les lancements avec agressivité — un générateur à la seconde capable de diffuser en continu émousserait l'avantage principal de Griffin. Troisièmement, si NVIDIA ou une autre partie neutre réexécute VideoFDB en y incluant H3 ou son successeur, l'affirmation selon laquelle Griffin est le premier en IA face-à-face cesse d'être infalsifiable. Tavus dit qu'il prévoit de publier Griffin très bientôt après que ses préoccupations de sécurité auront été traitées ; cette phrase constitue tout le calendrier.
L'essentiel
MiniMax H3 et Tavus Griffin ne sont pas rivaux pour l’instant, car un seul d’entre eux est achetable. H3 est un générateur omni-modal livré, à poids ouverts et facturé à la seconde, avec un prix publié et une fenêtre de sortie de 4 à 15 secondes ; Griffin est un modèle conversationnel duplex avec les meilleurs chiffres en face-à-face jamais publiés, aucune API, aucun prix, et une déclaration explicite de son propre fournisseur selon laquelle les clients ne peuvent pas encore l’utiliser. Si vous avez besoin de génération vidéo aujourd’hui, H3 est la réponse et elle se mesure en centimes par seconde. Si vous avez besoin d’un visage en temps réel qui peut être interrompu, surveillez Tavus — mais construisez d’abord le reste du produit, car la date de sortie est une phrase, pas une date.
