Carte de titre principale pour Tavus Griffin, sous-titrée « Le premier modèle d'interaction humaine — annoncé le 1er octobre 2026 », au-dessus de trois pastilles indiquant « 48 % pensaient qu'il s'agissait d'une vraie personne », « Génération VideoFDB : 3,83 contre une référence humaine de 3,92 » et « Latence audio-vers-vidéo de 0,43 s ». Pied de page : « Tous les chiffres sont communiqués par le fournisseur et par NVIDIA ; Griffin-Lite est un aperçu de recherche, non disponible pour le grand public. » Le logo OrcaRouter est intégré en bas à droite.
Guides & Insights

Tavus Griffin : le premier modèle d'interaction humaine et les 48 % qui ont passé le test de Turing vidéo

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Vingt-six personnes sur cinquante-quatre ont terminé un appel vidéo d’une minute et ont déclaré que leur interlocuteur avait été une vraie personne. C’est le chiffre que Tavus met en avant pour Tavus Griffin, annoncé le 1er octobre 2026, et c’est un résultat véritablement frappant : selon le même protocole, l’ancienne pile de l’entreprise — Phoenix-4.5 assurant le rendu du visage, Raven-1 assurant la perception, Sparrow-2 gérant la dynamique des tours de parole — a produit une seule personne convaincue sur quarante et un, soit 2,4 %. Les deux lectures évidentes de ce bond sont toutes deux fausses, et les distinguer constitue l’essentiel de ce qui suit. Griffin n’est pas un meilleur moteur d’avatars, et ce n’est pas un produit que l’on peut acheter. C’est un aperçu de recherche appelé Griffin-Lite, ouvert à une sélection de testeurs de confiance, sans tarification, sans API publique et sans entrée dans un quelconque classement vidéo indépendant. Le fait que ces deux choses soient vraies en même temps est la véritable histoire.

Ce que mesure les 48 %, et ce qu'il ne mesure pas

L'étude est un test de Turing en face à face plutôt qu'une enquête de préférences, et le protocole mérite d'être énoncé avec précision, car c'est l'affirmation sur laquelle tout repose. Cinquante-quatre participants ont été recrutés via une plateforme de recherche indépendante et informés qu'ils seraient mis en relation avec un autre participant pour un appel vidéo d'une minute portant sur ce qu'ils attendaient avec impatience cette année. Leur partenaire était un PAL exécutant Griffin-Lite, générant un visage, une voix et des réponses en temps réel. Ce n'est qu'à la fin de l'enquête qu'on leur a demandé si l'idée leur avait traversé l'esprit que le partenaire n'était peut-être pas une personne réelle, et chaque participant a ensuite été informé qu'il s'agissait d'une IA. La session de comparaison a utilisé le même protocole sur l'ancienne pile technologique, avec quarante et un participants.

Les chiffres à l’appui comptent autant que le titre principal. Les croyants étaient confiants — 79 % en moyenne — et les sceptiques l’étaient aussi, à 81 %, ce qui est ce qu’une étude souhaite : personne ne devinait. Plus de la moitié des participants ont déclaré que la possibilité ne leur avait pas du tout traversé l’esprit pendant l’appel, et presque tous les membres de ce groupe ont ensuite affirmé que le partenaire était réel. Les participants qui avaient des doutes avaient tendance à douter dans les vingt premières secondes. C’est la phrase la plus inconfortable du rapport et celle qui devrait influencer votre lecture de la section sur la sécurité plus loin.

Sur une échelle de sept points, le modèle a obtenu en moyenne 5,4 pour paraître naturel, 5,6 pour paraître digne de confiance, 5,8 pour savoir si les participants auraient plaisir à reparler avec lui — une note qui se maintenait à 5,4 même chez les participants qui l'ont correctement identifié comme une IA — et 5,5 pour savoir s'ils avaient le sentiment que leur partenaire écoutait vraiment. La note la plus basse était de 4,9, pour savoir si la conversation se déroulait naturellement. Lues dans leur ensemble, ces notes dessinent un profil précis : Griffin-Lite est convaincant moment après moment, mais un peu moins convaincant lorsqu'on le considère comme un tout.

Le benchmark indépendant, et comment lire ses deux pistes

Les chiffres de qualité proviennent de VideoFDB de NVIDIA, un benchmark pour la conversation audio-visuelle full-duplex qui évalue un modèle sur deux pistes distinctes — la génération, c’est-à-dire si le modèle produit le bon comportement, et la perception, c’est-à-dire s’il comprend le moment — chacune avec sa propre grille d’évaluation et son propre classement. NVIDIA a construit le benchmark, conduit l’évaluation avec son propre juge selon les métriques publiées, et note la réponse sur une échelle de zéro à cinq. Tavus ne l’a pas exécuté, ce qui est la raison pour laquelle il faut le citer.

• Génération — Griffin-Lite a obtenu 3,83, le système publié le plus performant juste derrière a obtenu 2,80 (Gemini 2.5 avec Anam), et la référence humaine de vérité terrain est de 3,92. Cela représente 1,03 d’avance sur le meilleur système comparable et 0,09 en dessous de l’humain.

• Perception — 3,73 contre une référence humaine de 4,20, avec 3,44 pour la meilleure baseline rapportée, MiniCPM-o 4.5 dans sa configuration audio uniquement. Gemini 2.5 Flash Native a obtenu 3,17 et le gpt-realtime d'OpenAI a obtenu 2,97.

• Alignement du taux de prise de parole — 62,8 % en génération et 73,8 % en perception. Cela mesure à quel point les décisions du modèle quant au moment de parler correspondent au timing des conversations de référence, et Tavus décrit ces deux résultats comme les plus élevés de tous les systèmes du classement.

Deux mises en garde s’imposent sur ces chiffres avant que quiconque ne les répète. L’écart avec l’humain en génération est de 0,09 sur une échelle de cinq points jugée par un modèle de langage, ce qu’il vaut mieux interpréter comme « proche de l’humain sur ce barème » plutôt que comme « au niveau de l’humain ». Et la comparaison de perception n’est pas à périmètre égal : MiniCPM-o 4.5 et gpt-realtime sont évalués dans des configurations audio uniquement, tandis que Griffin lit aussi la vidéo. L’avance de 0,29 point sur une base de référence audio uniquement est réelle, mais une partie de ce qu’elle mesure correspond à la valeur du fait d’avoir des yeux.

La propre ligne de résumé du fournisseur — première au test indépendant de NVIDIA sur l’IA en face-à-face, avec 37 % d’avance sur la deuxième meilleure IA pour réagir dans l’instant — est une caractérisation des mêmes données plutôt qu’un constat distinct. Conservez les scores sous-jacents des pistes, pas le cadrage.

A screenshot of NVIDIA's VideoFDB project page, captured 2 October 2026: the heading "VideoFDB — Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents", the note that it is the first benchmark for full-duplex audio-visual-to-audio-visual conversation, the author list (Amrita Mazumdar, Seonwook Park, Rajarshi Roy, Nikhil Srihari, Shengze Wang, Yuhao Zhou, Julia Wang, Koki Nagano, Shalini De Mello) credited to NVIDIA, links to leaderboard, paper and Hugging Face dataset, and an abstract arguing that natural conversation is full-duplex.

Deux moteurs, tournant en même temps

L'affirmation architecturale est plus facile à évaluer que le marketing qui l'entoure, car elle porte sur ce qui s'exécute simultanément. Griffin est décrit comme deux systèmes fonctionnant en parallèle plutôt qu'un pipeline qui se transmet le relais entre les étapes.

Le premier est un moteur de modélisation conversationnelle continue. Il ingère l'audio et la vidéo de la personne et réévalue l'échange à intervalles réguliers inférieurs à la seconde — Tavus appelle ces mini-tours — en décidant à chacun d'eux s'il doit rester silencieux, émettre un signal, faire un retour minimal ou prendre le tour de parole. La sortie n'est pas seulement constituée des mots, mais d'un ensemble de contrôles expressifs portant le timing, la posture, l'expression du visage et les gestes. Tout l'intérêt de cette conception est qu'une décision prise au milieu d'une phrase se manifeste dans la voix et sur le visage au cours du même mini-tour, plutôt qu'après une passation de relais : c'est ce qui permet au modèle de s'arrêter lorsqu'on l'interrompt, d'acquiescer pendant qu'il écoute et de considérer une pause de réflexion comme autre chose que la fin d'un tour de parole.

Le second est un moteur de génération audiovisuelle qui transforme ces contrôles en son et en pixels simultanément : un générateur de parole en continu et un générateur vidéo en continu pilotés par les mêmes signaux, afin qu’un changement de ton et un changement d’expression tombent sur le même temps.

Une note d'honnêteté au sujet du contenu que Tavus a publié avec ceci, car on pourrait facilement le confondre avec une mesure. Le diagramme interactif d'un échange de neuf secondes est annoté dans le texte même de la page comme illustratif et explicitement non mesuré à partir d'une session réelle. La même mise en garde s'applique à la figure de timing comparant le mode tour à tour et le mode full-duplex. Ce qui est mesuré, c'est le chiffre de latence plus bas.

Dans la pile de streaming

Le côté audio repose sur un codec appelé Tavec, un autoencodeur convolutif qui transforme de l'audio à 48 kHz en une représentation latente continue de 40 valeurs par trame, à 100 trames par seconde, sans livres de codes. Son décodeur est entièrement causal : il conserve donc son état d'un segment à l'autre et émet des paquets audio d'une taille aussi réduite que 10 ms, sans anticipation. Une minute de parole correspond à 6 000 trames latentes plutôt qu'à 2,88 millions d'échantillons bruts, ce qui rend la séquence suffisamment légère pour que le transformeur de parole la prédise plus vite que le temps réel. Le générateur de parole proprement dit est un transformeur de diffusion autorégressif qui se conditionne sur un préfixe de locuteur encodé — une voix peut être clonée à partir d'une dizaine de secondes d'audio — et génère un segment latent à la fois au fur et à mesure que les contrôles arrivent, de sorte que la lecture commence avant que l'énoncé soit terminé.

Le volet vidéo part du même postulat : une forte compression temporelle est ce qui rend un modèle de diffusion assez rapide pour tenir une conversation. Un générateur autorégressif à quelques pas prend une photo de référence, l’audio en streaming et les contrôles en streaming, et produit un latent par pas à raison de trois pas de diffusion par latent. Un VAE compresse le temps d’un facteur huit, donc à 25 fps un latent correspond à huit images, soit 320 ms de vidéo 720p. Les latents plus anciens sont conservés à une résolution progressivement plus faible afin que les longs rollouts restent abordables. Le résultat est un générateur qui émet de la 720p par tranches de 320 ms en temps réel.

Y parvenir a nécessité une distillation en trois étapes à partir d’un grand enseignant de diffusion bidirectionnel à plusieurs étapes : la distillation par correspondance de distributions (Distribution Matching Distillation) vers un étudiant à quelques étapes, le teacher forcing pour convertir cet étudiant en un modèle autorégressif qui génère un latent à la fois, et enfin un entraînement avec self-forcing sur l’historique généré par le modèle lui-même, plus un mécanisme ajouté agissant sur les trames de l’historique afin que les longs déroulements ne dérivent pas. Cette troisième étape est celle qui traite le mode de défaillance que cette classe de modèles présente habituellement — un visage qui se dégrade, ou un arrière-plan qui dérive lentement, au fil d’une conversation qui dure plusieurs minutes.

Le chiffre de latence, qui est la véritable promesse du produit

Face à quatre modèles de diffusion de streaming publiés dans un contexte audio-vers-vidéo, où chaque modèle reçoit de la parole et une image de référence et doit produire le visage parlant, le générateur de Griffin-Lite a affiché une latence audio-vers-vidéo réelle moyenne de 0,43 seconde sur des H100 — le temps entre l'arrivée d'un extrait audio et le moment où la vidéo en montre l'effet. Tavus présente cela comme la moitié de la méthode la plus rapide suivante. Il annonce aussi la première place sur la qualité perceptuelle DOVER et FID, ainsi que sur THEval, un cadre d'évaluation des têtes parlantes, et la deuxième place sur la confiance de synchronisation labiale LSE-C avec 7,27, derrière une baseline — le fournisseur précisant que le LSE-C récompense un mouvement marqué de la bouche, y compris au-delà du point où cela paraît naturel.

Toutes ces mesures sont celles de Tavus lui-même, réalisées par rapport aux références qu'il a choisies. Elles sont utiles parce qu'elles sont précises et parce que le chiffre de 0,43 seconde est le genre de nombre qui tient ou ne tient pas la route lors d'un test en direct. Elles ne sont pas indépendantes, et les seuls scores indépendants de cet article sont les deux pistes VideoFDB ci-dessus.

A screenshot of Tavus's own Griffin announcement page at tavus.io/griffin, captured 2 October 2026: the heading "INTRODUCING GRIFFIN", the strapline "The First Human Interaction Model", the description of Griffin as the world's first Human Interaction Model that listens while watching expressions and pauses, and the byline "By: Hassaan Raza, Ioannis Patras, Head of Tavus Research Team".

Pourquoi n'y a-t-il pas de prix à comparer ?

Griffin-L est disponible aujourd’hui pour un groupe sélectionné de premiers testeurs, sous forme d’aperçu de recherche, une diffusion plus large d’une version plus performante devant suivre. Il ne sera pas utilisable par les clients pour le moment. L’accès se fait au moyen d’un formulaire de demande. Il n’est pas sur la plateforme Tavus, et la phrase de clôture de l’entreprise dans l’annonce le dit clairement : Griffin n’est pas encore sur la plateforme Tavus, et le sera une fois que Tavus aura trouvé comment le déployer en toute sécurité. Tout ce qu’un acheteur comparerait normalement — tarification à la seconde ou à la requête, identifiant de modèle, limites de débit, SLA, liste de régions — n’existe pas encore. Tavus oriente quiconque souhaite développer aujourd’hui vers les modèles que 150 000 développeurs et entreprises utilisent déjà, à savoir les trois prédécesseurs, et non Griffin.

Ce n'est pas un détail technique à reléguer en note de bas de page. Cela change à quoi sert ce modèle, ici et maintenant. C'est une cible d'évaluation pour les équipes dont le produit dépend de la capacité d'une personne à faire la distinction, et un signal sur la direction que prend la feuille de route du fournisseur. Ce n'est pas une base sur laquelle bâtir un parcours client ce trimestre.

La barrière de sécurité est le plan de publication

La chose la plus intéressante que Tavus ait écrite à propos de Griffin ne concerne pas le modèle. C’est l’aveu que les mêmes propriétés qui font d’un modèle d’interaction humaine une meilleure interface le rendent aussi plus apte à tromper quelqu’un en lui faisant croire qu’il ne s’agit pas d’une IA, que davantage de travail d’alignement et de sécurité est nécessaire avant une mise à disposition sûre, et que l’entreprise travaille sur des fonctionnalités de divulgation et avec des organisations sur les évaluations de sûreté de l’IA. Étant donné que près de la moitié d’un échantillon en direct n’a pas pu le distinguer, et que ceux qui y sont parvenus l’ont, pour la plupart, compris en moins de vingt secondes, un mécanisme de divulgation qui résiste à une conversation ordinaire n’est pas un simple petit plus.

Deux choses modifieraient substantiellement cet article. Une fiche de modèle publiée avec un endpoint et un prix ferait passer Griffin du statut de résultat de recherche à celui de question d’approvisionnement. Et une entrée dans un classement vidéo indépendant — avec la réserve que ces classements notent des clips courts selon une préférence par paires et ne sont pas conçus pour noter une conversation en direct, de sorte que l’inadéquation pourrait être permanente plutôt que temporaire — donnerait aux affirmations sur la latence et la qualité une vérification externe. Jusqu’à ce que l’un de ces éléments se concrétise, les pistes VideoFDB sont les preuves les plus solides disponibles et elles comportent un écart humain de 0,09 et 0,47 point respectivement.

L’argument contraire qu’il vaut la peine de peser est qu’une exécution de benchmark n’est pas un déploiement. Le protocole de NVIDIA impose à chaque système la même tâche d’alternance des tours de parole et le même juge ; il ne dit rien sur le comportement de la neuvième heure d’un appel, sur ce qui se passe lorsque deux personnes se coupent la parole pendant une minute entière, ni sur la question de savoir si les contrôles expressifs se dégradent sur un visage que la photographie de référence a mal rendu. Tavus présente l’entraînement spécifique à la dérive — l’étape d’auto-forçage et le mécanisme d’historique — comme la solution à exactement ce problème, et les rapports sont tout ce qu’un lecteur a jusqu’à ce que quelqu’un d’extérieur à Tavus mène une longue session et la publie. Considérez le benchmark comme la meilleure preuve disponible plutôt que comme un résultat de déploiement.

Quoi construire autour en attendant

La question pratique, pour une équipe qui veut quelque chose comme ça aujourd'hui, est de savoir quelles parties de la pile sont déjà achetables. Une interface vidéo conversationnelle est une chaîne — reconnaissance vocale, modèle de langage, synthèse vocale et, dans le cas de Tavus, un modèle de rendu — et les trois premières sont des produits banalisés. Celles-ci se trouvent derrière un seul point de terminaison compatible OpenAI chez OrcaRouter, avec plus de 200 modèles sur la même clé et le prix catalogue du fournisseur répercuté avec 0 % de marge, de sorte qu'une baisse de prix d'un fournisseur est effective ici le jour même, plutôt qu'après un cycle contractuel. Si vous assemblez un pipeline d'interaction et souhaitez garder la couche de génération ouverte jusqu'à ce que Griffin, ou quelque chose du même genre, devienne un véritable produit, c'est là que le remplacement coûte un changement de configuration plutôt qu'une migration. Tavus Griffin lui-même n'est pas un modèle routé ici, et il ne le sera pas tant qu'il restera un aperçu derrière un formulaire de demande.

Ce qui mérite d’être suivi, ce n’est pas une nouvelle bande de démonstration. C’est de savoir si les outils de divulgation que Tavus développe seront publiés, et si un second groupe de recherche reproduit le protocole en face-à-face. Une réussite au test de Turing de cette ampleur est exactement le genre de résultat qui nécessite qu’un second laboratoire l’exécute.

An explainer scoreboard for Tavus Griffin with six rows: Status: research preview; Pricing: none published; Model type: human interaction model; VideoFDB generation: 3.83 of 5; VideoFDB perception: 3.73 of 5; Open issue: disclosure. Footer: "NVIDIA VideoFDB per Tavus and NVIDIA, September 2026." The OrcaRouter logo is composited bottom-right.