Carte de titre principale pour « Tavus Griffin vs Muse Realtime Avatar » avec le sous-titre « Deux visages de 2026, deux problèmes différents », au-dessus de quatre pastilles : Griffin : 48 % l’ont cru humain ; Griffin : 0,43 s de l’audio à la vidéo ; Muse Realtime Avatar : 870 ms jusqu’au premier octet ; Muse Realtime Avatar : 448 x 768 à 25 fps.
Engineering & Research

Tavus Griffin vs Muse Realtime Avatar : deux visages de 2026, deux problèmes différents

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Tavus Griffin et Muse Realtime Avatar existent tous les deux pour résoudre le même problème embarrassant — un modèle de langage qui sait parler mais n’a pas de visage — et ils s’y attaquent par deux extrémités opposées. Griffin est un modèle d’interaction humaine vidéo-vers-vidéo qui observe un participant via une caméra et génère l’autre côté de la conversation en temps réel, et il a été annoncé par Tavus en octobre 2026 comme aperçu de recherche destiné à des testeurs sélectionnés. Muse Realtime Avatar est la couche d’incarnation de Meta pour son agent Muse, annoncée à Meta Connect le 23 septembre 2026, et elle prend l’audio et le transforme en un portrait parlant synchronisé. Ni l’un ni l’autre ne peut être acheté. La différence réside dans ce que chacun cherche à bien faire, et elle apparaît dès que l’on demande ce que chaque modèle reçoit réellement en entrée.

La version courte

• L'entrée de Griffin est la personne à l'autre bout — la vidéo et l'audio d'un participant en direct, qu'il doit lire, auxquels il doit répondre et qui doivent pouvoir l'interrompre.

• L'entrée de Muse Realtime Avatar est la parole de l'agent lui-même — un flux de tokens provenant de Muse Realtime Voice qu'il convertit en un visage correspondant.

• Tavus mesure Griffin selon que les gens y croient ou non, et publie un chiffre de 48 % issu d’un appel vidéo d’une minute.

• Meta mesure Muse Realtime Avatar à sa capacité à tenir le rythme, et publie 870 millisecondes entre la fin du tour et le premier octet.

• Ni l’un ni l’autre ne dispose d’une API publique, d’un prix publié, ni d’une date de disponibilité générale.

Lisez ces quatre lignes ensemble et la forme que prend le désaccord est évidente. Tavus optimise pour la croyance de l’autre personne. Meta optimise pour l’horloge.

Board titled 'Two Faces, Two Measurements'. Tavus Griffin column: input the live participant, video and audio; optimises for whether the other person believes it; headline figure 48% of 54 participants in a one-minute video call; output 720p duplex video at 25 fps; latency 0.43 s average audio to video on H100s; access research preview, selected testers only. Muse Realtime Avatar column: input Muse Realtime Voice's own speech tokens; optimises for the clock, end of turn to first frame; headline figure 870 ms from end of turn to first byte; output 448x768 portrait at 25 fps; capacity 12 concurrent sessions on one NVIDIA GB200; access research post only, no API.

Griffin : le modèle auquel il faut croire

Le positionnement de Tavus est que Griffin est le premier modèle d'interaction humaine, et l'architecture derrière cette affirmation est un système en deux parties combinant la modélisation conversationnelle continue et la génération audiovisuelle. La première partie est comportementale : elle décide ce que le persona devrait faire d'un moment à l'autre, en utilisant ce qu'il peut voir et entendre. La seconde partie est le rendu, et Tavus la divise à nouveau en génération de parole en streaming et génération vidéo en streaming.

Les chiffres que Tavus met en avant ne sont pas des chiffres de débit. Dans une étude menée par l'entreprise avec l'Université Queen Mary de Londres, 26 des 54 participants — 48 % — pensaient que Griffin était une personne réelle après un appel vidéo d'une minute, contre 1 sur 41 (2,4 %) pour son précédent stack de génération de visages Phoenix-4.5, de prise de parole Sparrow-2 et de vision Raven-1. Les participants qui n'ont pas été dupés doutaient généralement dans les 20 premières secondes. Sur le benchmark VideoFDB de NVIDIA, évalué en septembre 2026, Tavus rapporte Griffin en première position pour l'IA en face-à-face avec un score de génération de 3,83 contre 2,80 pour la base de référence la plus forte rapportée et 3,92 pour une référence humaine, et un score de perception de 3,73 contre 3,44 pour la meilleure base de référence rapportée et 4,20 pour une référence humaine. Ces chiffres sont rapportés par le fournisseur et spécifiques au benchmark, mais ce sont les points de comparaison humaine qui sont intéressants.

L'ingénierie qui sous-tend ces chiffres repose sur un codec appelé Tavec et un transformateur de diffusion autorégressif. Tavec fonctionne à 48 kHz avec 40 valeurs par trame à 100 trames par seconde, sans codebooks, avec un décodeur entièrement causal et des paquets aussi petits que 10 millisecondes — conçu pour qu'un visage puisse commencer à bouger avant qu'une phrase ne soit terminée. La chaîne vidéo pousse du 720p par blocs de 320 millisecondes, où un latent équivaut à huit trames à 25 i/s, avec trois étapes de diffusion par latent et une compression temporelle de 8× dans le VAE. C'est un processus de distillation en trois étapes (appariement de distributions, puis autorégressif avec forçage de l'enseignant, puis auto-forçage) qui lui permet tout simplement de réaliser ces trois étapes en temps réel. La latence mise en avant est en moyenne de 0,43 seconde entre l'audio et la vidéo sur des H100, ce que Tavus présente comme environ la moitié de la méthode la plus rapide suivante qu'il a mesurée. Le clonage vocal nécessite un échantillon d'environ 10 secondes.

Le prix à payer pour tout cela est que Tavus ne peut pas le mettre sur le marché. Griffin-Lite, l'aperçu de recherche, n'est disponible que pour un groupe restreint de premiers testeurs ; dans un texte consacré à cette sortie, l'entreprise déclare clairement que Griffin-Lite ne sera pas disponible pour une utilisation par les clients pour le moment et qu'elle prévoit de sortir Griffin très bientôt, une fois que certaines préoccupations de sécurité auront été traitées. Griffin n'est pas sur la plateforme Tavus et y arrivera « une fois que nous aurons trouvé comment le sortir en toute sécurité ». Un modèle qui convainc 48 % du temps lors d'un appel d'une minute est, du point de vue du déploiement, un modèle qui convainc 48 % du temps lors d'un appel d'une minute.

Screenshot of the Tavus website's Griffin announcement, captured 2 October 2026: the headline 'The First Human Interaction Model' under 'Introducing Griffin', a paragraph describing a video-to-video system that listens while the other person talks, and three statistic tiles reading 48% of people believed Griffin was a real person after a one-minute video call, #1 on NVIDIA's independent test of face-to-face AI, and 37% ahead of the next best AI at reacting in the moment, dated October 1st, 2026.

Muse Realtime Avatar : le modèle qui doit suivre le rythme

Muse Realtime Avatar a été annoncé le 23 septembre 2026 lors de Meta Connect et a fait l'objet, le jour même, d'un article de Meta Superintelligence Labs intitulé « Bringing Your Muse to Life ». Le cadrage de Meta est plus étroit et plus mécanique que celui de Tavus : l'agent Muse disposait déjà d'une voix, grâce à Muse Realtime Voice, et l'avatar est la couche qui donne un corps à cette voix.

Le chiffre publié est de 870 millisecondes entre la fin du tour de parole et le premier octet — c’est-à-dire depuis l’instant où l’utilisateur cesse de parler jusqu’à l’instant où le premier octet vidéo de l’avatar est prêt. L’avatar génère un portrait 448×768 à 25 images par seconde. Meta affirme que le système effectue environ 60× moins d’évaluations par segment que sa référence, et qu’un seul NVIDIA GB200 peut prendre en charge 12 sessions temps réel simultanées avec un gain de capacité de 8× par rapport à une implémentation BF16 en deux étapes.

La différence architecturale avec Griffin réside dans l’origine de l’information. Muse Realtime Avatar étend Muse Realtime Voice et partage son flux de tokens de parole — c’est la même représentation VQ que produit le modèle vocal qui pilote le visage, plutôt qu’une compréhension visuelle distincte d’un participant. Cela en fait une couche d’incarnation DiT pilotée par l’audio : efficace, étroitement couplée à son propre modèle vocal, et qui ne cherche pas du tout à lire l’humain à l’autre bout de l’appel. C’est une bouche et un visage pour un agent, pas un partenaire de conversation qui vous regarde.

Meta n’a publié ni API, ni prix, ni date de sortie pour Muse Realtime Avatar. L’article de recherche constitue l’intégralité des informations publiques.

Là où les deux designs divergent véritablement

La façon la plus claire de voir la séparation est de se demander ce qui se passe lorsque l’utilisateur interrompt.

Griffin est full duplex et conçu pour être interrompu en pleine prise de parole — il peut regarder et écouter pendant qu'il parle, ce qui explique pourquoi le marketing de Tavus mise sur l'idée que Griffin apprend le comportement conversationnel plutôt que la vidéo. C'est aussi pourquoi sa suite de benchmarks est construite autour de la perception et de la réaction, et pourquoi l'avance de 37 % sur le meilleur système suivant pour réagir dans l'instant est une affirmation que l'entreprise prend la peine de formuler.

Le chiffre de 870 millisecondes en fin de tour de Muse Realtime Avatar vous raconte l’histoire inverse : c’est un pipeline où le tour se termine, les tokens audio se résolvent, puis le visage rattrape son retard. C’est rapide — 870 ms est un bon chiffre pour un moteur de rendu de portrait — mais la mesure elle-même suppose qu’une frontière de tour existe, ce qui est précisément l’hypothèse qu’un modèle duplex est conçu pour écarter.

Ce n’est une critique d’aucune des deux conceptions. Meta construit un visage pour un agent qui vit au sein des surfaces d’assistant propres à Meta, où une frontière de tour nette constitue un modèle raisonnable de l’interaction. Tavus construit quelque chose qui doit survivre au jugement d’un inconnu qui décide, en vingt secondes, si la personne à l’écran est réelle.

Aucun des deux ne figure sur une liste de prix — et une seule partie de Muse est appelable.

Ni Tavus Griffin ni Muse Realtime Avatar ne peuvent être mis en production aujourd'hui. Griffin est réservé à des testeurs sélectionnés ; Muse Realtime Avatar n'a ni API, ni prix, ni date. Si vous planifiez un développement, ces deux faits doivent figurer dans le plan.

Ce qu'il vaut la peine de signaler, c'est la partie de la pile Muse qui est accessible. La famille Muse de Meta comprend Muse Spark, et l'un de ses checkpoints — meta/muse-spark-1.2 — est en ligne sur notre catalogue à 1,25 $ par million de tokens d'entrée et 4,25 $ par million de tokens de sortie, avec aucune marge sur le prix catalogue de Meta. Ce n'est pas l'avatar : il accepte du texte, des images, de la vidéo, de l'audio et des PDF en entrée et renvoie du texte, avec une fenêtre de contexte d'un million de tokens et un effort de raisonnement configurable. Mais c'est la partie de la gamme Muse que vous pouvez réellement appeler, et si vous développez l'agent qui se trouvera un jour derrière un avatar, la moitié linguistique est celle par laquelle vous pouvez commencer. OrcaRouter répercute les prix catalogue des fournisseurs avec 0 % de marge, de sorte qu'un changement de prix de Meta est reflété sur notre fiche le jour même plutôt qu'au cycle de facturation suivant, et une requête qui échoue chez un fournisseur est réessayée auprès d'un fournisseur sain au lieu de se manifester par un délai d'attente.

Screenshot of the OrcaRouter model page for Muse Spark 1.2, showing the model id meta/muse-spark-1.2, a 1M-token context window, text, image, video, file and audio inputs producing text output, a p50 time to first token of 10.00 s, input pricing of $1.25 per million tokens and output pricing of $4.25 per million tokens, and 6.2M tokens of traffic over seven days.

La même logique s’applique au volet vidéo. Nous ne routons ni Muse Realtime Avatar ni Tavus Griffin, et nous ne prétendrons pas le contraire. Ce que nous routons, c’est un catalogue de plus de deux cents dans les mêmes modalités, de sorte qu’un prototype qui alterne entre un agent textuel, un modèle vocal et un générateur vidéo reste sur une seule clé, tandis que les deux modèles de cet article restent non publiés.

Lequel est le plus éloigné de l'expédition ?

D’après les informations publiques, Muse Realtime Avatar est plus en retrait. Il dispose d’un article de recherche et n’a ni API, ni prix, ni date. Griffin n’a pas non plus d’API ni de prix, mais il a une intention de sortie explicite — « très bientôt après que ces préoccupations de sécurité auront été traitées » — un niveau d’aperçu nommé qui existe déjà aujourd’hui pour certains testeurs sélectionnés, ainsi qu’une série de résultats de référence publiés provenant d’un banc d’essai indépendant. C’est une position plus avancée, même si elle s’accompagne de l’aveu que le modèle n’est pas suffisamment sûr pour être remis aux clients.

Le piège, quand on les compare, est de considérer le chiffre de 870 millisecondes comme directement comparable à celui de 0,43 seconde. Ils mesurent des choses différentes : Meta mesure depuis la fin d’un tour jusqu’au premier octet d’un portrait, et Tavus mesure la latence audio-vidéo au sein d’un flux duplex continu où les tours ne sont pas des événements bien délimités. Ces chiffres sont tous les deux réels, et ils ne correspondent pas à la même mesure ; quiconque les présente dans une même colonne rend un mauvais service au lecteur.

L'essentiel

Muse Realtime Avatar est une couche d'incarnation : audio en entrée, portrait en sortie, 870 millisecondes entre la fin du tour et le premier octet, 448×768 à 25 fps, pas d'API et pas de date. Tavus Griffin est un modèle d'interaction humaine duplex : le participant en entrée, un visage réactif en sortie, 0,43 seconde de latence moyenne audio-vers-vidéo sur H100s, et un fournisseur prêt à publier que 48 % des gens pensaient qu'il était humain tout en déclarant que les clients ne peuvent pas l'utiliser. Meta construit quelque chose qui suit le rythme. Tavus construit quelque chose qui passe. Aucun des deux n'est achetable, ce qui signifie que la seule décision disponible aujourd'hui est de savoir par quelle moitié du problème commencer — et pour la plupart des équipes, cette moitié est le modèle de langage en dessous.