Carte héro générée pour « Muse Realtime Avatar : Meta donne un visage à son agent Muse, à 870 millisecondes par tour », affichant le surtitre « Meta Superintelligence Labs — 23 septembre 2026 », le titre principal et trois faits tirés de l'article de recherche de Meta : vidéo portrait 448×768 à 25 fps, environ 870 ms entre la fin du tour et le premier octet, et 12 sessions temps réel simultanées sur un seul NVIDIA GB200. Un sous-titre indique : « Ce n'est pas une tête parlante. C'est une couche de rendu au-dessus d'un modèle vocal. » Le logo OrcaRouter est intégré dans le coin inférieur droit.
Engineering & Research

Muse Realtime Avatar : Meta donne un visage à son agent Muse, à 870 millisecondes par tour.

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Le chiffre que Meta a choisi de mettre en avant est 870 millisecondes. C'est le temps que Muse Realtime Avatarprend, selon les propres mesures de Meta, entre le moment où vous arrêtez de parler et le moment où le premier octet d'une réponse synchronisée voix et vidéo arrive. C'est un chiffre véritablement agressif pour un système qui doit générer de la vidéo, et il mérite d'être lu avec précision — car presque tout ce qui est intéressant dans le nouveau modèle d'incarnation de Meta se situe dans l'écart entre ce que ce chiffre mesure et ce que les gens supposeront qu'il mesure.

Muse Realtime Avatar a été annoncé le 23 septembre 2026 à Meta Connect et documenté le jour même par Meta Superintelligence Labs dans un article de recherche intitulé « Donner vie à votre Muse ». Il étend Muse Realtime Voice, la couche conversationnelle au sein de l'agent Muse de Meta, en lui donnant un corps. Il ne s'agit pas d'un chatbot avec un avatar standard : vous lui fournissez une image de référence — une photographie, une illustration en pied, un animal, un objet du quotidien — et il fait parler, gesticuler et changer de posture cette chose en vidéo continue pendant toute la durée de la conversation. Zuckerberg a déclaré sur scène que l'avatar associé à son propre Muse s'appelle Jolly.

Un flux de tokens partagé, pas une passe de synchronisation labiale

L’architecture est la partie qui vaut la peine d’être comprise, car elle explique pourquoi Meta ne cesse de dire « incarnation » plutôt que « avatar ». Muse Realtime Voice produit un flux de tokens de parole — l’article les appelle des VQs — qui portent à la fois le contenu de ce qui est dit et sa prosodie : le rythme, l’accentuation, les montées et les descentes. Muse Realtime Avatar consomme ce même flux. C’est un Diffusion Transformer piloté par l’audio, conditionné sur ces tokens de parole, sur les médias de référence que vous avez fournis et sur une fenêtre glissante de latents vidéo récents, et il génère de la vidéo en courts segments causaux, en transmettant chaque nouveau latent vers l’avant comme contexte de mouvement pour le suivant.

Le partage d'un seul flux de tokens est ce qui maintient la voix, le mouvement des lèvres et l'expression solidaires. L'alternative — générer l'audio, puis lui appliquer un modèle de synchronisation labiale distinct — est le mode de fonctionnement de la plupart de l'industrie des avatars, et c'est pourquoi tant de ces avatars donnent l'impression d'être doublés. La conception de Meta élimine cette couture par construction. La fenêtre latente glissante est la seconde moitié de l'idée : sans elle, un générateur par blocs dérive, et au bout de trois minutes, votre personnage est discrètement devenu quelqu'un d'autre.

A screenshot of Meta's research post 'Bringing Your Muse to Life', dated September 23, 2026, showing the headline, the reading time, a vertical portrait video player paused at 0:00 of 0:51 showing a white furry character, and the opening paragraph introducing Muse Realtime Avatar as state-of-the-art embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.

Quatre chiffres publiés, et ce que chacun mesure réellement

Meta a publié plus de chiffres qu'il n'est habituel pour un article de recherche rattaché à une fonctionnalité grand public. Les quatre ci-dessous sont rapportés par l'entreprise, mesurés par Meta par rapport à des valeurs de référence choisies par Meta ; aucun d'entre eux n'a été reproduit en dehors de l'entreprise.

870 ms entre la fin du tour et le premier octet. Il s'agit d'un chiffre de début de réponse. Ce n'est pas le temps nécessaire pour obtenir une réponse complète, et ce n'est pas la latence de livraison continue pour le reste de l'appel. Un système peut atteindre 870 ms jusqu'au premier octet et malgré tout sembler lent à la douzième seconde. Le post de Meta indique explicitement qu'il s'agit de la mesure du premier octet ; une couverture qui omet cette précision l'interprète comme une réactivité de bout en bout, ce qu'elle n'est pas.

Vidéo portrait 448 × 768 à 25 images par seconde. C'est un cadre vertical en forme de téléphone, et non un cadre paysage, et 25 i/s relève davantage du cinéma que de la fluidité — la fréquence d'images standard du cinéma, inférieure aux 30 ou 60 i/s que fournirait un flux de caméra natif. Meta indique que les démos sont filigranées avec une superposition transparente afin qu'un destinataire puisse voir qu'il ne regarde pas un flux de caméra normal.

60× moins d’évaluations de modèle. Traité correctement ci-dessous, car c’est le nombre le plus susceptible d’être mal interprété.

12 sessions temps réel simultanées sur un seul NVIDIA GB200. Meta indique que son travail de serving — caches KV persistants, routage sensible au cache, batching dynamique sensible à la latence, entraînement sensible à la quantification en quatre bits, kernels fusionnés et capture CUDA Graph, développés avec NVIDIA — a multiplié la capacité par 8 par rapport à sa propre référence BF16 en deux étapes. L'arithmétique derrière tout cela est limpide : chaque étape de génération produit huit images, soit 320 ms de lecture, en 20 ms de temps modèle, ou 2,5 ms par image. Tant le 12 que le 8× se rapportent à la référence spécifiée par Meta, et non au matériel d'un autre fournisseur.

Pourquoi 60× n'est pas 60× plus rapide

L'affirmation sur la compression est celle qui sera le plus répétée et le moins comprise. Le modèle enseignant de Meta était un modèle de diffusion en 40 étapes avec un guidage sans classifieur à trois voies — trois passes par étape, soit 120 évaluations du modèle pour produire un segment de vidéo. L'élève est un modèle causal non guidé en deux étapes doté d'un cache KV de longueur fixe, entraîné par distillation et self-forcing, et il nécessite deux évaluations pour le même segment. Cela représente une réduction de 60× du nombre d'évaluations par segment, pour une qualité proche de celle de l'enseignant, selon les termes de Meta.

Il s'agit d'une réduction du calcul par segment. Soixante fois moins d'évaluations ne signifie pas qu'un utilisateur attend soixante fois moins longtemps, car la latence avait d'autres contributeurs avant la distillation et en a toujours après. Le graphique dans le propre article de Meta montre ce que la réduction a apporté en termes de qualité : la préférence humaine passant de 45 % à 55 %. C'est la version honnête de l'histoire — l'objectif de la distillation était de créer un système capable de fonctionner en temps réel tout court, et le coût en qualité a été maintenu à environ dix points de préférence plutôt que d'être éliminé.

L'évaluation, y compris le résultat qui a tourné dans l'autre sens

Meta a été testé face à deux systèmes d'avatars commerciaux, Runway Characters et HeyGen LiveAvatar, en utilisant des identités d'avatars appariées afin que les évaluateurs comparent l'animation plutôt que la conception du personnage. Les évaluateurs ont eu des conversations en direct de deux à trois minutes avec chaque système, puis ont comparé la qualité visuelle, la synchronisation, la cohérence du personnage et les attitudes.

Meta déclare être préféré à 78 % contre 22 % face à Runway Characters et à 88 % contre 12 % face à HeyGen LiveAvatar, et préféré sur chaque dimension évaluée. Ensuite, la publication fait quelque chose que la plupart des évaluations de fournisseurs ne font pas : elle révèle que la comparaison des maniérismes face à Runway Characters n’était pas statistiquement distinguable de la parité. Une égalité au sein d’une victoire sur toute la ligne est une petite chose, mais c’est le détail qui vous indique que cette victoire sur toute la ligne est rapportée honnêtement plutôt que triée sur le volet.

Les limites du test importent plus que l’égalité. Deux à trois minutes, c’est une courte conversation. Les évaluateurs étaient ceux de Meta. Et la publication elle-même avertit que ses démonstrations « illustrent la capacité du modèle et ne reflètent pas tous les avatars disponibles dans l’application Muse » — ce qui revient, de la part d’une équipe de recherche, à dire clairement que la vidéo que vous avez regardée n’est pas nécessairement le produit que vous obtiendrez.

Ce que vous ne pouvez pas faire avec

Il n'existe pas d'API pour Muse Realtime Avatar. Il n'y a pas de prix, pas de grille tarifaire, pas de liste d'attente et pas de date de publication. Meta n'a pas précisé quand les utilisateurs ou les développeurs pourront l'utiliser. L'application Muse réservée aux 18 ans et plus est la seule plateforme à laquelle il est destiné, et l'avatar arrive aux côtés d'un ensemble d'autres fonctionnalités Muse — personnalisation vocale, adresse e-mail Muse, contrôle d'un ordinateur Mac, intégration des lunettes — qui ont leurs propres calendriers, certaines étant annoncées comme « prochains mois ».

La comparaison qui compte ici n'est pas avec Runway ou HeyGen. Elle l'est avec le reste de la pile Muse. Muse Spark, le modèle de raisonnement sur lequel tourne l'agent, est disponible pour les développeurs depuis que Meta l'a ouvert via la Meta Model API, et Muse Spark 1.2 est servi via OrcaRouter sous le nom meta/muse-spark-1.2 à 1,25 $ par million de tokens d'entrée et 4,25 $ par million de tokens de sortie, prix catalogue du fournisseur sans majoration, dans une fenêtre de contexte d'un million de tokens qui accepte déjà le texte, les images, la vidéo, l'audio et les fichiers. C'est la partie de Muse que vous pouvez appeler dès aujourd'hui. La face est la partie que vous ne pouvez pas.

Cette asymétrie mérite qu’on s’y attarde si vous prévoyez quoi que ce soit. Un agent qui raisonne pendant un appel vidéo et un agent qui apparaît dans un tel appel sont des produits différents, avec des contraintes différentes, et un seul des deux figure sur une grille tarifaire.

A generated scoreboard titled 'Muse Realtime Avatar — the scoreboard' with six rows: turn to first byte — about 870 ms; video — 448×768 portrait at 25 fps; evaluations — 60× fewer than baseline; concurrency — 12 sessions per NVIDIA GB200; capacity — 8× over two-step BF16; developer access — none announced. A footer reads 'All figures company-reported by Meta; none independently reproduced.'

Que regarder ensuite

Trois choses feraient passer cela d'une annonce à une décision. La première est une date de sortie pour l'avatar dans Muse, car tout ce que Meta a publié concerne un modèle, et rien de ce qu'elle a publié ne concerne un produit utilisable un jeudi. La deuxième est une mesure de latence prise sur une longue conversation plutôt qu'au premier octet — 870 ms est un coup de départ, et la question que pose un véritable appel est ce qui se passe à la dixième minute. La troisième est de savoir si le système conserve son personnage dans des conditions adverses : un utilisateur qui change délibérément de sujet, va vite, ou lui fournit une image de référence conçue pour ressembler à une personne réelle.

D'ici là, le résumé honnête est celui que l'article de recherche sous-entend sans le dire. Muse Realtime Avatar est un véritable travail d'ingénierie, avec un véritable résultat de compression derrière, démontré dans un cadre contrôlé, évalué par l'entreprise qui l'a développé, dans des conversations qui ont duré le temps d'une commande de café. Ce n'est pas du vaporware. Ce n'est pas non plus quelque chose que l'on peut acheter, router ou benchmarker — et ce sont des affirmations différentes.

A screenshot of the OrcaRouter model page for Meta Muse Spark 1.2, showing the model id meta/muse-spark-1.2, input modalities text, image, video, file and audio with text output, capability badges for vision, audio, tools, JSON and reasoning, a p50 time-to-first-token of 4.91 seconds, and pricing of $1.25 per million input tokens and $4.25 per million output tokens, with 'Get the Muse Spark 1.2 API' and 'Try in playground' buttons.