Une carte hero générée pour « Muse Realtime Avatar », avec le surtitre « Meta AI Research - 23 septembre 2026 », le titre, et trois cartes étiquetées indiquant « Muse Realtime Voice - la couche conversationnelle, diffusion en continu de tokens vocaux », « Muse Realtime Avatar - la couche d'incarnation construite par-dessus, recherche uniquement », et « Muse Spark 1.2 - le modèle Muse routable sur OrcaRouter dès aujourd'hui ». Le logo OrcaRouter est incrusté dans le coin inférieur droit.
Engineering & Research

Muse Realtime Avatar : ce que Meta a construit, sur quoi il tourne, et pourquoi vous ne pouvez toujours pas l'appeler

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Muse Realtime Avatar est la technologie d'incarnation de Meta. Elle prend le flux vocal que Muse Realtime Voice produit et génère la performance correspondante : pointez-le vers un portrait photographique et le visage répond par de légers changements d'expression ; pointez-le vers une illustration en pied et le personnage fait des gestes et change de posture pendant qu'il parle. Meta AI Research l'a présentée le 23 septembre 2026 dans un billet intitulé « Bringing Your Muse to Life ». Il s'agit d'un résultat de recherche plutôt que d'un produit — la page de Meta elle-même n'offre ni API, ni prix, ni liste d'attente et ne publie aucune date pour celle-ci — donc la réponse honnête à « puis-je l'utiliser aujourd'hui » est non. Le modèle Muse que vous pouvez appeler aujourd'hui est un autre modèle, Meta Muse Spark 1.2.

Cette réponse mérite d’être formulée dès le premier paragraphe plutôt que dans le dernier, car un lecteur qui recherche ce nom est généralement en train de décider s’il doit planifier en fonction de cela. Planifiez en fonction de la recherche, pas en fonction d’un critère d’évaluation.

Une chose à dire clairement avant toute autre chose, car cette page enfreint une règle qu’elle devrait reconnaître. Ce blog écrit normalement sur les modèles la semaine de leur lancement. Muse Realtime Avatar a été annoncé une semaine avant la mise en ligne de cette page ; donc, selon une lecture stricte de la fenêtre de fraîcheur, l’élément serait ignoré. Ce n’est pas un article d’actualité sur un événement daté. C’est la page de référence d’un modèle qui est bien présent dans la conversation du catalogue aujourd’hui : la page à laquelle un lecteur accède après avoir saisi le nom du modèle lui-même, et dont le bien-fondé tient à une demande de recherche permanente que nous avons mesurée nous-mêmes plutôt qu’à la fraîcheur d’un lancement. L’annonce de septembre est citée ici comme un fait qui date le modèle, non comme un événement à rapporter, et rien ci-dessous n’est une seconde annonce. Notre couverture de ce jour-là est un article distinct, et elle le reste.

Où il se situe dans la famille Muse

Meta est explicite : il s’agit de deux couches d’un même système, et non de deux produits. Selon les termes de Meta, « Muse Realtime Voice et Muse Realtime Avatar forment un seul système de streaming qui relie l’intelligence, la voix et l’incarnation. » La couche vocale fournit l’intelligence conversationnelle et émet un flux de tokens de parole — que Meta appelle des VQs — qui portent à la fois ce qui est dit et la manière dont cela est dit. Un décodeur audio transforme ces tokens en son, et la couche avatar consomme le même flux pour générer l’image. Le partage d’un seul flux de tokens est ce qui maintient la voix, le mouvement des lèvres et l’expression synchronisés ; aucune passe distincte de synchronisation labiale n’est greffée après coup.

Donc : Muse Realtime Voice est la couche conversationnelle. Muse Realtime Avatar est la couche d'incarnation construite par-dessus. Ni l'une ni l'autre n'est la chose que vous pouvez appeler.

Faites tout aussi attention à un nom voisin, car c’est celui qui risque le plus d’être confondu avec l’un ou l’autre. Muse Voice Transcribe est un endpoint de transcription, et c’est un produit véritablement différent. La documentation pour développeurs de Meta est sans équivoque : « Il s’agit uniquement de reconnaissance vocale ; il ne synthétise pas la parole et ne fournit pas d’API de conversation parole-parole. » Il renvoie des horodatages au niveau des tours de parole, et non au niveau des mots, et Meta l’indique à 0,18 $ par heure sur cette page. C’est un endpoint réel, avec un tarif. Ce n’est pas une voix, et ce n’est certainement pas un avatar.

Le modèle Muse réellement appelable est Meta Muse Spark 1.2, le modèle de raisonnement que Meta livre avec un contexte d'un million de jetons et une entrée texte, image, vidéo, fichier et audio. Celui-là est routable ici dès aujourd'hui, au prix catalogue du fournisseur sans aucune marge, avec la même clé que tout le reste du catalogue, et sa fiche en direct contient la spécification complète. Nous ne proposons pas Muse Realtime Avatar. Nous avons revérifié la liste des modèles en direct pendant la rédaction de ce texte, et les seules entrées Muse qu'elle contient sont les deux checkpoints Spark, 1.2 et son prédécesseur 1.1. Dire quoi que ce soit de plus nuancé — que la famille est « partiellement disponible » — laisserait entendre que nous routons quelque chose que nous ne routons pas.

A screenshot of Meta's research post 'Bringing Your Muse to Life' as published, showing the headline, the reading time of 10 minutes, a vertical portrait video player, and the opening paragraph introducing Muse Realtime Avatar as an embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.

La technologie, selon les propres termes de Meta

La description de l’architecture par Meta est suffisamment concise pour être citée plutôt que paraphrasée. Muse Realtime Avatar est « un Diffusion Transformer piloté par l’audio, conditionné sur un flux de jetons de parole, un média de référence et une fenêtre glissante de latents vidéo récents », et il « génère de la vidéo en courts segments causaux ». La seconde moitié de cette phrase est l’élément porteur : à mesure que chaque segment se termine, ses latents générés les plus récents deviennent le contexte de mouvement du suivant. La raison avancée par Meta est la continuité — l’apparence et les manières de l’avatar se transmettent d’un tour à l’autre tandis que le calcul reste borné, ce qui permet à la génération de se poursuivre aussi longtemps que la conversation, plutôt que de dériver ou d’épuiser son budget.

Le mécanisme de provenance a sa place dans le même paragraphe, car Meta le présente comme une partie intégrante du système et non comme un ajout après coup : la vidéo générée porte un filigrane durable et invisible appliqué au moyen de Meta Video Seal, qui, selon Meta, n'ajoute aucune latence au chemin temps réel.

Meta a mesuré cette chose et en a publié quatre chiffres. Ces chiffres — et les réserves spécifiques que chacun exige, y compris celle qui se lit comme une accélération et n’en est pas une — appartiennent à l’article de lancement, qui les rapporte avec leur contexte intact. Nous n’allons pas répéter ici les chiffres bruts, car un chiffre brut est exactement ce que la version assortie de réserves existe pour empêcher.

Nous avons couvert l'annonce le jour même dans notre article sur le lancement de Muse Realtime Avatar, et celui-ci reste l'endroit où lire les affirmations mesurées dans leur intégralité.

Ce que le nom n'est pas

Trois faux voisins méritent d’être écartés un à la fois, car chacun d’eux est une supposition raisonnable à partir du nom seul.

• Ce n’est pas Muse Voice Transcribe. Ce point de terminaison convertit la parole en texte et, selon la propre description de Meta, ne fait rien dans l’autre sens. Si ce dont vous avez besoin est une transcription, Meta en vend une, et c’est une chose différente avec un prix différent.

• Il ne s'agit pas d'un service de clonage vocal. Rien sur les pages de Meta ne décrit la synthèse de la voix d'une personne précise, la vente d'un modèle vocal ou l'acceptation d'un échantillon vocal fourni par un utilisateur. La couche vocale est décrite comme produisant un flux de jetons ; la couche avatar est décrite comme en consommant un. La forme de produit que cette expression sous-entend habituellement — téléverser un échantillon, obtenir un clone — ne correspond pas à ce qui est décrit ici, et les éléments de démonstration que Meta publie effectivement sont présentés comme une illustration des capacités du modèle.

• Ce n’est pas un avatar grand public dans l’application de Meta elle-même. Meta accompagne ses exemples d’une mise en garde facile à manquer et qu’il vaut la peine de retenir : les démonstrations « illustrent la capacité du modèle et ne reflètent pas tous les avatars disponibles dans l’application Muse », et Muse est destinée aux utilisateurs âgés de 18 ans et plus. Prenez cela au pied de la lettre. Une partie de ce que la publication montre relève de la capacité, pas de l’inventaire.

Un quatrième nom mérite d’être mis à part pour une autre raison. Muse Realtime Avatar n’est pas Muse Video, le modèle de génération vidéo qui figure dans un classement public depuis la majeure partie de cette année sans être commercialisé. Notre propre page sur cette situation — Muse Video : date de sortie, accès API et ce que Meta Connect pourrait changer — comporte une contrainte que nous répéterons ici mot pour mot plutôt que de l’améliorer : toute page qui cite un jour de lancement précis ou un prix pour Muse Video sans une annonce plus récente de Meta se livre à des spéculations. La même discipline s’applique au sujet de cette page, c’est pourquoi cette page ne cite ni l’un ni l’autre. Cet article fournit également la date qu’il ne nous appartient pas de confondre : Muse Video fait l’objet d’une avant-première le 7 juillet 2026 et n’est pas sorti, ce qui explique qu’une recherche sur cette famille fasse apparaître des dates qui appartiennent à un autre modèle.

A generated reference card titled 'Muse Realtime Avatar - what is reachable' with six rows: 'Muse Realtime Avatar: research result, no API, no price, no waitlist, no published date'; 'Muse Realtime Voice: the conversational layer it renders, no API announced'; 'Muse Voice Transcribe: a different product, speech-to-text only'; 'Muse Spark 1.2: the Muse model callable today'; 'Muse Video: previewed, not released'; and 'Routable on OrcaRouter: Muse Spark 1.2 and 1.1 only'. A footer reads 'Status per Meta's own pages, read September 29, 2026.' The OrcaRouter logo is composited in the bottom-right corner.

À quoi sert cette page, et ce qui la modifierait

La raison pour laquelle une page de référence est le bon format ici est mesurable. Au cours des 28 jours précédant le 25 septembre 2026, le terme exact a généré 164 impressions sur notre propriété de recherche et aucun clic, avec une meilleure position à 9,3. Plus de cinquante de nos pages mentionnent le fragment quelque part, et presque tout ce trafic aboutit sur un seul article d’annonce. Un terme avec une demande réelle et soutenue, classé juste en dehors de la première page et qui ne convertit personne, n’est pas un problème de demande ni un problème de qualité — c’est un problème de page. Il n’y avait aucune page dont le sujet était le modèle lui-même. Ceci est cette page.

Cette position explique aussi pourquoi rien ici n’est présenté comme une actualité. Un lecteur qui arrive après une recherche par nom veut trois choses, dans l’ordre : ce que c’est, si c’est disponible, et sur quoi c’est construit. Ces questions trouvent une réponse ci-dessus, dans cet ordre, sans dates inventées ni concurrent nommé.

A screenshot of our own model list filtered to the search term 'muse', showing two results, both under the Meta provider: meta/muse-spark-1.2 and meta/muse-spark-1.1, with Muse Spark 1.2 marked as having a 4M-token context window at $1.25 per million input tokens and $4.25 per million output tokens.

Ce qui changerait la page, c'est une seule annonce. Si Meta publie un point de terminaison, un prix, une liste d'attente ou une date pour Muse Realtime Avatar, la section sur la disponibilité cesse d'être un « non » et devient une spécification, et cette page sera réécrite plutôt que complétée. Si Meta lance Muse Video, le paragraphe ci-dessus changera avec lui. Jusqu'à ce que l'un ou l'autre se produise, la démarche utile pour un développeur est la moins glorieuse : garder l'interface que vous avez déjà pointée vers le modèle que vous pouvez réellement atteindre. Chaque modèle du catalogue, y compris Meta Muse Spark 1.2, se trouve derrière un point de terminaison compatible OpenAI et une clé, ce qui signifie qu'essayer la partie de cette famille qui existe vous coûte un changement de chaîne de modèle plutôt qu'un nouveau contrat. Lorsque la couche d'incarnation deviendra appelable, le coût de basculement devrait lui aussi être une chaîne.