Une carte hero générée pour l’article « Muse Realtime Avatar vs SeedRealtime », montrant deux cartes arrondies de part et d’autre du titre. La carte de gauche affiche « Muse Realtime Avatar » au-dessus d’une icône de cadre vidéo sortant et les lignes « génère la vidéo » et « Meta, annoncé le 23 sept. » ; la carte de droite affiche « SeedRealtime » au-dessus d’une icône d’écran et d’œil et les lignes « regarde la vidéo » et « ByteDance, lancé le 5 août ». Un sous-titre indique « Aucun des deux n’a de grille tarifaire. » Le logo OrcaRouter est intégré dans le coin inférieur droit.
Guides & Insights

Muse Realtime Avatar vs SeedRealtime : deux modèles que vous ne pouvez que regarder

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Aucun des deux n'a de grille tarifaire. Muse Realtime Avatar, annoncé par Meta le 23 septembre 2026 à l'occasion de Meta Connect, n'a ni API, ni point de terminaison, ni prix, ni date — c'est une capacité de l'agent Muse de Meta, présentée dans un article de recherche intitulé « Bringing Your Muse to Life ». SeedRealtime, publié par ByteDance Seed le 5 août 2026, n'a ni API, ni poids, ni rapport technique, ni nombre de paramètres — il existe au sein de l'application Doubao de ByteDance elle-même, et la publication de ByteDance indique seulement qu'il a été « entièrement déployé ». Deux des plus grandes entreprises d'IA grand public au monde ont livré des systèmes temps réel audio-visuels à sept semaines d'intervalle l'une de l'autre, et aucun des deux n'est achetable. Voilà la comparaison, et elle est bien plus intéressante que le tableau de benchmarks que personne ne peut construire.

Ce qui les sépare, c’est la direction dans laquelle circule la vidéo. SeedRealtime regarde, écoute et parle de ce qu’il voit — l’audio, la vidéo et le texte réunis dans un seul réseau de bout en bout, la gestion des tours de parole étant transférée d’un détecteur externe d’activité vocale vers le modèle lui-même. Muse Realtime Avatar génère : vous lui fournissez une image de référence, une photographie, une illustration ou un objet, et il rend cette chose en train de parler et de gesticuler dans une vidéo continue pendant toute la durée de la conversation. La vidéo de SeedRealtime est une entrée. La vidéo de Muse Realtime Avatar est une sortie. Tous deux sont décrits comme full-duplex, tous deux sont audio-visuels, et ils font des tâches opposées avec cette étiquette.

Ce qu'est chacun, et où il se trouve

Six lignes, et les deux dernières sont celles qui décident de tout.

Vidéo — Muse Realtime Avatar le génère, en résolution portrait 448×768 et à 25 images par seconde, avec un filigrane en superposition transparente afin qu'un spectateur puisse voir qu'il ne s'agit pas d'un flux de caméra ; SeedRealtime le perçoit, en diffusant les images dans le même réseau que celui qui traite l'audio.

Le pari architectural — Muse Realtime Avatar partage un seul flux de tokens entre la voix et la vidéo : un Diffusion Transformer piloté par l'audio consomme directement les tokens de parole de Muse Realtime Voice, et rien n'est synchronisé labialement par la suite ; SeedRealtime intègre la gestion des tours de parole au cœur du modèle, de sorte que qui parle et quand cesse de relever de la décision d'un détecteur d'activité vocale externe.

Où cela s'exécute — Muse Realtime Avatar est une capacité au sein de l'agent Muse de Meta ; SeedRealtime se trouve dans l'application Doubao de ByteDance.

Accès développeur — aucun des deux n'a d'API. Aucun des deux ne publie ses poids. Il n'existe aucune option sans serveur, aucun point de terminaison hébergé, et aucune plateforme tierce ne propose l'un ou l'autre.

Prix — non publié pour les deux, car aucune offre commerciale n’existe d’un côté comme de l’autre.

Évaluation indépendante — aucune pour aucun des deux systèmes. Tous les chiffres que chaque entreprise a publiés au sujet de son propre modèle sont des données internes, et aucun évaluateur externe n'a testé ni l'un ni l'autre.

Deux bases de preuves, toutes deux de première main, et l’une d’elles est beaucoup plus mince

Ici, la comparaison cesse d'être symétrique. Meta a publié quatre chiffres pour Muse Realtime Avatar, tous déclarés par l'entreprise, mesurés par rapport à des références choisies par Meta, et aucun reproduit en dehors de l'entreprise : 870 ms entre la fin de votre tour de parole et le premier octet d'une réponse synchronisée voix et vidéo ; une vidéo portrait en 448×768 à 25 images par seconde ; 60× moins d'évaluations de modèle que sa propre référence ; et 12 sessions temps réel simultanées sur un seul NVIDIA GB200, soit un gain de capacité de 8× par rapport à la référence BF16 en deux étapes de Meta, obtenu grâce à l'entraînement sensible à la quantification en quatre bits et au traitement dynamique par lots sensible à la latence. Meta a aussi publié une comparaison de préférences face à deux systèmes d'avatars commerciaux — 78/22 contre l'un, 88/12 contre l'autre — et a révélé que, sur les maniérismes, le résultat face à l'un d'eux n'est pas statistiquement distinguable de la parité. Cette révélation vaut plus que les victoires ; c'est le genre de résultat que la plupart des annonces de lancement omettent.

Les preuves publiées de SeedRealtime consistent en une évaluation humaine de bout en bout. ByteDance affirme que, face aux systèmes en cascade — un modèle de vision relié à un modèle ASR relié à un LLM relié à une voix de synthèse vocale — SeedRealtime réduit de moitié les problèmes de rythme conversationnel audio-visuel, avec moins de coupures, moins de faux déclenchements et des réponses plus lentes et plus naturelles. Ce que ByteDance n’a pas publié, c’est une taille d’échantillon, une méthodologie, un nombre d’annotateurs, un chiffre de latence en millisecondes, un nom de benchmark ou un score. Un rapport secondaire cite un gain de 12 % en fluidité conversationnelle par rapport aux modèles antérieurs de l’équipe. C’est l’intégralité de la base de preuves publiques.

Donc, le classement honnête de la vérifiabilité s’établit ainsi : aucun des deux n’a d’exécution indépendante ; celui de Meta est un ensemble de mesures assorties de bases de référence déclarées et d’un résultat négatif divulgué ; celui de ByteDance est une unique affirmation de préférence dont le protocole n’est pas décrit. Aucun des deux n’est reproductible, mais un seul est suffisamment précis pour qu’on puisse en débattre.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs SeedRealtime — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'SeedRealtime'. Rows read: Video — generated output vs perceived input; Where it runs — Muse app vs Doubao app; Developer access — none vs none; Price — none published vs none published; Published figures — 870 ms first byte, 448x768 at 25 fps, 12 sessions per GB200 vs one human preference claim, no numbers; Independent runs — none vs none. A footer line reads 'Both systems author-reported; neither independently evaluated, and neither is callable.'

Le coup que chacun a joué

Les deux systèmes sont des réponses au même problème, et il vaut la peine de constater que ces deux réponses sont différentes.

Pour un système qui observe, le plus difficile est de savoir quand prendre la parole. Un modèle qui reçoit en continu des images de caméra et de l'audio doit décider, sans déclencheur externe, si la personne devant lui a fini de parler, si on s'est adressé à lui, et si l'objet qui vient d'entrer dans le champ est pertinent. C'est le problème que SeedRealtime a déplacé à l'intérieur du modèle, et ByteDance a opéré ce déplacement sur trois modalités plutôt que deux — une version plus difficile de ce que Google, OpenAI et NVIDIA ont chacun fait pour l'audio seul. Les comportements démontrés en découlent : associer une voix à un visage dans une conversation de groupe, prendre la parole sans y être invité lorsqu'un élément entre dans le champ, guider quelqu'un dans un musée ou dans une réparation.

Pour un système qui effectue du rendu, le plus difficile est de rester cohérent. Générer de la vidéo par courts segments causaux signifie que chaque segment est conditionné par le précédent, et le mode de défaillance est la dérive — à la troisième minute, le personnage est discrètement devenu quelqu'un d'autre. La fenêtre glissante de latents vidéo récents de Meta est la réponse à cela, et le flux de tokens partagé est la réponse à une autre défaillance : l'aspect doublé que l'on obtient lorsque l'audio est généré en premier et qu'un modèle de synchronisation labiale est appliqué par-dessus ensuite.

Aucune de ces deux approches n'est disponible dans l'autre système. SeedRealtime n'a pas d'image de référence à laquelle rester fidèle, car il n'effectue le rendu d'aucune personne. Muse Realtime Avatar n'a pas de monde extérieur à suivre, car sa tâche consiste entièrement à produire un visage qui correspond à une voix.

A screenshot of the ByteDance Seed blog post 'SeedRealtime: An Audio-Visual Full-Duplex LLM', dated August 5, 2026, showing the headline, the post date, and the opening description of SeedRealtime as a native audio-visual full-duplex model.

Pourquoi un modèle non appelable reste une question de routage

Ces deux systèmes délèguent. Muse Realtime Avatar repose sur Muse Realtime Voice, qui est la couche conversationnelle d'un agent dont le raisonnement tourne sur Muse Spark — c'est le modèle qui effectue le rendu, pas la réflexion. La conception de SeedRealtime permet à la conversation de se poursuivre pendant que le travail s'effectue en arrière-plan, ce qui signifie que le travail qui dépasse ce qu'il peut faire en ligne part ailleurs et revient. Dans les deux architectures, ce avec quoi l'utilisateur interagit est une interface, et l'intelligence est un modèle textuel distinct qui se trouve derrière.

Ce modèle de texte distinct relève de l'inférence ordinaire, et c'est la partie de la pile que vous pouvez réellement acheter. Sur OrcaRouter, il s'agit d'un point de terminaison unique couvrant 196 modèles issus de 15 fournisseurs, au prix catalogue du fournisseur, répercuté sans aucune marge, avec basculement automatique lorsque le modèle choisi renvoie une erreur ou expire. Nous n'hébergeons pas SeedRealtime — il appartient à ByteDance, au sein de Doubao, et il n'y a rien à router. Nous n'hébergeons pas Muse Realtime Avatar non plus, et personne d'autre ne le fait. Ce que nous proposons, c'est la couche à laquelle les deux systèmes confient leur travail difficile, celle qui change lorsque vous voulez qu'un autre modèle se charge de la réflexion.

Qu’est-ce qui changerait la réponse ?

Pour SeedRealtime, la pièce manquante n'est pas une fonctionnalité — c'est la preuve. Un rapport technique avec un nombre de paramètres, une suite de benchmarks et une évaluation humaine décrite le ferait passer du statut de « démonstration à l'intérieur d'une application » à celui d'un objet sur lequel une équipe pourrait raisonner. Le billet de ByteDance renvoie lui aussi vers des destinations génériques « Try Dola » et « Try in Playground », sans revendiquer de poids ni d'API documentée, ce qui correspond au schéma d'une fonctionnalité produit plutôt qu'à celui d'une publication de modèle.

Pour Muse Realtime Avatar, la pièce manquante est d’ordre commercial : une grille tarifaire, un point de terminaison, une date, ainsi que les conditions de région et d’âge que Meta n’a pas entièrement précisées. La publication de Meta indique que ses démos ne reflètent pas toutes les avatars disponibles dans l’application Muse, et c’est cette phrase qui devrait régir tout plan bâti autour de cela.

Jusqu’à ce que l’un de ces éléments change, la comparaison prend une forme inhabituellement brève. Les deux modèles sont audiovisuels, tous deux sont full-duplex, tous deux relèvent d’une ingénierie vraiment impressionnante, et aucun des deux ne peut être appelé depuis un terminal par quiconque lit ces lignes. La différence réside dans ce que vous feriez avec eux si vous le pouviez : l’un vous donne un personnage qui parle, et l’autre vous donne un système qui remarque.

A screenshot of Meta's research post 'Bringing Your Muse to Life', dated September 23, 2026, showing the headline, the reading time, a vertical portrait video player showing a white furry character, and the opening paragraph introducing Muse Realtime Avatar as embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.