
Muse Realtime Avatar vs SeedRealtime : deux modèles que vous ne pouvez que regarder
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 180 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
Aucun des deux n'a de grille tarifaire. Muse Realtime Avatar, annoncé par Meta le 23 septembre 2026 à l'occasion de Meta Connect, n'a ni API, ni point de terminaison, ni prix, ni date — c'est une capacité de l'agent Muse de Meta, présentée dans un article de recherche intitulé « Bringing Your Muse to Life ». SeedRealtime, publié par ByteDance Seed le 5 août 2026, n'a ni API, ni poids, ni rapport technique, ni nombre de paramètres — il existe au sein de l'application Doubao de ByteDance elle-même, et la publication de ByteDance indique seulement qu'il a été « entièrement déployé ». Deux des plus grandes entreprises d'IA grand public au monde ont livré des systèmes temps réel audio-visuels à sept semaines d'intervalle l'une de l'autre, et aucun des deux n'est achetable. Voilà la comparaison, et elle est bien plus intéressante que le tableau de benchmarks que personne ne peut construire.
Ce qui les sépare, c’est la direction dans laquelle circule la vidéo. SeedRealtime regarde, écoute et parle de ce qu’il voit — l’audio, la vidéo et le texte réunis dans un seul réseau de bout en bout, la gestion des tours de parole étant transférée d’un détecteur externe d’activité vocale vers le modèle lui-même. Muse Realtime Avatar génère : vous lui fournissez une image de référence, une photographie, une illustration ou un objet, et il rend cette chose en train de parler et de gesticuler dans une vidéo continue pendant toute la durée de la conversation. La vidéo de SeedRealtime est une entrée. La vidéo de Muse Realtime Avatar est une sortie. Tous deux sont décrits comme full-duplex, tous deux sont audio-visuels, et ils font des tâches opposées avec cette étiquette.
Ce qu'est chacun, et où il se trouve
Six lignes, et les deux dernières sont celles qui décident de tout.
• Vidéo — Muse Realtime Avatar le génère, en résolution portrait 448×768 et à 25 images par seconde, avec un filigrane en superposition transparente afin qu'un spectateur puisse voir qu'il ne s'agit pas d'un flux de caméra ; SeedRealtime le perçoit, en diffusant les images dans le même réseau que celui qui traite l'audio.
• Le pari architectural — Muse Realtime Avatar partage un seul flux de tokens entre la voix et la vidéo : un Diffusion Transformer piloté par l'audio consomme directement les tokens de parole de Muse Realtime Voice, et rien n'est synchronisé labialement par la suite ; SeedRealtime intègre la gestion des tours de parole au cœur du modèle, de sorte que qui parle et quand cesse de relever de la décision d'un détecteur d'activité vocale externe.
• Où cela s'exécute — Muse Realtime Avatar est une capacité au sein de l'agent Muse de Meta ; SeedRealtime se trouve dans l'application Doubao de ByteDance.
• Accès développeur — aucun des deux n'a d'API. Aucun des deux ne publie ses poids. Il n'existe aucune option sans serveur, aucun point de terminaison hébergé, et aucune plateforme tierce ne propose l'un ou l'autre.
• Prix — non publié pour les deux, car aucune offre commerciale n’existe d’un côté comme de l’autre.
• Évaluation indépendante — aucune pour aucun des deux systèmes. Tous les chiffres que chaque entreprise a publiés au sujet de son propre modèle sont des données internes, et aucun évaluateur externe n'a testé ni l'un ni l'autre.
Deux bases de preuves, toutes deux de première main, et l’une d’elles est beaucoup plus mince
Ici, la comparaison cesse d'être symétrique. Meta a publié quatre chiffres pour Muse Realtime Avatar, tous déclarés par l'entreprise, mesurés par rapport à des références choisies par Meta, et aucun reproduit en dehors de l'entreprise : 870 ms entre la fin de votre tour de parole et le premier octet d'une réponse synchronisée voix et vidéo ; une vidéo portrait en 448×768 à 25 images par seconde ; 60× moins d'évaluations de modèle que sa propre référence ; et 12 sessions temps réel simultanées sur un seul NVIDIA GB200, soit un gain de capacité de 8× par rapport à la référence BF16 en deux étapes de Meta, obtenu grâce à l'entraînement sensible à la quantification en quatre bits et au traitement dynamique par lots sensible à la latence. Meta a aussi publié une comparaison de préférences face à deux systèmes d'avatars commerciaux — 78/22 contre l'un, 88/12 contre l'autre — et a révélé que, sur les maniérismes, le résultat face à l'un d'eux n'est pas statistiquement distinguable de la parité. Cette révélation vaut plus que les victoires ; c'est le genre de résultat que la plupart des annonces de lancement omettent.
Les preuves publiées de SeedRealtime consistent en une évaluation humaine de bout en bout. ByteDance affirme que, face aux systèmes en cascade — un modèle de vision relié à un modèle ASR relié à un LLM relié à une voix de synthèse vocale — SeedRealtime réduit de moitié les problèmes de rythme conversationnel audio-visuel, avec moins de coupures, moins de faux déclenchements et des réponses plus lentes et plus naturelles. Ce que ByteDance n’a pas publié, c’est une taille d’échantillon, une méthodologie, un nombre d’annotateurs, un chiffre de latence en millisecondes, un nom de benchmark ou un score. Un rapport secondaire cite un gain de 12 % en fluidité conversationnelle par rapport aux modèles antérieurs de l’équipe. C’est l’intégralité de la base de preuves publiques.
Donc, le classement honnête de la vérifiabilité s’établit ainsi : aucun des deux n’a d’exécution indépendante ; celui de Meta est un ensemble de mesures assorties de bases de référence déclarées et d’un résultat négatif divulgué ; celui de ByteDance est une unique affirmation de préférence dont le protocole n’est pas décrit. Aucun des deux n’est reproductible, mais un seul est suffisamment précis pour qu’on puisse en débattre.

Le coup que chacun a joué
Les deux systèmes sont des réponses au même problème, et il vaut la peine de constater que ces deux réponses sont différentes.
Pour un système qui observe, le plus difficile est de savoir quand prendre la parole. Un modèle qui reçoit en continu des images de caméra et de l'audio doit décider, sans déclencheur externe, si la personne devant lui a fini de parler, si on s'est adressé à lui, et si l'objet qui vient d'entrer dans le champ est pertinent. C'est le problème que SeedRealtime a déplacé à l'intérieur du modèle, et ByteDance a opéré ce déplacement sur trois modalités plutôt que deux — une version plus difficile de ce que Google, OpenAI et NVIDIA ont chacun fait pour l'audio seul. Les comportements démontrés en découlent : associer une voix à un visage dans une conversation de groupe, prendre la parole sans y être invité lorsqu'un élément entre dans le champ, guider quelqu'un dans un musée ou dans une réparation.
Pour un système qui effectue du rendu, le plus difficile est de rester cohérent. Générer de la vidéo par courts segments causaux signifie que chaque segment est conditionné par le précédent, et le mode de défaillance est la dérive — à la troisième minute, le personnage est discrètement devenu quelqu'un d'autre. La fenêtre glissante de latents vidéo récents de Meta est la réponse à cela, et le flux de tokens partagé est la réponse à une autre défaillance : l'aspect doublé que l'on obtient lorsque l'audio est généré en premier et qu'un modèle de synchronisation labiale est appliqué par-dessus ensuite.
Aucune de ces deux approches n'est disponible dans l'autre système. SeedRealtime n'a pas d'image de référence à laquelle rester fidèle, car il n'effectue le rendu d'aucune personne. Muse Realtime Avatar n'a pas de monde extérieur à suivre, car sa tâche consiste entièrement à produire un visage qui correspond à une voix.

Pourquoi un modèle non appelable reste une question de routage
Ces deux systèmes délèguent. Muse Realtime Avatar repose sur Muse Realtime Voice, qui est la couche conversationnelle d'un agent dont le raisonnement tourne sur Muse Spark — c'est le modèle qui effectue le rendu, pas la réflexion. La conception de SeedRealtime permet à la conversation de se poursuivre pendant que le travail s'effectue en arrière-plan, ce qui signifie que le travail qui dépasse ce qu'il peut faire en ligne part ailleurs et revient. Dans les deux architectures, ce avec quoi l'utilisateur interagit est une interface, et l'intelligence est un modèle textuel distinct qui se trouve derrière.
Ce modèle de texte distinct relève de l'inférence ordinaire, et c'est la partie de la pile que vous pouvez réellement acheter. Sur OrcaRouter, il s'agit d'un point de terminaison unique couvrant 196 modèles issus de 15 fournisseurs, au prix catalogue du fournisseur, répercuté sans aucune marge, avec basculement automatique lorsque le modèle choisi renvoie une erreur ou expire. Nous n'hébergeons pas SeedRealtime — il appartient à ByteDance, au sein de Doubao, et il n'y a rien à router. Nous n'hébergeons pas Muse Realtime Avatar non plus, et personne d'autre ne le fait. Ce que nous proposons, c'est la couche à laquelle les deux systèmes confient leur travail difficile, celle qui change lorsque vous voulez qu'un autre modèle se charge de la réflexion.
Qu’est-ce qui changerait la réponse ?
Pour SeedRealtime, la pièce manquante n'est pas une fonctionnalité — c'est la preuve. Un rapport technique avec un nombre de paramètres, une suite de benchmarks et une évaluation humaine décrite le ferait passer du statut de « démonstration à l'intérieur d'une application » à celui d'un objet sur lequel une équipe pourrait raisonner. Le billet de ByteDance renvoie lui aussi vers des destinations génériques « Try Dola » et « Try in Playground », sans revendiquer de poids ni d'API documentée, ce qui correspond au schéma d'une fonctionnalité produit plutôt qu'à celui d'une publication de modèle.
Pour Muse Realtime Avatar, la pièce manquante est d’ordre commercial : une grille tarifaire, un point de terminaison, une date, ainsi que les conditions de région et d’âge que Meta n’a pas entièrement précisées. La publication de Meta indique que ses démos ne reflètent pas toutes les avatars disponibles dans l’application Muse, et c’est cette phrase qui devrait régir tout plan bâti autour de cela.
Jusqu’à ce que l’un de ces éléments change, la comparaison prend une forme inhabituellement brève. Les deux modèles sont audiovisuels, tous deux sont full-duplex, tous deux relèvent d’une ingénierie vraiment impressionnante, et aucun des deux ne peut être appelé depuis un terminal par quiconque lit ces lignes. La différence réside dans ce que vous feriez avec eux si vous le pouviez : l’un vous donne un personnage qui parle, et l’autre vous donne un système qui remarque.

