Carte héros générée pour l'article « Muse Realtime Avatar vs GPT-Live-1 », montrant deux cartes arrondies de part et d'autre du titre. La carte de gauche affiche « Muse Realtime Avatar » au-dessus d'une icône d'avatar de portrait, ainsi que les lignes « vidéo + voix, un seul flux » et « pas d'API, pas de prix, pas de date » ; la carte de droite affiche « GPT-Live-1 » au-dessus d'une icône de bulle de dialogue, ainsi que les lignes « 0,05 $ par minute, facturé à la seconde » et « sessions simultanées, WebRTC ». Un sous-titre indique « L'un vend des minutes. L'autre vend de la présence. » Le logo OrcaRouter est intégré dans le coin inférieur droit.
Guides & Insights

Muse Realtime Avatar vs GPT-Live-1 : la présence contre la conversation

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

L'unité de facturation vous dit ce que chaque entreprise pense vendre. GPT-Live-1, le modèle vocal full-duplex d'Open​AI, facture un tarif fixe de 0,05 $ par minute de voix, facturée à la seconde, et ses limites de débit sont exprimées en sessions simultanées — 25 au Tier 1, jusqu'à 500 au Tier 5. C'est l'unité d'une ligne téléphonique. Muse Realtime Avatar, annoncé par Meta le 23 septembre 2026, n'a pas d'unité de facturation, car il n'y a rien à facturer : pas d'API, pas de point de terminaison, pas de prix, pas de date. Son unité publiée est plutôt un chiffre matériel — 12 sessions temps réel simultanées sur un seul NVIDIA GB200. Une entreprise vend de la conversation à la minute. L'autre vous montre ce que coûte le rendu d'un visage, et n'a pas encore décidé de le vendre.

Les deux modèles sont relativement récents, et ni l’un ni l’autre ne constitue un lancement au sens où ce terme est habituellement employé. GPT-Live-1 a été déployé dans ChatGPT le 8 juillet 2026 et n’a atteint l’API pour développeurs que le 10 septembre — deux mois durant lesquels il était la voix par défaut d’un produit grand public et inaccessible à quiconque développait. Muse Realtime Avatar a été annoncé le 23 septembre 2026 à Meta Connect, est présenté dans l’article de recherche de Meta lui-même, et demeure une capacité de l’agent Muse plutôt qu’un produit. Les comparer, c’est comparer deux étapes différentes de la même idée : ce qui se passe lorsqu’un modèle conversationnel est suffisamment bon pour que la question suivante soit ce que l’utilisateur regarde pendant qu’il parle.

Ce qu'OpenAI a construit : une conversation qui ne cale jamais

GPT-Live-1 est full-duplex dans le sens qui compte sur le plan opérationnel — il n’attend pas que vous ayez fini avant de commencer à travailler. Il accède à l’API développeur via exactement un point de terminaison, le point de terminaison Live Sessions, sous exactement un ID de modèle, gpt-live-1, sans instantanés datés à épingler et sans points de terminaison frères activés. Pas de Chat Completions, pas de Responses, pas de Realtime, pas de fine-tuning, pas de points de terminaison de transcription audio ou de synthèse vocale. Les entrées image et vidéo ne sont explicitement pas prises en charge.

La décision de conception qui façonne tout ce qui en découle est la délégation. GPT-Live-1 ne se charge pas lui-même de la réflexion complexe. La documentation d'OpenAI associe la couche vocale à un backend de raisonnement distinct, et dans l'exemple WebRTC publié, ce backend est GPT-5.6 Terra. Ainsi, une session GPT-Live-1, ce sont deux compteurs qui tournent en même temps : 0,05 $ la minute pour la voix, plus les tarifs habituels par token du modèle backend pour chaque appel d'outil, recherche et étape de raisonnement qu'il délègue. Dans le Speech to Speech Index, cette personnalité scindée se traduit par le même modèle noté deux fois — 81,5 avec GPT-6 Astra qui effectue la réflexion à effort moyen, 80,1 avec GPT-5.6 Sol à faible effort. L'écart de 1,4 point entre ces deux configurations est plus large que la marge de 0,2 point qui place la meilleure configuration de GPT-Live-1 en première position.

C’est là la forme honnête du modèle. Le front-end vocal est fixe ; l’intelligence est un paramètre que vous définissez, et elle fait davantage bouger le score que n’importe quel modèle concurrent.

Ce que Meta a construit : un visage qui bouge avec la voix

Muse Realtime Avatar s'attaque à un problème que GPT-Live-1 ne connaît pas — maintenir la vidéo générée en parfaite synchronisation avec la parole générée. La réponse de Meta consiste à en faire un seul et même flux : Muse Realtime Voice émet des jetons de parole portant à la fois le contenu et la prosodie, et l'avatar est un Diffusion Transformer piloté par l'audio qui consomme ces mêmes jetons, conditionné par une image de référence et une fenêtre glissante de latents vidéo récents. Rien n'est synchronisé sur les lèvres après coup, car il n'y a pas d'« après coup » — voix, bouche et expression proviennent d'un seul processus.

Les chiffres publiés sont ceux de Meta, mesurés par rapport à des bases de référence que Meta a choisies, et aucun n'a été reproduit en dehors de l'entreprise. 870 ms entre la fin de votre tour et le premier octet d'une réponse synchronisée voix et vidéo. Vidéo portrait 448×768 à 25 images par seconde, filigranée avec une superposition transparente afin qu'un spectateur puisse constater que ce n'est pas une caméra. Douze sessions simultanées sur un seul GB200, un gain de capacité de 8× par rapport à la base de référence BF16 en deux étapes de Meta, grâce à un entraînement conscient de la quantification en quatre bits, à des caches KV persistants et à un traitement par lots dynamique sensible à la latence. Et un résultat de préférence que Meta rapporte comme passant de 45% à 55% par rapport à cette base de référence, avec deux victoires divulguées contre des systèmes d'avatars commerciaux — plus la divulgation que sur le maniérisme, le résultat contre l'un d'eux n'est pas statistiquement distinguable de la parité.

Rien dans cette liste n’est un taux, un point de terminaison ou une date.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs GPT-Live-1 — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'GPT-Live-1'. Rows read: What it returns — video + voice vs audio + text; Where it runs — Muse app only vs Live Sessions API, WebRTC; Billing unit — none published vs $0.05 per minute, by the second; Scale limit — 12 sessions per GB200 vs 25 to 500 concurrent sessions by tier; Independent score — none vs AA Speech to Speech 81.5 with Astra; Reasoning — inside Muse vs delegated to a separate backend model. A footer line reads 'Meta figures company-reported; GPT-Live-1 index figure per Artificial Analysis and configuration-specific.'

La facture de deux mètres, et où le routage gagne sa place

La structure de coûts de GPT-Live-1 ne se résume pas à un seul chiffre, et c'est précisément en la traitant comme telle qu'un modèle vocal d'apparence bon marché génère un mois coûteux. La voix coûte 0,05 $ la minute, facturée à la seconde sans arrondi supérieur, et les 15 premières secondes d'une session sont facturées d'avance mais déduites de la durée ultérieure plutôt que cumulées par-dessus. Tout ce que la session délègue — le raisonnement, les appels d'outils, toute recherche — est facturé séparément aux tarifs propres au modèle backend. Pointez la délégation vers un raisonneur de pointe et laissez-le effectuer une recherche à chaque tour : vous avez alors bâti une ligne ouverte à 3 $ l'heure avec un modèle premium derrière.

Ce second compteur est la moitié routable. Sur OrcaRouter, le backend d'une session GPT-Live-1 n'est qu'un appel de modèle comme un autre : 196 modèles issus de 15 fournisseurs derrière une seule clé, au tarif catalogue du fournisseur, répercuté sans aucune marge, avec bascule automatique lorsque le modèle que vous avez choisi renvoie une erreur ou expire. Vous ne pouvez pas router la couche vocale — Live Sessions est l'endpoint d'Open​AI uniquement — mais tout ce à quoi la couche vocale délègue repose sur une seule clé, ce qui signifie que la part de la facture qui évolue avec l'intensité de la réflexion de vos appelants est aussi celle que vous pouvez modifier sans contrat.

Muse Realtime Avatar, en revanche, n’a aucun compteur à router. C’est une fonctionnalité d’une application.

A screenshot of the Artificial Analysis Speech to Speech leaderboard showing the Speech to Speech Index ranking, with GPT-Live-1 listed at 81.5 in its Astra configuration alongside the other ranked speech-to-speech models.

Deux paris sur la vocation d'un agent vocal

Si l'on met de côté les spécifications, les deux entreprises sont en désaccord sur le produit. Le pari d'Open​AI, c'est que la conversation est le produit — qu'un agent vocal est une ligne téléphonique, et que tout le travail consiste à faire en sorte qu'il en donne l'impression : ne jamais se bloquer, confier les raisonnements difficiles à un modèle en arrière-plan, facturer à la minute, monter en charge selon les appels simultanés. Tous les choix de la surface d'API de GPT-Live-1 découlent de cette idée. Des limites de débit basées sur la concurrence, un transport en WebRTC uniquement, un point de terminaison unique délibérément restreint, aucune vidéo entrante ni sortante.

Le pari de Meta est que la présence est le produit — qu’un utilisateur qui peut voir l’agent est un utilisateur qui reste dans la conversation, et que l’ingénierie intéressante n’est pas l’alternance des tours de parole mais le maintien de la cohérence d’un personnage rendu pendant toute la durée d’un appel. Ces choix produisent un système optimisé pour la fréquence d’images et la densité de session sur un GPU, sans aucune surface commerciale.

Il est tout à fait possible que les deux aient raison et que les deux se composent. Un produit pourrait faire tourner sa conversation sur un modèle vocal full-duplex et sa couche visuelle sur un moteur de rendu d'avatar, et la seule chose qui l'en empêche aujourd'hui, c'est que le moteur de rendu d'avatar n'a pas de point de terminaison. Ce qui n'est pas plausible, c'est de les considérer comme deux versions du même achat.

Qui devrait agir, et qui devrait attendre

Si vous développez un produit vocal aujourd'hui, GPT-Live-1 est appelable et Muse Realtime Avatar ne l'est pas, et cela suffit à trancher. Le choix intéressant au sein de GPT-Live-1, c'est le backend auquel vous déléguez, car c'est là que le score comme la facture bougent réellement — et c'est la seule partie de la pile que vous pouvez router, permuter et basculer en cas de défaillance sans toucher à l'intégration vocale.

Si ce que vous voulez, c’est un avatar, attendre n’est pas passif. Les choses qui méritent d’être surveillées sont précises : si Meta publie une grille tarifaire et un endpoint, si une date annoncée apparaît, et si 870 ms survit au contact d’un téléphone sur une connexion cellulaire plutôt qu’à une démo Connect. Le propre post de Meta note que ses démos ne reflètent pas toutes les avatars disponibles dans l’application Muse, et c’est la phrase à retenir.

Jusqu’à ce que l’un de ces éléments change, la comparaison tient en une ligne. GPT-Live-1 est une ligne téléphonique avec un cerveau que vous choisissez. Muse Realtime Avatar est un visage sans numéro de téléphone.

A screenshot of the OrcaRouter models catalogue page, showing the subtitle '196 models · 15 providers · one API key, one bill', a 'How to call any model' panel with a POST example against the OpenAI-compatible endpoint, and a grid of model cards including DeepSeek V4.1 Flash, GPT-6 Astra, Gemini 3.8 Flash, Qwen3.8 Max and Claude Fable 5.1.