Une carte hero générée pour l'article « Muse Realtime Avatar vs Gemini 3.8 Live », montrant deux cartes arrondies de part et d'autre du titre. La carte de gauche affiche « Muse Realtime Avatar » au-dessus d'une icône de cadre vidéo et les lignes « video + voice out », « 448x768 portrait, 25 fps » et « annoncé le 23 sept., pas d'API » ; la carte de droite affiche « Gemini 3.8 Live » au-dessus d'une icône de microphone et de bulle de parole et les lignes « audio + text out », « 0,005 $/min en entrée audio » et « GA le 15 sept., Live API ». Un sous-titre indique « L'un rend un visage. L'autre fait tourner une ligne téléphonique. » Le logo OrcaRouter est intégré dans le coin inférieur droit.
Guides & Insights

Muse Realtime Avatar vs Gemini 3.8 Live : un visage contre une ligne vocale

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Ces deux-là ne sont pas interchangeables, et le moyen le plus rapide de s'en rendre compte est de se demander ce qui sort de chacun d'eux. Muse Realtime Avatar, annoncé par Meta le 23 septembre 2026, renvoie la vidéo synchronisée d'un personnage en train de parler — vous fournissez une image de référence et il génère cette entité qui parle et gesticule dans des cadres au format portrait 448×768. Gemini 3.8 Live, annoncé par Goog​le le 15 septembre 2026 et disponible en général pour les développeurs le jour même, renvoie de l'audio et du texte. Il n'a aucune sortie vidéo. Les placer dans la même comparaison n'est pas une erreur — les deux se disputent la même surface conversationnelle, et les acheteurs demandent déjà lequel des deux choisir comme base — mais la décision n'est pas « lequel est le meilleur ». Elle est « lequel de ces deux produits différents me faut-il », et presque toutes les comparaisons publiées du duo se trompent à ce sujet en alignant des benchmarks qui mesurent des choses différentes.

Voici l’asymétrie qui devrait servir de cadre à tout ce qui suit. Vous pouvez appeler Gemini 3.8 Live dès aujourd’hui, depuis un terminal, avec une clé. Vous ne pouvez pas du tout appeler Muse Realtime Avatar — pas d’API, pas de prix, pas de date. Meta l’a présenté à Connect et a publié un article de recherche ; Goog​le a livré une grille tarifaire et un identifiant de modèle. C’est une comparaison entre un produit et une annonce, et cela signifie que la question utile n’est pas de savoir lequel gagne, mais ce à quoi chacun vous engage.

Ce que chacun produit réellement

C'est toute la comparaison en six lignes, et aucune des six n'est proche.

Sortie — Muse Realtime Avatar renvoie une voix et une vidéo de portrait synchronisées, générées ensemble à partir d'un seul flux de jetons de parole ; Gemini 3.8 Live renvoie de l'audio et du texte, sans aucune génération vidéo nulle part dans le modèle.

Accès développeur — Muse Realtime Avatar n'en propose aucun : il a été annoncé le 23 septembre 2026 comme une capacité de l'agent Muse de Meta, sans API, sans point de terminaison et sans date annoncée. Gemini 3.8 Live est disponible dans l'API Gemini et dans Goog​le AI Studio depuis le 15 septembre 2026, sous deux identifiants de modèle, gemini-3.8-live et gemini-3.8-live-extended-thinking.

Prix — Muse Realtime Avatar n'a pas de prix publié, car il n'y a rien à acheter. Gemini 3.8 Live publie 0,005 $ par minute d'entrée audio et 0,018 $ par minute de sortie audio via la Live API.

Évaluation indépendante — Muse Realtime Avatar n'en propose aucune ; ses chiffres proviennent de Meta elle-même, mesurés par rapport à des références choisies par Meta. Gemini 3.8 Live obtient 76,0 sur l'Artificial Analysis Speech to Speech Index, sa variante à réflexion étendue atteignant 82,6 — un chiffre tiers, ce qui relève d'une autre catégorie de preuve.

Latence — les deux chiffres publiés ne relèvent pas de la même mesure, et c'est là que la plupart des analyses se trompent. Meta annonce 870 ms entre la fin de votre tour de parole et le premier octet d'une réponse voix et vidéo synchronisée. Le chiffre de Google, tel que mesuré par Artificial Analysis, est de 1,18 seconde jusqu'au premier son pour le modèle standard et de 1,35 seconde pour la variante de raisonnement.

Fréquence d'images et langue — Muse Realtime Avatar génère une vidéo portrait en 448×768 à 25 images par seconde. Gemini 3.8 Live assure un basculement automatique en cours de conversation entre 97 langues prises en charge et traite en quasi-temps réel une entrée visuelle.

Cette dernière ligne contient la distinction que les gens ne cessent de confondre. Gemini 3.8 Live peut voir. Il ne peut pas montrer. Muse Realtime Avatar peut montrer. Savoir s'il peut voir n'est pas le sujet du post de Meta — c'est un générateur piloté par l'audio, conditionné sur des tokens de parole et une image de référence, et son rôle est de produire un visage plutôt que d'en lire un.

A generated comparison scoreboard titled 'Muse Realtime Avatar vs Gemini 3.8 Live — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'Gemini 3.8 Live'. Rows read: Output — video + voice vs audio + text; Developer access — none, announced only vs Live API and AI Studio; Price — none published vs $0.005/min in, $0.018/min out; Independent score — none vs AA Speech to Speech 76.0; Latency — 870 ms to first byte of voice + video vs 1.18 s to first audio; Frame — 448x768 portrait at 25 fps vs audio only, 97 languages. A footer line reads 'Meta figures company-reported; Google and index figures per Artificial Analysis.'

Les chiffres de latence ne sont pas comparables, et l'écart est plus petit qu'il n'y paraît.

870 ms contre 1,18 seconde, voilà qui donne l'impression que Meta est 26 % plus rapide. Examinez les mesures et la comparaison se dissout. Le chiffre de Meta correspond au temps écoulé entre la fin du tour de l'utilisateur et le premier octet d'une réponse incluant de la vidéo — et le billet de Meta précise explicitement qu'il s'agit d'une mesure du premier octet, non du temps nécessaire à une réponse complète ni de la latence de livraison continue pour le reste de l'appel. Un système peut atteindre 870 ms jusqu'au premier octet et paraître malgré tout poussif à la douzième seconde. Le chiffre de Goog​le correspond au temps jusqu'au premier audio, une chose strictement plus petite à produire, et il est mesuré par un évaluateur externe plutôt que par le fournisseur.

Les deux sont le genre de chiffre qui indique qu’un système est conversationnel plutôt que basé sur des tours, et aucun des deux ne dit ce que l’appel donne au bout de cinq minutes. Si vous choisissez entre eux sur la réactivité, la position honnête est que personne n’a publié de mesure comparable, et la seule façon d’en obtenir une est de lancer celui qui est appelable.

Ce sur quoi vous pouvez vous appuyer aujourd'hui, et ce pour quoi vous devriez attendre

Gemini 3.8 Live arrive avec ce dont une décision de production a besoin : deux identifiants de modèle que vous pouvez épingler, des tarifs publiés à la minute, un score d’indice tiers et une date de disponibilité générale annoncée. Il présente aussi les contraintes qu’un produit vocal a habituellement — entrée audio, sortie audio et texte, et aucune génération vidéo.

Muse Realtime Avatar présente ce qu’on trouve dans un article de recherche : une architecture, quatre chiffres rapportés par l’entreprise, et une série de tests de préférence divulgués que Meta a menés face à deux systèmes d’avatars commerciaux, dont l’un, selon Meta elle-même, serait statistiquement indiscernable de la parité sur le plan des maniérismes. Ce qu’il n’a pas, c’est un moyen de l’acheter. La publication de Meta note également que les démos présentées ne reflètent pas toutes des avatars disponibles dans l’application Muse, et c’est la phrase qui devrait régir tout plan que vous élaborez autour de cela.

Il existe une troisième option qui mérite d’être nommée, car c’est celle que la plupart des équipes adoptent en réalité. Aucun de ces modèles n’est un agent complet. Gemini 3.8 Live confie le travail en arrière-plan à des outils et des API tout en continuant de parler ; GPT-Live-1 délègue entièrement son raisonnement à un modèle de back-end distinct. La couche conversationnelle constitue l’interface, et la réflexion est un appel distinct à un modèle distinct. Ce second appel est une inférence textuelle ordinaire, et il est routable.

Sur OrcaRouter, cette couche se résume à un seul point de terminaison : 196 modèles de 15 fournisseurs derrière une seule clé, au prix catalogue du fournisseur, répercuté sans aucune marge, avec basculement automatique si le modèle que vous avez choisi renvoie une erreur ou expire. Nous n'hébergeons pas Gemini 3.8 Live — l'API Live est l'apanage de Google — et nous n'hébergeons pas Muse Realtime Avatar, que personne n'héberge. Ce que nous proposons, c'est la moitié d'un agent vocal qui évolue selon l'intensité de la réflexion de vos appelants, et la moitié que vous pouvez modifier sans renégocier quoi que ce soit.

A screenshot of Google's blog post 'Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking', dated September 15, 2026, showing the announcement headline and the opening of the post introducing the two speech-to-speech models.

Là où les deux pourraient réellement se rejoindre

Ce qui justifie de les mettre côte à côte, ce ne sont pas les benchmarks. C’est que tous deux tentent d’occuper la même place dans un produit : celle de l’interlocuteur auquel un utilisateur s’adresse. Le pari de Google est que cette place est une conversation et que le livrable est bon — 97 langues, exécution d’outils en arrière-plan, une variante de raisonnement qui résout 68,6 % des scénarios de service client de τ-Voice, contre 30,1 % pour le modèle standard. Le pari de Meta est que cette place est une présence, et qu’un utilisateur qui peut voir l’agent est un utilisateur qui reste dans la conversation.

Ces paris ne sont pas exclusifs. Un produit pourrait plausiblement utiliser Gemini 3.8 Live pour la boucle vocale et quelque chose comme Muse Realtime Avatar pour la couche visuelle, si la couche avatar devient un jour appelable. Ce qu'il ne peut pas faire, c'est les traiter comme interchangeables, car l'un d'eux ne vous donnera jamais de visage et l'autre pourrait ne jamais vous donner de point de terminaison.

Comment décider

Si vous lancez un produit vocal ce trimestre, la décision est déjà prise pour vous : Gemini 3.8 Live est appelable et Muse Realtime Avatar ne l'est pas. Choisissez votre variante selon l'axe qui fait réellement débat dans cette version — le modèle à réflexion étendue apporte 38 points d'achèvement de tâches agentiques pour un peu plus de quatre fois le coût horaire de l'audio, et le modèle standard est le modèle vocal compétent le moins cher du classement public. Ensuite, acheminez le raisonnement délégué séparément, car c'est là que se trouvent à la fois la facture et la latence.

Si vous évaluez une couche d'avatar, la réponse honnête est qu'il n'y a encore rien à évaluer. Ce qui existe est un article de recherche avec quatre chiffres rapportés par l'entreprise et une démonstration. Ce qu'il faut surveiller n'est pas l'indice — Muse Realtime Avatar n'apparaîtra pas sur un — mais si Meta publie une grille tarifaire, un point de terminaison et une date, et si ses 870 ms tiennent le coup lorsque l'avatar tourne sur un téléphone avec une connexion cellulaire plutôt que dans une démo Connect.

D'ici là, la comparaison a une forme plus courte que celle que lui donnent la plupart des articles. L'un de ces éléments est un produit avec un prix, un identifiant de modèle et un score externe. L'autre est une très bonne démonstration de quelque chose qui n'a encore rien de tout cela.

A screenshot of the Artificial Analysis Speech to Speech leaderboard, showing the Speech to Speech Index ranking with Gemini 3.8 Live Extended Thinking at 82.6 and Gemini 3.8 Live at 76.0 among the listed rows, alongside panels for time to first audio and cost per hour of input audio.