Une carte hero générée pour « Gemini 3.8 Live with Live Avatar » sur fond blanc avec de doux accents bleu et cyan. Trois cartes empilées affichent « 15 sept. 2026 — Gemini 3.8 Live et 3.8 Live Extended Thinking sont déployés sur la Live API », « 24 sept. 2026 — annonce de Live Avatar, Gemini Enterprise » et « Aujourd'hui — l'avatar est une capacité d'entreprise, pas un identifiant de modèle ». Une ligne de pied de page indique « Dates selon Google DeepMind. » Le logo OrcaRouter est intégré dans le coin inférieur droit.
Guides & Insights

Gemini 3.8 Live avec Live Avatar : Google donne un visage à son modèle vocal

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking sont sortis le 15 septembre 2026 — les deux points de terminaison natifs de dialogue en direct que Goog​le a ouverts sur l'API du fournisseur, l'un optimisé pour la latence et l'autre pour la délibération. Le 24 septembre, l'entreprise a annoncé Gemini 3.8 Live with Live Avatar, qui associe une génération vidéo quasi en temps réel à la même boucle vocale, afin que le modèle ait un visage pendant qu'il parle. Rien n'a changé concernant les deux identifiants de modèle. Ce qui a changé, c'est ce à quoi la conversation est autorisée à ressembler, et — plus lourd de conséquences — ce que le modèle est autorisé à faire à la conversation pendant qu'elle est encore en cours.

Qu'est-ce qui a effectivement été livré le 24 septembre

Le post de DeepMind est court et précis, et il vaut la peine de distinguer ce qu'il affirme de ce qu'il signifie. Live Avatar, pour reprendre les propres termes de Google, « apporte une présence visuelle quasi en temps réel à l'IA conversationnelle de Gemini » en associant la génération vidéo en temps réel à la pile vocale existante. L'entreprise décrit une synchronisation labiale précise, des expressions naturelles et une alternance de parole fluide, et donne deux exemples de déploiement : le service client et les visites guidées interactives. Puis elle prononce la phrase qui compte le plus pour quiconque envisage de développer une application — « À compter d'aujourd'hui, Gemini 3.8 Live avec Live Avatar est disponible dans Gemini Enterprise. »

Voilà toute l'histoire de la disponibilité. Live Avatar n'est pas un ID de modèle de l'API Gemini. La liste des modèles audio de l'API contient toujours gemini-3.8-live et gemini-3.8-live-extended-thinking, sans aucune ligne avatar, et la grille tarifaire ne comporte pas de poste avatar. La fonctionnalité arrive dans Gemini Enterprise, ce qui signifie que le public de l'annonce est constitué d'acheteurs d'entreprise et des développeurs qui intègrent pour leur compte, et non du développeur individuel qui appelle aujourd'hui la Live API avec une clé.

Deux des affirmations de la publication méritent d’être citées précisément, car toutes deux sont plus fortes que le langage habituel d’un lancement. La première : Live Avatar « dispose d’une synchronisation parole-parole multilingue native » et « peut passer sans heurt d’une langue à l’autre parmi 97 langues, sans dégrader la fidélité vidéo ni introduire de dérive visuelle ». Le chiffre de 97 correspond au même nombre de langues que celui revendiqué lors du lancement du 15 septembre pour les modèles de dialogue en direct sous-jacents ; il s’agit donc de l’affirmation multilingue existante, reformulée avec une nouvelle contrainte associée — la synchronisation labiale et l’animation faciale doivent suivre lorsque la langue change en milieu de phrase. La seconde : toutes les sorties sont marquées d’un filigrane SynthID, « intégré directement dans la sortie audio et vidéo ». Les deux pistes, pas seulement la voix.

La capacité véritablement nouvelle est celle du milieu.

Passez outre les visuels : le paragraphe le plus intéressant est celui consacré aux appels d’outils. Google affirme que Live Avatar repose sur un « appel d’outils asynchrone » qui peut « déclencher des appels d’outils et récupérer des données en arrière-plan tout en poursuivant un dialogue actif, gérant des tâches complexes tout en assurant un flux de conversation ininterrompu ». L’exemple concret est l’enregistrement d’un client à l’hôtel, où le modèle appelle des outils en arrière-plan et continue de parler.

C'est une véritable différence architecturale par rapport à la forme requête-réponse autour de laquelle la plupart des intégrations vocales sont construites, et c'est la partie qui a un coût. L'exécution asynchrone signifie que le modèle effectue un travail que la transcription ne montre pas. Dans un pipeline textuel, vous verriez l'appel d'outil comme un tour. Ici, cela se produit sous une conversation encore en cours, ce qui soulève les mêmes questions que toute exécution concurrente : que se passe-t-il si l'appel d'outil échoue silencieusement au milieu d'une phrase, et comment l'appelant le sait-il ? Le post de Google ne le dit pas, et la fiche modèle est l'endroit où chercher cela. Considérez l'affirmation de « flux conversationnel ininterrompu » comme rapportée par le fournisseur et non testée par un tiers que nous puissions trouver.

Avatars prédéfinis, et la liste d’autorisation qui limite la moitié intéressante

L’histoire de la personnalisation comporte deux niveaux, et un seul d’entre eux est en disponibilité générale. Chaque déploiement d’entreprise reçoit « une bibliothèque d’avatars prédéfinis et variés ». Les avatars personnalisés — générés « à partir d’une image de référence de haute qualité » tout en « préservant la ressemblance avec la référence, le style de la marque ou l’identité du personnage » — sont derrière un accès restreint, et Google le dit sans détour : « La création d’avatars personnalisés n’est actuellement disponible que par le biais d’une liste d’autorisation d’entreprise. »

Ainsi, la capacité que la plupart des équipes voudront réellement, celle qui permet à un avatar de correspondre à une marque ou à un personnage nommé, est celle que vous ne pouvez pas activer en autonomie. Si votre plan dépend d’un présentateur synthétique qui ressemble à votre mascotte, vous attendez une décision d’inscription sur liste d’autorisation, et non la sortie d’un modèle. C’est un fait d’approvisionnement, pas un fait technique, et c’est le genre de chose qui décale discrètement un trimestre.

A screenshot of the Google DeepMind blog post 'Introducing Gemini 3.8 Live with Live Avatar', captured in English on 25 September 2026, showing the 24 September 2026 date, the authors listed as Shuo-yiin Chang and CJ Zheng on behalf of the Gemini Audio Team, the lede 'Building on the momentum of last week's Gemini 3.8 Live launch', the sentence 'Starting today, Gemini 3.8 Live with Live Avatar is available in Gemini Enterprise', and the section heading 'More natural and multimodal conversations'.

Où il se situe par rapport au reste de la ligne

Live Avatar n'est pas arrivé dans une famille de produits vide, et la position qu'il occupe se voit le plus facilement par rapport aux produits frères lancés la même quinzaine.

• Proposé sous — Gemini 3.8 Live avec Live Avatar est une capacité d’entreprise au sein de Gemini Enterprise, tandis que Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking sont des points de terminaison de l’API Gemini avec des ID de modèle et des tarifs à la minute publiés
• Appelable par les développeurs — Live Avatar : non, pas d’ID de modèle ni de ligne de tarification, tandis que les deux points de terminaison Live : oui, gemini-3.8-live et gemini-3.8-live-extended-thinking
• Sortie — Live Avatar : audio plus vidéo synchronisée, tandis que les points de terminaison Live : audio uniquement
• Prise en charge des langues annoncée — Live Avatar : 97 langues avec synchronisation labiale et continuité des expressions, tandis que les points de terminaison Live : 97 langues avec bascule automatique en cours de conversation
• Filigrane — Live Avatar : SynthID sur la piste audio et la piste vidéo, tandis que les points de terminaison Live : SynthID sur l’audio généré

Les deux points de terminaison Live eux-mêmes sont la paire bien documentée. Des mesures indépendantes les placent loin l'un de l'autre sur certains axes et proches sur d'autres : sur l'Artificial Analysis Speech to Speech Index, Gemini 3.8 Live Extended Thinking (High) se situe à 82,6 contre 76,0 pour Gemini 3.8 Live, un écart qui repose principalement sur la qualité du raisonnement plutôt que sur la dynamique conversationnelle, où le classement s'inverse. Les propres chiffres de Google les donnent à 68,6 % et 30,1 % sur l'achèvement des tâches τ-Voice, et à 98 % et 92 % sur Big Bench Audio. Live Avatar hérite de celui des deux que vous appelez en dessous, ainsi que de sa tarification, car l'avatar est une couche de présentation au-dessus de la même boucle de conversation.

A screenshot of the Artificial Analysis Speech to Speech leaderboard, captured in English on 25 September 2026, showing the AA Speech to Speech Index speed and cost-per-hour-of-input-audio panel. The top index values read 82.6, 81.5, 81.3, 80.1, 76.0, 73.9 and 71.5, with a cost axis running to roughly $10.75 per hour. The bar labels are set vertically and are not legible at capture size.

Ce que cela ne change pas

Cela n’améliore pas les modèles. Live Avatar est une couche de présentation et d’orchestration : les chiffres de qualité de Gemini 3.8 Live sont ceux qu’ils étaient le 15 septembre, et quiconque a besoin de la plus puissante des deux variantes doit toujours choisir Extended Thinking et accepter sa latence. Il ne met pas de vidéo dans l’API. Et il ne change pas le prix de la conversation avec le modèle, qui est toujours facturé selon les tarifs audio à la minute de la Live API — 0,005 $ par minute d’audio en entrée et 0,018 $ par minute d’audio en sortie — la génération vidéo de l’avatar n’ayant pas de prix public, car elle n’est pas vendue séparément.

Ce que cela change, c'est l'ensemble des produits que l'on peut construire sans couche de rendu distincte. Un agent de support qui, auparavant, parlait et laissait un panneau vide à l'écran peut désormais afficher un visage pendant qu'il travaille, et le travail qu'il effectue en arrière-plan n'est plus visible comme un temps mort. C'est un changement significatif dans la forme d'une interface et un changement modeste du modèle sous-jacent. Ces deux choses peuvent être vraies en même temps.

A generated summary card for Gemini 3.8 Live with Live Avatar on a white background with soft blue-and-cyan gradient accents. Four rows read 'Announced: 24 September 2026', 'Underlying models: gemini-3.8-live and gemini-3.8-live-extended-thinking, unchanged', 'Availability: Gemini Enterprise; custom avatars by enterprise allowlist', and 'Watermark: SynthID on audio and video'. A footer line reads 'Per Google DeepMind, 24 September 2026; vendor-reported and not independently benchmarked.' The OrcaRouter logo is composited in the bottom-right corner.

Quoi regarder, et une note de routage

Trois choses feraient passer cela d’une annonce à une décision de développement. La mise en liste blanche des avatars personnalisés devrait s’ouvrir, car les avatars prédéfinis sont une démo et les avatars personnalisés sont un produit. La piste vidéo devrait avoir un prix, car personne ne peut modéliser l’économie unitaire d’une sortie non tarifée. Et un point de terminaison d’avatar devrait apparaître dans la liste des modèles de l’API, car c’est la différence entre une fonctionnalité d’entreprise et quelque chose qu’un développeur peut appeler ce soir.

De notre côté, une chose mérite d'être précisée, car il est facile de supposer le contraire : OrcaRouter n'achemine pas les endpoints Gemini 3.8 Live ni Live Avatar, et rien ici ne doit être lu comme une affirmation qu'il le fait. Ce que nous proposons, c'est le reste de la gamme 3.8 de Goog​le — google/gemini-3.8-flash notamment — ainsi qu'un catalogue de plus de 200 modèles depuis une seule clé, au prix catalogue du fournisseur et sans marge. Si Live Avatar oriente votre architecture vers un agent qui doit raisonner sur ce que le client a dit, la moitié « raisonnement » de cette pile est celle que vous pouvez consolider dès aujourd'hui.