
Gemini 3.8 Live avec Live Avatar : Google donne un visage à son modèle vocal
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 36 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 181 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking sont sortis le 15 septembre 2026 — les deux points de terminaison natifs de dialogue en direct que Google a ouverts sur l'API du fournisseur, l'un optimisé pour la latence et l'autre pour la délibération. Le 24 septembre, l'entreprise a annoncé Gemini 3.8 Live with Live Avatar, qui associe une génération vidéo quasi en temps réel à la même boucle vocale, afin que le modèle ait un visage pendant qu'il parle. Rien n'a changé concernant les deux identifiants de modèle. Ce qui a changé, c'est ce à quoi la conversation est autorisée à ressembler, et — plus lourd de conséquences — ce que le modèle est autorisé à faire à la conversation pendant qu'elle est encore en cours.
Qu'est-ce qui a effectivement été livré le 24 septembre
Le post de DeepMind est court et précis, et il vaut la peine de distinguer ce qu'il affirme de ce qu'il signifie. Live Avatar, pour reprendre les propres termes de Google, « apporte une présence visuelle quasi en temps réel à l'IA conversationnelle de Gemini » en associant la génération vidéo en temps réel à la pile vocale existante. L'entreprise décrit une synchronisation labiale précise, des expressions naturelles et une alternance de parole fluide, et donne deux exemples de déploiement : le service client et les visites guidées interactives. Puis elle prononce la phrase qui compte le plus pour quiconque envisage de développer une application — « À compter d'aujourd'hui, Gemini 3.8 Live avec Live Avatar est disponible dans Gemini Enterprise. »
Voilà toute l'histoire de la disponibilité. Live Avatar n'est pas un ID de modèle de l'API Gemini. La liste des modèles audio de l'API contient toujours gemini-3.8-live et gemini-3.8-live-extended-thinking, sans aucune ligne avatar, et la grille tarifaire ne comporte pas de poste avatar. La fonctionnalité arrive dans Gemini Enterprise, ce qui signifie que le public de l'annonce est constitué d'acheteurs d'entreprise et des développeurs qui intègrent pour leur compte, et non du développeur individuel qui appelle aujourd'hui la Live API avec une clé.
Deux des affirmations de la publication méritent d’être citées précisément, car toutes deux sont plus fortes que le langage habituel d’un lancement. La première : Live Avatar « dispose d’une synchronisation parole-parole multilingue native » et « peut passer sans heurt d’une langue à l’autre parmi 97 langues, sans dégrader la fidélité vidéo ni introduire de dérive visuelle ». Le chiffre de 97 correspond au même nombre de langues que celui revendiqué lors du lancement du 15 septembre pour les modèles de dialogue en direct sous-jacents ; il s’agit donc de l’affirmation multilingue existante, reformulée avec une nouvelle contrainte associée — la synchronisation labiale et l’animation faciale doivent suivre lorsque la langue change en milieu de phrase. La seconde : toutes les sorties sont marquées d’un filigrane SynthID, « intégré directement dans la sortie audio et vidéo ». Les deux pistes, pas seulement la voix.
La capacité véritablement nouvelle est celle du milieu.
Passez outre les visuels : le paragraphe le plus intéressant est celui consacré aux appels d’outils. Google affirme que Live Avatar repose sur un « appel d’outils asynchrone » qui peut « déclencher des appels d’outils et récupérer des données en arrière-plan tout en poursuivant un dialogue actif, gérant des tâches complexes tout en assurant un flux de conversation ininterrompu ». L’exemple concret est l’enregistrement d’un client à l’hôtel, où le modèle appelle des outils en arrière-plan et continue de parler.
C'est une véritable différence architecturale par rapport à la forme requête-réponse autour de laquelle la plupart des intégrations vocales sont construites, et c'est la partie qui a un coût. L'exécution asynchrone signifie que le modèle effectue un travail que la transcription ne montre pas. Dans un pipeline textuel, vous verriez l'appel d'outil comme un tour. Ici, cela se produit sous une conversation encore en cours, ce qui soulève les mêmes questions que toute exécution concurrente : que se passe-t-il si l'appel d'outil échoue silencieusement au milieu d'une phrase, et comment l'appelant le sait-il ? Le post de Google ne le dit pas, et la fiche modèle est l'endroit où chercher cela. Considérez l'affirmation de « flux conversationnel ininterrompu » comme rapportée par le fournisseur et non testée par un tiers que nous puissions trouver.
Avatars prédéfinis, et la liste d’autorisation qui limite la moitié intéressante
L’histoire de la personnalisation comporte deux niveaux, et un seul d’entre eux est en disponibilité générale. Chaque déploiement d’entreprise reçoit « une bibliothèque d’avatars prédéfinis et variés ». Les avatars personnalisés — générés « à partir d’une image de référence de haute qualité » tout en « préservant la ressemblance avec la référence, le style de la marque ou l’identité du personnage » — sont derrière un accès restreint, et Google le dit sans détour : « La création d’avatars personnalisés n’est actuellement disponible que par le biais d’une liste d’autorisation d’entreprise. »
Ainsi, la capacité que la plupart des équipes voudront réellement, celle qui permet à un avatar de correspondre à une marque ou à un personnage nommé, est celle que vous ne pouvez pas activer en autonomie. Si votre plan dépend d’un présentateur synthétique qui ressemble à votre mascotte, vous attendez une décision d’inscription sur liste d’autorisation, et non la sortie d’un modèle. C’est un fait d’approvisionnement, pas un fait technique, et c’est le genre de chose qui décale discrètement un trimestre.

Où il se situe par rapport au reste de la ligne
Live Avatar n'est pas arrivé dans une famille de produits vide, et la position qu'il occupe se voit le plus facilement par rapport aux produits frères lancés la même quinzaine.
• Proposé sous — Gemini 3.8 Live avec Live Avatar est une capacité d’entreprise au sein de Gemini Enterprise, tandis que Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking sont des points de terminaison de l’API Gemini avec des ID de modèle et des tarifs à la minute publiés
• Appelable par les développeurs — Live Avatar : non, pas d’ID de modèle ni de ligne de tarification, tandis que les deux points de terminaison Live : oui, gemini-3.8-live et gemini-3.8-live-extended-thinking
• Sortie — Live Avatar : audio plus vidéo synchronisée, tandis que les points de terminaison Live : audio uniquement
• Prise en charge des langues annoncée — Live Avatar : 97 langues avec synchronisation labiale et continuité des expressions, tandis que les points de terminaison Live : 97 langues avec bascule automatique en cours de conversation
• Filigrane — Live Avatar : SynthID sur la piste audio et la piste vidéo, tandis que les points de terminaison Live : SynthID sur l’audio généré
Les deux points de terminaison Live eux-mêmes sont la paire bien documentée. Des mesures indépendantes les placent loin l'un de l'autre sur certains axes et proches sur d'autres : sur l'Artificial Analysis Speech to Speech Index, Gemini 3.8 Live Extended Thinking (High) se situe à 82,6 contre 76,0 pour Gemini 3.8 Live, un écart qui repose principalement sur la qualité du raisonnement plutôt que sur la dynamique conversationnelle, où le classement s'inverse. Les propres chiffres de Google les donnent à 68,6 % et 30,1 % sur l'achèvement des tâches τ-Voice, et à 98 % et 92 % sur Big Bench Audio. Live Avatar hérite de celui des deux que vous appelez en dessous, ainsi que de sa tarification, car l'avatar est une couche de présentation au-dessus de la même boucle de conversation.

Ce que cela ne change pas
Cela n’améliore pas les modèles. Live Avatar est une couche de présentation et d’orchestration : les chiffres de qualité de Gemini 3.8 Live sont ceux qu’ils étaient le 15 septembre, et quiconque a besoin de la plus puissante des deux variantes doit toujours choisir Extended Thinking et accepter sa latence. Il ne met pas de vidéo dans l’API. Et il ne change pas le prix de la conversation avec le modèle, qui est toujours facturé selon les tarifs audio à la minute de la Live API — 0,005 $ par minute d’audio en entrée et 0,018 $ par minute d’audio en sortie — la génération vidéo de l’avatar n’ayant pas de prix public, car elle n’est pas vendue séparément.
Ce que cela change, c'est l'ensemble des produits que l'on peut construire sans couche de rendu distincte. Un agent de support qui, auparavant, parlait et laissait un panneau vide à l'écran peut désormais afficher un visage pendant qu'il travaille, et le travail qu'il effectue en arrière-plan n'est plus visible comme un temps mort. C'est un changement significatif dans la forme d'une interface et un changement modeste du modèle sous-jacent. Ces deux choses peuvent être vraies en même temps.

Quoi regarder, et une note de routage
Trois choses feraient passer cela d’une annonce à une décision de développement. La mise en liste blanche des avatars personnalisés devrait s’ouvrir, car les avatars prédéfinis sont une démo et les avatars personnalisés sont un produit. La piste vidéo devrait avoir un prix, car personne ne peut modéliser l’économie unitaire d’une sortie non tarifée. Et un point de terminaison d’avatar devrait apparaître dans la liste des modèles de l’API, car c’est la différence entre une fonctionnalité d’entreprise et quelque chose qu’un développeur peut appeler ce soir.
De notre côté, une chose mérite d'être précisée, car il est facile de supposer le contraire : OrcaRouter n'achemine pas les endpoints Gemini 3.8 Live ni Live Avatar, et rien ici ne doit être lu comme une affirmation qu'il le fait. Ce que nous proposons, c'est le reste de la gamme 3.8 de Google — google/gemini-3.8-flash notamment — ainsi qu'un catalogue de plus de 200 modèles depuis une seule clé, au prix catalogue du fournisseur et sans marge. Si Live Avatar oriente votre architecture vers un agent qui doit raisonner sur ce que le client a dit, la moitié « raisonnement » de cette pile est celle que vous pouvez consolider dès aujourd'hui.
