
Gemini 3.8 Live vs Gemini 3.8 TTS : une boucle de conversation et une voix de lecture partagent un nom de génération
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 36 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 181 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
Gemini 3.8 Live est un modèle parole-à-parole lancé le 15 septembre 2026 sous les identifiants gemini-3.8-live et gemini-3.8-live-extended-thinking. « Gemini 3.8 TTS » n'est pas un modèle du tout : c'est le terme générique que la couverture du lancement, y compris le titre du billet de Google lui-même, emploie pour désigner la paire de points de terminaison de synthèse vocale arrivés le 23 septembre 2026 sous les noms gemini-3.8-flash-tts et gemini-3.8-flash-lite-tts. Il ne s'agit donc pas de la page comparative habituelle, où deux produits se disputent une même tâche. C'est une page consacrée à deux tâches qui partagent un numéro de génération, et à l'erreur précise que commettent les gens lorsqu'ils traitent les mots « Live » et « TTS » comme deux variantes d'une même chose.
Le fork que masque le numéro de génération partagé
La documentation de Google sur la génération vocale trace elle-même la frontière, et cette phrase peut facilement passer inaperçue : « La fonctionnalité TTS diffère de la génération vocale fournie via l’API Live. » Le même passage explique pourquoi, et la raison est structurelle plutôt qu’une question de qualité. L’API Live est conçue pour « l’audio interactif et non structuré, ainsi que les entrées et sorties multimodales ». Le TTS via l’API Gemini « est adapté aux scénarios qui exigent une récitation exacte du texte avec un contrôle précis ». Une note ultérieure rend explicite la forme de l’entrée : les modèles TTS ne prennent que du texte et ne renvoient que de l’audio.
Cette unique contrainte — texte en entrée, audio en sortie, aucune entrée audio — constitue toute la comparaison. Un modèle Gemini 3.8 Live entend la personne qui lui parle. Un modèle Gemini 3.8 Flash TTS ou Flash-Lite TTS n'entend jamais personne ; il lit une chaîne et l'interprète. Tout le reste en découle : les benchmarks qui existent pour l'un sont dénués de sens pour l'autre, la tarification est mesurée en unités différentes, et les modes de défaillance ne sont pas comparables du tout.
Cela compte parce que les deux cas d'usage sont identiques vus de l'extérieur. Un agent vocal et une chaîne de narration finissent tous deux par produire une parole qui sonne humaine. Seul l'un des deux peut être interrompu.
Où « Gemini 3.8 TTS » se résout réellement
Ouvrez le tableau des modèles pris en charge pour la génération vocale de l'API Gemini et vous y trouverez quatre entrées TTS et aucune entrée appelée Gemini 3.8 TTS. Deux d'entre elles appartiennent à cette génération : Gemini 3.8 Flash TTS, ID de modèle gemini-3.8-flash-tts, avec 130 langues, et Gemini 3.8 Flash-Lite TTS, ID de modèle gemini-3.8-flash-lite-tts, avec 101 langues. Les deux autres — Gemini 3.1 Flash TTS Preview et Gemini 2.5 Pro Preview TTS — sont la génération preview que Flash-Lite remplace.
Alors quand quelqu’un dit « Gemini 3.8 TTS », il fait généralement référence au niveau Flash, car c’est celui que le billet de lancement met en avant et celui que le classement Arena place le plus haut. Quand il le dit à propos d’un agent vocal en direct, il ne fait référence à rien, car ce qu’il veut se trouve sur un point de terminaison différent, avec un nom différent et un contrat d’entrée différent.
Il y a une troisième collision qu’il vaut la peine de nommer, car elle produit les pires conseils. Gemini 3.8 Live n’est pas un modèle de synthèse vocale avec des fonctionnalités supplémentaires. C’est un modèle de parole à parole, et la raison pour laquelle il coûte plus cher par unité est qu’il fait davantage de travail par unité : écouter, raisonner en pleine élocution, gérer les interruptions et, dans la variante Extended Thinking, délibérer avant de répondre.
Le seul numéro qui compare vraiment
Les scores de qualité ne se transfèrent pas entre ces deux familles ; aucune grille unique ne note un narrateur et une voix conversationnelle sur le même axe. L’argent, lui, se transfère, dès lors qu’on choisit l’unité honnêtement, et l’unité honnête pour tout ce qui relève de la voix est l’heure audio.
• Facturation à l'entrée — Gemini 3.8 Live facture à la minute d'audio, 0,005 $ par minute en entrée et 0,018 $ par minute en sortie, contre Gemini 3.8 Flash TTS qui facture au million de tokens audio, 9,00 $ jusqu'au 31 décembre 2026 et 18,00 $ ensuite
• Facturation à la sortie — l'audio bidirectionnel de Gemini 3.8 Live revient à environ 1,38 $ pour une heure d'entrée et de sortie simultanées au tarif catalogue, avant tout cache de prompt, contre Gemini 3.8 Flash TTS qui est un flux unidirectionnel, et un million de caractères de narration finalisée revient à 16,5 $ selon la normalisation d'Artificial Analysis
• Entrée de texte — Gemini 3.8 Live facture le texte et l'audio sur des lignes distinctes, 0,75 $ par million de tokens de texte en entrée et 4,50 $ en sortie, contre les points de terminaison TTS qui facturent l'entrée de texte à 0,50 $ par million de tokens
• Niveau Flash-Lite — Gemini 3.8 Live n'a pas d'équivalent moins cher ; le choix se fait entre Live et Extended Thinking, contre Gemini 3.8 Flash-Lite TTS qui est au catalogue à 6,00 $ puis 12,00 $ par million de tokens audio, avec Artificial Analysis à 11,0 $ par million de caractères
• Format d'entrée — Gemini 3.8 Live : audio, vidéo et texte en entrée, audio en sortie, contre les points de terminaison TTS : texte en entrée, audio en sortie
Le chiffre Live correspond à notre calcul à partir des tarifs par minute publiés par Google, et non à un chiffre horaire publié par Google. Les chiffres par caractère relèvent de la normalisation d'Artificial Analysis et sont ceux à citer lorsque vous comparez des paliers de synthèse. À noter que le tableau Speech to Speech d'Artificial Analysis comporte une colonne distincte de coût par heure d'audio d'entrée pour les modèles Live — environ 3,50 $ pour Gemini 3.8 Live et 0,84 $ pour la variante Extended Thinking — qui correspond encore à une autre normalisation et ne doit pas être alignée sur la grille tarifaire par minute comme s'il s'agissait de la même mesure.

Qu'est-ce qui casse lorsqu'on choisit le mauvais ?
Les modes de défaillance sont instructifs parce qu'ils sont si dissemblables.
Appelez un point de terminaison TTS alors qu'il vous fallait une boucle de conversation, et aucune erreur ne se produit. La requête renvoie un audio valide. Vous obtenez une réponse fluide et bien lue à une chaîne fixe, puis le silence — parce que rien n'écoutait. Les équipes s'en aperçoivent lorsqu'elles réalisent leur premier test de barge-in et constatent que l'« utilisateur » doit attendre que le clip entier soit terminé avant que le tour suivant puisse commencer. Ajouter une conversation à un point de terminaison de synthèse suppose d'y greffer la reconnaissance vocale, une politique de prise de tour et un mécanisme d'interruption ; à ce stade, vous avez reconstruit une cascade et vous payez pour deux modèles au lieu d'un.
Faites appel à un point de terminaison Live quand vous aviez besoin de narration, et vous payez pour une capacité que vous n’utilisez pas. Un modèle Live est facturé dans les deux sens, car il attend les deux sens. Pour un livre audio ou une voix off de vidéo de formation, le côté entrée est un script qui ne change jamais et le modèle n’a jamais besoin d’entendre quoi que ce soit. Vous achetez une boucle de conversation pour lire un document à voix haute.
Le seul cas où le choix est véritablement difficile, c'est la cascade : reconnaissance, puis raisonnement, puis synthèse. Cette architecture n'est pas obsolète, et pour beaucoup de systèmes en production, elle reste la bonne, parce qu'elle permet de remplacer chaque étape indépendamment et de choisir un fournisseur différent pour chacune. Elle coûte en latence et elle coûte la prosodie qu'un modèle unique de bout en bout conserve à la frontière d'un tour de parole. Le compromis est réel dans les deux sens.
Là où l'itinéraire existe déjà
OrcaRouter ne propose pas les points de terminaison Gemini 3.8 Live ni les points de terminaison 3.8 TTS, et cela vaut la peine de le dire avant toute autre chose à propos du routage, car il est facile de supposer le contraire à partir d’un catalogue aussi vaste. Ce que le catalogue contient bel et bien, c’est le reste de la famille — google/gemini-3.8-flash parmi 28 modèles Google et plus de 200 modèles au total, avec une seule clé au prix catalogue du fournisseur, sans majoration.
Cela compte spécifiquement pour la cascade. Si votre architecture est reconnaissance, puis raisonnement, puis synthèse, l'étape de raisonnement est celle où une clé unique auprès de nombreux fournisseurs porte ses fruits, car c'est l'étape que vous remplacez le plus souvent et celle où une baisse de prix d'un fournisseur devrait atteindre votre facture le jour même plutôt qu'à la prochaine reconduction de contrat. C'est aussi l'étape où le basculement automatique mérite sa place : une cascade a trois points de rupture, et celui du milieu est le moins coûteux à rendre redondant.

Une courte règle de décision
Si le modèle doit répondre à quelque chose qu’il n’avait pas déjà sous forme de texte, il vous faut Gemini 3.8 Live, et vous devez établir votre budget d’après les tarifs audio à la minute de Google et vous attendre à devoir réfléchir à celle des deux variantes dont vous avez besoin. Si le texte est déjà écrit et que la tâche consiste à le restituer à l’oral, il vous faut Gemini 3.8 Flash TTS ou Flash-Lite TTS, et vous devez prévoir un budget par million de caractères et choisir le palier en fonction de la couverture linguistique et de la question de savoir si l’écart de qualité justifie l’écart de prix.
Et si l’on vous demande de comparer « Gemini 3.8 Live et Gemini 3.8 TTS » comme s’il s’agissait de deux produits, la première chose utile à faire est de demander de quel point de terminaison il s’agit. Le nom indiqué dans le brief ne renvoie pas à un seul, et la réponse change l’architecture, pas seulement la facture.

