Une carte hero générée pour « Gemini 3.8 Live vs Gemini 3.8 TTS » sur fond blanc avec de doux accents en dégradé bleu et cyan. Une colonne de gauche intitulée « Est disponible sur l’API Live » liste « gemini-3.8-live », « entend et parle », « entrée audio, sortie audio » ; une colonne de droite intitulée « Est disponible sur les endpoints TTS » liste « gemini-3.8-flash-tts », « lit le texte écrit », « entrée texte, sortie audio ». Une ligne de pied de page indique « Aucun des deux ne s’appelle Gemini 3.8 TTS. » Le logo OrcaRouter est incrusté dans le coin inférieur droit.
Guides & Insights

Gemini 3.8 Live vs Gemini 3.8 TTS : une boucle de conversation et une voix de lecture partagent un nom de génération

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Gemini 3.8 Live est un modèle parole-à-parole lancé le 15 septembre 2026 sous les identifiants gemini-3.8-live et gemini-3.8-live-extended-thinking. « Gemini 3.8 TTS » n'est pas un modèle du tout : c'est le terme générique que la couverture du lancement, y compris le titre du billet de Goog​le lui-même, emploie pour désigner la paire de points de terminaison de synthèse vocale arrivés le 23 septembre 2026 sous les noms gemini-3.8-flash-tts et gemini-3.8-flash-lite-tts. Il ne s'agit donc pas de la page comparative habituelle, où deux produits se disputent une même tâche. C'est une page consacrée à deux tâches qui partagent un numéro de génération, et à l'erreur précise que commettent les gens lorsqu'ils traitent les mots « Live » et « TTS » comme deux variantes d'une même chose.

Le fork que masque le numéro de génération partagé

La documentation de Google sur la génération vocale trace elle-même la frontière, et cette phrase peut facilement passer inaperçue : « La fonctionnalité TTS diffère de la génération vocale fournie via l’API Live. » Le même passage explique pourquoi, et la raison est structurelle plutôt qu’une question de qualité. L’API Live est conçue pour « l’audio interactif et non structuré, ainsi que les entrées et sorties multimodales ». Le TTS via l’API Gemini « est adapté aux scénarios qui exigent une récitation exacte du texte avec un contrôle précis ». Une note ultérieure rend explicite la forme de l’entrée : les modèles TTS ne prennent que du texte et ne renvoient que de l’audio.

Cette unique contrainte — texte en entrée, audio en sortie, aucune entrée audio — constitue toute la comparaison. Un modèle Gemini 3.8 Live entend la personne qui lui parle. Un modèle Gemini 3.8 Flash TTS ou Flash-Lite TTS n'entend jamais personne ; il lit une chaîne et l'interprète. Tout le reste en découle : les benchmarks qui existent pour l'un sont dénués de sens pour l'autre, la tarification est mesurée en unités différentes, et les modes de défaillance ne sont pas comparables du tout.

Cela compte parce que les deux cas d'usage sont identiques vus de l'extérieur. Un agent vocal et une chaîne de narration finissent tous deux par produire une parole qui sonne humaine. Seul l'un des deux peut être interrompu.

Où « Gemini 3.8 TTS » se résout réellement

Ouvrez le tableau des modèles pris en charge pour la génération vocale de l'API Gemini et vous y trouverez quatre entrées TTS et aucune entrée appelée Gemini 3.8 TTS. Deux d'entre elles appartiennent à cette génération : Gemini 3.8 Flash TTS, ID de modèle gemini-3.8-flash-tts, avec 130 langues, et Gemini 3.8 Flash-Lite TTS, ID de modèle gemini-3.8-flash-lite-tts, avec 101 langues. Les deux autres — Gemini 3.1 Flash TTS Preview et Gemini 2.5 Pro Preview TTS — sont la génération preview que Flash-Lite remplace.

Alors quand quelqu’un dit « Gemini 3.8 TTS », il fait généralement référence au niveau Flash, car c’est celui que le billet de lancement met en avant et celui que le classement Arena place le plus haut. Quand il le dit à propos d’un agent vocal en direct, il ne fait référence à rien, car ce qu’il veut se trouve sur un point de terminaison différent, avec un nom différent et un contrat d’entrée différent.

Il y a une troisième collision qu’il vaut la peine de nommer, car elle produit les pires conseils. Gemini 3.8 Live n’est pas un modèle de synthèse vocale avec des fonctionnalités supplémentaires. C’est un modèle de parole à parole, et la raison pour laquelle il coûte plus cher par unité est qu’il fait davantage de travail par unité : écouter, raisonner en pleine élocution, gérer les interruptions et, dans la variante Extended Thinking, délibérer avant de répondre.

Le seul numéro qui compare vraiment

Les scores de qualité ne se transfèrent pas entre ces deux familles ; aucune grille unique ne note un narrateur et une voix conversationnelle sur le même axe. L’argent, lui, se transfère, dès lors qu’on choisit l’unité honnêtement, et l’unité honnête pour tout ce qui relève de la voix est l’heure audio.

• Facturation à l'entrée — Gemini 3.8 Live facture à la minute d'audio, 0,005 $ par minute en entrée et 0,018 $ par minute en sortie, contre Gemini 3.8 Flash TTS qui facture au million de tokens audio, 9,00 $ jusqu'au 31 décembre 2026 et 18,00 $ ensuite
• Facturation à la sortie — l'audio bidirectionnel de Gemini 3.8 Live revient à environ 1,38 $ pour une heure d'entrée et de sortie simultanées au tarif catalogue, avant tout cache de prompt, contre Gemini 3.8 Flash TTS qui est un flux unidirectionnel, et un million de caractères de narration finalisée revient à 16,5 $ selon la normalisation d'Artificial Analysis
• Entrée de texte — Gemini 3.8 Live facture le texte et l'audio sur des lignes distinctes, 0,75 $ par million de tokens de texte en entrée et 4,50 $ en sortie, contre les points de terminaison TTS qui facturent l'entrée de texte à 0,50 $ par million de tokens
• Niveau Flash-Lite — Gemini 3.8 Live n'a pas d'équivalent moins cher ; le choix se fait entre Live et Extended Thinking, contre Gemini 3.8 Flash-Lite TTS qui est au catalogue à 6,00 $ puis 12,00 $ par million de tokens audio, avec Artificial Analysis à 11,0 $ par million de caractères
• Format d'entrée — Gemini 3.8 Live : audio, vidéo et texte en entrée, audio en sortie, contre les points de terminaison TTS : texte en entrée, audio en sortie

Le chiffre Live correspond à notre calcul à partir des tarifs par minute publiés par Goog​le, et non à un chiffre horaire publié par Goog​le. Les chiffres par caractère relèvent de la normalisation d'Artificial Analysis et sont ceux à citer lorsque vous comparez des paliers de synthèse. À noter que le tableau Speech to Speech d'Artificial Analysis comporte une colonne distincte de coût par heure d'audio d'entrée pour les modèles Live — environ 3,50 $ pour Gemini 3.8 Live et 0,84 $ pour la variante Extended Thinking — qui correspond encore à une autre normalisation et ne doit pas être alignée sur la grille tarifaire par minute comme s'il s'agissait de la même mesure.

A screenshot of Google's Gemini API pricing documentation in English, captured 25 September 2026, showing the speech-generation model index — a limited-access group listing Gemini 3.8 Live, Gemini 3.8 Live Extended Thinking and Gemini 3.1 Flash Live Preview, alongside Gemini 3.8 Flash TTS, Gemini 3.8 Flash-Lite TTS and Gemini 3.1 Flash TTS Preview — above the Gemini 3.8 Flash per-million-token rates: $0.75 input through 31 December 2026 rising to $1.50, $3.75 output including thinking rising to $7.50, $0.075 context caching rising to $0.15, and storage at $0.50 rising to $1.00 per million tokens per hour, with search requests and prompts billed at $14 per 1,000 beyond the monthly free allowance. The page carries no rate-card line for a model named Gemini 3.8 TTS.

Qu'est-ce qui casse lorsqu'on choisit le mauvais ?

Les modes de défaillance sont instructifs parce qu'ils sont si dissemblables.

Appelez un point de terminaison TTS alors qu'il vous fallait une boucle de conversation, et aucune erreur ne se produit. La requête renvoie un audio valide. Vous obtenez une réponse fluide et bien lue à une chaîne fixe, puis le silence — parce que rien n'écoutait. Les équipes s'en aperçoivent lorsqu'elles réalisent leur premier test de barge-in et constatent que l'« utilisateur » doit attendre que le clip entier soit terminé avant que le tour suivant puisse commencer. Ajouter une conversation à un point de terminaison de synthèse suppose d'y greffer la reconnaissance vocale, une politique de prise de tour et un mécanisme d'interruption ; à ce stade, vous avez reconstruit une cascade et vous payez pour deux modèles au lieu d'un.

Faites appel à un point de terminaison Live quand vous aviez besoin de narration, et vous payez pour une capacité que vous n’utilisez pas. Un modèle Live est facturé dans les deux sens, car il attend les deux sens. Pour un livre audio ou une voix off de vidéo de formation, le côté entrée est un script qui ne change jamais et le modèle n’a jamais besoin d’entendre quoi que ce soit. Vous achetez une boucle de conversation pour lire un document à voix haute.

Le seul cas où le choix est véritablement difficile, c'est la cascade : reconnaissance, puis raisonnement, puis synthèse. Cette architecture n'est pas obsolète, et pour beaucoup de systèmes en production, elle reste la bonne, parce qu'elle permet de remplacer chaque étape indépendamment et de choisir un fournisseur différent pour chacune. Elle coûte en latence et elle coûte la prosodie qu'un modèle unique de bout en bout conserve à la frontière d'un tour de parole. Le compromis est réel dans les deux sens.

Là où l'itinéraire existe déjà

OrcaRouter ne propose pas les points de terminaison Gemini 3.8 Live ni les points de terminaison 3.8 TTS, et cela vaut la peine de le dire avant toute autre chose à propos du routage, car il est facile de supposer le contraire à partir d’un catalogue aussi vaste. Ce que le catalogue contient bel et bien, c’est le reste de la famille — google/gemini-3.8-flash parmi 28 modèles Goog​le et plus de 200 modèles au total, avec une seule clé au prix catalogue du fournisseur, sans majoration.

Cela compte spécifiquement pour la cascade. Si votre architecture est reconnaissance, puis raisonnement, puis synthèse, l'étape de raisonnement est celle où une clé unique auprès de nombreux fournisseurs porte ses fruits, car c'est l'étape que vous remplacez le plus souvent et celle où une baisse de prix d'un fournisseur devrait atteindre votre facture le jour même plutôt qu'à la prochaine reconduction de contrat. C'est aussi l'étape où le basculement automatique mérite sa place : une cascade a trois points de rupture, et celui du milieu est le moins coûteux à rendre redondant.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard in English, captured 25 September 2026, showing Cartesia Sonic 3.6 first at Elo 1,273, Google Gemini 3.8 Flash TTS second at 1,260 on 1,999 samples and priced at $16.5 per million characters, Alibaba Qwen-Audio-3.0-TTS-Plus third at 1,259, and Google Gemini 3.8 Flash-Lite TTS sixth at 1,235 on 2,000 samples at $11.0 per million characters. The board lists no model named Gemini 3.8 TTS.

Une courte règle de décision

Si le modèle doit répondre à quelque chose qu’il n’avait pas déjà sous forme de texte, il vous faut Gemini 3.8 Live, et vous devez établir votre budget d’après les tarifs audio à la minute de Google et vous attendre à devoir réfléchir à celle des deux variantes dont vous avez besoin. Si le texte est déjà écrit et que la tâche consiste à le restituer à l’oral, il vous faut Gemini 3.8 Flash TTS ou Flash-Lite TTS, et vous devez prévoir un budget par million de caractères et choisir le palier en fonction de la couverture linguistique et de la question de savoir si l’écart de qualité justifie l’écart de prix.

Et si l’on vous demande de comparer « Gemini 3.8 Live et Gemini 3.8 TTS » comme s’il s’agissait de deux produits, la première chose utile à faire est de demander de quel point de terminaison il s’agit. Le nom indiqué dans le brief ne renvoie pas à un seul, et la réponse change l’architecture, pas seulement la facture.

A generated summary card for Gemini 3.8 Live vs Gemini 3.8 TTS on a white background with soft blue-and-cyan gradient accents. Five rows read 'Gemini 3.8 Live — gemini-3.8-live on the Live API, shipped 15 September 2026', 'Gemini 3.8 TTS — not a model ID; resolves to gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts', 'Input contract: Live hears audio and video; TTS reads text only', 'The one shared unit: the hour of finished audio, not the benchmark', and 'Verdict: two jobs, one generation number — ask which endpoint'. A footer line reads 'Prices and language counts are vendor-reported.' The OrcaRouter logo is composited in the bottom-right corner.