
Gemini 3.8 TTS : Deux pélicans, deux modèles et un prix qui double en janvier
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
Le moyen le plus rapide de comprendre ce que le fournisseur a livré le 23 septembre 2026 est de regarder la démo qui a circulé avec cette sortie : deux pélicans qui se disputent pour savoir s'ils doivent déménager à Pacifica Pier, une voix par oiseau, avec un script, tour après tour. Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS sont les deux modèles derrière cette démo, tous deux disponibles en disponibilité générale sur l'API Gemini, et les pélicans ne sont pas un gadget. C'est la première chose, dans cette génération, que les précédents modèles vocaux Gemini ne pouvaient pas faire du tout : deux locuteurs, une seule génération, un script qui contrôle qui dit quoi.
Le prix constitue l'autre moitié de l'histoire, et c'est là que les deux modèles divergent. Flash TTS facture 0,50 $ par million de jetons de texte en entrée et 9,00 $ par million de jetons audio en sortie jusqu'au 31 décembre 2026, puis 18,00 $ ; Flash-Lite TTS facture 0,50 $ et 6,00 $ selon le même échéancier, puis 12,00 $. Il s'agit des tarifs propres à Google. Converti par Artificial Analysis en base par million de caractères afin de pouvoir figurer dans le même classement que tous les autres, ils ressortent à 16,50 $ et 11,00 $ — environ un tiers moins cher pour le modèle Lite, et tous deux bien en dessous de ce que facture le sommet de ce classement.
La question intéressante n’est donc pas de savoir si les modèles sont bons. C’est de savoir sur lequel des deux vous devriez vous appuyer, car l’écart entre eux n’est pas celui que vous devineriez d’après leurs noms.
Ce que contient réellement l’annonce du 23 septembre
Deux modèles, pas un seul, et Google précise explicitement qu’il s’agit d’une séparation plutôt que d’une petite et d’une grande version de la même chose. L’annonce nomme cinq endroits où ils sont déployés — Google AI Studio, l’API Gemini, Gemini Enterprise, Gemini Notebook et Google Vids — et les identifiants d’API sont simples : gemini-3.8-flash-tts et gemini-3.8-flash-lite-tts.

La liste des capacités est plus longue que ne le suggère le titre. D'après l'annonce de Google et la documentation sur la génération vocale de l'API Gemini :
• Conception de voix — vous décrivez une voix en mots et recevez en retour un ID de voix personnalisée, plutôt que de choisir dans une liste fixe.
• Réplication vocale — un échantillon de 30 secondes produit un ID vocal, qui est la voie que la plupart des équipes utiliseront réellement pour une voix de marque ou un narrateur.
• Dialogue à deux interlocuteurs — le cas du pélican. Le script comporte des tours de parole plutôt qu’un seul bloc de prose.
• Style au niveau du tour — la documentation décrit une annotation speech_metadata qui attache une direction à un tour spécifique plutôt qu'à l'ensemble de la requête.
• Voix prédéfinies, ainsi qu'une bibliothèque de voix étendue accessible à GET /v1beta/voices.
• Trois encodages audio — WAV par défaut, avec mulaw et alaw disponibles pour les pipelines de type téléphonie.
• Entrée uniquement textuelle, sortie uniquement audio. La documentation est sans détour là-dessus : les modèles TTS n'acceptent aucune autre modalité d'entrée et ne produisent aucune autre sortie, et une section Limitations distincte énumère les restrictions.
L’annonce ne contient aucun des chiffres dont un planificateur de capacité a besoin. Les limites de débit, les quotas et la durée de conservation d’une voix conçue figurent tous dans la documentation et sur la page de tarification, et non dans l’article de lancement, ce qui est la raison habituelle pour laquelle une semaine de lancement se déroule bien pour les démos et mal pour la production.

Les pélicans sont la véritable actualité.
La synthèse vocale à un seul locuteur est un problème suffisamment résolu depuis deux ans. Ce qui manquait, c'était un modèle capable de maintenir deux identités distinctes tout au long d'un long script sans dériver, et c'est précisément ce que la démo teste réellement — non pas si la voix semble humaine, mais si le locuteur A est toujours le locuteur A au bout de quatre minutes.
Deux choses en découlent, et c'est pourquoi cela compte au-delà des gadgets de podcast.
La première, c'est que l'unité de travail change. Avec un modèle à un seul locuteur, un dialogue de vingt minutes représente vingt minutes d'audio que vous assemblez à partir de deux exécutions indépendantes, et chaque jointure est un endroit où la prosodie se réinitialise. Avec un modèle à deux locuteurs, il s'agit d'un seul appel, d'un seul contexte, et le modèle peut réagir à la réplique qui précède. C'est une différence de qualité que le post-traitement ne peut pas compenser.
Le deuxième point est que le format de script devient l'interface. Si votre pipeline produit déjà quelque chose qui a la forme de SSML — une annotation par phrase —, cette génération est proche d'un remplacement direct. Si votre pipeline se contente de transmettre un mur de texte à un modèle en espérant que ça marche, vous avez désormais une raison de le restructurer, car le style qui était autrefois implicite est désormais quelque chose que vous devez exprimer explicitement. C'est le même compromis que le reste du secteur fait de différentes manières, et c'est l'axe sur lequel ces deux modèles Google rivalisent avec tout le reste sur l'échiquier.
Ce que coûte une heure d'audio de deux pélicans
Le calcul des jetons mérite d’être fait une fois, car le chiffre par million de jetons audio n’est pas un chiffre par heure, et la différence a surpris certaines personnes.
Les jetons audio sont générés à un débit fixe par seconde de sortie, de sorte que le coût dépend de la durée de l'audio final, et non de la longueur du script. Prenons le tarif de Google pour Flash TTS — 9,00 $ par million de jetons audio en sortie — et le calcul pour un rendu fini d'une heure revient à un montant à un chiffre en dollars sur le palier standard, le modèle Lite étant à deux tiers de ce montant. La tarification Batch et Flex, à 0,25 $ en entrée et 4,50 $ en sortie pour Flash TTS, contre 0,25 $ et 3,00 $ pour Flash-Lite TTS, réduit encore la facture pour tout ce qui n'a pas besoin d'être généré à la demande. Priority, à 0,90 $ et 16,00 $, s'adresse aux travaux qui, eux, doivent l'être.
Trois conséquences pratiques :
• Régénérer un paragraphe coûte peu ; régénérer une série est une décision. À ces tarifs, la partie coûteuse d’un pipeline de parole cesse d’être l’inférence et redevient l’humain qui approuve la prise.
• Le tarif d'entrée de texte est négligeable. 0,50 $ par million de jetons de texte sur un script de quelques milliers de mots est une erreur d'arrondi par rapport à la partie audio. N'optimisez pas le script pour la longueur.
• La falaise du 31 décembre est bien réelle, et elle double le tarif audio. Si vous prévoyez un déploiement en 2027, inscrivez au budget le montant post-promotionnel, et non le montant de lancement, sinon vous referez vos plans en janvier.
Le nombre qui est indépendant, et ceux qui ne le sont pas
Un chiffre dans ce lancement provient d'ailleurs que de Google. Sur l'Artificial Analysis Provider Voice Arena, relevé le 24 septembre 2026, Gemini 3.8 Flash TTS se classe 2e avec un Elo de 1 260 sur 1 999 échantillons et 8 voix d'arène, et Gemini 3.8 Flash-Lite TTS se classe 6e avec 1 235 sur 2 000 échantillons. Tous deux se situent dans l'intervalle de confiance l'un de l'autre, à ±16 et ±17, donc le classement vous dit qu'ils sont statistiquement indiscernables en matière de préférence — un résultat véritablement utile, car cela signifie que le moins cher n'est pas mesurablement moins bon pour les auditeurs.
Tout le reste est une affirmation de Google lui-même et doit être lu comme tel : le langage d'expressivité, le nombre de langues, la qualité de réplication. L'arène vous donne un classement de préférences et rien d'autre. Elle ne vous dit pas comment l'un ou l'autre modèle gère un script de 40 minutes sans dérive, comment il se comporte face à un nom propre qu'il n'a jamais vu, ni ce qui arrive à une voix conçue après une semaine.

Le modèle Lite est aussi le meilleur argument pour que cette paire constitue une véritable séparation plutôt qu’un palier marketing. Un écart Elo de 25 points qui se situe dans les barres d’erreur, face à un écart de prix de 33 %, a la forme d’une décision que les pipelines sensibles au prix devraient prendre en faveur de Lite presque à chaque fois — et la forme d’une décision que les pipelines sensibles à la latence devraient prendre dans l’autre sens, puisque les deux diffèrent tant sur l’horloge que sur la facture.
Où l’exécuter, et la version honnête de cette réponse
OrcaRouter n’héberge pas les points de terminaison Gemini 3.8 TTS. Cela vaut la peine de le dire clairement plutôt que de laisser entendre le contraire, car ce qu’il est utile de dire à propos de ces deux modèles, ce n’est pas que nous les servons — ce n’est pas le cas — mais qu’une baisse de prix d’un fournisseur comme celle du 31 décembre est exactement le genre d’événement qui rend le routage utile.
OrcaRouter met plus de 200 modèles derrière une seule clé API, au prix catalogue du fournisseur, sans marge : le tarif affiché par un fournisseur est donc exactement ce que vous payez, et toute modification de ce tarif est effective de notre côté le jour même, et non au cycle de facturation suivant. Pour un pipeline vocal en pleine migration, la couche de basculement compte davantage que le catalogue : vous pouvez faire passer un chemin de requête par un modèle encore en cours d'évaluation sans parier une route de production dessus, car un appel qui échoue peut être redirigé vers un modèle déjà éprouvé. Le DSL de routage compose plusieurs modèles en un seul appel pour les cas où aucune voix unique ne suffit, et la fusion de modèles répond à une invite avec un panel lorsque la réponse importe plus que la latence.
Pour les modèles Gemini 3.8 TTS eux-mêmes, l’endroit où les appeler est l’API propre à Google, ainsi que les surfaces que Google a nommées le 23 septembre. Ce que le duo fait à votre architecture — un appel pour deux locuteurs, le style sous forme d’annotation, une voix que l’on peut décrire plutôt que choisir — est la partie qui survit à la remise de lancement.
Que regarder ensuite
Trois choses détermineront si cette génération constitue un saut qualitatif ou une simple fonctionnalité.
Le premier est la dérive. Personne n’a publié d’évaluation au long cours permettant de déterminer si le parcours à deux locuteurs maintient l’identité sur une heure entière, et tant que personne ne l’aura fait, la démo pelican reste une démo. Le deuxième est la durée de vie de la voix. Une voix conçue qui expire au bout d’une semaine est un prototype ; une voix qui peut être redérivée à partir d’une configuration stockée est un produit, et la réponse dépend de lequel des deux identifiants vous conservez. Le troisième est ce qui se passe après le 31 décembre, lorsque le tarif promotionnel prend fin et que le coût horaire d’un pipeline vocal double du jour au lendemain.
Aucun de ces éléments n’est visible depuis l’article de lancement. Tous les trois sont visibles dans la documentation, et c’est là que la couverture du lancement cesse de lire.
