
Créez et déployez de l'audio personnalisé avec Gemini 3.8 Flash TTS : conception de voix, clonage et les deux horloges qui décident
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 506 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 184 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS vous permettent tous deux d'inventer une voix à partir d'une description écrite au lieu d'en choisir une dans une liste, et tous deux sont passés en disponibilité générale sur l'API Gemini le 23 septembre 2026. Ce que les gens répètent en une phrase, c'est la conception de voix. Ce qu'il vaut la peine de planifier, c'est ce qui arrive à une voix conçue par la suite, car le fournisseur vous donne deux façons d'en conserver une et associe une durée de vie différente à chacune. Choisissez la mauvaise et la voix dont dépend votre produit expirera dans une semaine.
Voilà la lacune dans la couverture du lancement jusqu'à présent. Les articles d'annonce expliquent que l'on peut faire naître une voix à partir d'une simple invite, et quelques-uns mentionnent le clonage à partir d'un échantillon de 30 secondes. Aucun d'entre eux ne détaille le modèle de stockage, qui est précisément ce qui détermine si un pipeline vocal est reproductible à partir d'un fichier de configuration ou s'il doit être reprovisionné selon un calendrier. Cet article couvre l'ensemble du parcours — conception, stockage, appel et facturation — avec les prix et les quotas tels que Google les publie.
Qu'est-ce qui a été expédié le 23 septembre ?
Deux modèles, un seul schéma d'API. Les identifiants sont gemini-3.8-flash-tts et gemini-3.8-flash-lite-tts, et la documentation de Google précise explicitement que les deux acceptent « exactement le même schéma d'API et le même format de prompt » — passer de l'un à l'autre revient à modifier un seul paramètre, et non à tout réécrire.
• Entrée — texte uniquement. Les deux modèles acceptent du texte et renvoient de l'audio ; ils ne sont pas multimodaux et ne génèrent pas de texte en retour.
• Sortie — WAV, 24 kHz mono PCM signé 16 bits sur le point de terminaison unaire ; PCM sans en-tête (audio/l16) sur le point de terminaison en streaming ; audio/mulaw et audio/alaw acceptés avec une fréquence d'échantillonnage configurable.
• Langues — 130 sur Flash TTS, 101 sur Flash-Lite TTS, détectées automatiquement à partir du texte plutôt que déclarées dans la requête.
• Voix — 30 voix de studio sélectionnées répertoriées dans la documentation (dont Kore et Puck), une Extended Voice Library contenant « des centaines » d’autres voix interrogeables via le point de terminaison voices, ainsi que les deux parcours de création ci-dessous.
• Direction — contrôle de l’interprétation ligne par ligne, scènes à deux locuteurs mises en scène à partir d’un seul script, et indications non verbales telles que <rires>, <soupir> et |mhm| inscrites directement dans la transcription.
Les deux niveaux existent parce que les charges de travail ont divergé. Flash TTS est positionné pour une fidélité acoustique maximale et une interprétation complexe ; Flash-Lite TTS est décrit, selon les propres termes de Google, comme la « solution de remplacement robuste » pour gemini-3.1-flash-tts-preview, destiné au doublage en masse, aux fonctionnalités de lecture à voix haute et aux cascades d'agents vocaux. Les deux remplacent un seul modèle d'aperçu qui était disponible dans l'API depuis avril 2026, donc si vous utilisiez l'aperçu, la migration relève d'un choix de niveau plutôt que d'une simple mise à niveau de version.

Concevoir une voix est un prompt, et cela change l’étape de révision.
La surface de création est véritablement la nouveauté de cette génération. par invite se construit à partir d'une description en langage naturel — rôle, accent, caractère vocal — et renvoie un identifiant que vous réutilisez. Dans l'API, il s'agit d'un appel de création de voix avec store: true et une entrée sous forme d'invite ; dans les exemples de Google eux-mêmes, les descriptions vont d'un DJ de Melbourne plein d'énergie à un dragon japonais. Une fois créée, la voix est référencée dans une requête vocale par son identifiant, et les instructions de style par requête peuvent alors être minimales ou vides, car le caractère est déjà intégré à la voix.
La conséquence pratique est un changement de flux de travail, pas seulement une fonctionnalité. Le casting vocal passait autrefois par une négociation de licence ou une réservation de studio, ce qui signifiait que la sélection de la voix se faisait une fois, tôt, et survivait à la revue parce que la changer coûtait cher. Quand une voix est un paragraphe de texte, le casting devient un jeton de design — quelque chose qu'un chef de produit peut demander de faire régénérer le mardi. Les équipes qui placent la chaîne de description dans le contrôle de source et traitent l'ID de voix généré comme un artefact de build obtiendront une sortie cohérente d'un environnement à l'autre. Les équipes qui créent des voix à la main dans AI Studio n'y parviendront pas, et la défaillance ressemblera à une différence inexplicable entre l'audio de préproduction et celui de production.
Les deux horloges
Voici la section que les articles de lancement omettent. Google vous permet de conserver une voix conçue ou reproduite dans l’un de deux états, et ceux-ci expirent à des rythmes radicalement différents.
• Voix stockées — créées avec le stockage activé, elles résident dans votre projet et sont soumises à un quota de 200 voix par projet, avec une durée de vie d'un an.
• Clés sans état — la réplication vocale peut renvoyer une clé gérée par le client (la forme voicekey_…) au lieu d'un identifiant stocké, et cette clé a une durée de vie de sept jours.
Lus ensemble, ces deux éléments forment une consigne de conception. Une voix stockée, c'est un engagement d'un an et un plafond strict de 200 par projet, ce qui est généreux pour un produit à distribution fixe et inutile pour tout ce qui génère une nouvelle voix par client. La clé sans état est l'inverse : aucune pression de quota, mais une clé qu'il faut régénérer chaque semaine, ce qui signifie que votre application a besoin d'un chemin de rafraîchissement et que votre infrastructure doit stocker des identifiants qui changent. Ni l'une ni l'autre n'est mauvaise. Choisir sans remarquer ce que l'on a choisi, c'est ainsi qu'un agent vocal devient silencieux le huitième jour.
Deux autres propriétés sont attachées à la réplication et méritent d'être connues avant de promettre quoi que ce soit à une équipe juridique. Créer une voix répliquée exige un enregistrement de consentement verbal de la part du propriétaire de la voix, qui doit correspondre au locuteur de référence — une vérification parlée, pas une case à cocher. Et la sortie porte une provenance : chaque clip est marqué par un filigrane SynthID, et les voix répliquées portent en plus des identifiants de contenu C2PA. Le chemin de conception est délibérément le plus difficile à abuser, et les deux barrières sont structurelles plutôt que de simples déclarations de principe.
Une divergence qui mérite d’être signalée plutôt que résolue. Le tableau des modèles pris en charge de Google indique que la conception de voix et la réplication de voix sont disponibles sur les deux modèles TTS 3.8. La plupart des articles de lancement décrivent la réplication comme relevant spécifiquement du volet Flash TTS. Si la réplication compte dans votre choix entre les niveaux, vérifiez-la dans la documentation du niveau que vous comptez déployer plutôt que de vous fier à l’une ou l’autre de ces synthèses.
Combien coûte une heure d’audio
Google facture la synthèse vocale en tokens, pas en caractères ni en secondes, et la conversion est publiée : l’audio est comptabilisé à 25 tokens par seconde de sortie, soit 90 000 tokens par heure. Cela rend le calcul inhabituellement simple, et c’est le nombre à mettre dans un budget plutôt que le tarif par million.
• Flash TTS standard — 0,50 $ par million de jetons de texte en entrée, 9,00 $ par million de jetons audio en sortie jusqu'au 31 décembre 2026, puis 1,00 $ et 18,00 $. Batch et Flex sont à 0,25 $ et 4,50 $ ; Priority est à 0,90 $ et 16,20 $.
• Flash-Lite TTS standard — 0,50 $ et 6,00 $ jusqu'à la même date, puis 1,00 $ et 12,00 $. Batch et Flex 0,25 $ et 3,00 $ ; Priority 0,90 $ et 10,80 $.
• En secondes — Flash TTS revient à environ 0,81 $ par heure d’audio généré pendant la fenêtre promotionnelle, et à environ 1,62 $ après celle-ci ; Flash-Lite TTS revient à environ 0,54 $, puis à 1,08 $.
• Par rapport au modèle qu'il remplace — gemini-3.1-flash-tts-preview est facturé à 1,00 $ et 20,00 $ par million, de sorte que la ligne de sortie audio a baissé de 55 % sur Flash TTS et de 70 % sur Flash-Lite TTS.
Ne planifiez pas en vous basant sur le tarif promotionnel. Google publie les deux colonnes dans le même tableau, ce qui signifie que le tarif de janvier n'est pas une rumeur à découvrir plus tard — il figure dès aujourd'hui sur la carte tarifaire, et toute estimation par millier de minutes établie à 0,81 $ doit pouvoir résister à un doublement.
Un nombre indépendant, et plusieurs qui ne le sont pas
L’annonce de Google commence par des résultats de benchmark, et ils doivent être lus pour exactement ce qu’ils sont. L’entreprise affirme que Flash TTS a pris la première place au Voice Design Benchmark de Hume AI avec 71,4, a dominé la modélisation des accents avec 60,8, et que Flash TTS et Flash-Lite TTS se sont classés premier et deuxième à l’Overall Quality Index de Hume, avec de solides positions en préférence à l’aveugle sur Voice Arena pour le japonais, le portugais brésilien, le vietnamien, l’arabe standard moderne, l’espagnol mexicain et l’hindi. Tout est rapporté par le fournisseur, aucune des exécutions n’est publique.
Il y a un détail dans cette liste qui mérite d'être relevé. Alan Cowen, crédité comme auteur de l'annonce de Google, est le fondateur de Hume AI — le laboratoire dont le Voice Design Benchmark fournit le chiffre phare. Cela ne rend pas le chiffre faux, et le benchmark de Hume est bien réel, mais les deux ne sont pas indépendants l'un de l'autre, et un lecteur qui soupèse le 71,4 devrait le savoir avant de le répéter comme une validation tierce.
Le chiffre recueilli de façon indépendante figure sur la Provider Voice Arena d'Artificial Analysis, relevé pour cet article le 24 septembre 2026 : Gemini 3.8 Flash TTS occupe la deuxième place avec un Elo de 1 260, un intervalle de 17 points sur 1 999 échantillons, derrière Cartesia Sonic 3.6 à 1 273. Gemini 3.8 Flash-Lite TTS est sixième à 1 235. Le modèle qu'il remplace, Gemini 3.1 Flash TTS, est dixième à 1 199 sur 3 430 échantillons. Préférence d'auditeurs en aveugle, et non l'évaluation interne d'un laboratoire — et le seul chiffre de qualité ici que Google n'a pas fait produire.

Où l'exécuter, et où ce n'est pas encore possible
Les deux modèles sont disponibles dès aujourd'hui dans l'API Gemini et Google AI Studio, sans liste d'attente. Les surfaces grand public et entreprise sont planifiées plutôt que livrées : Flash TTS arrive dans Gemini Notebook et Flash-Lite TTS dans Google Vids, l'accès à Gemini Enterprise est annoncé comme prochainement disponible, et le remixage vocal — ajuster le timbre, la hauteur, le débit et l'accent d'une voix existante — est présenté comme une fonctionnalité à venir plutôt qu'actuelle. Si votre plan dépend du remixage, cela n'existe pas encore.
De notre côté, l’honnêteté d’abord : les endpoints Gemini 3.8 TTS ne figurent pas dans la table de routage d’OrcaRouter. La génération qu’ils remplacent, elle, y est — google/gemini-3.1-flash-tts-preview figure au catalogue au même tarif de 1,00 $ et 20,00 $ par million de tokens que celui publié par Google, car le prix catalogue du fournisseur est répercuté sans marge, et il répond sur le même /v1/audio/speech endpoint que votre SDK compatible OpenAI cible déjà. Cela compte plus qu’il n’y paraît pour une charge de travail vocale, car ce que vous achetez réellement, c’est un endpoint stable que votre application peut appeler pendant que les modèles derrière évoluent. Votre code contient une chaîne de modèle ; le catalogue contient le routage. Quand la fenêtre promotionnelle de Google se ferme le 31 décembre et que Flash TTS double, le prix d’un modèle routé change le jour même plutôt qu’à la prochaine renégociation de contrat — et un modèle qui tombe bascule vers un autre au lieu d’emporter votre file de narration avec lui.

Si vous évaluez cette génération avant de vous engager, l'expérience peu coûteuse est une expérience à deux niveaux. Faites tourner le même script avec Flash TTS et Flash-Lite TTS, car le schéma est identique et la différence tient à un paramètre — puis décidez à l'écoute de votre propre audio plutôt qu'avec un graphique comparatif, et vérifiez sur Artificial Analysis si l'écart de qualité survit à ses barres d'erreur avant de payer le supplément. Pour un projet de narration grand format, le supplément représente une vraie somme d'argent ; pour un bot d'assistance qui lit un numéro de téléphone à voix haute, il ne vous achète pas manifestement quoi que ce soit qu'un auditeur puisse entendre.
