
Gemini 3.8 Flash TTS dit bonjour : Google scinde sa gamme vocale en deux et baisse le prix
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
Le fournisseur a livré deux modèles vocaux le 23 septembre 2026, et l'annonce est rédigée comme si le titre principal portait sur la qualité vocale. Ce n'est pas le cas. Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS sont les premiers modèles de synthèse vocale que le fournisseur a mis sur l'API Gemini Developer à un prix inférieur au modèle d'aperçu qu'ils remplacent — et pour quiconque payait au caractère ailleurs, c'est l'élément qui change une ligne budgétaire. Le tarif de sortie audio sur Gemini 3.8 Flash TTS est de 9,00 $ par million de jetons jusqu'à la fin de 2026. L'audio est facturé à 25 jetons par seconde, ce qui équivaut à environ 0,02 cent par seconde de parole générée. Le modèle qu'il remplace, Gemini 3.1 Flash TTS Preview, était facturé à 20,00 $ par million de jetons audio.
La seconde moitié de l’histoire, c’est qu’il y a désormais deux modèles, et non un seul. Google a scindé sa gamme : Flash TTS prend en charge l’ensemble complet des langues et le débit audio le plus élevé, tandis que Flash-Lite TTS propose une liste de langues plus courte et revient moins cher. C’est une configuration différente de celle à modèle d’aperçu unique présente sur l’API depuis avril, et cela vous dit comment Google se représente le marché — un petit nombre d’applications qui ont besoin de 130 langues et de clonage vocal, et un nombre bien plus important d’applications qui ont besoin d’une voix anglaise compétente pour un bot d’assistance, et de rien d’autre.
Ce qui a réellement été livré le 23 septembre
Les deux modèles sont généralement disponibles sur l'API Gemini et dans AI Studio depuis l'annonce, sans être soumis à une liste d'attente. Les noms sur l'API sont gemini-3.8-flash-tts et gemini-3.8-flash-lite-tts.
• Flash TTS — 130 langues, langue détectée automatiquement à partir du texte, 30 voix studio prédéfinies dont Kore et Puck.
• Flash-Lite TTS — 101 langues, la même surface de conception vocale, positionné comme le palier à fort volume.
• Les deux — conception vocale à partir d’une description en langage naturel, direction d’interprétation ligne par ligne, mise en scène d’une scène à deux locuteurs, et indications non verbales écrites directement dans le script.
• Sortie — WAV 24 kHz mono PCM signé 16 bits sur le point de terminaison unaire ; PCM sans en-tête (audio/l16) sur le point de terminaison de streaming ; audio/mulaw et audio/alaw également acceptés, avec un taux d'échantillonnage configurable.
La grille tarifaire, par million de tokens, mérite d’être lue dans son intégralité, car les paliers diffèrent par bien plus que le chiffre principal :
• Flash TTS Standard — 0,50 $ en entrée de texte / 9,00 $ en sortie audio, passant à 1,00 $ / 18,00 $ après le 31 décembre 2026.
• Flash TTS Batch et Flex — 0,25 $ / 4,50 $.
• Flash TTS Priority — 0,90 $ / 16,20 $.
• Flash-Lite TTS Standard — 0,50 $ / 6,00 $, passant à 1,00 $ / 12,00 $ après le 31 décembre 2026.
• Flash-Lite TTS Batch et Flex — $0.25 / $3.00.
• Flash-Lite TTS Priorité — 0,90 $ / 10,80 $.
• Gemini 3.1 Flash TTS Preview, pour comparaison — 1,00 $ / 20,00 $, lot 0,50 $ / 10,00 $.
La fenêtre promotionnelle est ce qu'il faut retenir. Google a fixé le prix des deux nouveaux modèles à demi-tarif jusqu'à la fin de l'année et publié les chiffres après promotion dans le même tableau. Quiconque modélise le coût pour mille minutes doit utiliser le chiffre de janvier, pas celui de septembre.

Le design vocal est la capacité véritablement nouvelle
Les voix prédéfinies sont la base incontournable. Ce que Google a ajouté dans la version 3.8, c’est un moyen de décrire une voix avec des mots et de l’obtenir, ainsi qu’un moyen d’en cloner une à partir d’un court échantillon, avec une vérification du consentement associée.
La conception vocale prend une invite en langage naturel — débit, timbre, accent, le genre de chose pour lequel vous passeriez autrement un après-midi à auditionner — et renvoie une voix utilisable sans enregistrement de référence. La réplication vocale fonctionne dans l'autre sens : vous fournissez un échantillon de 30 secondes, le système vérifie le consentement, et la voix obtenue est marquée d'un filigrane SynthID et de justificatifs C2PA sur l'audio généré. Le remixage vocal, qui vous permet de mélanger ou de modifier une voix personnalisée existante, est annoncé comme bientôt disponible plutôt que comme déjà déployé.
Les voix personnalisées se déclinent en deux variantes, et leur comportement diffère suffisamment pour que la distinction ait son importance en production. Les voix personnalisées avec état sont stockées au niveau du projet, plafonnées à 200 par projet, avec une durée de vie d'un an. Les voix sans état sont adressées par un identifiant voicekey_... et expirent au bout de sept jours. Si votre application provisionne une voix par client, le plafond et la durée de vie sont les deux chiffres qui déterminent si vous avez besoin de votre propre couche de stockage.
Les contrôles de diction sont l'autre moitié de la « nouveauté ». Vous pouvez diriger une réplique comme vous dirigeriez un acteur — rythme, emphase, registre émotionnel — plutôt que de simplement choisir une voix et espérer. Les scènes à deux locuteurs peuvent être mises en scène dans un seul appel. Et les vocalisations non verbales sont des éléments de script de premier ordre : <laughs>, <sigh> et <gasp> comme indications en ligne, plus |mhm| et |yeah| pour les petits bruits de rétroaction qui font qu'une conversation synthétique ressemble à une conversation. La lecture longue est censée conserver l'identité du locuteur avec une dérive minimale, ce qui est le mode de défaillance qui apparaît en premier lorsque vous générez un chapitre de livre audio de 40 minutes.
Les benchmarks, et qui les a menés
Les supports de lancement de Google s'appuient sur deux évaluations externes et une série de classements dans des arènes. Tous ces éléments sont rapportés par le fournisseur — Google les cite, et les exécutions sous-jacentes ne sont pas publiques —, alors considérez-les comme des affirmations plutôt que comme des mesures.

• Benchmark de conception vocale de Hume AI — Gemini 3.8 Flash TTS s'est classé premier avec 71,4, et premier pour la modélisation des accents avec 60,8.
• Indice de qualité globale Hume — Flash TTS en premier, Flash-Lite TTS en second.
• Préférence à l'aveugle dans la Speech Arena — des places en tête obtenues en japonais, portugais brésilien, vietnamien, arabe standard moderne, espagnol mexicain et hindi.
• Face à Gemini 3.1 Flash TTS — Google revendique des gains en matière de cohérence sur les textes longs et de contrôle des dialogues à deux voix dans les scénarios, soit exactement les deux points pour lesquels les fonctionnalités de direction d'interprétation ont été conçues.
Une divergence documentée mérite d’être signalée, car elle déroutera quiconque compare les sources. L’article de blog décrit une bibliothèque de plus de 2 000 voix prêtes pour la production. La documentation destinée aux développeurs décrit « des centaines » de voix dans l’Extended Voice Library, aux côtés des 30 voix studio prédéfinies. Des articles tiers ont cité des chiffres encore d’un ordre de grandeur supérieur. Ces éléments ne sont pas conciliables de l’extérieur — l’interprétation honnête est que l’ensemble prédéfini obtenu par défaut compte 30 voix, que l’Extended Voice Library est plus vaste et décrite de manière vague, et que les grands nombres renvoient à un catalogue qui inclut les voix créées par les utilisateurs. Si un nombre de voix est déterminant pour votre décision, testez la voix précise dont vous avez besoin plutôt que de vous fier à l’un de ces trois chiffres.
Ce que cela signifie si vous construisez dessus
Le changement concret, c’est que la synthèse vocale est passée d’un poste spécialisé à un élément que vous pouvez intégrer au même modèle de coûts que vos jetons de langage. À 25 jetons par seconde, une heure d’audio généré représente 90 000 jetons audio, ce qui, au tarif promotionnel de Flash-Lite, revient à environ 54 cents. C’est assez bon marché pour que la question intéressante cesse d’être « pouvons-nous nous permettre une voix synthétique » et devienne « de laquelle des deux formules cette surface a-t-elle besoin ».
Le deuxième changement pratique, c'est qu'un tout nouveau modèle TTS est exactement le genre de chose que l'on veut essayer sans faire reposer une voie de production dessus. C'est ce qui justifie de placer un nouveau modèle derrière un routeur plutôt que de le connecter directement : OrcaRouter expose plus de 200 modèles derrière une seule clé, au prix catalogue du fournisseur et sans marge, et son basculement automatique signifie qu'un nouveau point de terminaison vocal qui vacille sous charge se replie vers un modèle auquel vous faites déjà confiance au lieu de laisser tomber l'appel. Nous n'hébergeons pas les points de terminaison TTS Gemini 3.8 — ceux-ci proviennent de l'API propre à Google — mais la couche de texte sous la voix, et le chemin de repli lorsqu'un appel de synthèse échoue, sont les parties pour lesquelles un routeur est réellement conçu.
Qu'est-ce qui manque encore ?
Trois choses sont absentes du lancement et chacune d’elles est une véritable contrainte, pas un détail.
Il n'existe aucune évaluation indépendante publiée. Les chiffres Hume de Google correspondent au fournisseur qui cite le benchmark d'un tiers, ce qui vaut mieux que rien et moins qu'un audit. Tant qu'Artificial Analysis ou un équivalent n'aura pas publié sa propre exécution sur les mêmes modèles, toute affirmation de qualité dans cet article doit être lue comme une affirmation.
Il n’existe pas d’option à poids ouverts. Les deux modèles sont fermés et accessibles uniquement via API, ce qui les place dans une catégorie différente des modèles vocaux ouverts qui ont débarqué dans la même arène. Si votre déploiement exige d’exécuter le modèle vous-même, ce lancement ne vous concerne pas.
Et la tarification promotionnelle prend fin. Le tarif de janvier 2027 pour Flash TTS est le double de celui de septembre, et toute analyse de rentabilité bâtie sur les chiffres de lancement devra être refaite au premier trimestre. Ce n'est pas une critique — publier les deux chiffres d'emblée est plus honnête que la plupart — mais c'est le chiffre qui doit figurer dans le tableur.
Google n'a pas indiqué si Gemini 3.1 Flash TTS Preview sera déprécié, seulement que Flash-Lite TTS est positionné comme son remplaçant principal. Toute personne qui utilise encore le modèle preview devrait planifier une migration plutôt que d'attendre un avis de mise hors service.

