
Gemini 3.8 TTS vs Gemini 3.1 Flash TTS : le seul véritable écart dans cette famille
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
Passer à une version supérieure au sein d'une même famille de modèles est généralement la décision facile, mais celle-ci comporte une subtilité qui la rend moins évidente qu'il n'y paraît. Gemini 3.1 Flash TTS — toujours répertorié comme aperçu dans l'API du fournisseur — occupe la 10e place du Provider Voice Arena d'Artificial Analysis, avec un Elo de 1 199 et un intervalle de 12 points. Gemini 3.8 Flash TTS, sorti le 23 septembre 2026, occupe la 2e place avec un Elo de 1 260 et un intervalle de 17 points. Soit un gain de 61 points et, contrairement à la plupart des écarts de ce classement, il résiste aux barres d'erreur : la plage de la 3.1 va de 1 187 à 1 211, celle de la 3.8 de 1 243 à 1 277, et il existe une zone morte de trente-deux points entre les deux. L'amélioration de la qualité est bien réelle. C'est du côté du prix que cela devient étrange.

La grille tarifaire de Google elle-même indique que le tarif de sortie audio est passé de 20,00 $ par million de tokens sur 3.1 à 9,00 $ sur 3.8 — soit une réduction de 55 %. Artificial Analysis normalise ces deux mêmes modèles à 18,30 $ et 33,00 $ par million de caractères respectivement, ce qui indique l’inverse. Les deux chiffres sont publiés ; aucun des deux n’est faux ; ils mesurent des choses différentes, et le rapprochement est la partie la plus utile de cette comparaison pour quiconque planifie une migration.
Ce que la mise à niveau a réellement changé
La génération 3.8 n'est pas un simple réajustement. Trois surfaces ont changé en profondeur.
• Nombre de voix et création de voix — 3.1 Flash TTS était livré avec un ensemble de voix prédéfinies. 3.8 Flash TTS propose 30 voix studio prédéfinies, dont Kore et Puck, ainsi que la conception de voix à partir d'une description en langage naturel et la réplication de voix à partir d'un échantillon de 30 secondes, avec vérification du consentement, un filigrane SynthID et des justificatifs C2PA sur la sortie. Le remixage de voix est annoncé comme à venir plutôt que déjà disponible.
• Contrôle de l’élocution — indications ligne par ligne, mise en scène à deux voix dans un seul appel, et indications non verbales écrites directement dans le script sous la forme de <rires>, <soupir>, <halètement>, |mhm| et |ouais|. Les documents de lancement de Google revendiquent une meilleure cohérence sur les formats longs et un contrôle de scénario à deux locuteurs par rapport à 3.1 en particulier. Il s’agit d’une affirmation de fournisseur qu’aucune exécution publique ne vient étayer.
• Couverture linguistique — 130 langues sur Flash TTS et 101 sur Flash-Lite TTS, détectées automatiquement à partir du texte. La couverture publiée de 3.1 Flash TTS est inférieure.
Le changement structurel, c’est la scission. Il n’y a pas un successeur unique à 3.1 Flash TTS ; il y en a deux, et la documentation de Google positionne Flash-Lite TTS comme le « remplaçant pour le gros du travail ». Cela compte, car une migration est une décision de palier, pas une simple montée de version. Le palier moins cher n’est pas la version plus récente de ce que vous avez — c’est un autre point sur la courbe.
Pourquoi le prix a baissé alors que le classement indique qu’il a augmenté
Commencez par ce que Google publie, car c’est ce qui vous sera réellement facturé.
• Gemini 3.1 Flash TTS Preview — 1,00 $ par million de jetons de texte en entrée, 20,00 $ par million de jetons audio en sortie. Le traitement par lots coûte 0,50 $ et 10,00 $.
• Gemini 3.8 Flash TTS Standard — 0,50 $ et 9,00 $ jusqu’au 31 décembre 2026, puis 1,00 $ et 18,00 $. Batch et Flex 0,25 $ et 4,50 $. Priority 0,90 $ et 16,20 $.
• Gemini 3.8 Flash-Lite TTS Standard — 0,50 $ et 6,00 $ jusqu’au 31 décembre 2026, puis 1,00 $ et 12,00 $. Batch et Flex : 0,25 $ et 3,00 $. Priority : 0,90 $ et 10,80 $.

Pour la seule ligne de sortie audio, 3.8 Flash TTS à 9,00 $ contre 3.1 à 20,00 $ représente une baisse de 55 %, et 3.8 Flash-Lite TTS à 6,00 $ représente une baisse de 70 %. Même au tarif après promotion de 18,00 $, Flash TTS reste en dessous du modèle qu’il remplace. C’est le chiffre qui figure sur une facture, et il est sans ambiguïté.
Passons au classement. Artificial Analysis publie un chiffre par million de caractères afin que les modèles facturés dans différentes unités puissent être classés côte à côte, et pour cette paire, il indique 18,30 $ pour 3.1 Flash TTS et 33,00 $ pour 3.8 Flash TTS. Pris isolément, cela signifie que la mise à niveau a presque doublé de prix.
Le rapprochement tient au fait qu’un tarif par caractère est une conversion, non un prix, et que le facteur de conversion n’est pas le même pour les deux modèles. Convertir des jetons audio en caractères exige de supposer à la fois un débit de parole et un ratio de jetons audio — Google facture l’audio à 25 jetons par seconde de sortie — et il faut choisir le niveau de service par rapport auquel normaliser. Si le conseil normalise 3,8 au tarif post-promotion de 18,00 $ tandis qu’il normalise 3,1 à son propre tarif de 20,00 $, les deux sont suffisamment proches pour que toute différence dans les secondes par caractère supposées domine le résultat. Un tarif par caractère fondé sur une hypothèse généreuse de débit de parole flatte le modèle auquel il est appliqué.
La consigne pratique est donc la suivante : utilisez les tarifs par token de Google pour budgétiser, et n'utilisez les tarifs par caractère du classement que pour le ratio entre les modèles que le classement a mesurés de la même manière. Ne les mélangez pas, et ne citez pas le passage de 18,30 $ à 33,00 $ comme une augmentation de prix — c'est un artefact d'une normalisation que les deux modèles ne partagent pas.
Le véritable coût de migration est d’un autre ordre : c’est la fenêtre promotionnelle. Les deux nouveaux paliers bénéficient d’un tarif réduit de moitié jusqu’au 31 décembre 2026 et doublent le 1er janvier. Une migration planifiée sur les chiffres de septembre et exécutée en novembre sera re-tarifée au premier trimestre. Le tarif de janvier 2027 pour Flash TTS, 18,00 $ par million de jetons audio, reste inférieur aux 20,00 $ de la 3.1 — la baisse est donc bien réelle au-delà de la promo, mais beaucoup plus faible qu’elle n’en a l’air aujourd’hui.
Le gain de qualité, et ce qui n’en est pas à l’origine
L'Elo d'arène est le seul chiffre ici recueilli par quelqu'un d'autre que le fournisseur, et c'est celui qui dépasse ses barres d'erreur. Soixante et un points, de 1 199 à 1 260, avec 3 430 échantillons sur 3.1 et 1 999 sur 3.8, et 7 voix d'arène contre 8. Le nombre d'échantillons pour le modèle plus récent est plus faible, ce qui élargit son intervalle, et malgré cela, les plages ne se touchent pas.

Ce qui n'est pas derrière : aucun benchmark indépendant autre que l'arène. Les chiffres de lancement de Google — premier au Hume AI Voice Design Benchmark avec 71,4, premier en modélisation d'accent avec 60,8, premier et deuxième au Hume Overall Quality Index pour Flash et Flash-Lite, et des places de tête en préférence à l'aveugle revendiquées en japonais, en portugais brésilien, en vietnamien, en arabe standard moderne, en espagnol mexicain et en hindi — sont des citations, par le fournisseur, d'un benchmark tiers. Les exécutions sous-jacentes ne sont pas publiques. Lisez-les comme des affirmations, allant dans le même sens que le résultat de l'arène, mais sans y ajouter de poids indépendant.
La question de la dépréciation, et une checklist de migration
Google n'a pas annoncé de date d'arrêt pour Gemini 3.1 Flash TTS Preview. Elle a déclaré que Flash-Lite TTS était positionné comme son remplacement principal, ce qui est le genre de langage qui précède un avis de dépréciation plutôt qu'il ne le suit. Si vous utilisez encore le modèle preview, la bonne lecture est que vous avez une migration à planifier, pas une échéance à respecter — et qu'attendre l'échéance est la mauvaise stratégie pour un modèle dont le remplacement a déjà 61 points Elo d'avance.
• Vérifiez de quel palier votre charge de travail a besoin. Flash TTS pour 130 langues et l’ensemble de la surface de diffusion ; Flash-Lite TTS pour 101 langues à 6,00 $ par million de tokens audio. La liste des langues est la ligne de démarcation, pas la qualité.
• Revoyez le prix en fonction du tarif de janvier 2027, et non du tarif promotionnel. 18,00 $ par million de jetons audio sur Flash TTS, 12,00 $ sur Flash-Lite.
• Déterminez si la tâche peut être traitée par lots. Batch et Flex réduisent de moitié le tarif audio sur les deux niveaux — 4,50 $ et 3,00 $ par million de jetons. Tout ce qui n’est pas interactif ne devrait pas être sur le niveau Standard.
• Vérifiez à nouveau tout ce qui dépendait du jeu de voix. Le catalogue par défaut compte 30 voix préconstruites ; la voix que vous utilisiez dans la version 3.1 devra peut-être être recréée, soit par la conception de voix, soit à partir d’un échantillon de réplication de 30 secondes.
• Revérifiez le façonnage des requêtes. Aucun plafond de caractères par requête n'est publié pour les modèles 3.8, et l'audio est facturé à la seconde plutôt qu'au caractère, de sorte qu'un long énoncé coûte plus cher que ne le laisserait penser un tarif par caractère.
• Planifiez le cycle de vie des voix personnalisées. 200 voix avec état par projet avec une durée de vie d'un an, ou sans état voicekey_... dont les identifiants expirent dans sept jours.
Exécuter les deux pendant que vous décidez
Une mise à niveau au sein d'une même famille, avec une expiration promotionnelle et un désaccord de normalisation, est exactement le cas où il ne faut pas basculer en une seule étape. OrcaRouter achemine aujourd'hui le modèle plus ancien — models/google/gemini-3.1-flash-tts-preview figure sur notre liste de modèles — afin que vous puissiez déployer le nouveau modèle à côté de lui et comparer sur votre propre trafic avant de déplacer le chemin de production. Nous n'hébergeons pas les points de terminaison Gemini 3.8 TTS ; ceux-ci proviennent de l'API de Google elle-même. Ce que nous fournissons, c'est la clé unique pour plus de 200 modèles au prix catalogue du fournisseur, sans marge, de sorte qu'un changement de tarif du fournisseur se répercute sur votre facture le jour même plutôt qu'au renouvellement, et un basculement automatique afin qu'un tout nouveau modèle soit quelque chose que vous pouvez essayer sans y parier un chemin exposé au client.
Ce qu’il faut surveiller, c’est de savoir si Google associe une date à l’aperçu de 3.1 Flash TTS. Cette seule ligne de documentation vaut plus pour un plan de migration que n’importe lequel des benchmarks de cet article, et elle n’a pas encore été écrite.
