
Gemini 3.8 TTS vs ElevenLabs : ce qu'un prix trois fois plus élevé vous apporte
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
À volume égal, le modèle de synthèse phare d'ElevenLabs coûte environ trois fois ce que coûte le nouveau modèle du fournisseur. ElevenLabs Eleven v3 facture 0,10 $ pour mille caractères — 100 $ par million — et Gemini 3.8 Flash TTS facture 9,00 $ par million de tokens audio, qu'Artificial Analysis normalise à 33,00 $ par million de caractères. Il s'agit d'un écart de 3,0x au compteur, et c'est le fait le plus important de cette comparaison. La question intéressante n'est pas de savoir si l'écart est réel ; c'est ce que les soixante-sept dollars supplémentaires par million de caractères achètent réellement, car la réponse n'est pas « une meilleure parole ».

Trois mètres, pas un
La première chose à bien saisir, c’est que ces deux produits ne mesurent pas la même chose, et les grilles tarifaires publiées le cachent.
• ElevenLabs facture au caractère. Eleven v3 coûte 0,10 $ pour 1 000 caractères, avec un plafond de 5 000 caractères par requête. Eleven v3 Conversational coûte 0,05 $ pour 1 000, et les modèles Flash et Turbo coûtent également 0,05 $ pour 1 000, mais avec une limite de 40 000 caractères par requête et une latence annoncée d’environ 75 ms contre environ 280 ms pour Eleven v3 Conversational.
• Google facture au token, et les tokens audio ne sont pas des tokens de texte. Gemini 3.8 Flash TTS facture 0,50 $ par million de tokens de texte en entrée et 9,00 $ par million de tokens audio en sortie, comptabilisés à 25 tokens audio par seconde de parole générée. Aucun plafond de caractères par requête n’est publié.

• Artificial Analysis ne facture ni l’un ni l’autre ; c’est une normalisation. Les 100,00 $ et 33,00 $ par million de caractères sur son classement Provider Voice Arena sont un dénominateur commun dérivé, pour que le classement puisse, ne serait-ce que, se faire selon le prix. Utile pour un ratio, pas pour un devis.
Donc, la version honnête du chiffre de 3,0x est la suivante : sur la seule base comparable disponible, Google revient à environ un tiers du prix. Ce que cela signifie dans votre propre tableur dépend de si votre charge de travail est dominée par des chaînes courtes ou longues — un compteur audio à la seconde et un compteur texte par caractère divergent fortement à mesure que les énoncés s'allongent, car le silence, les pauses et le remplissage prosodique coûtent tous des tokens audio et aucun caractère.
Un mois travaillé
Prenez un million de caractères de texte, soit environ la longueur d’un roman de taille moyenne, convertis une fois en parole.
• ElevenLabs Eleven v3 — 100,00 $ pour la synthèse, plus le niveau de forfait dont vous avez besoin pour l’exécuter à votre niveau de concurrence. Les forfaits publiés s’échelonnent ainsi : Starter à 6 $, Creator à 22 $, Pro à 99 $, Scale à 299 $ et Business à 990 $, et les quotas de caractères sont inclus dans ces forfaits plutôt que facturés séparément.
• Gemini 3.8 Flash TTS — l'équivalent de 33,00 $, ou environ 16,50 $ si la tâche peut être traitée par lots, car le palier Batch et Flex réduit de moitié le tarif audio à 4,50 $ par million de jetons. Le service prioritaire le fait passer à 16,20 $ par million, soit environ l'équivalent de 59,40 $, ce qui reste bien en dessous d'ElevenLabs.
• Gemini 3.8 Flash-Lite TTS — 6,00 $ par million de jetons audio, soit environ 22,10 $ équivalent avec la même normalisation, au prix de 101 langues au lieu de 130.
Faites passer le même million de caractères par la tarification promotionnelle de Google et l’écart se creuse encore davantage, car les deux nouveaux modèles Gemini TTS sont à moitié prix jusqu’au 31 décembre 2026, puis leur prix double. Quiconque bâtit un business case sur les chiffres de septembre le bâtit sur une remise dont la date d’expiration est publiée.

Le seul endroit où la comparaison s’inverse, ce sont les énoncés très courts. Un compteur par caractère ne facture presque rien pour une confirmation de trois mots ; un compteur audio par seconde facture la seconde que prend la confirmation à être prononcée, y compris le silence qui l’entoure. Si votre produit est une interface vocale constituée de réponses d’une seule phrase, le calcul penche vers ElevenLabs. S’il s’agit de narration, de livres audio, de localisation de contenus longs ou de tout ce où le texte est long et l’audio plus long encore, il penche fortement vers Google.
La question de la qualité, honnêtement
Sur l’Artificial Analysis Provider Voice Arena — des votes en aveugle par paires sur les voix natives de chaque fournisseur — les deux modèles ne sont pas proches, et Google est en tête.
• Gemini 3.8 Flash TTS — rang 2, Elo 1 260, un intervalle de 17 points, 1 999 échantillons, 8 voix d’arène, sorti en septembre 2026.
• ElevenLabs Eleven v3 — 17e au classement, Elo 1 167, un intervalle de 11 points, 4 345 échantillons, 8 voix d’arène, répertorié comme février 2026 sur le tableau.
Quatre-vingt-treize points Elo les séparent, et contrairement à l'écart entre les trois premiers de ce classement, celui-ci est réel : l'intervalle d'Eleven v3 est de 1 156 à 1 178 et celui de Gemini de 1 243 à 1 277, sans chevauchement. Le nombre d'échantillons d'Eleven v3 est plus du double de celui de Gemini, donc l'estimation n'est pas fragile non plus.
C'est un résultat vraiment embarrassant pour l'argument du prix, et cela va à l'encontre de la conclusion évidente. ElevenLabs facture trois fois plus cher et se classe dix-sept places plus bas en préférence à l'aveugle. Quoi que les soixante-sept dollars supplémentaires achètent, ce n'est pas une voix plus agréable à l'oreille lors d'un face-à-face.
Ce qu'ElevenLabs vend réellement
ElevenLabs ne vend pas principalement un point de terminaison de synthèse, et c'est en le tarifant comme tel que la plupart des comparaisons se trompent. Ce que l'argent achète :
• Une bibliothèque de voix. La bibliothèque de voix partagée d'ElevenLabs compte des centaines de voix et constitue une véritable surface produit — ce pour quoi les gens viennent chez ElevenLabs est souvent une voix spécifique qu'ils ont entendue quelque part, pas le modèle derrière. Gemini 3.8 Flash TTS propose 30 voix studio prédéfinies, un parcours de conception vocale qui en génère une à partir d'une description en langage naturel, et un parcours de réplication qui clone à partir d'un échantillon de 30 secondes avec vérification du consentement, un filigrane SynthID et des justificatifs C2PA attachés. Le catalogue par défaut est plus petit ; la capacité de créer une voix spécifique est comparable.
• Les paliers de latence comme produits distincts. Flash et Turbo, à ~75 ms et avec une limite de 40 000 caractères, sont un produit différent de v3, à ~280 ms et 5 000 caractères, et les deux sont moins chers que v3. Si votre application a besoin d'une latence inférieure à 100 ms, ElevenLabs le commercialise explicitement et la documentation de lancement de Google ne revendique aucune latence comparable pour l'un ou l'autre des nouveaux modèles TTS.
• Un écosystème. Doublage, agents vocaux, endpoints conversationnels, une structure de forfait avec la concurrence rattachée — la même raison pour laquelle Cartesia vend de la téléphonie : c’est une stack, pas un modèle.
Si vous achetez une stack, le 3,0x est le prix à payer pour ne pas l’assembler. Si vous achetez un appel de synthèse, vous le payez pour une bibliothèque de voix et un palier de latence.
Ce que Google vend réellement
Le contre-argument est plus restreint et plus solide que « moins cher ».
• Couverture linguistique — 130 langues sur Flash TTS et 101 sur Flash-Lite TTS, détectées automatiquement à partir du texte, contre les plus de 70 langues documentées par ElevenLabs pour Eleven v3. Pour une passe de localisation, cette différence n'est pas une comparaison de fonctionnalités, c'est un écart de couverture.
• Direction — contrôle de la diction ligne par ligne, mise en scène d'une scène à deux locuteurs dans un seul appel, et indications non verbales écrites dans le script sous la forme <laughs>, <sigh>, <gasp>, |mhm| et |yeah|. Google affirme que la génération 3.8 a amélioré la cohérence sur les formats longs et le contrôle à deux locuteurs par rapport à Gemini 3.1 Flash TTS, ce qui est exactement la raison d'être de ces fonctionnalités. Affirmation du fournisseur, non reproduite.
• Modèle d'état des voix — 200 voix personnalisées avec état par projet, avec un TTL d'un an, ou des voix sans état adressées par un voicekey_... identifiant qui expirent en sept jours. C'est une décision d'infrastructure que vous pouvez anticiper dans votre planification.
Contrôle de sortie — WAV 24 kHz mono PCM signé 16 bits sur le point de terminaison unaire, PCM sans en-tête (audio/l16) sur le point de terminaison de streaming, et audio/mulaw et audio/alaw avec un taux d’échantillonnage configurable.
Les benchmarks de lancement de Google sont rapportés par le fournisseur et doivent être lus comme tels : premier sur le Hume AI Voice Design Benchmark avec 71,4 et premier pour la modélisation des accents avec 60,8, premier et deuxième au Hume Overall Quality Index pour Flash et Flash-Lite, respectivement, et des places de tête en préférence à l’aveugle revendiquées en japonais, portugais brésilien, vietnamien, arabe standard moderne, espagnol mexicain et hindi. Aucune de ces évaluations n’est publique. L’Elo de l’arène ci-dessus est le seul chiffre recueilli de manière indépendante dans cet article, et il se trouve qu’il va dans le même sens que les affirmations du fournisseur.
Le calcul du switch
Basculez si votre charge de travail est de type long format, multilingue ou suffisamment volumineuse pour que 3,0x apparaisse comme un poste à part entière, et si vous pouvez vous accommoder d’un catalogue de voix par défaut plus restreint et de l’absence de palier publié sous les 100 ms. Cela couvre la narration, le doublage, l’accessibilité et la plupart des fonctionnalités vocales intégrées aux produits.
Restez si vous achetez la stack — la bibliothèque de voix, les paliers de latence, les produits de doublage et d’agents — ou si votre charge de travail est dominée par des énoncés très courts où un compteur audio à la seconde vous pénalise. Restez aussi si vous avez déjà affiné une identité vocale sur ElevenLabs que vos utilisateurs reconnaissent, car la continuité vocale est une fonctionnalité produit et la recréer sur un nouveau modèle est un projet.
Dans un cas comme dans l'autre, la décision raisonnable est de faire tourner les deux pendant un mois sur du trafic réel avant de s'engager, et c'est l'argument pour ne câbler ni l'un ni l'autre directement dans votre base de code. OrcaRouter place plus de 200 modèles derrière une seule clé, au prix catalogue du fournisseur, sans marge, de sorte qu'une variation de prix chez l'un ou l'autre laboratoire se répercute sur votre facture le jour même plutôt qu'au renouvellement, et le basculement automatique maintient en vie un chemin vocal de production lorsqu'un tout nouvel endpoint se comporte mal. Nous n'hébergeons pas ElevenLabs — ses couches de synthèse et d'agents constituent son propre produit — et nous n'hébergeons pas non plus les endpoints TTS Gemini 3.8, qui proviennent de l'API de Google. Ce que nous prenons en charge, c'est la couche texte en dessous et le routage au-dessus.
Le chiffre à surveiller, c’est l’Elo d’Eleven v3 lors de la prochaine révision du classement. Quatre-vingt-treize points, c’est un déficit important pour un modèle facturé trois fois plus cher, et si l’intervalle se resserre sans que l’écart ne se comble, l’argument du prix cesse d’être un compromis pour devenir un verdict.
