Carte hero générée pour ElevenLabs Eleven v4 vs Google Gemini 3.1 Flash TTS, avec deux cartes de score : Eleven v4 à 1 319 points Elo et 80,00 $ par million de caractères, et Gemini 3.1 Flash TTS à 1 203 points Elo et 18,31 $ par million de caractères, avec la légende « 116 points Elo, 4,4 fois le prix du classement ». Pied de page : « Provider Voice Arena, d'après Artificial Analysis, septembre 2026. » Le logo OrcaRouter se trouve dans le coin inférieur droit.
Guides & Insights

Eleven v4 vs Gemini 3.1 Flash TTS : un écart de 116 points, et le modèle Google moins cher

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Si vous cherchez aujourd'hui la voix de Google, vous tomberez sur la mauvaise. Google Gemini 3.1 Flash TTS figure au 11e rang de la Provider Voice Arena d'Artificial Analysis, avec un Elo de 1 203 sur 3 512 apparitions, à 18,31 $ par million de caractères. ElevenLabs Eleven v4, sorti le 28 septembre 2026, occupe la 1re place avec un Elo de 1 319 sur 1 674 apparitions, à 80,00 $ par million. Cela ressemble à un écart de 116 points face à un concurrent moins cher — jusqu'à ce que vous remarquiez que le Gemini 3.8 Flash TTS de Google se classe troisième sur le même tableau, avec 1 267 et un prix normalisé inférieur, à 16,49 $. Le véritable duel n'est pas celui que suggère l'affiche, et la raison tient à une date de sortie.

L'un de ceux-ci est dix-huit mois plus récent qu'il n'y paraît.

Gemini 3.1 Flash TTS porte une date de sortie au 15 avril 2026 sur le tableau. Eleven v4 porte le 28 septembre 2026. Soit cinq mois et demi, ce qui ne représente pas une génération en synthèse vocale, mais c'est suffisamment long pour que Google ait déjà livré un successeur : Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS sont tous deux passés en disponibilité générale le 23 septembre 2026, cinq jours avant Eleven v4, et tous deux sont classés au-dessus de 3.1 sur le même tableau. Gemini 3.8 Flash-Lite TTS se classe sixième à 1 241 et à 11,03 $ par million.

A generated scoreboard comparing ElevenLabs Eleven v4 and Google Gemini 3.1 Flash TTS across six dimensions: Provider Voice rank and Elo (1 / 1,319 against 11 / 1,203), samples (1,674 with an interval of plus or minus 19 against 3,512 with plus or minus 12), board price ($80.00 against $18.31 per 1M characters), rate card ($0.022 per 1K characters until October 12 against billed per token), script direction (inline audio tags against a voice set and prompting) and release date (September 28, 2026 against April 15, 2026). Footer: 'Ranks, Elo, intervals and board prices per Artificial Analysis; rate meters and capabilities vendor-documented.' The OrcaRouter logo sits in the bottom-right corner.

Donc, la comparaison honnête comporte trois points, et non deux, et c’est le classement par prix qui est la partie intéressante :

• Rang 1, ElevenLabs Eleven v4 — Elo 1 319, 80,00 $ par million de caractères, 1 674 apparitions, intervalle ±19

• 3e place, Google Gemini 3.8 Flash TTS — Elo 1 267, 16,49 $ par million de caractères, lancé le 23 septembre 2026

Rang 6, Google Gemini 3.8 Flash-Lite TTS — Elo 1 241, 11,03 $ par million de caractères, sorti le 23 septembre 2026

• Rang 11, Google Gemini 3.1 Flash TTS — Elo 1 203, 18,31 $ par million de caractères, sorti le 15 avril 2026, 3 512 apparitions, intervalle de ±12

Notez ce que les intervalles font à ce classement. Gemini 3.1 Flash TTS estime 1 203 avec un intervalle de ±12, donc sa valeur réelle se situe quelque part entre 1 191 et 1 215. Eleven v4 estime 1 319 avec un intervalle de ±19 — environ 1 300 à 1 338. Les deux plages ne se touchent pas, et l’écart qui les sépare dépasse les cent points. C’est aussi net qu’un tableau de préférences peut l’être.

A screenshot of Artificial Analysis' Provider Voice Arena leaderboard, top of the table. ElevenLabs Eleven v4 is rank 1 at Elo 1,319 with an interval of plus or minus 19, 1,674 samples, eight arena voices, released Sept 2026 at $80.0 per 1M characters. Cartesia Sonic 3.6 is second at 1,276. Google Gemini 3.8 Flash TTS is third at 1,267 with $16.5 per 1M characters. Google Gemini 3.8 Flash-Lite TTS is sixth at 1,241 with $11.0. SpeechifyAI Simba 3.2 is seventh at 1,240 with $6.6. Google Gemini 3.1 Flash TTS is eleventh at 1,203 with an interval of plus or minus 12, 3,512 samples, seven arena voices, released Apr 2026 at $18.3 per 1M characters.

Pourquoi les effectifs d’échantillon comptent plus que les rangs

Gemini 3.1 Flash TTS compte 3 512 apparitions à l'appui de son estimation ; Eleven v4 en compte 1 674, car il n'a qu'un jour dans ce classement. L'estimation d'un modèle plus récent porte davantage d'incertitude par échantillon, et l'intervalle de ±19 le reflète. Si vous êtes le genre d'acheteur qui attend qu'un chiffre se stabilise, la règle empirique est que le classement au-dessus de la largeur de l'intervalle est la partie sur laquelle vous pouvez agir. Ici, le classement survit confortablement à ses barres d'erreur dans les deux directions — devant 3.8 Flash TTS et derrière aucun autre dans cette comparaison.

L’arène comptabilise aussi les voix d’arène : huit pour Eleven v4, sept pour Gemini 3.1 Flash TTS. C’est le nombre de voix de fournisseurs distinctes utilisées dans les tests à l’aveugle, et c’est un indicateur approximatif de l’ampleur du casting par défaut qu’un fournisseur apporte. La 1re place d’Eleven v4 a été obtenue avec huit voix, ce qui signifie que la victoire ne tient pas à un seul narrateur chanceux.

Les différences de capacités que l'Elo ne valorise pas

Les classements mesurent la préférence, pas la couverture fonctionnelle. Quatre différences déterminent les projets réels, et aucune d’entre elles n’apparaît dans un Elo.

• Direction de jeu — Eleven v4 documente les balises audio en ligne ([laughs], [whispers], [said angrily in French accent]) et les invites de jeu en langage naturel ; la génération 3.1 de Google documente le choix de la voix et le prompting, mais pas une syntaxe de balises équivalente pour la direction de jeu.

• Création de voix — la génération Gemini 3.8 a ajouté la conception de voix à partir d'une description écrite et la réplication de voix à partir d'un échantillon de 30 secondes, avec tatouage et métadonnées de provenance sur la sortie. Gemini 3.1 Flash TTS est antérieur et est livré avec un ensemble de voix prédéfinies.

• Clonage à partir d’audio réel — le clonage vocal instantané d’Eleven v4 fonctionne à partir de dix secondes d’audio, avec un niveau professionnel au-dessus. La voie de réplication de Google dans la génération 3.8 demande 30 secondes et ajoute une vérification du consentement. Des seuils différents, des mécanismes de consentement différents.

• Plafond d'entrée par requête — Eleven v4 documente 10 000 caractères. Google facture ses modèles TTS en tokens plutôt qu'en caractères, il n'existe donc pas de plafond de caractères par requête directement comparable, et les deux unités de mesure ne doivent pas être présentées côte à côte comme si elles l'étaient.

Ce dernier point est celui qui fait trébucher les tableurs d'approvisionnement. ElevenLabs annonce un prix pour 1 000 caractères. Google annonce un prix par million de tokens, en entrée comme en sortie. Artificial Analysis normalise les deux sur un axe par million de caractères — c'est de là que viennent les 80,00 $ et les 18,31 $ — mais cette normalisation est la conversion du tableau de bord, pas la facture de l'un ou l'autre fournisseur. Utilisez-la pour classer, pas pour prévoir.

A screenshot of Google's Gemini API documentation page for text-to-speech generation, headed by a banner reading 'Gemini 3.8 Flash is now available'. The page covers single-speaker and multi-speaker TTS, states that the TTS capability differs from the Live API in being designed for exact text recitation with fine-grained control, names the gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts models, notes that TTS models accept text-only input and produce audio-only output, and shows a Python example that attaches a speech_metadata annotation with the style 'cheerful and friendly' and a voice of 'Kore' in generation_config.speech_config.

Ce que la grille tarifaire d’Eleven v4 fait à cette comparaison

Pendant deux semaines, la comparaison de prix ci-dessus est erronée en faveur d’ElevenLabs, puis elle est erronée à son détriment. Sur la page de tarification de l’API d’ElevenLabs, Eleven v4 est affiché à 0,022 $ pour 1 000 caractères, contre un prix catalogue indiqué de 0,08 $, avec la mention « 72 % de réduction » jusqu’au 12 octobre. Eleven v4 Turbo est affiché à 0,011 $ contre 0,04 $. Après le 12 octobre, le chiffre promotionnel disparaît et le montant de 80,00 $ par million affiché au tableau devient le tarif que vous payez réellement.

Faites le calcul pour un mois de cinq millions de caractères. Eleven v4 coûte 110 $ pendant la fenêtre et 400 $ après. Gemini 3.1 Flash TTS, selon la normalisation de 18,31 $ du tableau de bord, revient à environ 92 $ pour le même mois — moins cher que la promotion et environ quatre fois moins cher que le tarif catalogue. Une équipe qui fait ses benchmarks en septembre et livre en novembre aura pris sa décision sur la base d’un chiffre qui n’existe plus.

Là où le routage a sa place, et là où il ne l’a pas

Aucun de ces modèles ne figure dans le catalogue OrcaRouter. Il n’y a ici aucun point de terminaison ElevenLabs ni aucun point de terminaison Google TTS à appeler, et la réponse honnête à « comment puis-je les joindre par votre intermédiaire » est que vous ne le pouvez pas : on accède à Eleven v4 via l’API propre d’ElevenLabs, et à Gemini 3.1 Flash TTS via celle de Google. Dire autre chose reviendrait à inventer une intégration.

Ce qu'une clé unique apporte dans une comparaison comme celle-ci, c'est la décision elle-même. Si vous pesez un endpoint à 400 $ par mois contre un autre à 92 $ par mois, la réponse dépend de vos propres scripts, de vos propres langages et de vos propres listeners — et pour obtenir cette réponse, il faut appeler les deux depuis le même chemin de code avec la même forme de requête, plutôt que de mettre en place deux intégrations fournisseurs pour exécuter un seul test. OrcaRouter couvre cette couche : plus de 200 modèles derrière une seule clé, avec les prix catalogue des fournisseurs répercutés à 0 % de marge, de sorte qu'un changement de prix d'un fournisseur se répercute le jour même de son entrée en vigueur, plus un basculement automatique si un amont se dégrade en cours d'évaluation.

Qui devrait choisir lequel ?

Choisissez Eleven v4 lorsque la voix est le produit. Il domine le classement de 116 points avec un intervalle plus net que le modèle qui le suit, c'est le seul des deux à disposer d'une syntaxe de balises en ligne documentée pour la direction d'interprétation, et son seuil de clonage est de dix secondes plutôt que de trente. Le surcoût est bien réel — quatre fois le prix normalisé au tarif catalogue — et il achète le sommet du classement.

Ne choisissez Gemini 3.1 Flash TTS que si vous y êtes déjà engagé. C'est un modèle de génération preview âgé de cinq mois, avec un score inférieur et un prix normalisé supérieur à ceux de la version de septembre de Google, et la seule raison de le conserver est l'inertie d'une intégration existante. Si vous avez cette inertie, migrer au sein de la stack Google vers 3.8 Flash TTS permet de gagner 64 points Elo et d'obtenir un prix normalisé inférieur sans changer de fournisseur — ce qui est un cas rare où la mise à niveau est aussi l'option la moins chère.

Pour tous les autres, la question d’actualité est Eleven v4 face à Gemini 3.8 Flash TTS, et la réponse est un véritable arbitrage plutôt qu’un classement : 52 points Elo et la syntaxe de balises contre environ un cinquième du coût par caractère. Testez les deux sur les mêmes scripts après le 12 octobre, lorsque la promotion ElevenLabs aura pris fin et que l’écart de prix sera celui que vous paierez réellement.