Une carte hero générée pour « Gemini 3.8 TTS vs Inworld Realtime TTS-2 » sur fond blanc avec de doux dégradés bleu et cyan. La carte de gauche, « Gemini 3.8 Flash TTS », indique un Elo de 1 260 au rang 2, 8 voix d'arène, 130 langues annoncées et 16,50 $ par million de caractères normalisés ; la carte de droite, « Inworld Realtime TTS-2 », indique un Elo de 1 245 au rang 4, 8 voix d'arène, anglais uniquement, 20,80 $ par million de caractères normalisés et une première place dans la Controlled Voice Arena. Une ligne de pied de page indique « Elo selon l'Artificial Analysis Provider Voice Arena, sept. 2026 ; prix selon Google et Inworld. » Le logo OrcaRouter est intégré dans le coin inférieur droit.
Guides & Insights

Gemini 3.8 TTS vs Inworld Realtime TTS-2 : quel tableau de bord, selon vous, change la réponse

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Placez Gemini 3.8 Flash TTS et Inworld Realtime TTS-2 côte à côte sur l'Artificial Analysis Provider Voice Arena et la réponse paraît évidente : rang 2 contre rang 4, Elo 1 260 contre 1 245, 8 voix d'arène chacun, et un prix normalisé de 16,50 $ par million de caractères contre 20,80 $. Le fournisseur l'emporte sur la position et sur le prix, et l'écart de 15 points se situe de toute façon dans les intervalles de confiance des deux lignes.

Passez à l'autre classement publié par Artificial Analysis et l'ordre s'inverse. Inworld Realtime TTS-2 occupe la première place du Controlled Voice Arena avec un Elo de 1 123, sa variante Flash se situant à 1 075. Ce n'est pas une différence d'arrondi — c'est un modèle différent qui l'emporte, et la raison en est que les deux classements ne mesurent pas la même chose. Si vous choisissez une voix pour un produit, savoir laquelle de ces deux questions votre cas d'usage pose réellement constitue toute la décision.

A generated comparison scoreboard for Gemini 3.8 Flash TTS and Inworld Realtime TTS-2, showing Provider Arena position (rank 2, Elo 1,260 against rank 4, Elo 1,245), Controlled Arena position (not top ranked against rank 1 at Elo 1,123), price ($16.50 against $20.80 per 1M characters), languages (130 claimed against English only), cloning path (a 30-second sample against 5 to 15 seconds) and dialogue (two speakers against a single voice).

Deux tableaux, deux questions différentes

La Provider Voice Arena évalue les voix natives d'un modèle — celles que le fournisseur livre et héberge. La Controlled Voice Arena maintient la voix constante et évalue la performance de chaque modèle lorsqu'on lui demande de parler avec une voix qui n'est pas la sienne. Mêmes juges, même type de comparaison à l'aveugle, variable différente.

Cette distinction correspond à deux tâches différentes :

• Le classement des fournisseurs répond à la question « ce modèle sonne-t-il bien dès la sortie de la boîte ». C'est le bon type de classement pour un produit livré avec un ensemble fixe de voix de narration et qui ne clone jamais rien.

• Le classement contrôlé répond à la question « ce modèle obéit-il à une spécification de voix ? ». C’est le bon tableau pour un produit où la voix est celle du client — une voix de marque clonée, un acteur sous licence, une identité propre à chaque locataire.

Les modèles de Google dominent le premier. Ceux d’Inworld dominent le second. Ces deux affirmations sont vraies en même temps et ni l’une ni l’autre n’est une contradiction, ce qui explique exactement pourquoi une réponse unique à « quel modèle TTS est le meilleur » est généralement le signe que l’auteur s’est appuyé sur un seul classement et n’a pas regardé l’autre.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and Inworld Realtime TTS-2 at rank 4 with an Elo of 1,245, with Inworld Realtime TTS-2 Flash further down at 1,210 and Gemini 3.8 Flash-Lite TTS at rank 6.

Ce que la position de numéro un d'Inworld implique en pratique

Un résultat Controlled à la première place est une affirmation quant à la fidélité à une instruction, et la fidélité à une instruction est la propriété qui décide si le clonage est utilisable tout court.

La méthode de clonage d'Inworld se présente sous deux formes. Le clonage instantané fonctionne à partir d'un court échantillon — le chiffre annoncé par le fournisseur est de 5 à 15 secondes d'audio de référence — et une offre de clonage professionnel, en bêta, exige de l'ordre de dix minutes. Ces deux chiffres sont déclarés par le fournisseur et aucun n'est vérifié de façon indépendante par l'arène ; ce que l'arène mesure, c'est le comportement du modèle une fois qu'il dispose d'une voix, et non la qualité de l'étape de clonage qui l'a produite.

Les affirmations de latence associées à la famille relèvent de la même catégorie. Le chiffre de premier octet de la variante Flash — 25 millisecondes, rapporté via une mesure tierce — et les chiffres p99 du modèle complet sont ceux d'Inworld, et l'arène n'a rien à dire sur aucun des deux. Ils sont plausibles pour un modèle orienté temps réel et ils ne sont pas vérifiés, ce qui est la bonne façon de les considérer.

Donc, en pratique : si votre produit clone des voix, le résultat Controlled d'Inworld est le plus pertinent des deux scores, et c'est la raison pour laquelle un rang Provider inférieur n'est pas disqualifiant. Si votre produit ne clone pas, cet avantage vous est invisible et c'est le tableau Provider qu'il faut lire.

L’échelle des prix comporte trois échelons, et le moins cher est un abonnement.

Comparer un prix à un autre prix fausse cette comparaison, car Inworld n'a pas de prix — il a une échelle.

• À la demande — Realtime TTS-2 à 25,00 $ par million de caractères, Flash à 15,00 $. C’est le tarif qu’un utilisateur pay-as-you-go voit, et c’est le montant publié par le fournisseur lui-même.

• Creator plan — 20,00 $ et 10,00 $ pour les deux mêmes modèles, soit une remise de 20 % et de 33 % pour un engagement à un forfait plutôt qu’à la facturation à l’usage. Déclaré par le fournisseur, et le palier qu’il vaut le plus la peine de revérifier sur la page de tarification en direct avant de vous engager, car les conditions des forfaits évoluent plus vite que les tarifs catalogue.

• Normalisé — la conversion par million de caractères de l'arène donne 20,80 $ pour Realtime TTS-2 et 10,40 $ pour Flash, ce qui relève de l'arithmétique du classement plutôt que du tarif annoncé par l'un ou l'autre fournisseur.

En revanche, les tarifs de Google sont basés sur les tokens et promotionnels : 0,50 $ par million de tokens de texte en entrée et 9,00 $ par million de tokens audio en sortie jusqu'au 31 décembre 2026, puis 18,00 $ ; Flash-Lite TTS est à 0,50 $ et 6,00 $, puis 12,00 $. Normalisé, cela représente 16,50 $ et 11,00 $.

A screenshot of Inworld's text-to-speech product page, showing the Realtime TTS-2 and TTS-2 Flash model cards, the instant and professional voice cloning tiers, per-million-character pricing, and usage statistics including 642,022,085 characters used and 223,764 minutes generated.

Lisez les deux ensemble et le tableau est plus intéressant que « Google est moins cher ». D'après les chiffres publiés aujourd'hui, Flash TTS est le moins cher des trois modèles et la variante Flash d'Inworld est le deuxième moins cher — les deux modèles Flash sont suffisamment proches pour qu'un petit changement dans votre ratio audio-texte puisse inverser lequel facture le moins. Le 1er janvier 2027, lorsque le tarif de Google doublera, l'ordre se stabilisera et Inworld deviendra l'option la moins chère à chaque palier de son barème. Quiconque compare ces deux modèles en septembre et s'engage en décembre compare les mauvais chiffres.

Où chacun est la meilleure réponse

Les deux modèles sont suffisamment proches en qualité pour que les facteurs de différenciation soient structurels ; la version honnête est donc une liste de conditions plutôt qu’un verdict.

Choisissez Gemini 3.8 Flash TTS quand c'est à vous de choisir la voix. Conception de voix à partir d'une description écrite, dialogue à deux locuteurs en un seul appel, stylisation au niveau du tour de parole et la couverture linguistique la plus large des deux selon le décompte de Google lui-même — autant d'éléments qu'Inworld n'égale pas dans cette comparaison. C'est aussi le modèle le moins cher aujourd'hui, et son frère Flash-Lite vous offre un second point de prix au sein de la même API.

Choisissez Inworld Realtime TTS-2 lorsque la voix est celle du client. Une ligne Controlled Voice de premier plan, un parcours de clonage instantané mesuré en secondes d’audio de référence, un niveau de clonage professionnel pour les cas qui nécessitent davantage, et une orientation temps réel étayée par des allégations sur le premier octet publiées par le fournisseur — avec la réserve qu’il s’agit des allégations du fournisseur. Il n’est disponible qu’en anglais selon la documentation du fournisseur lui-même, ce qui constitue une contrainte absolue si vous avez besoin d’autre chose.

Aucun de ces modèles n'est hébergé par OrcaRouter, et il vaut la peine de le dire plutôt que de laisser entendre le contraire : l'endroit où appeler Gemini 3.8 Flash TTS est l'API de Google elle-même et les surfaces que Google a désignées le 23 septembre, et l'endroit où appeler Inworld Realtime TTS-2 est la plateforme d'Inworld elle-même. Ce à quoi sert OrcaRouter, c'est tout ce qui entoure ce choix — plus de 200 modèles derrière une seule clé au prix catalogue du fournisseur sans marge, de sorte qu'un changement de tarif fournisseur comme celui de janvier est répercuté de notre côté le jour même, un basculement automatique pour qu'un modèle évalué n'ait pas à devenir une dépendance de production, et un DSL de routage pour composer des modèles en un seul appel quand aucune voix ne porte à elle seule l'ensemble du travail.

Si l’on garde ces deux éléments en lice, c’est parce que la modification des tarifs de janvier et la distinction entre « Controlled » et « Provider » constituent deux raisons distinctes pour lesquelles la réponse peut changer. Un pipeline qui ne peut en invoquer qu’une seule ne peut suivre ni l’une ni l’autre.