
Gemini 3.8 TTS vs Inworld Realtime TTS-2 : quel tableau de bord, selon vous, change la réponse
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
Placez Gemini 3.8 Flash TTS et Inworld Realtime TTS-2 côte à côte sur l'Artificial Analysis Provider Voice Arena et la réponse paraît évidente : rang 2 contre rang 4, Elo 1 260 contre 1 245, 8 voix d'arène chacun, et un prix normalisé de 16,50 $ par million de caractères contre 20,80 $. Le fournisseur l'emporte sur la position et sur le prix, et l'écart de 15 points se situe de toute façon dans les intervalles de confiance des deux lignes.
Passez à l'autre classement publié par Artificial Analysis et l'ordre s'inverse. Inworld Realtime TTS-2 occupe la première place du Controlled Voice Arena avec un Elo de 1 123, sa variante Flash se situant à 1 075. Ce n'est pas une différence d'arrondi — c'est un modèle différent qui l'emporte, et la raison en est que les deux classements ne mesurent pas la même chose. Si vous choisissez une voix pour un produit, savoir laquelle de ces deux questions votre cas d'usage pose réellement constitue toute la décision.

Deux tableaux, deux questions différentes
La Provider Voice Arena évalue les voix natives d'un modèle — celles que le fournisseur livre et héberge. La Controlled Voice Arena maintient la voix constante et évalue la performance de chaque modèle lorsqu'on lui demande de parler avec une voix qui n'est pas la sienne. Mêmes juges, même type de comparaison à l'aveugle, variable différente.
Cette distinction correspond à deux tâches différentes :
• Le classement des fournisseurs répond à la question « ce modèle sonne-t-il bien dès la sortie de la boîte ». C'est le bon type de classement pour un produit livré avec un ensemble fixe de voix de narration et qui ne clone jamais rien.
• Le classement contrôlé répond à la question « ce modèle obéit-il à une spécification de voix ? ». C’est le bon tableau pour un produit où la voix est celle du client — une voix de marque clonée, un acteur sous licence, une identité propre à chaque locataire.
Les modèles de Google dominent le premier. Ceux d’Inworld dominent le second. Ces deux affirmations sont vraies en même temps et ni l’une ni l’autre n’est une contradiction, ce qui explique exactement pourquoi une réponse unique à « quel modèle TTS est le meilleur » est généralement le signe que l’auteur s’est appuyé sur un seul classement et n’a pas regardé l’autre.

Ce que la position de numéro un d'Inworld implique en pratique
Un résultat Controlled à la première place est une affirmation quant à la fidélité à une instruction, et la fidélité à une instruction est la propriété qui décide si le clonage est utilisable tout court.
La méthode de clonage d'Inworld se présente sous deux formes. Le clonage instantané fonctionne à partir d'un court échantillon — le chiffre annoncé par le fournisseur est de 5 à 15 secondes d'audio de référence — et une offre de clonage professionnel, en bêta, exige de l'ordre de dix minutes. Ces deux chiffres sont déclarés par le fournisseur et aucun n'est vérifié de façon indépendante par l'arène ; ce que l'arène mesure, c'est le comportement du modèle une fois qu'il dispose d'une voix, et non la qualité de l'étape de clonage qui l'a produite.
Les affirmations de latence associées à la famille relèvent de la même catégorie. Le chiffre de premier octet de la variante Flash — 25 millisecondes, rapporté via une mesure tierce — et les chiffres p99 du modèle complet sont ceux d'Inworld, et l'arène n'a rien à dire sur aucun des deux. Ils sont plausibles pour un modèle orienté temps réel et ils ne sont pas vérifiés, ce qui est la bonne façon de les considérer.
Donc, en pratique : si votre produit clone des voix, le résultat Controlled d'Inworld est le plus pertinent des deux scores, et c'est la raison pour laquelle un rang Provider inférieur n'est pas disqualifiant. Si votre produit ne clone pas, cet avantage vous est invisible et c'est le tableau Provider qu'il faut lire.
L’échelle des prix comporte trois échelons, et le moins cher est un abonnement.
Comparer un prix à un autre prix fausse cette comparaison, car Inworld n'a pas de prix — il a une échelle.
• À la demande — Realtime TTS-2 à 25,00 $ par million de caractères, Flash à 15,00 $. C’est le tarif qu’un utilisateur pay-as-you-go voit, et c’est le montant publié par le fournisseur lui-même.
• Creator plan — 20,00 $ et 10,00 $ pour les deux mêmes modèles, soit une remise de 20 % et de 33 % pour un engagement à un forfait plutôt qu’à la facturation à l’usage. Déclaré par le fournisseur, et le palier qu’il vaut le plus la peine de revérifier sur la page de tarification en direct avant de vous engager, car les conditions des forfaits évoluent plus vite que les tarifs catalogue.
• Normalisé — la conversion par million de caractères de l'arène donne 20,80 $ pour Realtime TTS-2 et 10,40 $ pour Flash, ce qui relève de l'arithmétique du classement plutôt que du tarif annoncé par l'un ou l'autre fournisseur.
En revanche, les tarifs de Google sont basés sur les tokens et promotionnels : 0,50 $ par million de tokens de texte en entrée et 9,00 $ par million de tokens audio en sortie jusqu'au 31 décembre 2026, puis 18,00 $ ; Flash-Lite TTS est à 0,50 $ et 6,00 $, puis 12,00 $. Normalisé, cela représente 16,50 $ et 11,00 $.

Lisez les deux ensemble et le tableau est plus intéressant que « Google est moins cher ». D'après les chiffres publiés aujourd'hui, Flash TTS est le moins cher des trois modèles et la variante Flash d'Inworld est le deuxième moins cher — les deux modèles Flash sont suffisamment proches pour qu'un petit changement dans votre ratio audio-texte puisse inverser lequel facture le moins. Le 1er janvier 2027, lorsque le tarif de Google doublera, l'ordre se stabilisera et Inworld deviendra l'option la moins chère à chaque palier de son barème. Quiconque compare ces deux modèles en septembre et s'engage en décembre compare les mauvais chiffres.
Où chacun est la meilleure réponse
Les deux modèles sont suffisamment proches en qualité pour que les facteurs de différenciation soient structurels ; la version honnête est donc une liste de conditions plutôt qu’un verdict.
Choisissez Gemini 3.8 Flash TTS quand c'est à vous de choisir la voix. Conception de voix à partir d'une description écrite, dialogue à deux locuteurs en un seul appel, stylisation au niveau du tour de parole et la couverture linguistique la plus large des deux selon le décompte de Google lui-même — autant d'éléments qu'Inworld n'égale pas dans cette comparaison. C'est aussi le modèle le moins cher aujourd'hui, et son frère Flash-Lite vous offre un second point de prix au sein de la même API.
Choisissez Inworld Realtime TTS-2 lorsque la voix est celle du client. Une ligne Controlled Voice de premier plan, un parcours de clonage instantané mesuré en secondes d’audio de référence, un niveau de clonage professionnel pour les cas qui nécessitent davantage, et une orientation temps réel étayée par des allégations sur le premier octet publiées par le fournisseur — avec la réserve qu’il s’agit des allégations du fournisseur. Il n’est disponible qu’en anglais selon la documentation du fournisseur lui-même, ce qui constitue une contrainte absolue si vous avez besoin d’autre chose.
Aucun de ces modèles n'est hébergé par OrcaRouter, et il vaut la peine de le dire plutôt que de laisser entendre le contraire : l'endroit où appeler Gemini 3.8 Flash TTS est l'API de Google elle-même et les surfaces que Google a désignées le 23 septembre, et l'endroit où appeler Inworld Realtime TTS-2 est la plateforme d'Inworld elle-même. Ce à quoi sert OrcaRouter, c'est tout ce qui entoure ce choix — plus de 200 modèles derrière une seule clé au prix catalogue du fournisseur sans marge, de sorte qu'un changement de tarif fournisseur comme celui de janvier est répercuté de notre côté le jour même, un basculement automatique pour qu'un modèle évalué n'ait pas à devenir une dépendance de production, et un DSL de routage pour composer des modèles en un seul appel quand aucune voix ne porte à elle seule l'ensemble du travail.
Si l’on garde ces deux éléments en lice, c’est parce que la modification des tarifs de janvier et la distinction entre « Controlled » et « Provider » constituent deux raisons distinctes pour lesquelles la réponse peut changer. Un pipeline qui ne peut en invoquer qu’une seule ne peut suivre ni l’une ni l’autre.
