
Gemini 3.8 TTS vs Qwen Audio 3.0 TTS : deux réponses différentes à la question « faire sonner juste »
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
Un point Elo sépare ces deux modèles sur l'Artificial Analysis Provider Voice Arena, et ils y parviennent en résolvant des problèmes complètement différents. Qwen-Audio-3.0-TTS-Plus se classe au 3e rang avec un Elo de 1 259 sur 1 447 échantillons et 15 voix d'arène, sorti en septembre 2026 et affiché à 27,60 $ par million de caractères. Gemini 3.8 Flash TTS se classe au 2e rang avec 1 260 sur 1 999 échantillons et 8 voix d'arène, sorti le 23 septembre 2026 et affiché à 33,00 $ par million de caractères. Statistiquement indiscernables, 20 % d'écart sur le prix, et construits sur des théories opposées de ce qui fait la qualité d'une parole synthétique.
La théorie est la partie intéressante. La réponse de Qwen est le contrôle inline : 86 balises de rendu que l’on parsème dans le texte pour que le modèle sache où respirer, insister et changer de registre. La réponse de Google est une couche de direction : des instructions ligne par ligne, une mise en scène à deux voix et un petit ensemble d’indications non verbales. Si vous avez déjà construit un pipeline qui émet des annotations de type SSML, l’une de ces approches conviendra et l’autre non, et cette compatibilité compte plus qu’un seul point Elo.
Où les deux se trouvent réellement sur le plateau
Pour lire honnêtement le Provider Voice Arena, il faut examiner les intervalles, et non les rangs.
• Qwen-Audio-3.0-TTS-Plus — rang 3, Elo 1 259, 1 447 échantillons, 15 voix d’arène, septembre 2026, 27,6 $ par million de caractères.
• Gemini 3.8 Flash TTS — rang 2, Elo 1 260, 1 999 échantillons, 8 voix d’arène, septembre 2026, 33,0 $ par million de caractères.
• Cartesia Sonic 3.6 — rang 1, Elo 1 273, 1 757 échantillons, 8 voix d’arène, août 2026, 49,0 $ par million de caractères.
Les trois premiers forment un seul groupe. Les intervalles publiés pour les deux premiers s’étendent de dix-sept points de part et d’autre, ce qui est plus large que l’écart total entre le premier et le troisième ; l’ordre entre eux ne constitue donc pas une preuve fiable. Ce que le classement établit, en revanche, c’est que tous les trois font partie du groupe de tête et que rien en dessous n’est proche — le rang 10, Gemini 3.1 Flash TTS, est à 1 199.
La seule asymétrie qu’il vaut la peine de signaler est le nombre de voix dans l’arène. Qwen aligne 15 voix contre 8 pour Gemini, donc le score de Qwen est une moyenne calculée sur un échantillon plus large du produit du fournisseur lui-même. Cela joue dans les deux sens : c’est une estimation plus juste de ce à quoi ressemble l’ensemble du catalogue de Qwen, et cela donne à Qwen plus d’occasions d’aligner une voix faible qui tire la moyenne vers le bas. Aucune de ces lectures ne change la conclusion selon laquelle les deux sont à égalité.

86 étiquettes de livraison par rapport à une couche de direction
C'est là la différence de fond, et c'est elle qui détermine la plupart des intégrations.
Qwen-Audio-3.0-TTS est livré avec 86 balises de diction en ligne — des annotations intégrées au texte qui contrôlent la façon dont un segment est prononcé. C'est une approche par balisage : c'est votre script qui porte l'interprétation. Cela est familier à quiconque a travaillé avec SSML, et s'articule bien avec les outils qui génèrent du texte par programmation, car la surface de contrôle est une transformation de chaîne de caractères plutôt qu'un appel d'API.
Gemini 3.8 Flash TTS prend l'autre voie. Vous dirigez une réplique comme vous dirigeriez un acteur — rythme, accentuation, registre émotionnel — sous forme d'instruction distincte plutôt que de balisage intégré au texte. Les scènes à deux locuteurs peuvent être mises en scène dans un seul appel. Et un petit ensemble d'indices non verbaux est écrit dans le script : <laughs>, <sigh>, <gasp> comme indications intégrées au texte, plus |mhm| et |yeah| pour les bruits d'acquiescement.
Ainsi, les deux modèles acceptent l’annotation dans le texte ; la différence réside dans la taille du vocabulaire et dans l’endroit où vit le reste du contrôle. Celui de Qwen est plus large et plus plat — 86 balises, toutes dans le texte. Celui de Google est plus étroit dans le texte et plus large en dehors, avec la direction de diction et la répartition des locuteurs comme paramètres au niveau de l’appel. Si vous portez un système qui émet déjà un riche balisage en ligne, le portage vers Qwen est plus court. Si vous construisez de toute façon la logique de direction dans le code de l’application, la séparation de Google est plus propre.

Couverture linguistique par rapport à la couverture dialectale
Les chiffres de couverture ne sont pas comparables, et les comparer naïvement est une erreur.
Gemini 3.8 Flash TTS couvre 130 langues, détectées automatiquement à partir du texte ; Flash-Lite TTS en couvre 101. C’est une étendue à travers les familles de langues, ce qu’il vous faut pour une passe de localisation qui doit atteindre une longue traîne de marchés.
Qwen-Audio-3.0-TTS couvre 16 langues ainsi que 20 régions dialectales chinoises. C’est une profondeur au sein d’une même famille linguistique. Vingt régions dialectales ne représentent pas un nombre plus petit que 130 langues, contrairement aux apparences — c’est un type de revendication différent, et pour un produit qui sert des utilisateurs sinophones à travers les régions continentales, c’est la revendication la plus utile. Un modèle doté de 130 langues et d’une seule voix mandarine ne rend pas service à un utilisateur du Sichuan de la manière dont le fait un modèle avec 20 régions dialectales.
Ce qui compte dépend entièrement de votre public. Si votre exigence est « au moins passable sur vingt marchés », Gemini. S'il s'agit d'« vraiment juste sur le marché chinois », Qwen.
Prix, et ce que cache le chiffre par caractère
• Qwen-Audio-3.0-TTS-Plus — 27,60 $ par million de caractères sur la base normalisée du classement ; la variante Flash coûte environ 15 $ par million de caractères, avec une latence annoncée du premier paquet d'environ 300 ms.
• Gemini 3.8 Flash TTS — 33,00 $ par million de caractères normalisés ; facturé par Google à 0,50 $ par million de tokens de texte en entrée et 9,00 $ par million de tokens audio en sortie jusqu'au 31 décembre 2026, puis 1,00 $ et 18,00 $.
• Gemini 3.8 Flash-Lite TTS — 22,10 $ par million de caractères normalisés au rang 6 avec un Elo de 1 235 ; facturé à 6,00 $ par million de jetons audio jusqu’au 31 décembre 2026.
Les deux chiffres par caractère sont des normalisations d’Artificial Analysis, et non des prix catalogue des fournisseurs — Qwen facture via Alibaba Cloud Model Studio et Google facture en jetons, et aucun des deux ne publie de tarif par caractère pour ces modèles. Utilisez-les pour le ratio, qui est d’environ 1,2x en faveur de Qwen, et non comme des devis.
Les paliers divergent en forme. Qwen se scinde en Plus et Flash, le palier Flash sacrifiant la qualité au profit d’une promesse de premier paquet à ~300 ms. Google se divise en Flash et Flash-Lite, puis encore en Standard, Batch et Flex, et Priority — 4,50 $, 9,00 $ et 16,20 $ par million de jetons audio sur Flash TTS. Le modèle de Google récompense la classification de votre charge de travail ; celui de Qwen récompense le choix d’un palier de qualité dès le départ.
La disponibilité est l'autre vraie différence. Gemini 3.8 Flash TTS est en disponibilité générale sur l'API Gemini Developer. Qwen-Audio-3.0-TTS est fermé et uniquement hébergé, servi via Alibaba Cloud Model Studio, sans poids ouverts. Si vous devez exécuter le modèle vous-même, aucun des deux n'est fait pour vous — mais si votre infrastructure est déjà sur Alibaba Cloud, le modèle Qwen est celui pour lequel il n'y a aucune question de trafic sortant à régler.
Revendications des fournisseurs des deux côtés
Aucun des deux modèles ne dispose d’un benchmark indépendant en dehors de l’arène, et les deux fournisseurs ont publié des affirmations qui devraient être présentées comme telles.
Ceux de Google, pour Gemini 3.8 Flash TTS : premier sur le Hume AI Voice Design Benchmark avec 71,4, premier sur la modélisation des accents avec 60,8, premier et deuxième sur le Hume Overall Quality Index pour Flash et Flash-Lite, et des places de tête en préférence à l’aveugle revendiquées en japonais, en portugais brésilien, en vietnamien, en arabe standard moderne, en espagnol mexicain et en hindi. Les exécutions ne sont pas publiques.
D'Alibaba, pour Qwen-Audio-3.0-TTS : le système de livraison à 86 balises, les 20 régions dialectales, et le chiffre d'environ 300 ms pour le premier paquet sur la variante Flash. Également non reproduit.
L'Elo d'arène est la seule note de qualité collectée de manière indépendante dans cet article, et il indique que les deux sont à égalité en tête du classement.

Ce que Gemini ajoute que Qwen n’ajoute pas
La création de voix est la lacune la plus évidente. Gemini 3.8 Flash TTS prend en charge la conception de voix à partir d'une description en langage naturel et la réplication de voix à partir d'un échantillon de 30 secondes, avec vérification du consentement et un filigrane SynthID ainsi que des justificatifs C2PA sur la sortie. Les voix personnalisées se présentent sous deux formes : 200 voix avec état par projet avec une durée de vie d'un an, ou des voix sans état adressées par un identifiant voicekey_... qui expirent après sept jours. Le remixage de voix est annoncé comme prochainement disponible.
Le contrôle du format de sortie est le deuxième. WAV 24 kHz mono PCM signé 16 bits sur le point de terminaison unaire, PCM sans en-tête (audio/l16) sur le point de terminaison de streaming, plus audio/mulaw et audio/alaw et une fréquence d'échantillonnage configurable. Pour les travaux liés à la téléphonie, la prise en charge de mulaw supprime une étape de transcodage.
Lequel appeler ?
Choisissez Qwen-Audio-3.0-TTS si vos utilisateurs parlent chinois et que la couverture des dialectes est une exigence, si vous voulez un riche vocabulaire de balisage inline que votre générateur peut émettre directement, ou si vous êtes déjà sur Alibaba Cloud et voulez le chemin le plus court vers un point de terminaison opérationnel. C'est aussi le moins cher des deux sur une base normalisée, et la variante Flash est encore moins chère si un premier paquet à ~300 ms est acceptable.
Choisissez Gemini 3.8 Flash TTS si vous avez besoin d’une large couverture de nombreuses langues plutôt que d’une profondeur dans une seule, si vous avez besoin de créer ou de reproduire une voix spécifique, si vous avez besoin d’une sortie mulaw ou alaw, ou si « disponible en général plutôt qu’hébergé uniquement » constitue une exigence d’approvisionnement.
Aucun des deux n’est un mauvais choix, et aucun n’est clairement meilleur — c’est tout l’intérêt d’un écart d’un point Elo. La décision relève de la compatibilité, pas de la qualité.
C'est aussi l'argument pour ne pas s'engager fermement dans l'un ou l'autre pour l'instant. OrcaRouter vous donne plus de 200 modèles derrière une seule clé, au prix catalogue du fournisseur et sans marge, si bien qu'une modification tarifaire venant de l'un ou l'autre laboratoire se répercute sur votre facture le jour même plutôt qu'au renouvellement, et le basculement automatique fait qu'un point de terminaison de synthèse qui flanche sous la charge bascule vers un autre au lieu de rejeter la requête. Nous n'hébergeons pas Qwen-Audio-3.0-TTS — celui-ci est servi via Alibaba Cloud Model Studio — et nous n'hébergeons pas les points de terminaison Gemini 3.8 TTS, qui proviennent de l'API de Google. Ce que nous prenons en charge, c'est la couche texte et le routage au-dessus, ce qui vous permet de faire tourner les deux sur du trafic réel pendant un mois avant de faire votre choix.
Le chiffre à surveiller est la prochaine révision de l’arène. Avec 1 447 échantillons sur Qwen et 1 999 sur Gemini, les deux intervalles sont encore assez larges pour qu’un seul mois de votes puisse les séparer — ou confirmer que l’égalité est la réponse.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
