
Eleven v4 vs Qwen Audio 3.1 : La voix la moins chère du plateau l'a emporté
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 982 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 197 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
Sur le classement où chaque participant reçoit les mêmes huit voix clonées, Alibaba Qwen-Audio-3.1-TTS-Plus a terminé premier avec un Elo de 1 178 et ElevenLabs Eleven v4 a terminé deuxième avec 1 157. Le modèle qui a gagné coûte 19,30 $ par million de caractères sur ce classement. Le modèle arrivé deuxième coûte 80,00 $. Cela représente un écart de qualité de 21 points et un écart de prix d’un facteur quatre qui pointent dans des directions opposées, et c’est le résultat le plus intéressant de toute la semaine de lancement — plus intéressant que la première place qu’ElevenLabs a occupée sur l’autre arène, car sur celle-ci, le classement est conventionnel et le gagnant est la voix la plus chère du top dix.
Les deux classements ne sont pas interchangeables, et la raison pour laquelle cette confrontation se lit comme elle se lit tient entièrement à celui que l’on regarde. Provider Voice fait juger par des auditeurs les voix propres de chaque fournisseur. Controlled Voice clone les mêmes huit voix — quatre américaines, quatre britanniques — pour chaque modèle, de sorte que personne ne peut l’emporter grâce à son casting vocal par défaut. ElevenLabs remporte le premier avec 61 points d’avance. Alibaba remporte le second avec 21 points d’avance. Aucun des deux classements n’est faux, et c’est le second qui prédit un produit embarquant une voix de marque clonée.

Le tableau des scores des voix contrôlées, dans son intégralité
• Préférence à l’aveugle, clones appariés — Qwen-Audio-3.1-TTS-Plus classé n°1, Elo 1 178, 19,30 $ pour un million de caractères contre Eleven v4 classé n°2, Elo 1 157, 80,00 $.
• Préférence à l'aveugle, les voix propres à chaque fournisseur — Eleven v4 classé 1er, Elo 1 319 contre Qwen-Audio-3.0-TTS-Plus classé 4e, Elo 1 258. Un écart de 61 points dans l'autre sens.
• Prix, normalisation d'arène — Qwen 19,30 $ vs Eleven v4 80,00 $. Qwen est 76 % moins cher.
• Prix, grille tarifaire du fournisseur — Eleven v4 0,022 $ pour mille caractères en promotion et 0,08 $ après le 12 octobre. La grille tarifaire propre à Qwen Audio 3.1 ne fait pas partie de ce que nous avons pu lire, donc la normalisation de l’arène est le seul prix que nous pouvons comparer.
• Version sur chaque carte — 3.1 sur Controlled Voice, 3.0 sur Provider Voice. Ce sont des modèles différents et les cartes ne sont pas interchangeables.
• L'entrée 3.0 sur Controlled Voice — rang 5, Elo 1 124, même prix de 19,30 $. La version 3.1 vaut 54 Elo de plus que son propre prédécesseur à un prix identique.
• Les générations antérieures de Qwen sur Provider Voice — Qwen3 TTS Flash rang 79, Elo 944 ; Qwen3 TTS rang 82, Elo 930.
• L'ancien produit phare d'ElevenLabs sur Controlled Voice — Eleven v3 rang 7, Elo 1 073.
• Contrôle de cohérence des barres groupées — l’écart à huit voies du rang 1 au rang 10 sur Controlled Voice est de 121 Elo. L’avance de 21 points de Qwen sur Eleven v4 est inférieure à un cinquième de l’amplitude totale du peloton, ce qui est l’échelle appropriée pour la maintenir.

Deux lignes y font l’essentiel. La première est la comparaison 3.0 contre 3.1 : Alibaba a gagné 54 points Elo en une seule montée de version, sans aucun changement de prix. C’est un rythme plus rapide que les 84 points du passage de v3 à v4 d’ElevenLabs, et cela signifie que l’ordre de classement précis donné dans cet article est un instantané que les deux fournisseurs font activement évoluer.
Le second est l'écart total de 121 points. Un écart de 21 points dans un classement dont la plage utile est d'environ 120 points constitue une différence réelle mais modeste — à peu près du même ordre de grandeur que l'écart entre le 3.1 de Qwen et son 3.0. Si votre cas d'usage relève d'une langue sur laquelle aucun des deux modèles n'a été ajusté, cette marge est bien dans la fourchette qu'une poignée de scripts de test exigeants peut renverser.
Le problème de version que personne ne signale
Le résultat qui circule sous la forme « Eleven v4 est deuxième sur Controlled Voice » est exact et incomplet, et cette omission compte pour quiconque prévoit en fonction de ce résultat. Le modèle situé au-dessus d’Eleven v4 dans ce classement est la version 3.1 d’Alibaba. L’entrée Qwen du classement Provider Voice, quant à elle, correspond à la version 3.0 — le modèle 3.1 n’apparaît pas dans les premières lignes de ce classement, selon notre lecture. Ainsi, les deux titres — « Eleven v4 est numéro un » et « Eleven v4 est numéro deux » — sont des affirmations portant sur deux modèles Qwen différents dans deux tâches différentes, et la version de Qwen qui l’a battu dans un classement n’est pas la version de Qwen qu’il a battue dans l’autre.
Ce n'est pas un piège visant l'un ou l'autre des fournisseurs ; c'est une raison de se méfier de tout résumé d'une semaine comme celle-ci en une seule phrase. Si vous devez choisir entre ces deux systèmes, la comparaison qu'il vous faut, c'est 3.1 face à v4 sur votre propre voix clonée, dans votre propre langue, et aucun des deux fournisseurs n'a publié cela.
Ce que nous pouvons et ne pouvons pas dire sur Qwen Audio 3.1
L’honnêteté sur les preuves vaut davantage ici qu’un tableau complet de spécifications, aussi voici la limite sur laquelle repose cet article. D’après les classements de l’arène dont nous disposons, pour Qwen-Audio-3.1-TTS-Plus : un Elo en voix contrôlée de 1 178, une normalisation de prix de 19,30 $ par million de caractères, et le fait qu’il s’agit de la version actuelle d’une gamme dont la version précédente a obtenu 54 points de moins au même prix.
Nous ne disposons pas, et ne chercherons pas à deviner : sa couverture linguistique, sa latence, sa limite d'entrée par requête, s'il prend en charge des directives de rendu intégrées, s'il propose un clonage vocal au-delà des huit voix de l'arène, ou ce qu'il facture selon son propre barème tarifaire. Tous ces éléments sont documentés pour Eleven v4 — plus de 90 langues, une limite de 10 000 caractères, des balises audio, des clones instantanés de dix secondes, la prise en charge des phonèmes IPA — et leur absence du côté de Qwen est une lacune dans ce qui est lisible publiquement, non un grief contre le modèle. Une décision d'achat fondée sur cet article seul serait une décision prise sur deux chiffres.

Un contraste survit néanmoins à cette limitation, car les deux côtés sont déclarés par le fournisseur ou tous deux sont déclarés par le board. Sur le prix, la normalisation du board est le dénominateur commun et elle avantage Qwen de 76 %. Sur la qualité à locuteurs appariés, ce même board avantage Qwen de 21 Elo. Ces deux lignes sont comparables. Tout le reste ici ne l'est pas, et l'article ne prétendra pas le contraire.
Pourquoi un conseil contrôlé devrait peser plus lourd que d'habitude
La plupart des comparaisons de voix se fondent par défaut sur le classement qui place en tête le modèle que vous aimez déjà. Dans cette confrontation, il existe une raison de principe de préférer Controlled Voice, et elle est spécifique plutôt que générale.
Alibaba et ElevenLabs s'affrontent avec des atouts radicalement différents. L'avantage d'ElevenLabs réside dans une bibliothèque de voix constituée au fil d'années de casting soigneusement sélectionné ; celui d'Alibaba, dans une organisation de recherche qui livre des versions de modèles à un rythme soutenu. Un classement qui permet à chaque concurrent d'apporter ses propres voix mesure autant la bibliothèque que le synthétiseur, et sur ce classement, ElevenLabs l'emporte de 61 points. Retirez les bibliothèques — les mêmes huit locuteurs clonés pour tout le monde — et l'avantage change de camp. Si la voix qu'entendent vos utilisateurs est le clone d'une personne précise, vous n'achetez pas la bibliothèque d'ElevenLabs ; c'est donc le classement contrôlé qui décrit votre achat. Si vous choisissez dans un menu de voix standard, c'est l'inverse, et la marge de 61 points d'Eleven v4 est le chiffre qui compte.
Il existe une seconde raison, moins confortable, de pondérer le résultat contrôlé. Un classement de voix de fournisseurs récompense une distribution par défaut distinctive, et une distribution distinctive peut être polarisante d’une manière qu’un Elo moyen masque — ce qui a du caractère pour un auditeur est maniéré pour un autre. Un classement de voix clonées avec des locuteurs appariés élimine entièrement cette variable, ce qui en fait la mesure la plus reproductible des deux.
Exécuter l'un ou l'autre, et ce que nous routons réellement
OrcaRouter n'héberge ni les modèles vocaux d'ElevenLabs ni ceux d'Alibaba. Aucun des deux fournisseurs ne figure dans notre catalogue, il est donc impossible de faire appel à l'un ou l'autre par notre intermédiaire, et cet article ne suggérera pas le contraire — vous passez par l'API propre à chaque fournisseur ainsi que par plusieurs plateformes tierces pour les deux.
Ce que nous couvrons, c’est la couche au-dessus. Si votre pile vocale est un nœud dans un pipeline plus vaste, nous servons plus de 200 modèles derrière une seule clé API, avec les prix catalogue des fournisseurs répercutés à 0 % de marge, de sorte qu’une modification tarifaire en amont — y compris la fenêtre promotionnelle d’ElevenLabs et le tarif catalogue bien plus élevé qui suivra le 12 octobre — est répercutée de notre côté le jour même, et non au cycle de facturation suivant. Pour une décision qui repose sur un rapport de prix de 4 pour 1, ce timing fait la différence entre une comparaison qui vieillit bien et une autre qui paraîtra erronée dans trois semaines.
Et là où le chemin vocal ne peut pas être emprunté, le basculement automatique redirige le trafic vers un amont sain au lieu de faire échouer la requête. Dans une confrontation aussi serrée sur la qualité et aussi déséquilibrée sur le prix, l'architecture sensée consiste à placer les deux modèles derrière un seul point de terminaison, avec le routage qui décide de la répartition — et non un choix permanent fait à partir d'un instantané de classement que les deux fournisseurs invalideront en l'espace d'un trimestre.
Le verdict, et sa date d’expiration
Choisissez Qwen-Audio-3.1-TTS-Plus si vous clonez une voix et surveillez les coûts. Il est premier au classement qui maintient les locuteurs constants, il coûte environ un quart du prix, et sa courbe progresse plus vite — 54 Elo en une seule étape de version à un tarif inchangé suggère que la prochaine version est un meilleur pari que la version actuelle sur le papier.
Choisissez Eleven v4 si vos utilisateurs entendent des voix standards, si vous avez besoin d’une couverture dans des langues que vous pouvez vérifier avant le déploiement, ou si l’ensemble de fonctionnalités documentées — balises audio, contrôle des phonèmes, requêtes de 10 000 caractères, clonages en dix secondes — accomplit dans votre produit un travail que les classements d’arènes ne mesurent pas. Son avance de 61 points au classement des voix de fournisseurs n’est pas rien, et les deux fonctionnalités que vous pouvez intégrer dans un script sont des capacités, et non des scores.
Fixez une date de révision. Alibaba a gagné 54 points Elo lors d’une montée de version ce cycle et ElevenLabs a gagné 84 points sur une génération complète, et le tarif promotionnel d’Eleven v4 expire le 12 octobre. Quoi que dise cette comparaison aujourd’hui, les deux faits les plus susceptibles de la faire basculer — une sortie de la version 3.2 et un prix rétabli — tombent tous les deux avant la fin du trimestre.
