Une carte hero comparant Qwen-Audio-3.1-TTS à ElevenLabs Eleven v3, indiquant les 16 langues de Qwen plus 20 dialectes, une réduction de prix de 70 % et l’absence de score d’arène, face aux 74 langues d’ElevenLabs, à environ 100 $ par million de caractères et un Elo de 1 168, au-dessus d’un bandeau indiquant « Annoncé à Apsara, le 23 septembre 2026 ».
Guides & Insights

Qwen-Audio-3.1 vs ElevenLabs : une baisse de prix de 70 % face au tenant du titre

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Le fournisseur a réduit d’environ 70 % le prix de son API Qwen-Audio-3.1-TTS le 23 septembre 2026, lors d’une annonce faite sur scène à la conférence Apsara, à Hangzhou, aux côtés de quatre autres modèles vocaux. Ce simple chiffre justifie à lui seul l’intérêt d’écrire cette comparaison : ElevenLabs Eleven v3 est la voix de production par défaut de la plupart des équipes occidentales, à un tarif effectif proche de 100 $ par million de caractères, et un concurrent crédible vient de réajuster le prix du même service à une fraction de ce montant, tout en élargissant en même temps la couverture linguistique. Les deux systèmes ne sont pas équivalents — Qwen-Audio-3.1-TTS est une API uniquement hébergée du Tongyi Lab du fournisseur, avec un écosystème de voix plus restreint, tandis qu’ElevenLabs est une plateforme de contenu complète dotée de la bibliothèque de voix la plus riche du secteur. Mais si votre décision a déjà été dictée par la facture, le calcul a changé cette semaine.

Ce qui a réellement été livré le 23 septembre

Qwen-Audio-3.1 n'est pas un seul modèle. C'est une mise à jour de cinq modèles de l'ensemble de la stack vocale d'Alibaba, et les niveaux comptent parce qu'ils ont des tarifs et des usages différents :

Qwen-Audio-3.1-TTS — le successeur direct du modèle de synthèse que la plupart des équipes utilisent. Il ajoute sept langues, pour un total de 16, conserve les 20 régions dialectales chinoises, ajoute un transfert naturel de timbre entre langues (une même voix qui passe du mandarin au cantonais, à l'anglais et au japonais), un contrôle par instruction de l'émotion, du débit et du style d'élocution, et gère les audios de référence bruités, avec écho ou autrement médiocres, sans mode de débruitage séparé.

Qwen-Audio-3.1-TTS-Next — un nouveau niveau, et un produit différent. Alibaba le qualifie de modèle « Audiogen » : il génère de la voix, des effets sonores et une ambiance de fond en une seule passe à partir de texte, d’horodatages et d’audio de référence. Dialogue multi-locuteurs, podcasts, paysages sonores de cinéma et de télévision, sortie à 48 kHz. Selon la documentation Model Studio d’Alibaba Cloud, il accepte jusqu’à 3 000 caractères en entrée, limite l’audio généré à 240 secondes pour les podcasts et à 120 secondes sinon, fonctionne à 3 requêtes par seconde et renvoie des fichiers WAV, MP3 ou PCM.

Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next et Qwen-Audio-3.1-Realtime — respectivement la reconnaissance, la compréhension audio (émotion, musique, sons environnementaux, localisation d'événements) et la conversation en duplex intégral. Realtime est celui qu'Alibaba pousse dans le matériel : Qwen Office, Qoder, QwenNote A2, le robot de bureau QwenNote Eva et les lunettes Qwen AI.

Les baisses de prix ont touché toute la gamme, pas seulement la TTS : la synthèse en recul d'environ 70 %, le temps réel d'environ 85 %, la reconnaissance jusqu'à 95 %. Alibaba a également open-sourcé Qwen-Audio-Agent, un framework pour créer des agents vocaux en temps réel, et a dévoilé Qwen3.8-LiveTranslate avec une latence ramenée sous les 2,5 secondes.

A screenshot of Alibaba Cloud Model Studio's English documentation site showing the reference page for qwen3.8-livetranslate-flash-realtime, a real-time audio and video translation model that accepts audio and images and outputs text and audio across 60 input languages and 29 speech output languages, under an Apsara 2026 Conference banner, with the Speech-to-Speech branch of the navigation listing the qwen-audio-3.0 realtime models.

Le tableau d'affichage

A two-column scoreboard for Qwen-Audio-3.1-TTS and ElevenLabs Eleven v3 across price, languages, weights, voice library, delivery control and arena score, with a footer stating that the Qwen figures are vendor-reported and unscored and the ElevenLabs figures are per Artificial Analysis.

Prix — Qwen-Audio-3.1-TTS : environ 70 % de moins que la génération Qwen-Audio précédente, qui plaçait le palier 3.0 Plus à près de 27,60 $ par million de caractères et le palier Flash à près de 15 $. ElevenLabs Eleven v3 : environ 100 $ par million de caractères selon le suivi d'Artificial Analysis, avec Flash à environ 50 $.

Langues — Qwen-Audio-3.1-TTS : 16 langues plus 20 régions dialectales chinoises. ElevenLabs Eleven v3 : 74 langues.

Poids — Qwen-Audio-3.1-TTS : fermé, hébergé uniquement sur Alibaba Cloud Model Studio. ElevenLabs Eleven v3 : fermé, hébergé uniquement.

Bibliothèque de voix — Qwen-Audio-3.1-TTS : clonage natif et transfert de timbre interlangue ; aucune place de marché publique comparable. ElevenLabs : la plus grande bibliothèque de voix partagée du secteur, plus le clonage instantané à partir d'environ 30 secondes d'audio.

Contrôle de la diction — Qwen-Audio-3.1-TTS : émotion, rythme et style pilotés par des instructions, héritant des 86 balises de diction en ligne introduites avec la version 3.0. ElevenLabs Eleven v3 : les balises audio ainsi que la plateforme qui les entoure (doublage, agents, studio).

Benchmark indépendant — Qwen-Audio-3.1-TTS : aucun pour l'instant. ElevenLabs Eleven v3 : 1 168 Elo au classement Provider Voice Arena d'Artificial Analysis en août 2026.

Là où le challenger l'emporte véritablement

Trois choses, et une seule d’entre elles est le prix.

Le prix, évidemment. Une réduction de 70 % face à un acteur en place à 100 $ par million de caractères n’est pas une différence d’arrondi. C’est la différence entre un produit avec lequel vous faites des prototypes et un produit que vous déployez auprès de chaque utilisateur. Si vous générez de la narration en volume, l’économie annuelle n’est pas un poste budgétaire que vous devez défendre en interne — elle se défend d’elle-même.

Le chinois, sans ambiguïté. Vingt régions dialectales chinoises forment un fossé auquel rien de ce qu'offre ElevenLabs ne peut se comparer. Si votre produit s'adresse aux utilisateurs de Chine continentale, aux locuteurs cantonais, ou à un public de la diaspora qui passe d'une langue à l'autre en pleine phrase, la comparaison est terminée avant même d'avoir commencé.

Transfert de timbre interlingue. Qwen-Audio-3.1-TTS prend une voix et la fait passer naturellement du mandarin au cantonais, à l'anglais et au japonais. Il s'agit d'une capacité spécifique, associée à un cas d'usage précis — une voix de marque unique qui survit à un changement de langue — et c'est un véritable facteur de différenciation pour quiconque localise un seul présentateur plutôt que d'en recruter un nouveau pour chaque marché.

Là où ElevenLabs gagne encore, et ce n'est pas serré

La couverture linguistique est le premier critère, et le plus important. Soixante-quatorze langues contre seize : ce n’est pas un écart que l’on comble avec une annonce tarifaire. Si vous livrez en polonais, turc, vietnamien et portugais, ElevenLabs vous couvre aujourd’hui et Qwen-Audio-3.1-TTS non.

Le deuxième, c’est l’écosystème. ElevenLabs n’est pas un simple point de terminaison de synthèse ; c’est une plateforme de contenu. Une bibliothèque de voix partagée que vous pouvez licencier plutôt que cloner, des workflows de doublage, une infrastructure d’agents, un produit studio, une surface d’API documentée avec des années de bibliothèques clientes derrière elle. Migrer loin de tout cela est un projet, pas un changement de configuration, et les équipes qui se sont appuyées dessus savent exactement ce à quoi elles renonceraient.

Le troisième point est plus difficile à nommer et vaut quand même la peine d’être nommé : la perception du naturel sur une seule voix anglaise. La synthèse de Qwen a toujours été excellente en chinois et simplement très bonne en anglais, et bien que la version 3.1 prétende améliorer le rendu multilingue, il n’existe pas encore de test d’écoute indépendant sur le nouveau modèle. Quiconque vous dit savoir comment sonne la nouvelle voix de Qwen en anglais ne fait que deviner.

Le chiffre que personne ne devrait encore citer

C'est la partie de l'histoire qui sera déformée dans la couverture médiatique, alors la voici telle quelle. Qwen-Audio-3.1-TTS n'a aucun score de benchmark indépendant. Son prédécesseur, Qwen-Audio-3.0-TTS-Plus, se situait à 1 234 Elo sur le classement Provider Voice Arena d'Artificial Analysis à la mi-août 2026, entre la deuxième et la cinquième place de ce classement. Qwen-Audio-3.1-TTS n'a encore été ajouté à aucune arène. Toutes les affirmations de qualité figurant dans les documents de lancement d'Alibaba proviennent du fournisseur et n'ont fait l'objet d'aucune reproduction.

Cela ne rend pas ces affirmations fausses. Cela les rend non vérifiées, et cela signifie que la présentation honnête de cette comparaison, à l’heure actuelle, est la suivante : un modèle avec un prix et aucun score, face à un modèle avec un score et un prix bien plus élevé. Toute affirmation plus forte que cela relève de la spéculation déguisée en benchmark.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard in its August 2026 state, ranking text-to-speech models by Elo: Cartesia Sonic 3.6 first at 1,277, Alibaba's Qwen-Audio-3.0-TTS-Plus at 1,234 and ElevenLabs Eleven v3 at 1,168.

La même discipline s’applique à la latence. Le chiffre phare d’Alibaba pour le premier jeton du côté ASR de cette famille — 92 millisecondes — provient du propre benchmark à haute concurrence de l’entreprise sur une spécification 0,6B, et non de tests tiers, et les analyses publiées depuis le lancement notent que l’ASR et le TTS sont des produits distincts dans un pipeline plutôt qu’un modèle de bout en bout, et que des rapports de la communauté décrivent une latence qui s’accumule dans les longs dialogues selon un schéma de pseudo-streaming. Considérez les chiffres de latence des fournisseurs pour toute cette famille comme des plafonds, et non comme une expérience mesurée.

Ce que vaut la baisse de prix en pratique

Prenons une charge de travail réaliste : un produit qui synthétise 20 millions de caractères de narration par mois, en anglais et en mandarin. Au tarif d'environ 100 $ par million de caractères d'ElevenLabs Eleven v3, cela représente environ 2 000 $ par mois, soit 24 000 $ par an. Au tarif d'environ 27,60 $ par million de Qwen-Audio-3.0-TTS-Plus, le même volume représentait déjà environ 552 $ par mois. Appliquez la réduction d'environ 70 % annoncée par Alibaba le 23 septembre, et la même charge de travail tombe à quelques centaines de dollars par mois.

Aucun de ces chiffres n’est un prix catalogue sur lequel vous pouvez vous engager — ElevenLabs facture en crédits via des paliers d’abonnement, et les réductions d’Alibaba sont des baisses en pourcentage appliquées à des tarifs qui varient selon la région et selon le palier. Mais la forme de la comparaison est sans ambiguïté, et c’est cette forme qui sert de base à votre budget.

Une mise en garde mérite d'être signalée à quiconque modélise cela avec soin : Alibaba Cloud a fait passer la facturation de sa transcription en temps réel sur le nœud de Singapour d'une mesure basée sur la durée à une mesure basée sur les tokens, à 0,93 $ par million de tokens d'entrée et 0,70 $ par million de tokens de sortie. La facturation au token est moins prévisible que la facturation à la durée lorsque vous ne maîtrisez pas le nombre de tokens que devient un segment audio donné, et le bruit, le silence et le contexte multi-tours gonflent tous la consommation de tokens. Une réduction affichée de 70 % ne se traduit pas automatiquement par une économie de 70 % sur votre trafic spécifique.

Comment exécuter réellement le switch

Si vous évaluez cette option, ce qu'il est utile de savoir, c'est ce qu'une migration vous coûte en temps d'ingénierie. Les deux modèles sont des API hébergées fermées, donc dans un cas comme dans l'autre, vous intégrez un point de terminaison HTTP, et le travail consiste en un client, une politique de nouvelles tentatives et un inventaire de voix — pas en une réarchitecture.

C'est là que l'approche d'OrcaRouter est utile, avec d'abord une mise en garde honnête : nous ne routons pas Qwen-Audio-3.1-TTS ni aucun modèle Qwen-Audio. Les points de terminaison vocaux d'Alibaba sortent de notre périmètre, et il en va de même pour ElevenLabs. Ce que nous couvrons, c'est la couche d'inférence qui les entoure — une seule clé API pour plus de 200 modèles texte à 0 % de marge, c'est-à-dire le prix catalogue du fournisseur répercuté directement, si bien qu'une baisse de prix d'un fournisseur est effective de notre côté le jour même plutôt qu'après un cycle de re-tarification. Pour les équipes qui construisent l'application qui pilote un pipeline vocal — le module de résumé, le générateur de script, le planificateur de contenu — cela signifie un seul contrat au lieu de plusieurs, un basculement automatique lorsqu'un service en amont se dégrade, et un DSL de routage pour composer des modèles en un seul appel. Cela ne signifie pas que vous appelez la voix de Qwen via nous. Quiconque vous dit le contraire n'a pas lu le catalogue.

Qui doit bouger, et qui doit attendre

Passez à l'action maintenant si votre charge de travail est prioritairement en chinois, si la couverture des dialectes figure sur votre liste d'exigences, si le coût au volume est la contrainte qui vous a maintenu sur une voix moins chère mais de moindre qualité, ou si vous avez besoin d'une seule voix de marque pour survivre à un changement de langue. La tarification du 23 septembre rend l'argument économique difficile à réfuter, et la qualité en langue chinoise était déjà compétitive avant cela.

Attendez si vous livrez dans plus d’environ seize langues, si votre produit dépend d’une bibliothèque vocale sous licence plutôt que du clonage, si vous êtes profondément impliqué dans l’outillage de doublage ou d’agents d’une plateforme, ou si votre processus d’approvisionnement exige un score de qualité indépendant avant validation. Aucun de ces éléments n’est un obstacle permanent, mais aucun n’a été résolu par une baisse de prix.

Et surveillez une chose en particulier : si Qwen-Audio-3.1-TTS apparaît sur une arène d’écoute à l’aveugle. Dès que ce sera le cas, cette comparaison cessera de porter sur le prix et le nombre de langues pour porter sur la question de savoir si la voix moins chère est réellement aussi bonne. C’est la question à laquelle le lancement n’a pas répondu.