
Qwen-Audio-3.1-TTS vs Qwen-Audio-3.0-TTS : ce que deux mois ont apporté
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 495 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 186 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 114 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
Qwen-Audio-3.0-TTS est sorti le 20 juillet 2026 et a directement pris la tête des classements indépendants de synthèse vocale — le niveau Plus a atteint 1 238 Elo sur le classement Provider Voice Arena d’Artificial Analysis, deuxième du classement. Neuf semaines plus tard, le 23 septembre 2026, le fournisseur a annoncé Qwen-Audio-3.1-TTS à la conférence Apsara de Hangzhou, avec une baisse de prix d’environ 70 % à la clé. Ce timing en fait une comparaison inhabituelle : le modèle remplacé n’est pas obsolète, il est évalué, éprouvé et toujours proche du sommet. La vraie question n’est donc pas de savoir lequel est le meilleur. Elle est de savoir ce qui a précisément changé, si cela importe pour votre charge de travail, et ce qu’il advient du score auquel vous faites déjà confiance alors que le successeur n’a pas du tout été évalué.
Deux mois, cinq endpoints, une famille
Alibaba n'a pas livré un seul modèle. La version 3.1 en couvre cinq : Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next, Qwen-Audio-3.1-TTS, Qwen-Audio-3.1-TTS-Next et Qwen-Audio-3.1-Realtime. Pour quiconque appelle actuellement Qwen-Audio-3.0-TTS, un seul de ces modèles est directement compatible — le palier TTS standard — et un autre est un véritable nouveau produit plutôt qu'une mise à niveau.
Ce deuxième modèle vaut la peine d’être compris, même si vous ne l’appelez jamais. Qwen-Audio-3.1-TTS-Next est ce qu’Alibaba appelle un modèle « Audiogen » : une seule passe qui produit voix, effets sonores et ambiance de fond à partir de texte, d’horodatages et d’audio de référence. Dialogue multi-intervenants, assemblage de podcast, paysages sonores de scène, sortie à 48 kHz. La documentation Model Studio d’Alibaba Cloud énumère clairement ses limites : 3 000 caractères d’entrée, 240 secondes d’audio généré pour les podcasts et 120 secondes dans les autres cas, 3 requêtes par seconde, sortie WAV, MP3 ou PCM, et il accepte jusqu’à trois extraits de référence de 30 secondes chacun en WAV, MP3 ou OGG Opus. L’entrée de référence PCM brut n’est pas prise en charge. Son tarif est de 0,848 $ par million de tokens d’entrée et de 1,696 $ par million de tokens de sortie sur le nœud de Pékin, hors tarifs promotionnels, et il ne gère que le chinois et l’anglais.
Si vous êtes sur 3.0-TTS et que votre travail consiste à « transformer ce script en voix », rien de tout cela ne change votre intégration. Si votre travail consiste à « assembler un podcast à deux animateurs avec des fonds musicaux », 3.1-TTS-Next est une catégorie de produit différente et peut-être la raison même de s’intéresser à cette version.
La mise à niveau, ligne par ligne

• Langues — Qwen-Audio-3.1-TTS : 16 langues annoncées par le fournisseur, dont sept ajoutées par rapport à la génération précédente. Qwen-Audio-3.0-TTS : 16 langues, comme indiqué dans les publications consacrées à la version de juillet.
• Dialectes chinois — Qwen-Audio-3.1-TTS : 20 régions dialectales, héritées de la version précédente. Qwen-Audio-3.0-TTS : 20 régions dialectales.
• Transfert de timbre inter-langues — Qwen-Audio-3.1-TTS : oui, une même voix transportée à travers le mandarin, le cantonais, l'anglais et le japonais. Qwen-Audio-3.0-TTS : non proposé.
• Contrôle de l'élocution — Qwen-Audio-3.1-TTS : contrôle de l'émotion, du rythme et du style par instructions. Qwen-Audio-3.0-TTS : 86 balises d'élocution intégrées.
• Entrée de référence bruitée — Qwen-Audio-3.1-TTS : gère directement l'audio de référence bruité ou avec écho, pas de mode de débruitage séparé. Qwen-Audio-3.0-TTS : audio de référence propre attendu.
• Score indépendant — Qwen-Audio-3.1-TTS : aucun pour l'instant. Qwen-Audio-3.0-TTS-Plus : 1 238 Elo sur le classement Provider Voice Arena d'Artificial Analysis en date d'août 2026.
Le décompte des langues ne correspond pas, et c'est important
Ce détail peut sembler anodin et sera sans doute gommé partout ailleurs, mais il mérite d’être signalé. La documentation de lancement d’Alibaba indique que le palier TTS 3.1 ajoute sept langues. Les articles publiés sur la génération 3.0 de juillet — y compris nos propres comparatifs de ce mois-là — mentionnaient 16 langues pour le palier 3.0. Sept ajoutées à seize font vingt-trois, pas seize, et Alibaba n’a publié aucun rapprochement entre ces deux chiffres.
Les explications possibles sont peu reluisantes : le chiffre 3.1 peut comptabiliser un ensemble différent, le chiffre 3.0 a peut-être été surestimé au lancement, ou « ajoute sept » peut décrire le palier ASR plutôt que le TTS. Nous ne savons pas laquelle. Ce que nous savons, c'est que le nombre de langues des deux côtés de cette comparaison est un chiffre déclaré par le fournisseur qui n'a jamais été audité de manière indépendante, et que quiconque cite « 16 langues » comme un fait établi à propos de l'un ou l'autre modèle cite une diapositive marketing. Vérifiez les langues précises dont vous avez besoin par rapport à la documentation de Model Studio avant de planifier en fonction d'un nombre.

Le contrôle des instructions est le changement qui se manifeste réellement dans le code
De tout ce que contient la version 3.1 de TTS, c'est l'élément qui change votre façon d'écrire vos prompts. La génération 3.0 contrôlait l'élocution au moyen de 86 balises en ligne — un vocabulaire figé qu'il fallait apprendre, insérer aux bonnes positions, et qui faisait exactement ce qu'il annonçait, rien de plus. Le niveau 3.1 remplace cela par des instructions en langage naturel : vous décrivez l'émotion, le rythme, le style que vous souhaitez, et le modèle les interprète.
La différence pratique réside dans l’expressivité face à la prévisibilité. Un vocabulaire d’étiquettes est un contrat — une même étiquette produit le même rendu à chaque fois, ce que vous voulez dans un pipeline de production où une voix doit rester cohérente sur dix mille clips. L’instruction libre est plus large mais plus lâche, et elle hérite du problème habituel de sensibilité au prompt : deux formulations de « chaleureux mais pas sentimental » ne donneront pas un résultat identique, et deux appels de la même formulation à des jours différents non plus.
Si votre pipeline actuel repose sur ces 86 tags, la mise à niveau n'est pas gratuite. Vous troquez une surface de contrôle déterministe contre une surface probabiliste, et le travail de portage ne réside pas dans l'appel API — il consiste à revalider chaque modèle de prompt que vous possédez au regard de l'interprétation du nouveau modèle. Prévoyez un budget pour cela avant de prévoir un budget pour les économies.
Transfert de timbre inter-langues, et à quoi cela sert réellement
Une seule voix de référence, transposée en mandarin, en cantonais, en anglais et en japonais, qui préserve son identité à mesure que la langue change. Sur le papier, cela ressemble à une simple ligne de fonctionnalité. En pratique, cela résout un problème précis et coûteux : un seul présentateur qui doit exister dans plusieurs langues sans donner l’impression d’être une personne différente dans chacune.
La solution de contournement traditionnelle consiste à engager un comédien de doublage distinct par langue et à accepter que votre voix de marque soit désormais quatre voix qui partagent un même texte. L’alternative consistait à cloner un seul locuteur dans chaque langue, ce qui correspond précisément au flux de travail où les voix clonées ont tendance à dériver : l’accent persiste, le timbre s’affaiblit, et les auditeurs s’en aperçoivent en l’espace d’une phrase. Le transfert de timbre inter-langues est l’affirmation qu’aucun de ces deux compromis n’est nécessaire.
C’est également, à l’heure actuelle, totalement non vérifié. Il n’existe aucun test d’écoute réalisé par un tiers sur Qwen-Audio-3.1-TTS, dans quelque langue que ce soit, et les démos d’Alibaba sont la seule preuve que le transfert tient. Si cette capacité est la raison pour laquelle vous envisagez la mise à niveau, testez-la sur votre propre audio de référence avant de vous engager — c’est une expérience de cinq minutes, et c’est la seule qui répond à la question.
Ce que la baisse des prix fait à un projet de loi 3.0
Alibaba a réduit les tarifs des services vocaux sur toute sa gamme : la synthèse d'environ 70 %, le temps réel d'environ 85 %, la reconnaissance jusqu'à 95 %. L'ajustement a pris effet sur Alibaba Cloud Model Studio le 22 septembre 2026 à 00 h 00, heure de Pékin ; il couvre les régions de Pékin et de Singapour et s'applique aux points de terminaison TTS 3.1 et temps réel 3.0. Après l'ajustement, le palier TTS Flash s'affiche à 1,5 yuan par million de jetons en entrée et 12 yuan par million de jetons en sortie ; le palier Flash temps réel s'affiche à 1,5 pour l'entrée texte, 6 pour l'entrée audio, 4,5 pour la sortie texte et 12 pour la sortie combinée texte et audio, par million de jetons.
Voici la partie qui compte si vous utilisez déjà 3.0-TTS. L'offre 3.0 Plus se situait autour de 27,60 $ par million de caractères sur Artificial Analysis jusqu'en août, tandis que l'offre Flash était proche de 15 $. Si la réduction d'environ 70 % s'applique à l'offre que vous utilisez, votre facture pour la même charge de travail tombe à environ un tiers de ce qu'elle était — sans que vous ayez à changer la moindre ligne de code. C'est ce qui est inhabituel dans cette version : pour un client 3.0, la baisse de prix vaut plus que la mise à niveau du modèle, et elle s'applique que vous migriez ou non.
Deux réserves qu'il convient de garder à l'esprit. Les réductions en pourcentage sont annoncées par rapport à des tarifs qui varient selon la région et selon le palier, de sorte que le chiffre phare de 70 % ne constitue pas une promesse concernant votre trafic spécifique. Et Alibaba Cloud a fait passer la facturation de la transcription en temps réel sur le nœud de Singapour d'une mesure basée sur la durée à une mesure basée sur les jetons — 0,93 $ par million de jetons d'entrée et 0,70 $ par million de jetons de sortie —, ce qui constitue une base moins prévisible lorsque le silence, le bruit et le contexte multi-tours gonflent tous la consommation de jetons. Consultez la nouvelle grille tarifaire à l'aune de vos propres fichiers audio, et non du communiqué de presse.
Quand Qwen-Audio-3.0-TTS reste le bon choix
Trois cas, et ce ne sont pas des cas limites.
Quand vous avez besoin d’un chiffre que vous pouvez défendre. Qwen-Audio-3.0-TTS-Plus a un Elo indépendant de 1 238 — le même classement indique 1 259 pour ce modèle en septembre, toujours deuxième, donc le score a dérivé à la hausse plutôt que de se dégrader — provenant d’une arène d’écoute en aveugle avec des milliers de votes à l’appui. Qwen-Audio-3.1-TTS n’a aucun score d’arène. Si votre processus de validation exige des preuves tierces, c’est le modèle plus ancien qui en dispose, et une baisse de prix n’y change rien.

Quand le déterminisme l'emporte sur l'expressivité. Si votre pipeline de production repose sur la surface de contrôle à 86 balises, vous disposez d'un système dont la sortie est prévisible. Le contrôle par instructions est plus puissant et moins prévisible, et le coût de migration est bien réel.
Quand rien dans la mise à niveau ne concerne votre charge de travail. Si vous synthétisez du mandarin et de l'anglais à volume modéré avec une voix de référence propre et un ensemble fixe de balises de diction, alors le transfert de timbre inter-langues, la robustesse aux entrées bruitées et sept langues supplémentaires ne font que résoudre des problèmes que vous n'avez pas. Profitez de la baisse de prix, gardez le modèle.
Exécuter les deux sans exécuter deux intégrations
La partie délicate d'un passage d'une génération à l'autre est que l'on souhaite souvent que les deux modèles soient actifs en même temps — la 3.0 pour le chemin de production avec le score derrière, la 3.1 pour les nouvelles langues et la fonctionnalité de transfert, et un moyen de déplacer le trafic entre eux sans redéploiement. Les deux sont des API hébergées fermées sur Alibaba Cloud Model Studio, ce qui fait deux points de terminaison, deux limites de débit et deux modes de défaillance derrière une seule fonctionnalité.
Une mise au point honnête sur notre position : OrcaRouter ne route pas Qwen-Audio-3.1-TTS ni aucun modèle Qwen-Audio, et nous ne routons pas du tout les points de terminaison vocaux d'Alibaba. Ce que nous fournissons, c'est la couche d'inférence texte autour d'un pipeline comme celui-ci — une seule clé API pour plus de 200 modèles à 0 % de majoration, le prix catalogue du fournisseur répercuté tel quel, de sorte qu'une baisse de prix d'un fournisseur arrive chez nous le jour même plutôt qu'après un cycle de révision tarifaire. Si le service qui pilote votre pipeline vocal est un générateur de scripts, un outil de synthèse ou un planificateur de contenu, cela signifie un seul contrat au lieu de plusieurs, un basculement automatique en cas de dégradation d'un service en amont, et un DSL de routage pour composer des modèles en un seul appel. Cela ne signifie pas que vous passez par nous pour appeler la voix de Qwen, et toute page suggérant le contraire se trompe sur notre propre catalogue.
Le résumé honnête
Qwen-Audio-3.1-TTS est une véritable amélioration, avec trois ajouts qui comptent — le contrôle de l’élocution guidé par instructions, le transfert de timbre inter-langues et la robustesse face à un audio de référence de mauvaise qualité — plus une baisse de prix qui vaut plus que chacun d’eux. Qwen-Audio-3.0-TTS n’est pas supplanté comme l’est habituellement un modèle vieux de deux mois : il détient encore un score de benchmark indépendant que son successeur n’a pas obtenu, et il couvre toujours l’éventail de dialectes chinois sur lequel repose l’essentiel de la différenciation de cette famille.
Donc la décision est plus étroite que ne le suggère le marketing. Si vous générez en volume, le changement de tarification est déjà le vôtre. Si vous avez besoin des nouvelles langues ou du transfert de timbre, migrez et validez d'abord la fonctionnalité sur votre propre audio. Si vous avez besoin d'un chiffre de qualité défendable, attendez que Qwen-Audio-3.1-TTS apparaisse dans une arène d'écoute à l'aveugle — c'est le seul événement qui réglerait la question, et tant qu'il n'a pas lieu, la position honnête est que le modèle le plus récent est le moins cher et que le plus ancien est celui qui a fait ses preuves.
