
HeyGen Voice vs Qwen-Audio-3.0-TTS : ce que vous payez pour l'Elo, et quel palier Qwen vous avez réellement benchmarké
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 51 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 404 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Faites d’abord le calcul, car il est moins déséquilibré que ne le suggère le tableau des scores. Qwen-Audio-3.0-TTS-Plus coûte 19,30 $ par million de caractères sur la plateforme Model Studio — un tarif publié par le fournisseur. HeyGen Voice se situe à 30,00 $ par million de caractères sur le propre graphique des prix d’Artificial Analysis, un chiffre que le site déduit de la tarification en crédits de HeyGen, car la page de tarification publique de HeyGen vend des crédits sans préciser ce que consomme une génération vocale. Pendant ce temps, l’écart de voix contrôlée entre eux est de 79 Elo : HeyGen Voice a obtenu 1 202 dans l’arène qui maintient constantes les huit voix de référence, Qwen-Audio-3.0-TTS-Plus 1 123. Ainsi, le modèle le moins cher est classé bien derrière le meilleur, le rapport entre eux est d’environ 1,55×, et un seul de ces deux prix est un chiffre que le fournisseur qui le vend a endossé.
Le piège dans le nom
Avant tout cela, déterminez correctement le palier, car il s’agit d’une famille qui vous laissera volontiers évaluer le mauvais modèle. Deux entrées Alibaba comptent ici, et elles ne sont pas interchangeables.
Qwen-Audio-3.0-TTS-Plus est le modèle auquel cet article se compare. Il obtient 1 123 points sur le classement contrôlé — septième sur quarante-deux — et 1 264 sur le classement Provider Voices, où il se classe sixième sur quatre-vingt-seize. C’est un véritable produit TTS en streaming, actuel, avec un tarif publié de 19,30 $ par million de caractères.
Qwen-Audio-3.1-TTS-Plus est son niveau successeur, et c'est celui qui se classe deuxième sur le classement contrôlé à 1 186 — le modèle qui s'est le plus rapproché de battre HeyGen Voice lors de ses débuts. Son tarif est indiqué au même prix de 19,30 $, bien que la documentation d'Alibaba avertisse que différentes versions de modèle nécessitent des voix correspondantes, donc « même prix, niveau plus récent » ne signifie pas « prêt à l'emploi ».
Quiconque lit « #1 devant Qwen » puis évalue Qwen-Audio-3.0-TTS testera un modèle 63 Elo plus faible que celui dont parlait le titre. La querelle de palier vaut 63 points, soit plus que l’écart entre HeyGen Voice et la troisième place.
Le tableau d'affichage

• Elo de voix contrôlé (les mêmes 8 voix clonées) — HeyGen Voice : 1 202, n° 1 sur 42. Qwen-Audio-3.0-TTS-Plus : 1 123, n° 7.
• Elo des voix du fournisseur (voix natives) — Qwen-Audio-3.0-TTS-Plus : 1 264, n° 6 sur 96. HeyGen Voice : non classé.
• Prix pour 1 million de caractèresQwen-Audio-3.0-TTS-Plus : 19,30 $, prix publié par le fournisseur Alibaba Cloud. HeyGen Voice : 30,00 $ selon la conversion des tarifs de crédits établie par l'arène elle-même ; HeyGen ne publie aucun tarif vocal.
• Coût de 100 heures de narration — Qwen-Audio-3.0-TTS-Plus : environ 926 $ à ~480 000 caractères par heure de parole. HeyGen Voice : environ 1 440 $ au tarif de 30,00 $ de l'arène — calculé, non cité.
• Contrôle vocal — Qwen-Audio-3.0-TTS-Plus : instruction paramètre, balises d'émotion et de langue, clonage vocal et conception vocale. HeyGen Voice : conception de voix à partir d'une description de ≤ 1 000 caractères, clonage instantané, clonage professionnel entraîné sur plus de 20 minutes.
• Sortie — Qwen-Audio-3.0-TTS-Plus : PCM, WAV, MP3 et Opus jusqu'à 48 kHz, avec taux, hauteur, volume et débit binaire réglables. HeyGen Voice : vitesse 0,5–1,5 et hauteur ±50 demi-tons par requête.

Ce que l'ingénierie d'Alibaba vous apporte réellement
La famille Qwen-Audio-3.0-TTS est un produit de streaming, et la documentation est rédigée comme telle. Les requêtes passent par un protocole WebSocket partagé avec CosyVoice, avec le flux d'événements run-task, continue-task et finish-task, ainsi que les réponses task-started, result-generated, task-finished et task-failed associées. L'annulation est prise en charge sur tous les modèles Qwen-Audio-TTS, dans les régions de Pékin et de Singapour, via streaming_cancel(). La sortie atteint 48 kHz, et les formats incluent Opus, ce qui compte si vous transférez de l'audio vers un navigateur ou un appel téléphonique plutôt que vers un fichier WAV.
Deux détails dans cette documentation sont faciles à manquer et coûteux à découvrir trop tard. Les balises Emotion et de langage riche ne s’appliquent qu’aux niveaux Plus et Flash — pas à toute la famille — et elles ne fonctionnent qu’en mode de streaming unidirectionnel. Et les clés API diffèrent entre les régions Singapour et Pékin, les espaces de travail étant adressés à des URL de la forme wss://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api-ws/v1/inferenceLes clés régionales sont un détail de provisionnement jusqu’au jour où elles causent une panne.
Du côté de HeyGen, le produit prend une tout autre forme : une API v3 de style REST où POST /v3/voices/speech génère de la parole, GET /v3/voices liste le catalogue derrière un filtre engine, et le voice design renvoie jusqu'à trois options classées à partir d'un prompt textuel, avec une seed pour la reproductibilité. La documentation révèle aussi que le engine accepte des valeurs allant au-delà de celles propres à HeyGen — HeyGen vous orientera donc volontiers vers un moteur vocal tiers via son API. Un fournisseur qui livre le modèle d'un concurrent comme option sélectionnable vous dit quelque chose sur l'endroit où il estime que réside sa propre force.

Où vont les 79 Elo
Un écart de 79 points sur un classement contrôlé est considérable — plus important que la marge de 16 points qui sépare HeyGen Voice de la deuxième place, et à peu près la distance entre la troisième et la huitième place dans ce domaine. Il est également mesuré sur un seul axe.
L’arène contrôlée clone huit voix et les maintient fixes. Elle ne dit rien de la surface de contrôle pilotée par instructions qu’expose Qwen, rien de la sortie Opus à 48 kHz via un WebSocket annulable, et rien du déploiement régional. Ce sont des propriétés d’ingénierie, et c’est la raison pour laquelle une équipe qui construit un centre de contact en mandarin ne passerait pas à un modèle qui obtient 79 points de plus sur huit voix de référence en anglais.
Ce que dit le résultat contrôlé est plus restreint et reste utile : lorsque les deux moteurs reçoivent la même voix clonée, les auditeurs ont préféré le rendu de HeyGen Voice. Si votre produit clone des voix, c'est votre axe. Si votre produit choisit une voix dans un catalogue et la diffuse dans un appel, le classement des fournisseurs est plus proche de votre réalité — et là, HeyGen Voice n'a aucun rang du tout, tandis que Qwen-Audio-3.0-TTS-Plus occupe la sixième place sur quatre-vingt-seize.
L’argument du prix, pris au sérieux
À 19,30 $ le million de caractères, Qwen-Audio-3.0-TTS-Plus coûte environ la moitié du palier à 40 $ d’ElevenLabs et environ 40 % du tarif de 49 $ de Cartesia Sonic 3.6. Pour une charge de travail de 100 heures de narration — environ 48 millions de caractères à un débit de parole typique — cela représente de l’ordre de 926 $. Le même volume sur Eleven v4 Turbo coûterait environ 1 920 $, et sur Sonic 3.6 environ 2 352 $. HeyGen Voice, au tarif de 30,00 $ de l’arène, se situe près de 1 440 $ : entre l’offre bon marché et les deux acteurs en place, plus proche du milieu que du haut.
Ce calcul comporte une mise en garde dont les autres n'ont pas besoin. 19,30 $ est le tarif publié par Alibaba lui-même. 30,00 $ correspond à la conversion par Artificial Analysis d'un système de crédits que HeyGen n'a jamais traduit en caractères ; il s'agit donc d'une estimation de bonne foi plutôt que d'un prix cité. Si le véritable ratio caractères par crédit est plus défavorable que ne le suppose le graphique, l'avantage de 79 points Elo coûte plus que le facteur de 1,55× qu'il implique ; s'il est plus favorable, moins. Un modèle dont vous devez déduire le prix est un modèle que vous pilotez sur une tranche mesurée de trafic, plutôt qu'un modèle que vous érigez en standard. Ce n'est pas une critique du moteur — c'est une description des informations disponibles au 10 octobre 2026.
Décider
Choisissez Qwen-Audio-3.0-TTS-Plus lorsque le coût et l’infrastructure de streaming guident la décision. À moins de 20 $ par million de caractères, un WebSocket annulable avec sortie Opus 48 kHz, un paramètre d’instruction et des balises d’émotion, ainsi qu’une sixième place au classement des fournisseurs en font la voix la plus économique parmi celles bien notées dans cette comparaison. Prenez plutôt le palier 3.1 si vous voulez le modèle qui s’est réellement classé deuxième sur le tableau contrôlé, et vérifiez la liste des voix avant de supposer que le remplacement est gratuit.
Testez HeyGen Voice lorsque la fidélité du clonage est le produit. Un seul locuteur, de nombreuses répliques, une voix qui doit être *cette* voix à chaque fois — c’est l’axe que le tableau de contrôle mesure et l’axe sur lequel il devance l’ensemble du secteur. Prévoyez une période de mesure, car le modèle de crédits signifie que vous apprendrez votre coût réel en exécutant votre propre texte plutôt qu’en lisant une grille tarifaire.
Et ignorez complètement la comparaison si la charge de travail est en chinois et en temps réel. Aucun des deux scores Elo n’a été mesuré sur vos voix, dans votre langue, avec votre budget de latence.
Garder les deux accessibles
C'est l'un des appariements où la couche de routage mérite sa place plutôt que d'être un simple ajout. Une seule clé API couvrant les deux fournisseurs — le prix catalogue du fournisseur répercuté sans marge, donc les 19,30 $ publiés par Alibaba sont ce que vous payez et une évolution tarifaire de Qwen est effective le jour même — supprime la nécessité de choisir un gagnant avant d'avoir des preuves. Le basculement automatique couvre le risque évident dans un pipeline vocal, où un flux bloqué s'entend pour l'auditeur, et le DSL de routage vous permet d'envoyer la narration en masse vers le moteur bon marché et les lignes critiques pour le clonage vers celui qui obtient 79 points de plus, sans deux bibliothèques clientes ni deux relations de facturation. La valeur d'OrcaRouter ici ne réside pas dans le fait qu'il héberge un modèle vocal ; elle réside dans le fait qu'il rend quasiment nul le coût de découvrir lequel vous voulez.
Les questions ouvertes
Trois choses permettraient de trancher. Un tarif de voix sur la propre page de tarification de HeyGen transformerait les 30,00 $ que l’arène déduit en un nombre que vous pouvez auditer. Une entrée HeyGen dans le tableau Provider Voices nous dirait si l’avance des voix clonées survit face aux voix natives — le test que Qwen-Audio-3.0-TTS-Plus réussit à la sixième place sur quatre-vingt-seize. Et un résultat de voix contrôlée pour Qwen-Audio-3.1-TTS-Plus face à HeyGen Voice après davantage de votes nous dirait si 16 Elo est un classement stable. D’ici là : Qwen est l’option tarifée, streamable et bien classée ; HeyGen Voice est celle au score plus élevé, non tarifable ; et le palier que vous évaluez compte plus que le titre que vous lisez.
