
HeyGen Voice débute à la 1re place de la Controlled Voice TTS Arena — surpassant Qwen et ElevenLabs sur les voix clonées
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 51 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 404 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Le 9 octobre 2026, Artificial Analysis a ajouté HeyGen Voice à son arène Controlled Voice et le modèle s’est directement hissé en tête. HeyGen Voice — le premier modèle de synthèse vocale de HeyGen à être évalué sur le tableau — a obtenu un score de 1 202 Elo, devant Qwen-Audio-3.1-TTS-Plus à 1 186 et Eleven v4 Turbo d’ElevenLabs à 1 167. Cartesia Sonic 3.6, qui mène le tableau ouvert Provider Voices du site, se classe cinquième ici avec 1 143. C’est un véritable résultat sur un classement conçu pour éliminer le plus grand facteur de confusion dans l’évaluation des voix, et c’est aussi un résultat dont la signification très précise est facile à surinterpréter : HeyGen Voice est la meilleure voix de cette arène sur huit voix de référence clonées, mais pas encore un champion mesuré du tableau qui compte quatre-vingt-seize modèles.
Ce que mesure la carte Controlled Voice, et pourquoi c'est important
Artificial Analysis gère deux classements vocaux qui répondent à des questions différentes. L’arène Provider Voices permet à chaque fournisseur de proposer ses propres voix natives — les voix de démonstration soignées qu’une entreprise choisit pour se représenter — et classe les modèles selon la qualité sonore de celles-ci. Son classement est vaste et mature : quatre-vingt-seize entrées, avec Eleven v4 Turbo en tête à 1 328 Elo et Cartesia Sonic 3.6 quatrième à 1 280.
L'arène Controlled Voice fait quelque chose de plus restreint et, pour quiconque commercialise un produit, de plus utile. Chaque modèle qui s'y trouve génère de la parole à partir des mêmes huit voix clonées — quatre américaines, quatre britanniques — de sorte que la comparaison ne porte pas sur « la voix marketing de qui est la plus agréable », mais sur « comment chaque moteur gère la même voix, le même texte et les mêmes conditions d'enregistrement ». C'est ce que l'industrie propose de plus proche d'un test du moteur à conditions égales plutôt que d'une bande démo, et c'est le classement qui compte si vous prévoyez de cloner une voix et de la confier à un modèle TTS.
HeyGen Voice est désormais en tête. L'écart est de 16 Elo par rapport à Qwen-Audio-3.1-TTS-Plus et de 35 par rapport à Eleven v4 Turbo, avec un intervalle de confiance à 95 % annoncé d'environ 1 185 à 1 219 sur le score HeyGen. Seize Elo, c'est un véritable écart, mais pas un gouffre — dans un classement aussi dense, c'est la différence entre la première et la deuxième place, pas entre utilisable et inutilisable.

Où HeyGen Voice n'est pas encore classé
Le côté honnête de ce résultat, c’est que HeyGen Voice n’apparaît pas du tout sur le tableau Provider Voices, et son absence n’est pas un signal concernant la qualité. Artificial Analysis précise que des modèles peuvent être omis parce qu’ils n’ont pas encore assez de votes. Un modèle vieux de quelques jours, avec une seule arène notée différemment derrière lui, n’a tout simplement pas accumulé le volume d’auditeurs à l’aveugle qu’exige le tableau plus important.
Ainsi, la lecture correcte au 10 octobre 2026 est la suivante : HeyGen Voice est la voix la mieux classée dans la comparaison contrôlée de voix clonées, et une inconnue face au champ plus large. Quiconque cite « le meilleur modèle TTS au monde » à partir de ce chiffre se réfère à un classement plus restreint que ne le laisse entendre la phrase.

Les deux nombres derrière l'Elo
• Elo de voix contrôlée — Voix HeyGen : 1 202 (IC à 95 % environ 1 185–1 219). Qwen-Audio-3.1-TTS-Plus : 1 186. Eleven v4 Turbo : 1 167.
• Elo des voix des fournisseurs — Voix HeyGen : non répertoriée (votes insuffisants). Eleven v4 Turbo : 1 328, en 1re position. Sonic 3.6 : 1 280, en 4e position.
• Classement dans le panel contrôlé — HeyGen Voice : n° 1 sur 42 entrées classées (la n° 42 est OpenVoice v2 avec 812).
• Prix selon la base de calcul de l'arène — HeyGen Voice : 30,00 $ par million de caractères, conversion propre à l'arène de la tarification en crédits de HeyGen. Qwen-Audio-3.1-TTS-Plus : 19,30 $ par million de caractères. Eleven v4 Turbo : 40,00 $ par million de caractères.
• Ancre Elo — OpenAudio S1 est le point de référence fixe à 1 000, donc HeyGen Voice se situe 202 points au-dessus de l'ancre.
• Qui d'autre figure dans le top cinq — Eleven v4 à 1 160 et Sonic 3.6 à 1 143 complètent le top cinq derrière les leaders.

Ce que HeyGen a réellement livré
Le moteur derrière l'entrée est le TTS interne de HeyGen, exposé dans l'API v3 de l'entreprise. Un GET /v3/voices correspond à un appel qui prend un filtre engine dont les valeurs incluent orca — le moteur vocal propre à HeyGen — aux côtés de starfish et d'un relais vers les voix ElevenLabs. Le rendu de la parole passe par POST /v3/voices/speech ; le réglage par requête expose speed de 0,5 à 1,5 et pitch de −50 à +50 demi-tons, avec un BCP-47 locale comme indice.
Le catalogue répertorie plus de 300 voix prédéfinies dans des dizaines de langues. Les voix personnalisées se déclinent en trois variantes : la conception texte-voix, qui génère jusqu’à trois options classées à partir d’une description limitée à 1 000 caractères, un clone instantané à partir d’un seul enregistrement, et un clone professionnel entraîné sur vingt minutes ou plus d’audio. Cette dernière est la partie que le classement Controlled Voice met réellement à l’épreuve — ces huit voix de référence sont des clones, et la qualité des clones est ce qui distingue les moteurs TTS.
Les moteurs sont également mentionnés dans la documentation comme sélectionnables par voix, ce qui signifie que HeyGen ne vous impose pas son modèle : vous pouvez acheminer vers un moteur vocal tiers via son API lorsque vous en préférez un. C'est un fournisseur qui se couvre par rapport à son propre modèle, et cela vaut la peine de le savoir lorsque vous lisez une affirmation de « voix n°1 » à propos de HeyGen.
Ce que cela change pour quiconque choisit une voix
Trois conséquences pratiques découlent de l'aboutissement d'un résultat en voix contrôlée, et aucune d'entre elles n'est « tout changer ».
Tout d'abord, si votre cas d'usage est une voix de marque clonée — un seul locuteur, de nombreuses répliques — c'est désormais le classement à consulter, et HeyGen Voice est le modèle à tester en premier. Un classement qui garde la voix constante mesure ce que vous ferez réellement.
Deuxièmement, si votre cas d'usage implique un large éventail de personnages à la sonorité native dans des langues que votre clone ne couvre pas, le tableau Provider Voices et ses quatre-vingt-seize entrées restent la référence pertinente, et HeyGen Voice n'y est pas encore classé. Rien dans le résultat d'une voix clonée ne vous dit comment le moteur gère cent voix distinctes.
Troisièmement, le prix a désormais un chiffre, mais pas celui publié par le fournisseur. L'arène liste HeyGen Voice à 30,00 $ pour 1 M de caractères, une conversion réalisée par Artificial Analysis d'un système de crédits que la page de HeyGen elle-même ne convertit jamais en tarif vocal. Cela place le nouveau leader sous les 40,00 $ d'Eleven v4 Turbo et au-dessus des 19,30 $ du palier Qwen — un prix de milieu de tableau associé à un score de première place, et qui est dérivé plutôt qu'indiqué.
La question du routage
La sélection d'une voix possède une propriété que la plupart des choix de modèles n'ont pas : l'échec est audible pour l'utilisateur final en l'espace d'une syllabe. Cela rend la migration peu coûteuse à tester et coûteuse à rater en production. Faire tourner un nouveau moteur derrière la même interface que le moteur en place — une seule surface d'API, une seule clé, le prix catalogue du fournisseur répercuté plutôt que majoré, avec bascule automatique vers un second fournisseur de voix en cas d'échec de requête — est la façon d'obtenir une réponse réelle sur votre propre audio plutôt que la réponse d'un graphique Elo sur huit voix de référence. La couche de routage d'OrcaRouter existe précisément pour ce type de décision : placer le challenger sur une fraction du trafic, garder le moteur en place chaud, et laisser la bascule automatique couvrir la fenêtre où le nouveau modèle n'est pas encore éprouvé. Le classement vous indique où regarder. Il ne peut pas vous dire comment sonne votre script.
Que regarder ensuite
Deux chiffres trancheront cette histoire. Le premier est de savoir si HeyGen Voice accumule suffisamment de votes pour entrer au classement Provider Voices, et où il se situe face aux 1 328 d'Eleven v4 Turbo — un modèle qui domine ce classement mais qui est à la traîne dans l'arène contrôlée, ce qui est précisément l'écart que les deux classements existent pour révéler. Le second est de savoir si HeyGen publie un tarif vocal qui lui est propre, afin que les 30,00 $ calculés par l'arène puissent être comparés à un chiffre du fournisseur plutôt qu'inférés à partir des crédits. Tant que ni l'un ni l'autre n'existe, une entrée à la 1re place dans le classement contrôlé est une affirmation forte sur la qualité des voix clonées et une question ouverte sur tout le reste.
