Une carte hero générée intitulée « HeyGen Voice débute à la 1re place du Controlled Voice Arena », avec la ligne « 1 202 Elo — devant Qwen-Audio-3.1-TTS-Plus et Eleven v4 Turbo » et la note « Les mêmes huit voix de référence clonées — Artificial Analysis, 9 octobre 2026 ». Le logo OrcaRouter apparaît dans le coin inférieur droit.
Guides & Insights

HeyGen Voice débute à la 1re place de la Controlled Voice TTS Arena — surpassant Qwen et ElevenLabs sur les voix clonées

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Le 9 octobre 2026, Artificial Analysis a ajouté HeyGen Voice à son arène Controlled Voice et le modèle s’est directement hissé en tête. HeyGen Voice — le premier modèle de synthèse vocale de HeyGen à être évalué sur le tableau — a obtenu un score de 1 202 Elo, devant Qwen-Audio-3.1-TTS-Plus à 1 186 et Eleven v4 Turbo d’ElevenLabs à 1 167. Cartesia Sonic 3.6, qui mène le tableau ouvert Provider Voices du site, se classe cinquième ici avec 1 143. C’est un véritable résultat sur un classement conçu pour éliminer le plus grand facteur de confusion dans l’évaluation des voix, et c’est aussi un résultat dont la signification très précise est facile à surinterpréter : HeyGen Voice est la meilleure voix de cette arène sur huit voix de référence clonées, mais pas encore un champion mesuré du tableau qui compte quatre-vingt-seize modèles.

Ce que mesure la carte Controlled Voice, et pourquoi c'est important

Artificial Analysis gère deux classements vocaux qui répondent à des questions différentes. L’arène Provider Voices permet à chaque fournisseur de proposer ses propres voix natives — les voix de démonstration soignées qu’une entreprise choisit pour se représenter — et classe les modèles selon la qualité sonore de celles-ci. Son classement est vaste et mature : quatre-vingt-seize entrées, avec Eleven v4 Turbo en tête à 1 328 Elo et Cartesia Sonic 3.6 quatrième à 1 280.

L'arène Controlled Voice fait quelque chose de plus restreint et, pour quiconque commercialise un produit, de plus utile. Chaque modèle qui s'y trouve génère de la parole à partir des mêmes huit voix clonées — quatre américaines, quatre britanniques — de sorte que la comparaison ne porte pas sur « la voix marketing de qui est la plus agréable », mais sur « comment chaque moteur gère la même voix, le même texte et les mêmes conditions d'enregistrement ». C'est ce que l'industrie propose de plus proche d'un test du moteur à conditions égales plutôt que d'une bande démo, et c'est le classement qui compte si vous prévoyez de cloner une voix et de la confier à un modèle TTS.

HeyGen Voice est désormais en tête. L'écart est de 16 Elo par rapport à Qwen-Audio-3.1-TTS-Plus et de 35 par rapport à Eleven v4 Turbo, avec un intervalle de confiance à 95 % annoncé d'environ 1 185 à 1 219 sur le score HeyGen. Seize Elo, c'est un véritable écart, mais pas un gouffre — dans un classement aussi dense, c'est la différence entre la première et la deuxième place, pas entre utilisable et inutilisable.

A generated single-column scoreboard titled 'HeyGen Voice — the scoreboard' with rows reading 'Controlled Voice Elo: 1,202', '95% confidence interval: roughly 1,185 to 1,219', 'Rank in the controlled field: #1 of 42 ranked entries', 'Provider Voices Elo: not listed, insufficient votes', "Price on the arena's basis: $30.00 per 1M characters, derived from credit pricing" and 'Elo anchor: the board baseline is 1,000 points', with a footer reading 'Elo per Artificial Analysis, 9 October 2026. Price shown is the arena's conversion of credit pricing.' The OrcaRouter logo appears in the bottom-right corner.

Où HeyGen Voice n'est pas encore classé

Le côté honnête de ce résultat, c’est que HeyGen Voice n’apparaît pas du tout sur le tableau Provider Voices, et son absence n’est pas un signal concernant la qualité. Artificial Analysis précise que des modèles peuvent être omis parce qu’ils n’ont pas encore assez de votes. Un modèle vieux de quelques jours, avec une seule arène notée différemment derrière lui, n’a tout simplement pas accumulé le volume d’auditeurs à l’aveugle qu’exige le tableau plus important.

Ainsi, la lecture correcte au 10 octobre 2026 est la suivante : HeyGen Voice est la voix la mieux classée dans la comparaison contrôlée de voix clonées, et une inconnue face au champ plus large. Quiconque cite « le meilleur modèle TTS au monde » à partir de ce chiffre se réfère à un classement plus restreint que ne le laisse entendre la phrase.

A screenshot of Artificial Analysis's Provider Voice Arena leaderboard, captured 10 October 2026, showing the ranked model list with Eleven v4 Turbo first at 1,328 Elo, Eleven v4 second at 1,320, Qwen-Audio-3.1-TTS-Plus third at 1,296 and Sonic 3.6 fourth at 1,280, alongside samples, release dates and API pricing columns and 8-voice arena badges.

Les deux nombres derrière l'Elo

• Elo de voix contrôlée — Voix HeyGen : 1 202 (IC à 95 % environ 1 185–1 219). Qwen-Audio-3.1-TTS-Plus : 1 186. Eleven v4 Turbo : 1 167.

• Elo des voix des fournisseurs — Voix HeyGen : non répertoriée (votes insuffisants). Eleven v4 Turbo : 1 328, en 1re position. Sonic 3.6 : 1 280, en 4e position.

• Classement dans le panel contrôlé — HeyGen Voice : n° 1 sur 42 entrées classées (la n° 42 est OpenVoice v2 avec 812).

• Prix selon la base de calcul de l'arène — HeyGen Voice : 30,00 $ par million de caractères, conversion propre à l'arène de la tarification en crédits de HeyGen. Qwen-Audio-3.1-TTS-Plus : 19,30 $ par million de caractères. Eleven v4 Turbo : 40,00 $ par million de caractères.

• Ancre Elo — OpenAudio S1 est le point de référence fixe à 1 000, donc HeyGen Voice se situe 202 points au-dessus de l'ancre.

• Qui d'autre figure dans le top cinq — Eleven v4 à 1 160 et Sonic 3.6 à 1 143 complètent le top cinq derrière les leaders.

A screenshot of HeyGen's developer documentation sidebar, captured 10 October 2026, showing the Voice Management group with the entries Voices, Browse Voices, Design a Voice, Voice Clone and Text to Speech, above the Realtime Video and Avatar Management groups.

Ce que HeyGen a réellement livré

Le moteur derrière l'entrée est le TTS interne de HeyGen, exposé dans l'API v3 de l'entreprise. Un GET /v3/voices correspond à un appel qui prend un filtre engine dont les valeurs incluent orca — le moteur vocal propre à HeyGen — aux côtés de starfish et d'un relais vers les voix ElevenLabs. Le rendu de la parole passe par POST /v3/voices/speech ; le réglage par requête expose speed de 0,5 à 1,5 et pitch de −50 à +50 demi-tons, avec un BCP-47 locale comme indice.

Le catalogue répertorie plus de 300 voix prédéfinies dans des dizaines de langues. Les voix personnalisées se déclinent en trois variantes : la conception texte-voix, qui génère jusqu’à trois options classées à partir d’une description limitée à 1 000 caractères, un clone instantané à partir d’un seul enregistrement, et un clone professionnel entraîné sur vingt minutes ou plus d’audio. Cette dernière est la partie que le classement Controlled Voice met réellement à l’épreuve — ces huit voix de référence sont des clones, et la qualité des clones est ce qui distingue les moteurs TTS.

Les moteurs sont également mentionnés dans la documentation comme sélectionnables par voix, ce qui signifie que HeyGen ne vous impose pas son modèle : vous pouvez acheminer vers un moteur vocal tiers via son API lorsque vous en préférez un. C'est un fournisseur qui se couvre par rapport à son propre modèle, et cela vaut la peine de le savoir lorsque vous lisez une affirmation de « voix n°1 » à propos de HeyGen.

Ce que cela change pour quiconque choisit une voix

Trois conséquences pratiques découlent de l'aboutissement d'un résultat en voix contrôlée, et aucune d'entre elles n'est « tout changer ».

Tout d'abord, si votre cas d'usage est une voix de marque clonée — un seul locuteur, de nombreuses répliques — c'est désormais le classement à consulter, et HeyGen Voice est le modèle à tester en premier. Un classement qui garde la voix constante mesure ce que vous ferez réellement.

Deuxièmement, si votre cas d'usage implique un large éventail de personnages à la sonorité native dans des langues que votre clone ne couvre pas, le tableau Provider Voices et ses quatre-vingt-seize entrées restent la référence pertinente, et HeyGen Voice n'y est pas encore classé. Rien dans le résultat d'une voix clonée ne vous dit comment le moteur gère cent voix distinctes.

Troisièmement, le prix a désormais un chiffre, mais pas celui publié par le fournisseur. L'arène liste HeyGen Voice à 30,00 $ pour 1 M de caractères, une conversion réalisée par Artificial Analysis d'un système de crédits que la page de HeyGen elle-même ne convertit jamais en tarif vocal. Cela place le nouveau leader sous les 40,00 $ d'Eleven v4 Turbo et au-dessus des 19,30 $ du palier Qwen — un prix de milieu de tableau associé à un score de première place, et qui est dérivé plutôt qu'indiqué.

La question du routage

La sélection d'une voix possède une propriété que la plupart des choix de modèles n'ont pas : l'échec est audible pour l'utilisateur final en l'espace d'une syllabe. Cela rend la migration peu coûteuse à tester et coûteuse à rater en production. Faire tourner un nouveau moteur derrière la même interface que le moteur en place — une seule surface d'API, une seule clé, le prix catalogue du fournisseur répercuté plutôt que majoré, avec bascule automatique vers un second fournisseur de voix en cas d'échec de requête — est la façon d'obtenir une réponse réelle sur votre propre audio plutôt que la réponse d'un graphique Elo sur huit voix de référence. La couche de routage d'OrcaRouter existe précisément pour ce type de décision : placer le challenger sur une fraction du trafic, garder le moteur en place chaud, et laisser la bascule automatique couvrir la fenêtre où le nouveau modèle n'est pas encore éprouvé. Le classement vous indique où regarder. Il ne peut pas vous dire comment sonne votre script.

Que regarder ensuite

Deux chiffres trancheront cette histoire. Le premier est de savoir si HeyGen Voice accumule suffisamment de votes pour entrer au classement Provider Voices, et où il se situe face aux 1 328 d'Eleven v4 Turbo — un modèle qui domine ce classement mais qui est à la traîne dans l'arène contrôlée, ce qui est précisément l'écart que les deux classements existent pour révéler. Le second est de savoir si HeyGen publie un tarif vocal qui lui est propre, afin que les 30,00 $ calculés par l'arène puissent être comparés à un chiffre du fournisseur plutôt qu'inférés à partir des crédits. Tant que ni l'un ni l'autre n'existe, une entrée à la 1re place dans le classement contrôlé est une affirmation forte sur la qualité des voix clonées et une question ouverte sur tout le reste.