Une carte hero générée intitulée « HeyGen Voice vs ElevenLabs » avec la ligne mettant en contraste une nouvelle première place sur l’arène contrôlée de voix clonées face au fournisseur détenant cinq des quinze premières entrées, source : Artificial Analysis, 9 octobre 2026. Le logo OrcaRouter apparaît dans le coin inférieur droit.
Guides & Insights

HeyGen Voice vs ElevenLabs : un nouveau n°1 en matière de voix clonées, et le fournisseur qui domine toujours le classement

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

HeyGen Voice a pris la première place de l’arène Controlled Voice d’Artificial Analysis le 9 octobre 2026 avec 1 202 Elo, et le modèle qu’il a délogé de cette place était un modèle de la gamme ElevenLabs : Eleven v4 Turbo, désormais troisième avec 1 167. Voilà le titre, et il est exact. C’est aussi une affirmation bien plus modeste qu’elle n’en a l’air, car les modèles du même fournisseur occupent les deuxième, troisième, quatrième, onzième et quinzième places de ce même classement contrôlé, et Eleven v4 Turbo reste premier sur l’arène Provider Voices, bien plus vaste, avec 1 328 Elo — 126 points d’avance sur HeyGen Voice, qui n’y est pas classé du tout. Un moteur a remporté un classement. Le fournisseur reste maître de la catégorie.

Le même fournisseur occupe désormais cinq des quinze premières places.

Le classement contrôlé maintient la voix constante — huit voix de référence clonées, quatre américaines et quatre britanniques — afin que chaque entrée soit jugée sur la manière dont le moteur gère une voix qu’il n’a pas pu choisir. Ce classement affiche désormais : HeyGen Voice 1 202, Qwen-Audio-3.1-TTS-Plus 1 186, Eleven v4 Turbo 1 167, Eleven v4 1 160, Sonic 3.6 1 143, Realtime TTS-2 1 143. Plus bas, Eleven v3 se situe à 1 072 et v3 Conversational à 1 056.

Cinq des quinze premières entrées de ce domaine portent le même nom de fournisseur. Le rival qui possède le meilleur modèle du classement en a cinq bons, sur deux générations et à deux niveaux de prix, plus une variante conversationnelle qui est un produit entièrement différent. Voilà à quoi ressemble un acteur en place vu de l’intérieur d’une première place de classement, et c’est pourquoi une entrée à la première place mérite la une plutôt qu’un plan de migration.

Ce que sont réellement les modèles ElevenLabs

Eleven v4 Turbo est décrit, dans la documentation du fournisseur lui-même, comme le modèle de pointe pour la synthèse vocale en temps réel, recommandé pour les agents de support, les assistants IA et les personnages interactifs, accessible via le websocket Text to Dialogue sous l'identifiant de modèle eleven_v4_turbo. ElevenLabs annonce une latence d'inférence médiane d'environ 100 ms — chiffre déclaré par le fournisseur, et la note de bas de page de cette même page exclut la latence applicative et réseau de ce chiffre ; il s'agit donc d'un chiffre propre au moteur du modèle, et non d'une promesse d'aller-retour.

La couverture linguistique de la famille v4 est de loin la plus large de cette comparaison : plus de 90 langues, de l’afrikaans et de l’arabe au cantonais, à l’hindi, au japonais, au mandarin et au zoulou. La documentation de HeyGen répertorie elle-même plus de 300 voix prédéfinies dans « des dizaines de langues » sans publier de décompte, ce qui constitue une autre façon de décrire un catalogue et n’est pas directement comparable à un nombre de langues.

Ensuite, il y a la partie qui n’apparaît pas du tout dans un classement : la bibliothèque de voix, les contrôles de stabilité et de similarité, le réglage par requête, et une décennie de surface d’intégration. Une comparaison de modèles n’est pas une comparaison de plateformes, et l’entrée ElevenLabs rivalise sur les deux tableaux.

A generated two-column scoreboard titled 'HeyGen Voice vs ElevenLabs — the scoreboard'. Rows compare controlled-voice Elo, provider-board Elo, published price per 1M characters, stated latency, language coverage and how many tiers each vendor holds in the controlled top fifteen, with HeyGen Voice at 1,202 in first on the controlled board and Eleven v4 Turbo at 1,328 in first on the provider board. A footer separates vendor-published rates from the arena's derived conversion of credit pricing. The OrcaRouter logo appears in the bottom-right corner.

Le tableau d'affichage

• Elo de voix contrôlée — HeyGen Voice : 1 202 (n° 1). Eleven v4 Turbo : 1 167 (n° 3). Eleven v4 : 1 160 (n° 4).

• Elo des voix des fournisseurs — Eleven v4 Turbo : 1 328 (n° 1 sur 96). HeyGen Voice : non classé.

• Prix publié pour 1 M de caractères — Eleven v4 Turbo : 40,00 $. Eleven v4 : 80,00 $. HeyGen Voice : 30,00 $, selon la conversion propre à l'arène de la tarification en crédits de HeyGen ; HeyGen ne publie elle-même aucun tarif de voix.

• Latence annoncée — Eleven v4 Turbo : ~100 ms de latence d'inférence médiane, hors latence applicative et réseau (rapporté par le fournisseur). HeyGen Voice : aucun chiffre publié.

• Couverture linguistique — La famille ElevenLabs v4 : plus de 90 langues (documentation du fournisseur). HeyGen Voice : « des dizaines de langues », nombre non publié.

• Modèles dans le top quinze contrôlé — ElevenLabs : cinq niveaux. HeyGen : un.

A screenshot of Artificial Analysis's Controlled Voice arena leaderboard, captured 10 October 2026, showing the language selector set to 'English (US & UK)' with HeyGen Voice first at 1,202 Elo, Qwen-Audio-3.1-TTS-Plus second at 1,186, Eleven v4 Turbo third at 1,167, Eleven v4 fourth at 1,160 and Sonic 3.6 fifth at 1,143, plus samples, release dates and per-1M-character API pricing columns.

L'écart entre les deux planches est le nombre intéressant

Eleven v4 Turbo devance HeyGen Voice de 161 points dans le classement Provider Voices et accuse 35 points de retard sur lui dans le classement contrôlé. Ces deux chiffres proviennent du même site, de la même méthode d’écoute en aveugle et de la même période. Ce qui les sépare, c’est la voix.

Sur le classement des fournisseurs, chaque fournisseur propose ses propres voix natives ; une entreprise qui a passé des années à constituer et à enrichir une bibliothèque de voix peut donc aligner ses meilleures. Sur le classement contrôlé, cet avantage disparaît — le moteur doit restituer une voix clonée qu’il n’a pas sélectionnée. L’écart de 196 points entre les deux résultats mesure, en pratique, la part de la position d’ElevenLabs qui vient des voix plutôt que du moteur. C’est une part importante. Elle n’est pas nulle non plus : 1 167 reste troisième sur quarante-deux.

Pour un acheteur, cela se traduit par une question concrète. Si vous choisissez une voix dans la bibliothèque d’un fournisseur, le classement des fournisseurs est votre classement, et la position d’ElevenLabs y est incontestée. Si vous clonez un locuteur précis, le classement contrôlé est votre classement, et cette semaine, un nouveau nom en occupe la première place.

Le coût du titulaire n'a pas changé

Eleven v4 Turbo coûte 40 $ par million de caractères sur l’API du fournisseur, et l’ancien Eleven v4 coûte 80 $ — le double, pour un modèle qui obtient sept points Elo de moins sur le classement contrôlé. Cet écart au sein d’un même fournisseur mérite qu’on s’y arrête : deux modèles d’une même entreprise, un écart de prix de 2×, trois places d’écart au classement.

Le côté HeyGen de la comparaison de prix existe, mais pas sous une forme que HeyGen a publiée. L’arène l’inscrit à 30,00 $ par million de caractères — dix dollars en dessous du palier ElevenLabs qu’il a remplacé, et 62 % des 80 $ de l’ancien Eleven v4 — mais ce chiffre est une conversion d’Artificial Analysis, pas un tarif communiqué par le fournisseur : la page de tarification publique de HeyGen vend des crédits (600 pour 29 $/mois, 1 000 pour 49 $, 1 500 pour 149 $) et indique que la consommation varie selon le modèle, la durée et la complexité, sans préciser de tarif à la voix. Ainsi, le challenger au meilleur score de voix clonée est facturé un quart en dessous de l’acteur en place, sur un chiffre que celui-ci n’a pas eu à calculer.

A screenshot of Artificial Analysis's Provider Voice Arena leaderboard, captured 10 October 2026, showing Eleven v4 Turbo first at 1,328 Elo, Eleven v4 second at 1,320, Qwen-Audio-3.1-TTS-Plus third at 1,296 and Sonic 3.6 fourth at 1,280, with samples, release dates, 8-voice arena badges and API pricing columns.

Là où chaque camp gagne réellement

Choisissez ElevenLabs lorsque l’étendue est la contrainte. Plus de quatre-vingt-dix langues, cinq paliers classés dans le classement contrôlé, une bibliothèque de voix mature, et une variante conversationnelle au prix de 50 $ par million de caractères, que le classement contrôlé place au quinzième rang — cette combinaison est difficile à réunir ailleurs, et c’est pourquoi l’avance du fournisseur a survécu à la perte de la première place.

Testez HeyGen Voice lorsque la contrainte est la constance. Un seul locuteur, des milliers de répliques, un clone qui doit sonner comme ce locuteur à chaque fois — c’est exactement la charge de travail que modélise l’arène contrôlée, et HeyGen Voice est actuellement le moteur qui obtient le meilleur score dans cet exercice. La voie du clone professionnel, entraînée sur plus de vingt minutes d’audio, est le produit pertinent pour ce travail, et non le clone instantané à partir d’un seul enregistrement.

Ne voyez pas dans le 1 202 une preuve que HeyGen Voice surpasse généralement ElevenLabs. Il bat un palier d’ElevenLabs sur un classement. Trois autres paliers sont à moins de 42 points de lui, et le leader de l’autre classement le devance de 126 points.

Tester un challenger sans migration

L’asymétrie de coûts est ici la partie utile : un remplacement de voix est peu coûteux à mettre en œuvre et immédiatement audible s’il tourne mal, tandis que le fournisseur en place à 40 $ par million de caractères est une chose coûteuse à laisser tourner sur du trafic que le challenger gère mieux. Pour résoudre cela, il faut faire tourner les deux derrière une seule intégration et laisser votre propre audio décider — OrcaRouter place les deux sur une seule clé API au prix catalogue du fournisseur, sans marge, de sorte qu’une modification du tarif d’un fournisseur se répercute à la source plutôt qu’au renouvellement du contrat, et le basculement automatique en cas d’échec signifie qu’une requête vocale qui échoue est redirigée vers l’autre moteur au lieu de devenir silencieuse. Pour une première approche, vous pouvez pondérer le trafic vers le moteur que votre oreille préfère sur un petit jeu de test, et le DSL de routage vous permet de réserver un moteur pour la narration pré-rendue et l’autre pour les tours interactifs sans une seconde bibliothèque cliente.

Qu’est-ce qui changerait cette histoire ?

L’entrée de HeyGen Voice dans l’arène Provider Voices nous dirait si une avance en matière de voix clonée se traduit par des voix natives compétitives — le test qu’ElevenLabs réussit à 1 328. Un tarif vocal sur la page de tarification de HeyGen elle-même transformerait les 30,00 $ dérivés de l’arène en une arithmétique vérifiable. Et un mois de votes supplémentaire montrerait si 16 Elo d’avance sur Qwen-Audio-3.1-TTS-Plus constituent un classement stable ou un instantané. N’importe lequel des trois pourrait modifier la recommandation ; aucun ne s’est encore produit, et le résumé honnête jusqu’à ce que cela se produise est que HeyGen Voice a remporté le tableau contrôlé et qu’ElevenLabs domine toujours la catégorie.