Une carte hero pour « Eleven v4 au sommet de la Voice Arena » : un classement avec ElevenLabs Eleven v4 au 1er rang et un Elo de 1 319, Cartesia Sonic 3.6 au 2e rang et un Elo de 1 276, Google Gemini 3.8 Flash TTS au 3e rang et un Elo de 1 267, ElevenLabs Eleven v3 au 18e rang et un Elo de 1 169, et un ruban indiquant « 72 % de réduction jusqu'au 12 oct. ». Pied de page : « Fournisseur : Voice Arena, d'après Artificial Analysis, sept. 2026. » Le logo OrcaRouter se trouve dans le coin inférieur droit.
Guides & Insights

Eleven v4 domine la Voice Arena : ce que le nouveau fleuron d'ElevenLabs a réellement remporté

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

ElevenLabs Eleven v4 est arrivé le 28 septembre et s'est directement hissé au sommet de la Provider Voice Arena d'Artificial Analysis avec un Elo de 1 319 — 43 points d'avance sur Cartesia Sonic 3.6 à 1 276 et 52 points d'avance sur Google Gemini 3.8 Flash TTS à 1 267. Il est également, à 80,00 $ par million de caractères sur ce même classement, le modèle le plus cher du top 10. Et sur la deuxième arène — celle construite à partir de voix clonées plutôt que du jeu de voix propre à chaque fournisseur — il ne l'emporte pas du tout : il termine deuxième, derrière un modèle qui coûte quatre fois moins cher. Ces deux constats sont vrais, et la partie utile de ce lancement consiste à déterminer laquelle de ces deux réalités s'applique à votre cas d'usage.

Qu'est-ce qui a réellement été livré le 28 septembre ?

ElevenLabs a mis deux modèles en disponibilité générale, et non un seul. ElevenLabs Eleven v4 est le modèle de synthèse phare — l'entreprise le qualifie de son plus expressif, et sa documentation fixe la limite d'entrée à 10 000 caractères par requête et la couverture linguistique à plus de 90 langues. ElevenLabs Eleven v4 Turbo est le petit frère à faible latence : les mêmes plus de 90 langues, une limite de 10 000 caractères, et la prise en charge des balises audio intégrées qui permettent d'écrire une indication de jeu directement dans le script — un rire, un murmure, un grésillement sur la ligne. Les deux sont disponibles sur les surfaces agent, création et API de l'entreprise dès le premier jour, un déploiement plus rapide que celui de la génération v3.

La page d'annonce est l'endroit où se trouve la liste des fonctionnalités et, notamment, pas la tarification. ElevenLabs décrit une nouvelle architecture, une meilleure gestion du ton, du rythme et du caractère, un dialogue multi-locuteurs plus fiable avec une identité de locuteur stable, une entrée de phonèmes IPA améliorée, et des clones vocaux instantanés créés à partir de dix secondes d'audio aux côtés du niveau professionnel de clonage existant. Le seul chiffre qu'on y trouve est une affirmation concernant les auditeurs : le fournisseur dit que des comparaisons à l'aveugle ont préféré v4 dans environ trois quarts des cas. C'est un chiffre du fournisseur, non reproduit, et il convient de le lire à côté des chiffres du classement ci-dessous plutôt qu'à leur place.

Là où se trouve réellement la tarification — la page de tarification de l'API — est le document le plus lourd de conséquences, et il est traité plus bas. En bref : ce lancement n'est pas une hausse de prix.

Deux conseils, deux réponses différentes

Artificial Analysis gère deux arènes vocales, et ce ne sont pas des variantes l'une de l'autre. Provider Voice demande aux auditeurs de comparer les voix propres à chaque fournisseur. Controlled Voice clone les mêmes huit voix — quatre américaines, quatre britanniques — pour chaque participant, de sorte que le locuteur reste constant et que seul le modèle varie. Un modèle doté d'un excellent casting vocal par défaut peut gagner la première et perdre la seconde. Eleven v4 fait exactement cela.

• Provider Voice, Eleven v4 — rang 1, Elo 1 319, 80,00 $ par million de caractères, 1 674 échantillons, huit voix d’arène, septembre 2026

• Voix du fournisseur, Cartesia Sonic 3.6 — rang 2, Elo 1 276, 49,00 $

• Voix du fournisseur, Google Gemini 3.8 Flash TTS — rang 3, Elo 1 267, 16,50 $

• Voix du fournisseur, l'ancien porte-drapeau ElevenLabs Eleven v3 — rang 18, Elo 1 169, 100,00 $

• Voix contrôlée, Alibaba Qwen-Audio-3.1-TTS-Plus — rang 1, Elo 1 178

• Controlled Voice, Eleven v4 — rang 2, Elo 1 157, 80,00 $

• Voix contrôlée, Cartesia Sonic 3.6 — rang 4, Elo 1 138

• Voix contrôlée, ElevenLabs Eleven v3 — rang 7, Elo 1 073

• Voix contrôlée, Google Gemini 3.8 Flash TTS — rang 13, Elo 1 048

• Meilleure entrée à poids ouverts sur Provider Voice — Breeze TTS 2, Elo 1 206, 34,00 $

A single-column scoreboard card for ElevenLabs Eleven v4 with six rows: 'Provider Voice rank: 1 (Elo 1,319)', 'Controlled Voice rank: 2 (Elo 1,157)', 'Board price: $80.00 per 1M characters', 'Rate card: $0.022 per 1K characters until Oct 12', 'Languages and cap: 90-plus, 10,000 characters', 'Latency: not stated for v4 itself'. Footer: 'Elo and board prices per Artificial Analysis; rate card and specs vendor-documented.'

Le saut générationnel est le point marquant pour quiconque est déjà sur ElevenLabs : face à son propre prédécesseur dans le même classement, Eleven v4 gagne 150 points Elo sous Provider Voice et 84 sous Controlled Voice. C’est un saut de génération, pas une simple passe de réglage, et l’amélioration est plus importante dans le classement où le fournisseur peut choisir les voix — ce qui est la façon honnête de dire que sa nouvelle distribution de voix par défaut fait réellement partie du gain.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, captured in English, showing ElevenLabs Eleven v4 first at Elo 1,319 with $80.0 per 1M chars, 1,674 samples and a -19/19 confidence interval, Cartesia Sonic 3.6 second at Elo 1,276 and $49.0, Google Gemini 3.8 Flash TTS third at Elo 1,267 and $16.5, and ElevenLabs Eleven v3 eighteenth at Elo 1,169 and $100.0, under columns for samples, arena voices, release month and API pricing.

Le tableau de prononciation auquel on ne peut pas donner de numéro

Artificial Analysis dispose bien d’une section Pronunciation Robustness, et il vaut la peine de la décrire correctement, car le résumé du classement qui circule décrit Eleven v4 comme arrivant en tête. Le tableau mesure la proportion de segments surlignés dont les évaluateurs ont jugé la prononciation correcte, avec jusqu’à trois évaluateurs par extrait, et les prompts sont envoyés exactement tels qu’ils ont été écrits — aucune expansion des nombres, aucune normalisation du texte. Il est divisé en sous-catégories, et l’intérêt de cette conception est qu’un modèle qui réécrit silencieusement « Dr. » ou « $4.50 » avant de parler obtienne un mauvais score, et ce à dessein.

Ce que le classement ne publie pas, dans le rendu que nous avons pu lire, c’est un score numérique citable par modèle. Il n’y a donc, dans ce classement, aucun chiffre à citer pour Eleven v4, et l’Elo de 1 319 relève de la préférence en arène — combien les auditeurs ont aimé la voix — non de l’exactitude de la prononciation. Si vous voyez les deux confondus, c’est précisément cette confusion. L’affirmation défendable issue de ce lancement est celle qui est accompagnée de chiffres : premier sur Provider Voice à 1 319, deuxième sur Controlled Voice à 1 157.

La réduction de lancement est la vraie nouvelle pour votre facture.

ElevenLabs a revu le prix des nouveaux modèles au moment même de leur lancement, et la réduction est suffisamment importante pour changer à elle seule une décision d'achat. Sur la page de tarification de l'API, Eleven v4 est affiché à 0,022 $ pour mille caractères, contre un prix catalogue annoncé de 0,08 $ — soit une réduction de 72 % — et Eleven v4 Turbo est affiché à 0,011 $ contre 0,04 $. Les deux ont la même période de validité : la promotion court jusqu'au 12 octobre. Après cela, les chiffres reviennent à la normale, et le prix rétabli de v4, à 0,08 $, est le double de ce que coûte aujourd'hui le v3 d'ElevenLabs lui-même. Planifiez à partir du tarif après promotion, pas du tarif promotionnel.

La nouvelle tarification déplace aussi la position de v4 face au reste du marché sur une base par caractère, ce que la normalisation de l’arène affiche déjà à 80,00 $ le million. Sonic 3.6 y est à 49,00 $, Breeze TTS 2 à 34,00 $, Qwen-Audio-3.0-TTS-Plus à 19,30 $, et Gemini 3.8 Flash TTS à 16,50 $. Au tarif promotionnel, Eleven v4, à 22 $ par million, passe nettement sous Sonic 3.6. Au tarif catalogue, c’est la voix la plus chère du tableau, et de loin. Quiconque prépare un budget pour le T1 devrait se fier au deuxième chiffre.

A screenshot of ElevenLabs' API pricing page, captured in English, showing the Eleven v4 row at $0.022 per 1K characters with a struck-through $0.08 and a '72% off until Oct 12' badge, and the Eleven v4 Turbo row at $0.011 with a struck-through $0.04, alongside the v3 row at $0.08 and the Eleven v3 Conversational row at $0.04.

Un mois chiffré rend l’écart concret. À cinq millions de caractères — un produit de taille moyenne qui lit environ cent heures de parole —, Eleven v4 pendant la fenêtre coûte 110 $. Au tarif rétabli de 0,08 $, il coûte 400 $. Sonic 3.6 coûte 245 $. Gemini 3.8 Flash TTS coûte 82,50 $. Le même mois sur la v3 d’ElevenLabs elle-même coûte aussi 400 $, ce qui est le fait étrange qui sous-tend ce lancement : pendant les deux prochaines semaines, le nouveau fleuron est moins cher que le modèle qu’il remplace, et le jour où la fenêtre se ferme, il cesse d’être moins cher et devient simplement meilleur.

La latence annoncée est fournie par le fournisseur et dépend du niveau de service

ElevenLabs publie des chiffres de latence par palier, et non par famille de modèles, et il s'agit de mesures réalisées par l'entreprise, non de mesures indépendantes. Eleven v4 Turbo est annoncé à environ 100 ms d'inférence médiane et à environ 150 ms de délai médian avant la première parole, mesurés en septembre 2026. Eleven v3 Conversational est annoncé à environ 280 ms, et les anciens paliers Flash et Turbo à environ 75 ms. La documentation ne publie pas de chiffre équivalent pour Eleven v4 lui-même, qui est le palier qu'il vous faudrait si vous construisez un agent en temps réel et que vous lisez une fiche technique plutôt que de faire des tests.

Cartesia revendique une latence inférieure à 90 ms pour Sonic et le classe premier pour la naturalité, avec un clonage vocal à partir de dix secondes d’audio, des dictionnaires de prononciation personnalisés et un ensemble de conformité couvrant HIPAA, SOC 2 Type 2, le RGPD et PCI. Ce sont les affirmations du fournisseur sur sa propre page produit — la même catégorie de preuves que les chiffres de latence par palier d’ElevenLabs, et non interchangeables avec l’Elo de l’arène. Les deux fournisseurs ne sont directement comparables que sur les classements.

Ce que cela implique pour vous, et comment l’essayer

Si vous choisissez une voix pour un produit où le casting par défaut est ce que vos utilisateurs entendent, c'est le résultat de Provider Voice qui compte, et Eleven v4 vient de le remporter, avec une remise associée pendant deux semaines. Si vous clonez la voix d'une personne précise et que l'on demande à chaque modèle candidat de reproduire les mêmes huit locuteurs, c'est le classement Controlled Voice qui compte, et Eleven v4 est deuxième — 21 Elo derrière le leader et, au prix catalogue, plus de quatre fois le coût par caractère. Aucun des deux résultats n'est faux ; ce sont des réponses à des questions différentes, et la seconde est la question que se pose réellement la plupart des travaux de clonage de voix en production.

OrcaRouter n'héberge pas ElevenLabs, Cartesia ni aucun des autres fournisseurs présents sur ces tableaux ; il n'y a donc rien ici à appeler via nous, et nous ne laisserons pas entendre le contraire. Ce que nous proposons, c'est la plomberie qui l'entoure si votre chaîne vocale finit par s'étendre sur plusieurs fournisseurs : une seule clé API pour plus de 200 modèles, avec les prix catalogue des fournisseurs répercutés à 0 % de marge, de sorte qu'une baisse de prix d'un fournisseur — y compris une fenêtre promotionnelle comme celle-ci — est effective de notre côté le jour même, et non au cycle de facturation suivant. Lorsqu'un chemin vocal est critique pour la production, le basculement automatique se fait vers un amont sain lorsqu'un composant se dégrade, ce qui est le moyen pratique de tester un tout nouvel endpoint sans faire dépendre une mise en production de celui-ci.

La date à noter dans votre agenda est le 12 octobre. C'est ce jour-là qu'Eleven v4 cessera d'être la bonne voix la moins chère du classement pour devenir la plus chère, et toute comparaison rédigée cette semaine qui cite 22 $ le million sans le préciser est une comparaison que vous devriez refaire dans trois semaines.