Carte héro générée pour ElevenLabs Eleven v4 vs OpenAI TTS-1 HD avec deux cartes de score : Eleven v4 à Elo 1 319, rang 1 et 0,00 $ par million de caractères ; OpenAI TTS-1 HD à Elo 1 104, rang 35 et 30,00 $ par million de caractères, avec la légende « 216 points Elo, et les deux points de terminaison reçoivent toujours du trafic ». Pied de page : « Provider Voice Arena, selon Artificial Analysis, septembre 2026. » Le logo OrcaRouter se trouve dans le coin inférieur droit.
Guides & Insights

Eleven v4 vs OpenAI TTS-1 HD : deux ans de dérive en un seul tableau

Auteur

Gideon Frost

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

La date de sortie d’OpenAI TTS-1 HD est le 6 novembre 2023. ElevenLabs Eleven v4 a la sienne le 28 septembre 2026. Sur le Provider Voice Arena d’Artificial Analysis, ces deux dates sont séparées de 216 points Elo — TTS-1 HD se classe 35e avec 1 104 sur 3 500 apparitions à 30,00 $ par million de caractères, tandis qu’Eleven v4 se classe 1er avec 1 319 sur 1 674 apparitions à 80,00 $. Les deux chiffres s’accompagnent d’intervalles serrés, ±12 et ±19, si bien que l’ordre ne fait aucun doute. La question intéressante n’est pas de savoir quel modèle est meilleur, car cela était réglé avant même que cet article n’existe. C’est pourquoi un endpoint de 2023 totalise encore 3 500 apparitions sur un tableau où un modèle vieux de cinq jours en compte 1 674, et ce que cela vous dit sur la migration que l’on vous demande d’envisager.

Le tableau des scores, et la seule ligne où OpenAI gagne

Cinq dimensions décident de cette confrontation, et les deux côtés de chacune méritent d’être lus côte à côte.

• Préférence à l'aveugle, voix de fournisseurs — Eleven v4 classé 1er, Elo 1 319 (±19, 1 674 apparitions) contre TTS-1 HD classé 35e, Elo 1 104 (±12, 3 500 apparitions). Un écart de 216 points qui résiste aux barres d'erreur.

• Prix affiché, par million de caractères — Eleven v4 80,00 $ vs TTS-1 HD 30,00 $. OpenAI est 62 % moins cher au tarif catalogue, et encore moins cher pendant la promotion ElevenLabs.

• Voix — Eleven v4 documente le clonage instantané à partir de dix secondes d’audio, ainsi qu’une offre de clonage professionnelle ; TTS-1 HD propose un ensemble fixe de voix, neuf pour la famille tts-1 dans la propre documentation d’OpenAI (alloy, ash, coral, echo, fable, onyx, nova, sage, shimmer) et aucun clonage.

• Direction de l’interprétation — Eleven v4 documente les balises audio intégrées et les invites de direction en langage naturel ; TTS-1 HD accepte du texte brut, et le paramètre steerable-instructions d’OpenAI appartient à son modèle TTS plus récent plutôt qu’à celui-ci.

• Date de sortie — Eleven v4 28 septembre 2026 vs TTS-1 HD 6 novembre 2023.

A generated scoreboard comparing ElevenLabs Eleven v4 and OpenAI TTS-1 HD across six dimensions: Provider Voice rank and Elo (1 / 1,319 against 35 / 1,104), samples (1,674 with an interval of plus or minus 19 against 3,500 with plus or minus 12), board price ($80.00 against $30.00 per 1M characters), rate card ($0.022 per 1K characters until October 12 against $30.00 per 1M at list), voices (cloning from 10 s of audio plus a professional tier against nine fixed presets) and direction (inline audio tags against plain text only). Footer: 'Ranks, Elo and board prices per Artificial Analysis; voice set, list price and capabilities vendor-documented.' The OrcaRouter logo sits in the bottom-right corner.

Le prix est la ligne où OpenAI l'emporte, et c'est une victoire plus importante qu'elle n'en a l'air, car la promotion d'ElevenLabs est temporaire. À 0,022 $ pour 1 000 caractères, Eleven v4 coûte 22 $ par million jusqu'au 12 octobre — moins cher que TTS-1 HD, purement et simplement. Après le 12 octobre, il coûte 80 $ par million contre 30 $ pour OpenAI, et il y reste.

Pourquoi un modèle 2023 a deux fois le nombre d’échantillons

Ce chiffre est l’élément le plus utile de ce tableau, et il est facile de le mal interpréter. Les apparitions dans l’arène s’accumulent avec le trafic, et le trafic s’accumule avec les intégrations qui ont été créées une fois puis jamais revues. TTS-1 HD compte 3 500 apparitions derrière lui parce qu’il a été le point de terminaison vocal par défaut pour chaque équipe qui appelle déjà OpenAI pour les complétions de chat : même clé, même SDK, même ligne de facturation, un appel de plus. Rien dans cette phrase ne concerne la qualité vocale, et le déficit de 216 points ne l’a pas arrêté.

A screenshot of Artificial Analysis' TTS-1 HD model page, titled TTS-1 HD Quality Elo, Speed & Price Analysis, credited to OpenAI and the OpenAI TTS family with an Elo of 1,103.83. The Provider Voice Arena Preference Elo bar chart runs from Eleven v4 at 1,319 at the left through Gemini 3.8 Flash TTS, Simba 3.2, Eleven v3 and Gemini 3.8 Flash-Lite TTS to TTS-1 HD at 1,104 at the right, with the model selector reading '28 of 96 models'.

Voici à quoi ressemble la dette de migration sur un tableau de classement. Ce n'est pas un signe que le modèle plus ancien est compétitif ; c'est un signe que le changement coûte quelque chose, et qu'un grand nombre d'équipes ont décidé que ce quelque chose vaut plus de 216 points Elo. C'est une conclusion légitime pour une lecture de notification et une mauvaise pour un produit où la voix est ce que le client entend.

Plaidoyer pour rester sur TTS-1 HD

Trois choses le rendent défendable, et aucune d’elles n’est la qualité.

Le déterminisme passe avant tout. Un ensemble fixe de neuf voix produit une sortie cohérente d’une version à l’autre, ce qu’un pipeline de clonage ne fait pas, et une sortie cohérente est ce que l’on veut dans un parcours utilitaire où personne n’écoute en quête de qualités artistiques. Il n’y a pas de clone qui puisse dériver, pas d’échantillon de référence à réenregistrer, et pas d’artefact de consentement à maintenir.

Le coût d’intégration est le deuxième, et c’est celui que l’arène ne peut pas chiffrer. Ajouter un deuxième fournisseur de synthèse vocale implique un nouveau compte, une nouvelle grille tarifaire, un nouveau mode de défaillance et une nouvelle chose à surveiller. Pour une équipe déjà dans l’écosystème OpenAI, c’est un vrai temps d’ingénierie, et 216 points Elo ne le financent pas.

Le volume bas de gamme arrive en troisième. À 30 $ le million de caractères, la facture vocale mensuelle entière d’un petit produit est une erreur d’arrondi, et il n’y a rien à optimiser. C’est le régime où la réponse bon marché et la réponse paresseuse sont la même réponse, et c’est très bien.

Les arguments en faveur du déménagement, et la contre-argumentation.

Basculez lorsque la voix s'adresse aux clients. Le clonage en dix secondes, les indications de performance intégrées, plus de 90 langues et une limite de 10 000 caractères par requête ne sont pas des différences cosmétiques par rapport à un ensemble fixe de neuf voix de 2023, et l'écart de 216 points de l'arène est la version compressée d'un écart de capacités bien plus important. Si vous développez un agent, un assistant de marque ou quoi que ce soit où un auditeur se forge une opinion de votre produit dès la première phrase, l'ancien point de terminaison est le mauvais choix par défaut.

Le contre-argument est que « passer à Eleven v4 » n’est pas la seule option. Depuis, OpenAI a livré un modèle TTS plus récent doté d’un paramètre d’instructions pilotable, et le Gemini 3.8 Flash TTS de Google occupe la troisième place du même classement, avec 1 267 et un coût normalisé de 16,49 $ par million — un gain de 163 points par rapport à TTS-1 HD, pour environ la moitié du prix affiché au classement. Si votre contrainte est de rester chez votre fournisseur actuel, c’est la mise à niveau la moins chère. Si c’est de rester dans votre cloud actuel, c’est la seule.

Où se situe réellement OrcaRouter dans cette comparaison

This is the rare article in this series where we host one of the two models, so let us be precise about which. openai/tts-1-hd is live in the OrcaRouter catalogue at OpenAI's list rate passed through at 0% markup: $30 per million, model ID openai/tts-1-hd, served on the OpenAI-compatible endpoint at https://api.orcarouter.ai/v1 with a POST /v1/audio/speech route and the voice, speed and response_format parameters. Our own page reports a median latency of 2,461 ms and a 95th percentile of 4,769 ms, which is the honest reason not to put it in front of a live conversation — that is a batch-shaped number, not an agent-shaped one.

A screenshot of the OrcaRouter model page for openai/tts-1-hd. The header shows the model ID openai/tts-1-hd with Audio and JSON tags, the description 'OpenAI's high-definition text-to-speech model, accessed via OrcaRouter's API at $30 per 1M tokens (zero markup)', and the endpoint /v1/audio/speech. Stat tiles read $30.00 per 1M characters, p50 TTFT 2.46 s, p95 TTFT 4.77 s and traffic of 1.5K characters over 7 days. Supported parameters are response_format, speed and voice, the OpenAI-compatible base URL is https://api.orcarouter.ai/v1, and the pricing panel states 'This model is not billed per token. The rate above is the unit it actually meters, and it is what settlement charges.'

ElevenLabs Eleven v4 ne figure pas dans notre catalogue, et il n'y a rien à appeler par notre intermédiaire : on y accède via l'API propre d'ElevenLabs, selon sa propre grille tarifaire. Ce qu'une simple clé change, c'est la forme de la migration. Si la raison pour laquelle vous n'avez pas testé le nouveau leader est que cela implique une seconde intégration fournisseur, le coût pour le savoir se limite à un appel API avec une clé que vous détenez déjà, plutôt qu'à un cycle d'achat. Les prix catalogue des fournisseurs sont répercutés avec 0 % de marge, donc une révision tarifaire d'un fournisseur — y compris le retour en arrière d'ElevenLabs du 12 octobre — est effective de notre côté le jour même où elle survient, et le basculement automatique signifie qu'un chemin vocal en cours d'évaluation n'a pas à devenir une dépendance de production pendant que vous décidez.

Le calcul qui devrait trancher

Cinq millions de caractères par mois, ce qui correspond à un produit de taille moyenne et à environ 100 heures de parole. TTS-1 HD coûte 150 $. Eleven v4 coûte 110 $ pendant la période promotionnelle et 400 $ après le 12 octobre. Gemini 3.8 Flash TTS, selon la normalisation du conseil, coûte environ 82,50 $.

Relisez ces quatre chiffres et la décision se départage nettement. Pendant la fenêtre, le modèle le plus récent et le mieux classé du tableau est aussi le deuxième moins cher — moins cher que le point de terminaison de 2023 qu’il dépasse de 216 points Elo. Après le 12 octobre, il devient l’option la plus chère de la liste, par un facteur de près de cinq. Rien ne change pour les modèles à cette date ; seule la facture change.

Donc : si vous évaluez ce mois-ci, évaluez avec le tarif promotionnel et inscrivez le tarif catalogue dans l’analyse de rentabilisation. Si vous livrez le trimestre prochain, planifiez à partir de 0,08 $ pour 1 000 caractères et considérez toute comparaison qui cite 0,022 $ comme un document sur lequel est imprimée une date d’expiration. Et si vous êtes sur TTS-1 HD et que la vraie raison est l’inertie d’intégration, la première étape utile n’est pas un plan de migration — c’est un seul test A/B sur vos propres scripts, évalué au tarif que vous paierez réellement en novembre.