![Une carte hero générée pour ElevenLabs Eleven v4 avec deux panneaux : à gauche, un bloc de script affichant des balises audio en ligne telles que [laughs], [whispers] et [said angrily in French accent] ; à droite, un panneau indiquant rang 1, Elo 1 319, 80,00 $ par million de caractères et 1 674 apparitions sur Provider Voice Arena d'Artificial Analysis, avec un pied de page indiquant « Rang Provider Voice, Elo et prix selon Artificial Analysis, septembre 2026 ; syntaxe des balises et latence documentées par le fournisseur. » Le logo OrcaRouter se trouve dans le coin inférieur droit.](https://cms.orcarouter.ai/api/media/file/1-1462.png)
Les Audio Tags et les clones de dix secondes d'Eleven v4 : ce qui change dans votre pipeline
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 982 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 197 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
Ce qui compte le plus à propos de ElevenLabs Eleven v4 n'est pas son Elo. C'est que le modèle lit les indications écrites dans le script — [rit], [chuchote], [soupire], [dit en colère avec un accent français], voire même [pluie légère] — et que ElevenLabs Eleven v4 Turbo, le modèle frère à faible latence sorti le même jour, suit les mêmes balises avec un temps médian jusqu'à la première parole que le fournisseur estime à environ 150 ms. Les deux sont passés en disponibilité générale le 28 septembre 2026. Le Provider Voice Arena d'Artificial Analysis classe déjà Eleven v4 au rang 1 avec un Elo de 1 319 sur 1 674 apparitions, à un prix affiché de 80,00 $ par million de caractères. Le classement est la une. La syntaxe des indications et le clone en dix secondes sont ce qui change ce que vous devez construire.
![A generated four-card summary of what ElevenLabs Eleven v4 changed in the pipeline: a Script direction card listing [laughs], [whispers], [sighs], [said angrily in French accent] and natural-language delivery prompts; a Sound and scene card listing [light rain], [phone buzzing], multi-speaker dialogue with turn-level context and IPA phonemes for custom pronunciations; a Voice creation card listing Instant Voice Cloning from 10 s of audio, a Professional Voice Cloning tier above it, and 90-plus languages with a 10,000-character cap; and a Two endpoints card describing Eleven v4 as the most emotive, highest-quality model against Eleven v4 Turbo at about 100 ms median inference and about 150 ms to first speech. Footer: 'Tag syntax, cloning bar, language count, character cap and Turbo latency are vendor-documented; no independent score is quoted on this card.' The OrcaRouter logo sits in the bottom-right corner.](https://cms.orcarouter.ai/api/media/file/2-1397.png)
Deux modèles, un lancement, des rôles différents
ElevenLabs a mis en ligne deux points de terminaison le 28 septembre 2026, et il ne s'agit pas du même produit avec un simple interrupteur de vitesse. ElevenLabs Eleven v4 est le modèle expressif : plus de 90 langues, une limite de 10 000 caractères par requête, une meilleure prise en charge de l'alphabet phonétique international pour les prononciations personnalisées, et un dialogue multi-locuteurs qui, selon l'entreprise, préserve l'identité des locuteurs tout au long d'une scène. ElevenLabs Eleven v4 Turbo conserve les plus de 90 langues et la limite de 10 000 caractères, mais est optimisé pour les agents — l'annonce cite une latence d'inférence médiane d'environ 100 ms et un délai médian avant la première parole d'environ 150 ms, mesurés par ElevenLabs en septembre 2026.

La question de la réactivité — le modèle phare est-il assez rapide pour un agent téléphonique — n’a pas de réponse publiée. ElevenLabs fournit des chiffres de latence pour Turbo, pas pour Eleven v4 lui-même, et les deux sont des points de terminaison distincts plutôt qu’un seul modèle sous deux noms. Si le budget de votre agent est de 200 ms avant le premier audio, Turbo est le point de terminaison indiqué dans la documentation, et le modèle phare ne l’est pas.
Les balises sont une véritable interface, et une véritable dépendance.
Les balises audio intégrées ne sont pas nouvelles en synthèse vocale, mais le changement utile ici réside dans la précision du respect. L’annonce indique qu’Eleven v4 suit les balises audio et les consignes de direction en langage naturel plus précisément que les modèles précédents, et que c’est ainsi que vous dirigez un rire, un chuchotement ou une interprétation dans un accent spécifique sans modifier l’audio par la suite.
Trois conséquences pratiques en découlent, et elles comptent davantage que les vidéos de démonstration :
• Votre script devient un artefact basé sur un gabarit, pas une chaîne. Une balise est un jeton dans votre pipeline de contenu : il doit être échappé si du texte non fiable est un jour transmis, et il doit survivre à votre CMS, à votre couche de traduction et à votre diff. Un traducteur qui omet [chuchote] a modifié une représentation, en silence.
• L’adhérence aux balises est une allégation de fournisseur avec une version attachée. L’affirmation selon laquelle cette génération suit mieux les balises que la précédente est celle d’ElevenLabs, testée par ElevenLabs, et elle ne tiendra pas de manière identique selon les langues. Validez sur vos propres scripts et vos propres locales avant de bâtir un guide de style dessus.
Les balises d'effets sonores comme [light rain] ou [phone buzzing] déplacent une partie du travail de post-production audio directement dans le prompt textuel. C'est un transfert de coûts qui mérite d'être mesuré : si une balise remplace une passe de bruitage, elle est peu coûteuse ; si elle ne remplace rien et ne fait qu'ajouter de la variance, c'est un nouveau mode de défaillance dans votre assurance qualité.
Dix secondes, c'est le chiffre qui change l'onboarding.
Le clonage vocal instantané dans cette version capture une voix avec une grande fidélité à partir de dix secondes d'audio, le niveau de clonage professionnel restant disponible au-dessus. Dix secondes, c'est assez court pour éliminer une étape du flux de travail : la capture du consentement, le téléversement de l'échantillon et la première synthèse peuvent se dérouler en une seule séance, sur un téléphone, sans studio.
Le problème du consentement ne diminue pas avec l’échantillon. Il s’amplifie, car la barre pour produire un clone convaincant est tombée à un extrait que n’importe qui peut enregistrer. Si vous clonez des voix qui ne vous appartiennent pas, la question de conformité vous incombe désormais entièrement, en amont de l’appel à l’API — le modèle fera ce que vous lui demandez. Considérez le chiffre de dix secondes comme un seuil opérationnel, et non comme une autorisation.
Ce que cela coûte pendant que la fenêtre est ouverte
ElevenLabs a revu ses tarifs au lancement, et le tarif promotionnel est celui affiché sur la page aujourd'hui. Dans le tableau des tarifs de l'API, Eleven v4 est affiché à 0,022 $ pour 1 000 caractères contre un tarif catalogue annoncé de 0,08 $, et Eleven v4 Turbo à 0,011 $ contre 0,04 $. Les deux portent la même mention : 72 % de réduction jusqu'au 12 octobre. La même page affiche le tarif du précédent modèle phare, Eleven v3, à 0,08 $ pour 1 000 caractères.
• Prix du classement sur l’arène, par million de caractères — Eleven v4 80,00 $, le plus élevé du top dix de ce classement.
• Tarif du fournisseur par millier de caractères — 0,022 $ jusqu’au 12 octobre, puis 0,08 $.
• Ce que cela signifie concrètement — un mois de forte activité de scripts avec cinq millions de caractères coûte 110 $ pendant la fenêtre et 400 $ après celle-ci, sur le même point de terminaison avec le même code.

Quiconque établit son budget du T1 à partir du chiffre affiché sur la page aujourd'hui établit son budget sur un chiffre qui expire dans deux semaines. Utilisez 0,08 $.
Là où un routeur justifie sa place dans un lancement comme celui-ci
OrcaRouter n'héberge pas ElevenLabs, donc il n'y a rien dans ce lancement qui puisse être appelé via nous, et nous ne laisserons pas entendre le contraire — l'endroit où appeler Eleven v4 est l'API d'ElevenLabs elle-même. Ce pour quoi une clé unique est réellement utile dans les quinze jours qui suivent un lancement, c'est la comparaison. Si vous cherchez à déterminer si le nouveau fer de lance surpasse ce que vous utilisez déjà, vous voulez tester les deux en A/B sur vos propres scripts plutôt que sur un classement, et faire cela entre deux fournisseurs implique deux comptes, deux relations de facturation et deux chemins d'intégration avant d'obtenir une réponse.
C'est le cas que nous traitons : une clé API unique pour plus de 200 modèles avec les prix catalogue des fournisseurs répercutés à 0 % de marge, de sorte qu'un changement de prix d'un fournisseur — y compris une fenêtre promotionnelle avec une date d'expiration — soit effectif de notre côté le jour même plutôt qu'au cycle de facturation suivant. Lorsqu'un canal vocal est destiné aux clients, le basculement automatique redirige le trafic vers une source amont saine lorsqu'un point de terminaison se dégrade, ce qui vous permet de tester un tout nouveau modèle sans risquer un lancement dessus.
Quoi tester en premier, et quoi ignorer
Trois vérifications vous en diront plus que n'importe quel classement. Premièrement, faites passer votre script réaliste le plus long dans la limite de 10 000 caractères et regardez où se situent les coupures — la limite est par requête, et le dialogue à plusieurs locuteurs est l'élément le plus susceptible d'être scindé par celle-ci. Deuxièmement, mettez cinq de vos propres phrases avec balises dans v4 et v4 Turbo, puis écoutez la dérive d'adhérence entre le point de terminaison expressif et celui à faible latence ; ce sont des modèles distincts, et une balise qui fonctionne sur l'un peut ne pas fonctionner à l'identique sur l'autre. Troisièmement, évaluez votre volume mensuel réel de caractères à 0,08 $ plutôt qu'à 0,022 $, car c'est le chiffre sur lequel reposera votre prochain trimestre.
Le chiffre de ~75 % de préférence à l’aveugle dans l’annonce est une mesure d’un fournisseur, et nous n’allons pas le transformer en autre chose. Le chiffre indépendant dans ce lancement est celui du classement : première place à 1 319 Elo sur 1 674 apparitions, et un intervalle d’environ ±19 points autour. C’est un résultat solide sur un vrai classement. Ce n’est pas une spécification, et cela ne vous dira pas si votre syntaxe de balises survit à une passe de traduction.
