Een gegenereerde hero-kaart voor ElevenLabs Eleven v4 met twee panelen: links een scriptblok met inline audiotags zoals [laughs], [whispers] en [said angrily in French accent]; rechts een paneel met rang 1, Elo 1.319, $80,00 per 1 miljoen tekens en 1.674 vermeldingen in Artificial Analysis' Provider Voice Arena, met een voettekst met de tekst 'Provider Voice-rang, Elo en prijs volgens Artificial Analysis, september 2026; tag-syntax en latentie gedocumenteerd.' Het OrcaRouter-logo staat in de rechteronderhoek.
Engineering & Research

Audio Tags en tiensecondenclones van Eleven v4: wat verandert er in je pipeline?

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Het meest ingrijpende aan ElevenLabs Eleven v4 is niet zijn Elo. Het is dat het model regieaanwijzingen leest die in het script staan — [lacht], [fluistert], [zucht], [boos gezegd met een Frans accent], zelfs [lichte regen] — en dat ElevenLabs Eleven v4 Turbo, het low-latency zustermodel dat dezelfde dag werd uitgebracht, dezelfde tags volgt bij een mediane tijd tot eerste spraak die de leverancier op ongeveer 150 ms stelt. Beide werden op 28 september 2026 algemeen beschikbaar. Artificial Analysis' Provider Voice Arena heeft Eleven v4 al op rang 1 staan met een Elo van 1.319 over 1.674 deelnames, tegen een op het scorebord vermelde prijs van $80,00 per miljoen tekens. De rangschikking is het nieuws. De syntax voor regieaanwijzingen en de kloon van tien seconden zijn het onderdeel dat verandert wat je moet bouwen.

A generated four-card summary of what ElevenLabs Eleven v4 changed in the pipeline: a Script direction card listing [laughs], [whispers], [sighs], [said angrily in French accent] and natural-language delivery prompts; a Sound and scene card listing [light rain], [phone buzzing], multi-speaker dialogue with turn-level context and IPA phonemes for custom pronunciations; a Voice creation card listing Instant Voice Cloning from 10 s of audio, a Professional Voice Cloning tier above it, and 90-plus languages with a 10,000-character cap; and a Two endpoints card describing Eleven v4 as the most emotive, highest-quality model against Eleven v4 Turbo at about 100 ms median inference and about 150 ms to first speech. Footer: 'Tag syntax, cloning bar, language count, character cap and Turbo latency are vendor-documented; no independent score is quoted on this card.' The OrcaRouter logo sits in the bottom-right corner.

Twee modellen, één lancering, verschillende taken

ElevenLabs heeft op 28 september 2026 twee endpoints uitgebracht, en dat zijn niet hetzelfde product met een snelheidsschakelaar. ElevenLabs Eleven v4 is het expressieve model: meer dan 90 talen, een limiet van 10.000 tekens per verzoek, verbeterde ondersteuning voor het Internationaal Fonetisch Alfabet voor aangepaste uitspraken, en dialoog met meerdere sprekers waarvan het bedrijf zegt dat die de identiteit van de spreker gedurende een scène behoudt. ElevenLabs Eleven v4 Turbo behoudt de meer dan 90 talen en de limiet van 10.000 tekens, maar is afgestemd op agents — de aankondiging noemt een mediane inferentielatentie van ongeveer 100 ms en een mediane tijd tot de eerste spraak van ongeveer 150 ms, gemeten door ElevenLabs in september 2026.

A screenshot of the ElevenLabs models documentation page, flagship Text to Speech section. Eleven v4 is described as the most emotive, high quality speech synthesis model, with exceptional voice cloning capabilities, 90+ languages supported, a 10,000 character limit and support for natural multi-speaker dialogue. Eleven v4 Turbo is described as the most emotive, real-time speech synthesis model, with ultra-low latency (median inference latency of ~100ms), exceptional voice cloning capabilities, 90+ languages supported and audio tags for fine-grained control. Below them the page lists Eleven v3, Eleven v3 Conversational, Eleven Multilingual v2 and Eleven Flash v2.5.

De reactieve vraag — is het vlaggenschip snel genoeg voor een telefoonagent — heeft geen gepubliceerd antwoord. ElevenLabs geeft latentiecijfers voor Turbo, niet voor Eleven v4 zelf, en de twee zijn afzonderlijke endpoints in plaats van één model onder twee namen. Als het budget van je agent 200 ms tot eerste audio is, is Turbo het endpoint in de documentatie en het vlaggenschip niet.

De tags zijn een echte interface, en een echte afhankelijkheid

Inline audiotags zijn niet nieuw voor spraaksynthese, maar de nuttige verandering hier is de nauwkeurigheid van het opvolgen. De aankondiging stelt dat Eleven v4 audiotags en instructies in natuurlijke taal nauwkeuriger opvolgt dan eerdere modellen, en dat dit de manier is waarop je een lach, een fluistering of een voordracht in een specifiek accent kunt regisseren zonder achteraf audio te bewerken.

Hieruit volgen drie praktische gevolgen, en die zijn belangrijker dan de demo-reels:

• Je script wordt een sjabloonartefact, geen string. Een tag is een token in je contentpijplijn: hij moet ge-escaped worden als er ooit niet-vertrouwde tekst doorheen wordt gestuurd, en hij moet je CMS, je vertaallaag en je diff-review overleven. Een vertaler die zich ontdoet van [fluistert] heeft in stilte een voorstelling veranderd.

• Tag-naleving is een leveranciersclaim met een versie eraan verbonden. De bewering dat deze generatie tags beter volgt dan de vorige is van ElevenLabs zelf afkomstig, getest door ElevenLabs, en zal niet in alle talen identiek opgaan. Valideer met je eigen scripts en je eigen locales voordat je er een stijlgids op baseert.

• Geluidseffect-tags zoals [lichte regen] of [telefoon zoemt] verplaatsen een klein deel van het werk van audio-postproductie naar de tekstprompt. Dat is een kostenverschuiving die het meten waard is: als een tag een foley-pass vervangt, is die goedkoop; als die niets vervangt en alleen variantie toevoegt, is het een nieuwe faalmodus in je QA.

Tien seconden is het getal dat onboarding verandert

Instant Voice Cloning in deze release legt een stem met hoge getrouwheid vast op basis van tien seconden audio, terwijl de professionele kloonoptie daarboven nog steeds beschikbaar is. Tien seconden is kort genoeg om een workflowstap te laten vervallen: het vastleggen van toestemming, het uploaden van een sample en de eerste synthese kunnen in één sessie gebeuren, op een telefoon, zonder studio.

Het toestemmingsprobleem krimpt niet mee met de sample. Het groeit, omdat de lat om een overtuigende kloon te produceren is gedaald tot een clip die iedereen kan opnemen. Als je stemmen kloont die niet van jou zijn, is de compliancevraag nu volledig aan jou om te beantwoorden vóór de API-aanroep — het model doet wat je vraagt. Beschouw het getal van tien seconden als een operationele drempel, niet als een vrijbrief.

Wat het kost zolang het venster open is

ElevenLabs heeft bij de lancering de prijzen aangepast, en het promotietarief is het tarief dat vandaag op de pagina staat. In de API-prijstabel staat Eleven v4 vermeld voor $0,022 per 1.000 tekens tegen een vermelde lijstprijs van $0,08, en Eleven v4 Turbo voor $0,011 tegen $0,04. Beide hebben hetzelfde label: 72% korting tot 12 oktober. Op dezelfde pagina kost het vorige vlaggenschip, Eleven v3, $0,08 per 1.000 tekens.

Prijs op het leaderboard van de arena, per miljoen tekens — Eleven v4 $80,00, de hoogste in de top tien van dat leaderboard.

• Tariefkaart van de leverancier, per duizend tekens — $0,022 tot 12 oktober, daarna $0,08.

• Wat dat in de praktijk betekent — een scriptintensieve maand van vijf miljoen tekens kost $110 tijdens het venster en $400 daarna, op hetzelfde endpoint met dezelfde code.

A screenshot of the ElevenLabs API pricing page filtered to ElevenAPI. Four Text to Speech columns are shown: v4 at $0.022 with $0.08 struck through, v4 Turbo at $0.011 with $0.04 struck through, both carrying a '72% off until Oct 12' badge, Eleven v3 at $0.08 and Eleven v3 Conversational at $0.04 per 1K characters. The v4 column lists audio tags for fine-grained control and 90+ languages supported; the Turbo column lists ultra-low latency (~100ms) and v4 expressiveness tuned for latency; the v3 column lists 70+ languages and a 5,000 character limit. The cost calculator below prices a Starter plan at $6 per month with 272.727k characters of TTS (v4) included.

Iedereen die voor Q1 budgetteert op basis van het getal dat vandaag op de pagina staat, budgetteert op basis van een getal dat over twee weken verloopt. Gebruik $0.08.

Waar een router zijn plek verdient in een lancering als deze

OrcaRouter host ElevenLabs niet, dus er is niets in deze lancering dat via ons kan worden aangeroepen, en we zullen niet suggereren van wel — de plek om Eleven v4 aan te roepen is de eigen API van ElevenLabs. Waar één enkele sleutel in de twee weken na een lancering echt nuttig voor is, is de vergelijking. Als je besluit of het nieuwe vlaggenschip beter is dan wat je al draait, wil je de twee A/B-testen op je eigen scripts in plaats van op een leaderboard, en dat doen bij twee leveranciers betekent twee accounts, twee facturatiestromen en twee integratietrajecten voordat je een antwoord hebt.

Dat is het geval dat wij aanpakken: één API-sleutel voor meer dan 200 modellen met de lijstprijzen van providers doorgegeven tegen 0% opslag, zodat een prijswijziging van een leverancier — inclusief een promotievenster met een einddatum — dezelfde dag aan onze kant live is in plaats van bij de volgende factuurcyclus. Bij een klantgericht spraakpad wordt automatische failover ingezet om verkeer naar een gezonde upstream te verplaatsen wanneer één endpoint degradeert; zo kun je een gloednieuw model uitproberen zonder er een release op het spel te zetten.

Wat je eerst moet testen, en wat je moet negeren

Drie checks vertellen je meer dan welke ranking dan ook. Ten eerste: haal je langste realistische script door de limiet van 10.000 tekens en kijk waar de naden vallen — de limiet geldt per verzoek, en dialoog met meerdere sprekers is de functie die er het waarschijnlijkst door wordt opgesplitst. Ten tweede: stop vijf van je eigen zinnen met tags in zowel v4 als v4 Turbo en luister naar nalevingsdrift tussen het expressieve en het low-latency-eindpunt; het zijn aparte modellen, en een tag die bij het ene landt, landt mogelijk niet identiek bij het andere. Ten derde: reken je werkelijke maandelijkse tekenvolume tegen $0,08 in plaats van $0,022, want dat is het getal waarop je volgende kwartaal draait.

Het ~75%-cijfer voor blinde voorkeur in de aankondiging is een leveranciersmeting en we gaan er niets anders van maken. Het onafhankelijke getal bij deze lancering is het getal op het scorebord: een eerste plaats met 1.319 Elo bij 1.674 verschijningen, en een interval van ongeveer ±19 punten eromheen. Dat is een sterk resultaat op een echt scorebord. Het is geen specificatie, en het zal je niet vertellen of je tag-syntaxis een vertaalslag overleeft.