![Ett genererat hero-kort för ElevenLabs Eleven v4 med två paneler: till vänster ett skriptblock som visar ljudtaggar som [laughs], [whispers] och [said angrily in French accent]; till höger en panel med rang 1, Elo 1 319, 80,00 USD per 1 miljon tecken och 1 674 förekomster i Artificial Analysis Provider Voice Arena, med en sidfot med texten "Provider Voice rank, Elo och pris enligt Artificial Analysis, september 2026; taggsyntax och latens enligt leverantörens dokumentation." OrcaRouter-logotypen sitter i det nedre högra hörnet.](https://cms.orcarouter.ai/api/media/file/1-1462.png)
Eleven v4:s Audio Tags och tio-sekunderskloner: Vad förändras i din pipeline
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 982 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 197 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
Det mest betydelsefulla med ElevenLabs Eleven v4 är inte dess Elo. Det är att modellen läser regianvisningar som skrivits in i manuset — [skrattar], [viskar], [suckar], [sagt argt med fransk accent], till och med [lätt regn] — och att ElevenLabs Eleven v4 Turbo, syskonmodellen med låg latens som släpptes samma dag, följer samma taggar vid en medianstid till första tal som leverantören uppger till omkring 150 ms. Båda blev allmänt tillgängliga den 28 september 2026. Artificial Analysis' Provider Voice Arena har redan Eleven v4 på plats 1 med en Elo på 1 319 över 1 674 framträdanden, till ett pris på 80,00 USD per miljon tecken enligt resultattavlan. Rangordningen är rubriken. Syntaxen för regianvisningar och tiossekundersklonen är den del som förändrar vad du behöver bygga.
![A generated four-card summary of what ElevenLabs Eleven v4 changed in the pipeline: a Script direction card listing [laughs], [whispers], [sighs], [said angrily in French accent] and natural-language delivery prompts; a Sound and scene card listing [light rain], [phone buzzing], multi-speaker dialogue with turn-level context and IPA phonemes for custom pronunciations; a Voice creation card listing Instant Voice Cloning from 10 s of audio, a Professional Voice Cloning tier above it, and 90-plus languages with a 10,000-character cap; and a Two endpoints card describing Eleven v4 as the most emotive, highest-quality model against Eleven v4 Turbo at about 100 ms median inference and about 150 ms to first speech. Footer: 'Tag syntax, cloning bar, language count, character cap and Turbo latency are vendor-documented; no independent score is quoted on this card.' The OrcaRouter logo sits in the bottom-right corner.](https://cms.orcarouter.ai/api/media/file/2-1397.png)
Två modeller, en lansering, olika jobb
ElevenLabs lanserade två slutpunkter den 28 september 2026, och de är inte samma produkt med en hastighetsomkopplare. ElevenLabs Eleven v4 är den uttrycksfulla modellen: över 90 språk, en gräns på 10 000 tecken per begäran, förbättrat stöd för Internationella fonetiska alfabetet för anpassade uttal och dialog med flera talare som företaget säger bevarar talaridentiteten genom en scen. ElevenLabs Eleven v4 Turbo behåller de över 90 språken och gränsen på 10 000 tecken men är optimerad för agenter — i tillkännagivandet anges en medianfördröjning för inferens på omkring 100 ms och en median för tid till första tal på omkring 150 ms, mätt av ElevenLabs i september 2026.

Den reaktiva frågan – är flaggskeppet tillräckligt snabbt för en telefonagent – har inget publicerat svar. ElevenLabs anger latenssiffror för Turbo, inte för Eleven v4 självt, och de två är åtskilda slutpunkter snarare än en och samma modell under två namn. Om din agents budget är 200 ms till första ljudet, är Turbo slutpunkten i dokumentationen och flaggskeppet är det inte.
Taggarna är ett riktigt gränssnitt, och ett riktigt beroende.
Inline-ljudtaggar är inte nya för talsyntes, men den användbara förändringen här är precisionen i efterlevnaden. I tillkännagivandet sägs att Eleven v4 följer ljudtaggar och regipromptar i naturligt språk mer exakt än tidigare modeller, och att det är så här du styr ett skratt, en viskning eller ett framförande i en specifik accent utan att redigera ljudet i efterhand.
Tre praktiska konsekvenser följer, och de spelar större roll än demorullarna:
• Ditt manus blir en mallad artefakt, inte en sträng. En tagg är en token i din innehållspipeline: den behöver escapas om obetrodd text någonsin passerar igenom, och den behöver överleva ditt CMS, ditt översättningslager och din diff-granskning. En översättare som utelämnar [viskar] har förändrat en föreställning, i tysthet.
• Taggföljsamhet är ett leverantörspåstående med en version knuten till sig. Påståendet att den här generationen följer taggar bättre än den förra är ElevenLabs eget, testat av ElevenLabs, och det kommer inte att gälla identiskt över språk. Validera på dina egna skript och dina egna lokaler innan du bygger en stilguide på det.
• Taggar för ljudeffekter som [lätt regn] eller [telefonsurr] flyttar en liten del av arbetet med ljudpostproduktion in i textprompten. Det är en kostnadsförskjutning värd att mäta: om en tagg ersätter ett foley-pass, är den billig; om den inte ersätter något och bara tillför varians, är den ett nytt felmod i din QA.
Tio sekunder är siffran som förändrar onboarding
I den här versionen fångar Instant Voice Cloning en röst med hög trohet från tio sekunders ljud, medan den professionella kloningsnivån fortfarande finns tillgänglig ovanför den. Tio sekunder är tillräckligt kort för att slå ihop ett steg i arbetsflödet: inhämtning av samtycke, uppladdning av röstprov och första syntesen kan ske vid ett och samma tillfälle, i mobilen, utan studio.
Samtyckesproblemet krymper inte med röstprovet. Det växer, eftersom ribban för att skapa en övertygande klon har sjunkit till ett klipp som vem som helst kan spela in. Om du klonar röster som du inte äger, är det nu helt och hållet du som måste besvara efterlevnadsfrågan före API-anropet – modellen kommer att göra det du ber om. Betrakta tio sekunder som en operativ tröskel, inte som en tillåtelse.
Vad det kostar medan fönstret är öppet
ElevenLabs ändrade prissättningen vid lansering, och kampanjpriset är det som står på sidan i dag. I API-pristabellen listas Eleven v4 till $0,022 per 1 000 tecken mot ett angivet listpris på $0,08, och Eleven v4 Turbo till $0,011 mot $0,04. Båda har samma etikett: 72 % rabatt till och med den 12 oktober. Samma sida prissätter det tidigare flaggskeppet, Eleven v3, till $0,08 per 1 000 tecken.
• Priset på arenans lista, per miljon tecken — Eleven v4 80,00 $, det högsta i topp tio på den listan.
• Leverantörens prislista, per tusen tecken — 0,022 $ fram till den 12 oktober, därefter 0,08 $.
• Vad det innebär i praktiken — en skripttung månad på fem miljoner tecken kostar 110 dollar under fönstret och 400 dollar efter det, på samma endpoint med samma kod.

Den som budgeterar för Q1 utifrån siffran som står på sidan i dag, budgeterar utifrån en siffra som upphör att gälla om två veckor. Använd 0,08 $.
Där en router förtjänar sin plats vid en lansering som denna
OrcaRouter är inte värd för ElevenLabs, så det finns inget i den här lanseringen att anropa via oss, och vi kommer inte att antyda något annat — platsen att anropa Eleven v4 är ElevenLabs eget API. Vad en enda nyckel verkligen är användbar för under de två veckorna efter en lansering är jämförelsen. Om du försöker avgöra om den nya flaggskeppsmodellen slår det du redan kör vill du A/B-testa de två på dina egna skript i stället för på en resultattavla, och att göra det över två leverantörer innebär två konton, två faktureringsrelationer och två integrationsvägar innan du har ett svar.
Det är det fallet vi hanterar: en API-nyckel över fler än 200 modeller med leverantörslistpriser som förs vidare med 0 % påslag, så en prisändring från leverantören – inklusive ett kampanjfönster med ett utgångsdatum – är live hos oss samma dag i stället för vid nästa faktureringscykel. När en röstväg är kundvänd, automatisk redundansväxling flyttar trafik till en frisk uppströmslänk när en slutpunkt försämras, vilket är hur du provar en helt ny modell utan att satsa en lansering på den.
Vad man bör testa först, och vad man bör ignorera
Tre kontroller säger dig mer än någon rangordning. För det första, kör ditt längsta realistiska manus genom gränsen på 10 000 tecken och se var sömmarna hamnar – gränsen gäller per begäran, och dialog med flera talare är den funktion som mest sannolikt delas av den. För det andra, kör fem av dina egna meningar med taggar genom både v4 och v4 Turbo och lyssna efter följsamhetsdrift mellan den uttrycksfulla och den låglatenta slutpunkten; de är separata modeller, och en tagg som landar i den ena kanske inte landar identiskt i den andra. För det tredje, prissätta din faktiska månatliga teckenvolym till $0.08 i stället för $0.022, eftersom det är siffran som ditt nästa kvartal baseras på.
Siffran på ~75 % för blind preferens i tillkännagivandet är en leverantörsmätning, och vi kommer inte att tvätta den till något annat. Det oberoende talet i den här lanseringen är det på resultattavlan: förstaplats med 1 319 Elo på 1 674 framträdanden, och ett intervall på ungefär ±19 punkter runt det. Det är ett starkt resultat på en riktig resultattavla. Det är inte en specifikation, och det kommer inte att tala om för dig om din taggsyntax överlever en översättningskörning.
