
Eleven v4 toppar Voice Arena: Vad ElevenLabs nya flaggskepp faktiskt vann
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 983 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 196 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
ElevenLabs Eleven v4 anlände den 28 september och gick rakt till toppen av Artificial Analysis Provider Voice Arena med en Elo på 1 319 — 43 poäng före Cartesia Sonic 3.6 på 1 276 och 52 poäng före Google Gemini 3.8 Flash TTS på 1 267. Det är också, med $80,00 per miljon tecken på samma resultattavla, den dyraste modellen bland de tio bästa. Och i den andra arenan — den som byggts på klonade röster i stället för varje leverantörs egen röstuppsättning — vinner den inte alls: den slutar tvåa, bakom en modell som kostar en fjärdedel så mycket. Båda dessa saker är sanna, och det användbara med den här lanseringen är att avgöra vilken av dem som ditt användningsfall hör hemma under.
Vad levererades faktiskt den 28 september?
ElevenLabs gjorde två modeller allmänt tillgängliga, inte en. ElevenLabs Eleven v4 är flaggskeppsmodellen för syntes – företaget kallar den sin mest känslofyllda, och dess dokumentation anger gränsen för indata till 10 000 tecken per begäran och språktäckningen till över 90. ElevenLabs Eleven v4 Turbo är syskonmodellen med låg latens: samma 90+ språk, en gräns på 10 000 tecken och stöd för de infogade ljudtaggarna som låter dig skriva en regianvisning för framförandet direkt i manuset – ett skratt, en viskning, ett surr på linjen. Båda är live i företagets agent-, kreativ- och API-ytor från dag ett, vilket är en snabbare utrullning än vad v3-generationen fick.
Tillkännagivandesidan är där funktionslistan finns och, anmärkningsvärt nog, inte prissättningen. ElevenLabs beskriver en ny arkitektur, bättre hantering av ton, tempo och karaktär, mer tillförlitlig dialog med flera talare och stabil talaridentitet, förbättrad inmatning av IPA-fonem samt direkta röstkloner byggda av tio sekunders ljud vid sidan av den befintliga nivån för professionella kloner. Den enda siffran på den är ett påstående om lyssnare: leverantören säger att blinda jämförelser föredrog v4 i ungefär tre fjärdedelar av fallen. Det är en leverantörssiffra, inte reproducerad, och den bör läsas vid sidan av siffrorna på tavlan nedan snarare än i stället för dem.
Platsen där prissättningen faktiskt finns – API-prissidan – är det mer avgörande dokumentet, och det behandlas längre ner. Kortversion: den här lanseringen är inte en prishöjning.
Två styrelser, två olika svar
Artificial Analysis driver två talarenor, och de är inte varianter av varandra. Provider Voice låter lyssnare jämföra varje leverantörs egna röster. Controlled Voice klonar samma åtta röster – fyra amerikanska, fyra brittiska – för varje deltagare, så talaren hålls konstant och bara modellen varierar. En modell med en utmärkt standardröstuppsättning kan vinna den första och förlora den andra. Eleven v4 gör precis det.
• Provider Voice, Eleven v4 — rang 1, Elo 1 319, $80,00 per miljon tecken, 1 674 prover, åtta arena-röster, september 2026
• Provider Voice, Cartesia Sonic 3.6 — rang 2, Elo 1 276, 49,00 USD
• Provider Voice, Google Gemini 3.8 Flash TTS — rang 3, Elo 1 267, 16,50 $
• Leverantörsröst, den tidigare flaggskeppsmodellen ElevenLabs Eleven v3 — rang 18, Elo 1 169, 100,00 $
• Kontrollerad röst, Alibaba Qwen-Audio-3.1-TTS-Plus — rang 1, Elo 1 178
• Kontrollerad röst, Eleven v4 — rang 2, Elo 1 157, 80,00 $
• Controlled Voice, Cartesia Sonic 3.6 — rang 4, Elo 1 138
• Kontrollerad röst, ElevenLabs Eleven v3 — rang 7, Elo 1 073
• Kontrollerad röst, Google Gemini 3.8 Flash TTS — placering 13, Elo 1 048
• Bästa bidraget med öppna vikter på Provider Voice — Breeze TTS 2, Elo 1 206, 34,00 USD

Generationshoppet är huvudnyheten för alla som redan använder ElevenLabs: jämfört med sin egen föregångare på samma resultattavla tar Eleven v4 150 Elo-poäng i Provider Voice och 84 i Controlled Voice. Det är ett generationskliv, inte en finjustering, och förbättringen är större på tavlan där leverantören får välja rösterna — vilket är det ärliga sättet att säga att dess nya standardröstbesättning är en verklig del av vinsten.

Uttalstavlan som vi inte kan sätta en siffra på
Artificial Analysis har faktiskt en sektion för Pronunciation Robustness, och den förtjänar en ordentlig beskrivning eftersom rankningssammanfattningen som florerar framställer Eleven v4 som att den toppar den. Resultattavlan mäter andelen markerade textpartier som bedömarna ansåg uttalades korrekt, med upp till tre bedömare per klipp, och prompterna skickas exakt som de är skrivna – ingen talexpansion, ingen textnormalisering. Den är uppdelad i underkategorier, och poängen med designen är att en modell som i tysthet skriver om "Dr." eller "$4.50" innan den talar avsiktligt får dåliga poäng.
Vad resultattavlan inte publicerar, i den rendering vi kunde läsa, är en citerbar numerisk poäng per modell. Så det finns ingen siffra att citera för Eleven v4 där, och Elo-talet 1 319 hör till arenapreferens — hur lyssnarna tyckte om rösten — inte till uttalsnoggrannhet. Om du ser de två sammanblandade, är det sammanblandningen. Det försvarbara påståendet från den här lanseringen är det som har siffror kopplade till sig: etta på Provider Voice med 1 319, tvåa på Controlled Voice med 1 157.
Lanseringsrabatten är den verkliga nyheten för din räkning.
ElevenLabs satte nytt pris på de nya modellerna samtidigt som de släpptes, och rabatten är tillräckligt stor för att på egen hand ändra ett köpbeslut. På API-prissidan listas Eleven v4 till $0,022 per tusen tecken mot ett angivet listpris på $0,08 – en minskning med 72 % – och Eleven v4 Turbo listas till $0,011 mot $0,04. Båda har samma tidsfönster: kampanjen pågår till den 12 oktober. Efter det återgår siffrorna, och det återställda priset för v4 är dubbelt så högt som ElevenLabs egen v3 kostar idag, $0,08. Utgå från siffran efter kampanjen, inte kampanjsiffran.
Omprissättningen flyttar också v4:s position gentemot fältet per tecken, vilket arena-normaliseringen redan visar vid 80,00 dollar per miljon. Sonic 3.6 ligger på 49,00 där, Breeze TTS 2 på 34,00, Qwen-Audio-3.0-TTS-Plus på 19,30 och Gemini 3.8 Flash TTS på 16,50. Med kampanjpriset underbjuder Eleven v4 till 22 dollar per miljon Sonic 3.6 direkt. Med listpriset är det den dyraste rösten på tavlan med bred marginal. Den som bygger en budget för Q1 bör titta på den andra siffran.

En genomräknad månad gör skillnaden konkret. Vid fem miljoner tecken – en medelstor produkt som läser ungefär hundra timmar tal – kostar Eleven v4 under fönstret 110 dollar. Vid det återställda priset 0,08 dollar kostar den 400 dollar. Sonic 3.6 kostar 245 dollar. Gemini 3.8 Flash TTS kostar 82,50 dollar. Samma månad med ElevenLabs egna v3 kostar också 400 dollar, vilket är det märkliga faktumet bakom den här lanseringen: under de kommande två veckorna är det nya flaggskeppet billigare än modellen det ersätter, och dagen fönstret stängs slutar det vara billigare och blir bara bättre.
Latenspåståendet är leverantörsuppgivet och nivåberoende.
ElevenLabs publicerar latenssiffror per nivå, inte per modellfamilj, och de är mätningar som företaget självt har gjort, inte något oberoende. Eleven v4 Turbo anges till ungefär 100 ms i medianinferens och omkring 150 ms i mediantid till första tal, uppmätt i september 2026. Eleven v3 Conversational anges till omkring 280 ms, och de äldre nivåerna Flash och Turbo till omkring 75 ms. Dokumentationen publicerar ingen motsvarande siffra för Eleven v4 självt, vilket är den nivå du skulle vilja ha om du bygger en realtidsagent och läser ett specifikationsblad i stället för att testa.
Cartesia hävdar latens under 90 ms för Sonic och beskriver den som rankad etta i naturlighet, med röstkloning från tio sekunders ljud, anpassade uttalsordböcker och ett efterlevnadspaket som omfattar HIPAA, SOC 2 Type 2, GDPR och PCI. Det är leverantörens egna påståenden på dess egen produktsida – samma kategori av bevis som ElevenLabs siffror för latensnivåer, och inte utbytbara mot arena Elo. Det enda stället där de två leverantörerna är direkt jämförbara är på resultattavlorna.
Var det här lämnar dig, och hur du kan prova det
Om du väljer en röst för en produkt där standardurvalet av röster är det användarna hör, är Provider Voice-resultatet det som spelar roll, och Eleven v4 tog just hem det, med en rabatt som gäller i två veckor. Om du klonar en specifik persons röst och varje kandidatmodell får i uppgift att återskapa samma åtta talare, är Controlled Voice-tavlan den som spelar roll, och Eleven v4 ligger tvåa – 21 Elo efter ledaren och, till listpris, mer än fyra gånger kostnaden per tecken. Inget av resultaten är fel; de är svar på olika frågor, och det andra är frågan som merparten av produktionsarbetet med röstkloning faktiskt ställer.
OrcaRouter hostar inte ElevenLabs, Cartesia eller någon av de andra leverantörerna på dessa anslagstavlor, så det finns inget här att anropa via oss och vi kommer inte att antyda något annat. Det vi erbjuder är den omkringliggande infrastrukturen om din röststack till slut sträcker sig över flera leverantörer: en API-nyckel för 200+ modeller med leverantörernas listpriser förmedlade med 0 % påslag, så en leverantörsprissänkning – inklusive ett kampanjfönster som detta – slår igenom hos oss samma dag i stället för vid nästa faktureringscykel. När en röstväg är produktionskritisk, automatisk redundansväxling växlar över till en frisk uppströmsleverantör när en försämras, vilket är det praktiska sättet att testa en helt ny slutpunkt utan att satsa en release på den.
Datumet att ringa in i kalendern är den 12 oktober. Det är då Eleven v4 slutar vara den billigaste bra rösten i utbudet och blir den dyraste, och varje jämförelse som skrivs den här veckan och anger 22 dollar per miljon utan att nämna det är en jämförelse du bör göra om om tre veckor.
