
Eleven v4 mot Cartesia Sonic 3.6: Ett Elo-gap på 43 punkter mot en 39 % billigare röst
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 982 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 195 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1189 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
ElevenLabs Eleven v4 ligger 43 Elo-poäng över Cartesia Sonic 3.6 på Artificial Analysis Provider Voice Arena — 1 319 mot 1 276 — och den vinner även Controlled Voice-tavlan, tvåa mot Sonic 3.6:s fjärdeplats. Den förlorar på pris med bred marginal i motsatt riktning: 80,00 USD per miljon tecken mot 49,00 USD, och ungefär nio gånger priset per tecken enligt leverantörernas egna prislistor under lanseringsfönstret. Det här är en sällsynt matchning där resultattavlan är tydlig och beslutet fortfarande inte är det, eftersom de två modellerna egentligen inte konkurrerar om samma jobb.

Vad varje modell är, i ett stycke vardera
ElevenLabs Eleven v4 lanserades den 28 september som företagets flaggskeppsmodell för talsyntes, tillsammans med Eleven v4 Turbo. Dokumentationen anger över 90 språk, en gräns på 10 000 tecken per begäran, dialog med flera talare och stabil talaridentitet, förbättrat stöd för IPA-fonem samt infogade direktiv som låter dig skriva in framförandet i manuset. Röstkloning fungerar från tio sekunders ljud för omedelbara kloner, med en professionell nivå ovanför det.
Cartesia Sonic 3.6 är den aktuella utgåvan av en modellserie som Cartesia positionerar utifrån snabbhet och naturlighet. Dess egen produktsida kallar den för den snabbaste och mest naturliga text-till-tal-modellen, uppger latens under 90 ms, inbyggt flerspråkigt stöd för 44 språk, röstkloning från tio sekunders ljud, anpassade uttalsordböcker och en uppsättning efterlevnadsstandarder som omfattar HIPAA, SOC 2 Type 2, GDPR och PCI. Båda leverantörerna publicerar latenssiffror för sina egna modeller; ingen av uppsättningarna är oberoende verifierad, och de är inte uppmätta på samma sätt.
Resultattavlan, dimension för dimension
• Blind preferens, varje leverantörs egna röster — Eleven v4 rang 1, Elo 1 319 vs Sonic 3.6 rang 2, Elo 1 276. En skillnad på 43 poäng.
Blind preferens, matchade klonade röster – Eleven v4 rank 2, Elo 1 157 mot Sonic 3.6 rank 4, Elo 1 138. En lucka på 19 poäng, snävare än den första.
• Arena-prisnormalisering, per miljon tecken — Eleven v4 $80.00 mot Sonic 3.6 $49.00. Sonic är 39 % billigare enligt boardens gemensamma nämnare.
• Leverantörens prislista, per tusen tecken — Eleven v4 $0.022 i kampanjpris, $0.08 efter 12 oktober jämfört med Sonic 3.6 $0.049. Sonic är 39 % billigare när kampanjen tar slut.
• Språktäckning, leverantörsdokumenterad — Eleven v4 90-plus mot Sonic 3.6 44. Ungefär dubbelt.
• Gräns för indata per begäran – Eleven v4 10 000 tecken vs Sonic 3.6 anges inte på dess produktsida.
• Latens, enligt leverantören — Eleven v4 Turbo cirka 150 ms median till första tal vs Sonic 3.6 under 90 ms. Återigen, olika tester.
• Röstkloning – båda från tio sekunders ljud, båda med en högre professionell nivå.
• Uppräkningskontroller — Eleven v4 dokumenterar IPA-foneminmatning och en professionell kloningsnivå; Sonic 3.6 dokumenterar anpassade uttalslexikon.
• Efterlevnadsstatus — Sonic 3.6 anger HIPAA, SOC 2 Type 2, GDPR och PCI. ElevenLabs anger sin efterlevnad separat från modellsidan och placerar inte en motsvarande lista bredvid v4.

Två av de raderna är de som avgör verkliga projekt. Elo-gapet är 43 poäng på tavlan för leverantörsröster och 19 på tavlan för klonade röster – Sonic-linjen minskar gapet med mer än hälften när talarna hålls konstanta. Det är kännetecknet för en modell vars finjustering är konkurrenskraftig men vars förvalda röstbesättning inte är det, och det säger att problemet med Sonic i den här matchningen är presentation snarare än synteskvalitet.
Varför prisskillnaden är mindre än den ser ut
Rubrikprisjämförelsen är missvisande åt båda hållen. Eleven v4:s $0,022 per tusen tecken är en kampanjsiffra med utgångsdatum den 12 oktober; den siffra som kvarstår efter kampanjperioden är $0,08, vilket är mer än 60 % över Sonic 3.6:s prislista. Men arena-normaliseringen bryr sig inte om kampanjen: den prissätter modellerna efter deras listpriser och landar på $80,00 mot $49,00, vilket är jämförelsen som fortfarande kommer att stämma i november.
Det finns en andra hake. Cartesia publicerar inte någon pris per tecken på sin produktsida, så siffran $0.049 kommer från arena-normaliseringen snarare än från leverantören, och de två mätarna kanske inte stämmer exakt överens – normaliseringen gör antaganden om hur en leverantör fakturerar. Betrakta ordningen som tillförlitlig och de exakta procenttalen som ungefärliga.
En beräknad månad med fem miljoner tecken: Eleven v4 kostar 110 dollar med kampanjtaxan och 400 dollar efter den 12 oktober. Sonic 3.6 kostar 245 dollar. Under de kommande två veckorna kostar Eleven v4 alltså mindre än hälften av Sonics kostnad, och därefter är den 63 % dyrare. Den som skriver en inköpsjämförelse i dag och skickar den nästa månad kommer att få detta bakvänt om de inte anger vilken taxa de använde.
Segmentet där Sonic 3.6 är det korrekta svaret
Det finns voice-arbetsbelastningar i produktion där arenatavlorna inte mäter det som spelar roll, och Sonic 3.6 är byggt för dem.
Realtidskonversationsagenter är det tydligaste fallet. Latens under 90 ms är inte en marknadsföringssiffra i en telefonagent; det är skillnaden mellan att ett avbrott känns hanterat och att det känns som ett tappat samtal, och ElevenLabs publicerar ingen motsvarande siffra för Eleven v4 självt – bara för Turbo-nivån med en median på cirka 150 ms till första tal. Om din agents socket-budget är snäv kan de 43 Elo-poängen vara värda mindre för dig än millisekunderna, och din egen barge-in-testning avgör det snabbare än någon resultattavla.
Reglerad driftsättning är den andra. Cartesia anger HIPAA, SOC 2 Type 2, GDPR och PCI på produktsidan. En efterlevnadslista är inte en Elo och kan inte ersättas av en sådan; om en granskare inom hälso- och sjukvård eller betalningar finns i din utgivningsväg, väger den raden på resultattavlan tyngre än de övriga nio.

Deterministiskt uttal är det tredje, och det är subtilare. Eleven v4:s dokumenterade IPA-foneminmatning är en styrka, Sonic 3.6:s anpassade uttalsordböcker är det arbetsflöde som team med stora produktnamnsvokabulärer tenderar att redan ha byggt. Att porta en ordbok är riktigt arbete; modellen som konsumerar artefakten du äger har ett försprång.
Där Eleven v4 helt enkelt är den bättre modellen
Med allt detta sagt mäter topplistorna något, och Eleven v4 vann båda. På Provider Voice leder den över Sonic 3.6 med 43 poäng, med 1 674 sampel bakom uppskattningen, och den tidigare flaggskeppsmodellen — ElevenLabs Eleven v3 på 1 169 — ligger 107 poäng efter Sonic 3.6, vilket betyder att ElevenLabs tätade ett verkligt gap på en generation i stället för att försvara ett försprång.
Den andra otvetydiga segern är antalet språk. Över 90 mot 44 är ungefär dubbelt så många, och för en produkt som släpps på fler språk än engelska och en handfull europeiska språk är det en täckningsfråga snarare än en kvalitetsfråga — Sonic 3.6 kanske inte har någon röst alls för vissa av dina språkversioner. Och hanteringen av dialoger med flera talare plus inline-direktiv för framförande är en verklig kapacitetsskillnad: att skriva in ett skratt i manuset är ett arbetsflöde som Sonic 3.6 inte dokumenterar, och att återskapa den effekten på en modell som saknar det innebär efterbearbetning eller en andra tagning, vilket kostar mer än vad Elo-gapet antyder.
Att köra någon av dem, och den del vi inte kan hjälpa till med
OrcaRouter är inte värd för någon av dessa modeller. ElevenLabs och Cartesia finns inte i vår katalog, så inget i den här jämförelsen kan anropas via oss, och det ärliga svaret på "hur får jag in det på OrcaRouter" är att du inte kan – du går till leverantören. Det vi hanterar är fallet där en talstack råkar sträcka sig över flera leverantörer i stället för en: en enda API-nyckel över 200+ modeller, med leverantörernas listpriser vidarebefordrade med 0 % påslag så att en leverantörsprisändring är live hos oss samma dag som den träder i kraft. För ett beslut som hänger på om du betalar 110 $ eller 400 $ för samma månads tecken, är den tidpunkten inte en liten sak.
När en röstväg är kundvänd och inte får brytas, flyttar automatisk redundansväxling trafik till en frisk uppströmsnod när en försämras. Det är mönstret som gör ett tvåveckors kampanjfönster värt att utnyttja: du kan rikta produktionen mot den billigare modellen i två veckor utan att skriva om integrationen och flytta tillbaka när priset återgår.
Vem bör byta, och vem bör vänta
Byt till Eleven v4 om din produkt bedöms efter hur den låter, om du släpper på fler än ett par dussin språk, eller om dina användare får höra vilken röst leverantören än har valt åt dem — den sista gruppen är precis den som Provider Voice-tavlan representerar, och gapet där är det största av alla rader.
Håll dig kvar på Sonic 3.6 om du kör realtidskonversation inom en latensbudget, om en regelefterlevnadsgranskare godkänner din stack, eller om du har ett uttalslexikon som du inte har råd att bygga om. På dessa tre rader ligger Sonic inte efter; det är det enda alternativet med ett publicerat svar.
Vänta, i båda fallen, om ditt beslut beror på priset. Om två veckor ändras Eleven v4:s prislista med en faktor på nästan fyra, och Sonic 3.6:s gör det inte, och en jämförelse som skrivs i dag kommer att framstå som felaktig i mitten av oktober. Elo-ordningen kommer fortfarande att hålla. Pengarna kommer inte att göra det.
