Een hero-kaart voor 'ElevenLabs Eleven v4 vs Cartesia Sonic 3.6' met twee scorekaarten: ElevenLabs Eleven v4 op Elo 1.319, rang 1 en $80,00 per 1 miljoen tekens; Cartesia Sonic 3.6 op Elo 1.276, rang 2 en $49,00 per 1 miljoen tekens; met als onderschrift '43 Elo-punten tegen een 39% goedkopere stem'. Voettekst: 'Provider Voice Arena, volgens Artificial Analysis, sept. 2026.' Het OrcaRouter-logo staat in de rechteronderhoek.
Guides & Insights

Eleven v4 vs Cartesia Sonic 3.6: Een Elo-verschil van 43 punten tegenover een 39% goedkopere stem

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

ElevenLabs Eleven v4 staat 43 Elo-punten boven Cartesia Sonic 3.6 op de Provider Voice Arena van Artificial Analysis — 1.319 tegen 1.276 — en het wint ook het Controlled Voice-board, met een tweede plaats tegenover de vierde plaats van Sonic 3.6. Op prijs verliest het met een ruime marge in de andere richting: $80,00 per miljoen tekens tegen $49,00, en ongeveer negen keer het tarief per teken op de eigen tariefkaarten van de leveranciers tijdens het lanceringsvenster. Dit is de zeldzame confrontatie waarin het scorebord helder is en de beslissing dat toch niet is, omdat de twee modellen niet echt voor dezelfde taak concurreren.

A two-column scoreboard for ElevenLabs Eleven v4 and Cartesia Sonic 3.6. Eleven v4: Provider Voice rank 1 Elo 1,319; Controlled Voice rank 2 Elo 1,157; $80.00 per 1M chars; $0.022 per 1K until Oct 12; 90-plus languages; latency not stated for v4. Sonic 3.6: Provider Voice rank 2 Elo 1,276; Controlled Voice rank 4 Elo 1,138; $49.00 per 1M chars; $0.049 per 1K; 44 languages; sub-90 ms. Footer: 'Elo and board prices per Artificial Analysis; rate cards and specs vendor-reported.'

Wat elk model is, in één zin

ElevenLabs bracht op 28 september Eleven v4 uit als het vlaggenschipmodel voor spraaksynthese van het bedrijf, naast Eleven v4 Turbo. De documentatie geeft het meer dan 90 talen, een invoerlimiet van 10.000 tekens per verzoek, dialoog met meerdere sprekers met stabiele sprekersidentiteit, verbeterde ondersteuning voor IPA-fonemen en inline-richtlijnen waarmee je de voordracht in het script kunt schrijven. Stemklonen werkt vanaf tien seconden audio voor directe clones, met daarboven een professionele laag.

Cartesia Sonic 3.6 is de huidige release van een modellijn die Cartesia positioneert op snelheid en natuurlijkheid. De eigen productpagina bestempelt het als het snelste en meest natuurlijke tekst-naar-spraakmodel, claimt een latentie van minder dan 90 ms, native meertalige werking in 44 talen, stemklonen op basis van tien seconden audio, aangepaste uitspraakwoordenboeken en een compliancepakket dat HIPAA, SOC 2 Type 2, GDPR en PCI omvat. Beide leveranciers publiceren latentiecijfers voor hun eigen modellen; geen van beide sets is onafhankelijk geverifieerd, en ze worden niet op dezelfde manier gemeten.

Het scorebord, dimensie voor dimensie

• Blinde voorkeur, de eigen stemmen van elke leverancier — Eleven v4 rang 1, Elo 1.319 vs Sonic 3.6 rang 2, Elo 1.276. Een verschil van 43 punten.

• Blinde voorkeur, gematchte gekloonde stemmen — Eleven v4 rang 2, Elo 1.157 vs Sonic 3.6 rang 4, Elo 1.138. Een verschil van 19 punten, kleiner dan het eerste.

• Prijsnormalisatie van Arena, per miljoen tekens — Eleven v4 $80,00 vs Sonic 3.6 $49,00. Sonic is 39% goedkoper op de gemeenschappelijke noemer van het leaderboard.

• Leverancierstariefkaart, per duizend tekens — Eleven v4 $0,022 promotietarief, $0,08 na 12 oktober vs Sonic 3.6 $0,049. Sonic is 39% goedkoper zodra de promotie eindigt.

• Taaldekking, door de leverancier gedocumenteerd — Eleven v4 90-plus versus Sonic 3.6 44. Ruwweg het dubbele.

• Maximale invoer per verzoek — 10.000 tekens voor Eleven v4 vs. Sonic 3.6: niet vermeld op de productpagina.

• Latentie, door leverancier opgegeven — Eleven v4 Turbo ongeveer 150 ms mediaan tot eerste spraak versus Sonic 3.6 onder 90 ms. Nogmaals, verschillende tests.

• Stemklonen — beide op basis van tien seconden audio, beide met een hogere professionele tier.

• Besturingselementen voor enumeratie — Eleven v4 documenteert IPA-foneeminvoer en een professionele kloon-tier; Sonic 3.6 documenteert aangepaste uitspraakwoordenboeken.

• Nalevingsstatus — Sonic 3.6 vermeldt HIPAA, SOC 2 Type 2, GDPR en PCI. ElevenLabs vermeldt de eigen naleving apart van de modelpagina en zet geen overeenkomstige lijst naast v4.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, captured in English, showing ElevenLabs Eleven v4 first at Elo 1,319 with $80.0 per 1M chars, Cartesia Sonic 3.6 second at Elo 1,276 with $49.0, and Google Gemini 3.8 Flash TTS third at Elo 1,267 with $16.5, each with its sample count, confidence interval, arena voice count and release month.

Twee van die rijen zijn de rijen die echte projecten bepalen. Het Elo-verschil is 43 punten op de ranglijst voor leveranciersstemmen en 19 op de ranglijst voor gekloonde stemmen — de Sonic-lijn verkleint de kloof met meer dan de helft wanneer de sprekers constant worden gehouden. Dat is het kenmerk van een model waarvan de tuning concurrerend is en de standaard stemmencast niet, en het vertelt je dat het probleem van Sonic in deze matchup presentatie is, niet synthesekwaliteit.

Waarom het prijsverschil kleiner is dan het lijkt

De tariefvergelijking in de kop is in beide richtingen misleidend. De $0,022 per duizend tekens van Eleven v4 is een promotietarief met een vervaldatum van 12 oktober; het tarief dat de actieperiode overleeft, is $0,08, wat meer dan 60% boven de tariefkaart van Sonic 3.6 ligt. Maar de arena-normalisatie houdt geen rekening met de promotie: ze prijst de modellen tegen hun lijsttarieven en komt uit op $80,00 tegenover $49,00, en dat is de vergelijking die in november nog steeds standhoudt.

Er is nog een tweede complicatie. Cartesia publiceert geen tarief per teken op de productpagina, dus het cijfer van $ 0,049 komt uit de arena-normalisatie en niet van de leverancier, en de twee meetwaarden komen mogelijk niet exact overeen — normalisatie doet aannames over hoe een provider factureert. Beschouw de rangorde als betrouwbaar en de precieze percentages als benaderend.

Een uitgewerkte maand bij vijf miljoen tekens: Eleven v4 kost met het promotietarief $110, en $400 na 12 oktober. Sonic 3.6 kost $245. De komende twee weken is Eleven v4 dus minder dan de helft van de kosten van Sonic, en daarna is het 63% hoger. Iedereen die vandaag een inkoopvergelijking schrijft en die volgende maand uitbrengt, krijgt dit verkeerd om, tenzij erbij wordt vermeld welk tarief is gebruikt.

Het segment waarin Sonic 3.6 het juiste antwoord is

Er zijn productie-spraakworkloads waarbij de arena-ranglijsten niet meten wat ertoe doet, en Sonic 3.6 is daarvoor gebouwd.

Real-time conversationele agents zijn het duidelijkste geval. Latentie onder de 90 ms is in een telefoonagent geen marketingcijfer; het is het verschil tussen een onderbreking die afgehandeld aanvoelt en het gevoel hebben dat een oproep is weggevallen, en ElevenLabs publiceert geen vergelijkbaar cijfer voor Eleven v4 zelf — alleen voor de Turbo-tier bij ongeveer 150 ms mediaan tot de eerste spraak. Als het socketbudget van je agent krap is, kunnen de 43 Elo-punten voor jou minder waard zijn dan de milliseconden, en je eigen barge-in-tests zullen dit sneller beslechten dan welke ranglijst dan ook.

Gereguleerde uitrol is de tweede. Cartesia vermeldt HIPAA, SOC 2 Type 2, GDPR en PCI op de productpagina. Een compliance-lijst is geen Elo en kan er niet door worden vervangen; als een reviewer uit de gezondheidszorg of de betalingssector in je releasepad zit, weegt die rij van het scorebord zwaarder dan de andere negen.

A screenshot of Cartesia's Sonic product page, captured in English, headed 'Sonic: The fastest and most natural text to speech model' with the claim 'Ranked #1 for naturalness, sub-90ms latency, and natively multilingual across 44 languages', a 'Try Sonic-3.6' button, an 'American English / Jacqueline' voice picker over a support-call sample, a 'Ranked #1 in Speech Arena leaderboard & Speech to Text leaderboard by Artificial Analysis' panel, and a 'Built for Voice Agents' tab strip spanning Naturalness, Reliability, Speed, Scalability, Multilingual, Consistency and Cost.

Deterministische uitspraak is de derde, en die is subtieler. Eleven v4's gedocumenteerde IPA-foneeminvoer is een sterk punt, maar Sonic 3.6's aangepaste uitspraakwoordenboeken zijn de workflow die teams met grote vocabularia van productnamen doorgaans al hebben opgebouwd. Een woordenboek overzetten is echt werk; het model dat het artefact dat je bezit gebruikt, heeft een voorsprong.

Waar Eleven v4 simpelweg het betere model is

Dat gezegd hebbende, de leaderboards meten iets en Eleven v4 won beide. Op Provider Voice leidt het met 43 punten op Sonic 3.6, met 1.674 samples die de schatting onderbouwen, en het vorige vlaggenschip — ElevenLabs Eleven v3 op 1.169 — staat 107 punten achter Sonic 3.6, wat betekent dat ElevenLabs in één generatie een echte kloof heeft gedicht in plaats van een voorsprong te verdedigen.

Het aantal talen is de tweede ondubbelzinnige overwinning. Meer dan 90 tegenover 44 is ongeveer het dubbele, en voor een product dat verder gaat dan Engels en een handjevol Europese talen, is dat eerder een kwestie van dekking dan van kwaliteit — Sonic 3.6 heeft voor sommige van uw locales misschien helemaal geen stem. En het verwerken van dialogen met meerdere sprekers plus inline voordrachtsaanwijzingen vormen een wezenlijk verschil in capaciteiten: het schrijven van een lach in het script is een workflow die Sonic 3.6 niet documenteert, en het reproduceren van dat effect op een model zonder die mogelijkheid betekent nabewerking of een tweede opname, wat meer kost dan het Elo-verschil doet vermoeden.

Een van beide uitvoeren, en het deel waar we niet mee kunnen helpen

OrcaRouter host geen van deze modellen. ElevenLabs en Cartesia staan niet in onze catalogus, dus niets uit deze vergelijking kan via ons worden aangeroepen, en het eerlijke antwoord op "hoe krijg ik het op OrcaRouter" is dat dat niet kan — je gaat naar de leverancier. Wat wij wel behandelen, is het geval waarin een spraakstack meerdere providers beslaat in plaats van één: één enkele API-sleutel voor meer dan 200 modellen, met de lijstprijzen van de providers doorgegeven tegen 0% opslag zodat een prijswijziging van een leverancier bij ons dezelfde dag ingaat waarop die ingaat. Voor een beslissing die ervan afhangt of je $110 of $400 betaalt voor de tekens van dezelfde maand, is die timing niet niks.

Waar een spraakpad klantgericht is en niet mag wegvallen, verplaatst automatische failover het verkeer naar een gezonde upstream wanneer er één verslechtert. Dat is het patroon waardoor een promotievenster van twee weken de moeite waard is om te benutten: je kunt productie twee weken lang naar het goedkopere model laten wijzen zonder de integratie te herschrijven, en weer teruggaan wanneer het tarief terugkeert.

Wie moet overstappen, en wie moet wachten?

Stap over op Eleven v4 als je product wordt beoordeeld op hoe het klinkt, als je in meer dan een paar dozijn talen uitbrengt, of als je gebruikers de stem horen die de leverancier voor hen heeft gekozen — die laatste groep is precies de groep die het Provider Voice-board vertegenwoordigt, en de kloof daar is de grootste van alle rijen.

Blijf op Sonic 3.6 als je realtimegesprekken uitvoert binnen een latentiebudget, als een compliance reviewer je stack goedkeurt, of als je een uitspraakwoordenboek hebt dat je je niet kunt veroorloven opnieuw op te bouwen. Op die drie punten loopt Sonic niet achter; het is de enige optie met een gepubliceerd antwoord.

Wacht, in beide gevallen, als je beslissing afhangt van de prijs. Over twee weken verandert de tariefkaart van Eleven v4 met een factor van bijna vier en die van Sonic 3.6 niet, en een vergelijking die vandaag wordt geschreven, zal medio oktober als onjuist worden gelezen. De Elo-rangorde blijft nog steeds overeind. Het geld niet.