Een herokaart voor 'ElevenLabs Eleven v4 vs Qwen-Audio-3.1-TTS-Plus' met twee scorekaarten: Qwen-Audio-3.1-TTS-Plus op Elo 1.178, rang 1 en $19,30 per 1 miljoen tekens; ElevenLabs Eleven v4 op Elo 1.157, rang 2 en $80,00 per 1 miljoen tekens; met als bijschrift '21 Elo-punten tegenover een viervoudig prijsverschil'. Voettekst: 'Controlled Voice Arena, volgens Artificial Analysis, sept. 2026.' Het OrcaRouter-logo staat in de rechteronderhoek.
Engineering & Research

Eleven v4 vs Qwen Audio 3.1: De goedkoopste stem op het bord won het

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Op de ranglijst waar elke deelnemer dezelfde acht gekloonde stemmen krijgt, Alibaba Qwen-Audio-3.1-TTS-Pluseindigde als eerste met een Elo van 1.178 en ElevenLabs Eleven v4eindigde als tweede met 1.157. Het model dat won kost $19,30 per miljoen tekens op die ranglijst. Het model dat tweede werd kost $80,00. Dat is een kwaliteitsverschil van 21 punten en een vier keer zo grote prijskloof die in tegengestelde richting wijzen, en het is het meest interessante resultaat van de hele lanceerweek — interessanter dan de eerste plaats die ElevenLabs in de andere arena innam, want daar is de volgorde conventioneel en is de winnaar de duurste stem in de top tien.

De twee ranglijsten zijn niet uitwisselbaar, en de reden dat deze confrontatie zo uitpakt, zit volledig in welke je bekijkt. Bij Provider Voice beoordelen luisteraars de eigen stemmen van elke leverancier. Controlled Voice kloont dezelfde acht stemmen — vier Amerikaanse, vier Britse — voor elk model, zodat niemand kan winnen op basis van de standaardstemmencast. ElevenLabs wint de eerste met 61 punten. Alibaba wint de tweede met 21 punten. Geen van beide ranglijsten is fout, en de tweede is degene die voorspelt dat een product een gekloonde merkstem meelevert.

A two-column scoreboard for Qwen-Audio-3.1-TTS-Plus and ElevenLabs Eleven v4. Qwen: Controlled Voice rank 1 Elo 1,178; Provider Voice rank 4 Elo 1,258 on the 3.0 build; $19.30 per 1M chars; rate card not publicly readable; 3.1 on one board and 3.0 on the other; documentation not readable publicly. Eleven v4: Controlled Voice rank 2 Elo 1,157; Provider Voice rank 1 Elo 1,319; $80.00 per 1M chars; $0.022 per 1K until Oct 12; v4 on both boards; 90-plus languages and a 10,000-character cap. Footer: 'All ranks, Elo and board prices per Artificial Analysis; Qwen rate card not readable.'

Het scorebord met gecontroleerde stem, in zijn geheel

• Blinde voorkeur, gematchte clones — Qwen-Audio-3.1-TTS-Plus rang 1, Elo 1.178, $19,30 per miljoen tekens vs Eleven v4 rang 2, Elo 1.157, $80,00.

• Blinde voorkeur, de eigen stemmen van elke leverancier — Eleven v4 rang 1, Elo 1.319 versus Qwen-Audio-3.0-TTS-Plus rang 4, Elo 1.258. Een gat van 61 punten de andere kant op.

• Prijs, arena-normalisatie — Qwen $19,30 vs Eleven v4 $80,00. Qwen is 76% goedkoper.

• Prijs, tariefkaart van leverancier — Eleven v4 $0,022 per duizend tekens als promotietarief en $0,08 na 12 oktober. De eigen tariefkaart van Qwen Audio 3.1 konden we niet lezen, dus de arena-normalisatie is de enige prijs waarop we kunnen vergelijken.

• Versie op elk board — 3.1 op Controlled Voice, 3.0 op Provider Voice. Het zijn verschillende modellen en de boards zijn niet onderling uitwisselbaar.

• De 3.0-vermelding op Controlled Voice — rang 5, Elo 1.124, dezelfde prijs van $19,30. De 3.1-release is 54 Elo meer waard dan zijn eigen voorganger bij een identieke prijs.

• Qwens eerdere generaties op Provider Voice — Qwen3 TTS Flash rang 79, Elo 944; Qwen3 TTS rang 82, Elo 930.

• ElevenLabs' eigen vorige vlaggenschip op Controlled Voice — Eleven v3 rang 7, Elo 1.073.

• Sanitycheck van gegroepeerde staven — de achtvoudige spreiding van rang 1 tot rang 10 op Controlled Voice is 121 Elo. De voorsprong van 21 punten van Qwen op Eleven v4 is minder dan een vijfde van het bereik van het hele veld, wat de juiste schaal is om die aan te houden.

A screenshot of the Artificial Analysis Controlled Voice Arena leaderboard, captured in English, showing Alibaba Qwen-Audio-3.1-TTS-Plus first at Elo 1,178 and $19.3 per 1M chars with 1,269 samples, ElevenLabs Eleven v4 second at Elo 1,157 and $80.0 with 1,483 samples, Cartesia Sonic 3.6 fourth at Elo 1,138, and Alibaba Qwen-Audio-3.0-TTS-Plus fifth at Elo 1,124 at the same $19.3 price, over the page subtitle 'Compare Text to Speech (TTS) models using the same 8 cloned voices (4 US, 4 UK)'.

Twee rijen daar doen het meeste werk. De eerste is de vergelijking tussen 3.0 en 3.1: Alibaba veranderde met 54 Elo in één versie-update zonder de prijs ook maar enigszins te wijzigen. Dat is een sneller tempo dan de 84-punts verschuiving van v3 naar v4 bij ElevenLabs, en het betekent dat de specifieke rangorde in dit artikel een momentopname is die beide leveranciers actief aan het veranderen zijn.

Het tweede is de totale spreiding van 121 punten. Een verschil van 21 punten op een scorebord waarvan het bruikbare bereik ongeveer 120 punten is, is een reëel maar bescheiden verschil — ongeveer dezelfde grootteorde als het verschil tussen Qwen's eigen 3.1 en zijn 3.0. Als jouw gebruiksscenario in een taal zit waarop geen van beide modellen is afgestemd, valt die marge ruim binnen het bereik dat een paar moeilijke testscripts kunnen omverwerpen.

Het versieprobleem dat niemand signaleert

Het resultaat dat circuleert als "Eleven v4 staat tweede op Controlled Voice" is juist en onvolledig, en die weglating is van belang voor iedereen die op basis daarvan plannen maakt. Het model dat op die ranglijst boven Eleven v4 staat, is Alibaba's 3.1-release. De Qwen-vermelding op de Provider Voice-ranglijst is ondertussen de 3.0-release — het 3.1-model komt niet voor in de bovenste rijen van die ranglijst zoals wij die lezen. Dus de twee koppen — "Eleven v4 is nummer één" en "Eleven v4 is nummer twee" — zijn uitspraken over twee verschillende Qwen-modellen bij twee verschillende taken, en de Qwen-versie die het op de ene ranglijst versloeg, is niet de Qwen-versie die het op de andere versloeg.

Dit is geen strikvraag over een van beide leveranciers; het is een reden om elke samenvatting in één zin van een week als deze te wantrouwen. Als je tussen deze twee systemen kiest, is de vergelijking die je wilt: 3.1 tegenover v4 op je eigen gekloonde stem, in je eigen taal, en geen van beide leveranciers heeft die gepubliceerd.

Wat we wel en niet kunnen zeggen over Qwen Audio 3.1

Eerlijkheid over bewijs is hier meer waard dan een volledige specificatietabel, dus hier is de grens van waarop dit artikel steunt. Uit de arena-ranglijsten hebben we, voor Qwen-Audio-3.1-TTS-Plus: een Elo voor gecontroleerde stem van 1.178, een prijsnormalisatie van $19,30 per miljoen tekens, en het feit dat dit de huidige release is in een reeks waarvan de vorige versie bij dezelfde prijs 54 punten lager scoorde.

We hebben ze niet, en zullen er niet naar raden: de taaldekking, de latentie, de invoerlimiet per verzoek, of het inline-voordrachtsinstructies ondersteunt, of het stemklonen biedt buiten de acht stemmen van de arena, of wat het volgens zijn eigen tariefkaart in rekening brengt. Die zijn allemaal gedocumenteerd voor Eleven v4 — meer dan 90 talen, een limiet van 10.000 tekens, audiotags, directe stemklonen in tien seconden, IPA-foneemondersteuning — en hun afwezigheid aan de Qwen-kant is een hiaat in wat publiekelijk leesbaar is, niet een minpunt voor het model. Een aankoopbeslissing die alleen op dit artikel is gebaseerd, zou een beslissing op basis van twee getallen zijn.

A screenshot of Artificial Analysis' Eleven v4 model page, captured in English, headed 'Eleven v4 Quality Elo, Speed & Price Analysis' and labelled 'ElevenLabs, Family ElevenLabs, Elo 1318.77', with the Provider Voice Arena Preference Elo chart showing Eleven v4 first at 1,319 ahead of Sonic 3.6 at 1,276 and Gemini 3.8 Flash TTS at 1,267, a '27 of 96 models' selector, and the Pricing section heading below.

Eén contrast overleeft die beperking wel, omdat beide kanten door de leverancier zijn opgegeven of beide door het board zijn opgegeven. Op het vlak van prijs is de board-normalisatie de gemene deler, en die begunstigt Qwen met 76%. Op het vlak van kwaliteit bij overeenkomstige sprekers begunstigt hetzelfde board Qwen met 21 Elo. Die twee rijen zijn vergelijkbaar. Al het overige hier is dat niet, en het artikel zal niet doen alsof dat wel zo is.

Waarom een gecontroleerde raad van bestuur zwaarder zou moeten wegen dan gewoonlijk

De meeste stemvergelijkingen vallen standaard terug op welke ranglijst dan ook die het model dat je al leuk vindt bovenaan zet. In deze confrontatie is er een principiële reden om Controlled Voice te verkiezen, en die is specifiek in plaats van algemeen.

Alibaba en ElevenLabs concurreren met totaal verschillende troeven. Het voordeel van ElevenLabs is een stemmenbibliotheek die in jaren van zorgvuldig samengestelde casting is opgebouwd; dat van Alibaba is een onderzoeksorganisatie die modelversies in een hoog tempo uitbrengt. Een ranglijst waarop elke deelnemer zijn eigen stemmen mag inbrengen, meet de bibliotheek net zo goed als de synthesizer, en op die ranglijst wint ElevenLabs met 61 punten. Haal de bibliotheken eruit — voor iedereen dezelfde acht gekloonde stemmen — en het voordeel wisselt van eigenaar. Als de stem die uw gebruikers horen een kloon van een specifiek persoon is, koopt u niet de bibliotheek van ElevenLabs, dus de gecontroleerde ranglijst is degene die uw aankoop beschrijft. Als u uit een menu met standaardstemmen kiest, geldt het omgekeerde en is de 61-puntsmarge van Eleven v4 het getal dat telt.

Er is een tweede, minder comfortabele reden om het gecontroleerde resultaat zwaarder te wegen. Een board met leveranciersstemmen beloont een onderscheidende standaardbezetting, en een onderscheidende bezetting kan op manieren polariseren die een gemiddelde Elo verbergt — wat voor de ene luisteraar karaktervol is, is voor de andere geaffecteerd. Een board met gekloonde stemmen en op elkaar afgestemde sprekers haalt die variabele volledig weg, waardoor het de meer reproduceerbare meting van de twee is.

Het uitvoeren van een van beide, en wat we daadwerkelijk routeren

OrcaRouter host noch de spraakmodellen van ElevenLabs, noch die van Alibaba. Geen van beide leveranciers staat in onze catalogus, dus er is geen manier om een van beide via ons aan te roepen, en dit artikel zal niet anders suggereren — voor beide ga je naar de eigen API van de leverancier en naar verschillende platforms van derden.

Wat we wél dekken is de laag erboven. Als je spraakstack één node is in een grotere pijplijn, dan leveren wij meer dan 200 modellen achter één API-sleutel, met de lijstprijzen van de aanbieder doorgegeven tegen 0% opslag, zodat een prijsherziening bij welke upstream dan ook — inclusief het promotievenster van ElevenLabs en de veel hogere lijstprijs die daar op 12 oktober op volgt — aan onze kant wordt weerspiegeld op de dag dat die plaatsvindt en niet pas bij de volgende factureringscyclus. Voor een beslissing die draait om een prijsverhouding van 4x is die timing het verschil tussen een vergelijking die goed veroudert en een die over drie weken als onjuist overkomt.

En waar het spraakpad niet kan worden gevolgd, verplaatst automatische failover het verkeer naar een gezonde upstream in plaats van het verzoek te laten mislukken. Bij een confrontatie die zo dicht bij elkaar ligt qua kwaliteit en zo scheef is qua prijs, is de verstandige architectuur beide modellen achter één endpoint, waarbij de routering de verdeling bepaalt — niet een permanente keuze op basis van een momentopname van een leaderboard die beide leveranciers binnen een kwartaal achterhaald zullen maken.

Het vonnis, en de vervaldatum ervan

Kies Qwen-Audio-3.1-TTS-Plus als je een stem kloont en op de kosten let. Het staat bovenaan de ranglijst die de sprekers constant houdt, het kost ongeveer een kwart van de prijs, en zijn lijn beweegt sneller — 54 Elo in één versiestap bij een ongewijzigd tarief suggereert dat de volgende versie op papier een betere gok is dan de huidige.

Kies Eleven v4 als je gebruikers standaardstemmen horen, als je dekking nodig hebt in talen die je kunt verifiëren voordat je verzendt, of als de gedocumenteerde functieset — audiotags, foneemcontrole, verzoeken van 10.000 tekens, clones van tien seconden — werk verricht in je product dat de arena boards niet meten. Zijn voorsprong van 61 punten op de vendor-voice board is niet niets, en de twee functies die je in een script kunt schrijven zijn capaciteiten, geen scores.

Stel een evaluatiedatum vast. Alibaba steeg deze cyclus 54 Elo met een versiebump en ElevenLabs steeg 84 over een volledige generatie, en het promotietarief van Eleven v4 verloopt op 12 oktober. Wat deze vergelijking vandaag ook zegt, de twee feiten die de uitkomst het meest waarschijnlijk kantelen — een release van 3.2 en een teruggedraaide prijs — vallen beide vóór het einde van het kwartaal.