Een herokaart die Qwen-Audio-3.1-TTS vergelijkt met ElevenLabs Eleven v3, met vermelding van Qwens 16 talen plus 20 dialecten, een prijsverlaging van 70% en het ontbreken van een arenascore, tegenover ElevenLabs' 74 talen, ongeveer $100 per miljoen tekens en een Elo van 1.168, boven een lint met de tekst 'Aangekondigd op Apsara, 23 september 2026'.
Guides & Insights

Qwen-Audio-3.1 vs ElevenLabs: Een prijsverlaging van 70% ontmoet de gevestigde speler

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

De leverancier verlaagde de prijs van zijn Qwen-Audio-3.1-TTS-API met ongeveer 70% op 23 september 2026, aangekondigd op het podium tijdens de Apsara Conference in Hangzhou, samen met vier andere spraakmodellen. Dat ene cijfer is de reden dat deze vergelijking het waard is om te schrijven: ElevenLabs Eleven v3 is de standaard productiestem geweest voor de meeste westerse teams tegen een effectief tarief van bijna $100 per miljoen tekens, en een geloofwaardige uitdager heeft net hetzelfde werk opnieuw geprijsd tegen een fractie daarvan, terwijl tegelijkertijd de taaldekking werd uitgebreid. De twee systemen zijn niet gelijkwaardig — Qwen-Audio-3.1-TTS is een uitsluitend gehoste API van het Tongyi Lab van de leverancier met een kleiner stemecosysteem, terwijl ElevenLabs een volwaardig contentplatform is met de diepste stemmenbibliotheek in de industrie. Maar als je beslissing ooit door de factuur werd bepaald, is de rekensom deze week veranderd.

Wat is er op 23 september daadwerkelijk uitgebracht?

Qwen-Audio-3.1 is niet één model. Het is een vernieuwing met vijf modellen van Alibaba's volledige spraakstack, en de niveaus doen ertoe omdat ze verschillende prijzen en verschillende taken hebben:

Qwen-Audio-3.1-TTS — de directe opvolger van het synthesemodel dat de meeste teams gebruiken. Voegt zeven talen toe voor een totaal van 16, behoudt de 20 Chinese dialectregio's, voegt natuurlijke klankkleuroverdracht tussen talen toe (één stem die meegaat over Mandarijn, Kantonees, Engels en Japans), op instructies gebaseerde controle van emotie, tempo en voordrachtsstijl, en verwerkt ruisige, galmende of anderszins slechte referentie-audio zonder een aparte ruisonderdrukkingsmodus.

Qwen-Audio-3.1-TTS-Next — een nieuwe laag, en een ander product. Alibaba noemt het een "Audiogen"-model: het genereert in één keer stem, geluidseffecten en achtergrondambiance op basis van tekst, tijdstempels en referentieaudio. Dialogen met meerdere sprekers, podcasts, film- en tv-geluidlandschappen, uitvoer in 48 kHz. Volgens de Model Studio-documentatie van Alibaba Cloud accepteert het maximaal 3.000 tekens aan invoer, is gegenereerde audio beperkt tot 240 seconden voor podcasts en 120 seconden in andere gevallen, draait het op 3 verzoeken per seconde en retourneert het WAV, MP3 of PCM.

Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next en Qwen-Audio-3.1-Realtime — respectievelijk herkenning, audiobegrip (emotie, muziek, omgevingsgeluid, lokalisatie van gebeurtenissen) en full-duplex gesprek. Realtime is degene die Alibaba de hardware in duwt: Qwen Office, Qoder, QwenNote A2, de QwenNote Eva-desktoprobot en de Qwen AI-bril.

De prijsverlagingen golden voor de hele productlijn, niet alleen TTS: synthese ongeveer 70% omlaag, realtime ongeveer 85% omlaag, herkenning tot wel 95% omlaag. Alibaba heeft ook Qwen-Audio-Agent open source gemaakt, een framework voor het bouwen van realtime spraakagenten, en introduceerde Qwen3.8-LiveTranslate, waarbij de latentie onder de 2,5 seconden werd gebracht.

A screenshot of Alibaba Cloud Model Studio's English documentation site showing the reference page for qwen3.8-livetranslate-flash-realtime, a real-time audio and video translation model that accepts audio and images and outputs text and audio across 60 input languages and 29 speech output languages, under an Apsara 2026 Conference banner, with the Speech-to-Speech branch of the navigation listing the qwen-audio-3.0 realtime models.

Het scorebord

A two-column scoreboard for Qwen-Audio-3.1-TTS and ElevenLabs Eleven v3 across price, languages, weights, voice library, delivery control and arena score, with a footer stating that the Qwen figures are vendor-reported and unscored and the ElevenLabs figures are per Artificial Analysis.

Prijs — Qwen-Audio-3.1-TTS: ongeveer 70% lager dan de vorige Qwen-Audio-generatie, waarbij de 3.0 Plus-tier rond $27,60 per 1M tekens lag en de Flash-tier rond $15. ElevenLabs Eleven v3: ongeveer $100 per 1M tekens volgens Artificial Analysis, met Flash op ongeveer $50.

Talen — Qwen-Audio-3.1-TTS: 16 talen plus 20 Chinese dialectregio's. ElevenLabs Eleven v3: 74 talen.

Gewichten — Qwen-Audio-3.1-TTS: gesloten, alleen gehost op Alibaba Cloud Model Studio. ElevenLabs Eleven v3: gesloten, alleen gehost.

Stembibliotheek — Qwen-Audio-3.1-TTS: native klonen plus timbreoverdracht tussen talen; geen vergelijkbare publieke marktplaats. ElevenLabs: de grootste gedeelde stembibliotheek in de branche, plus direct klonen op basis van ongeveer 30 seconden audio.

Voordrachtscontrole — Qwen-Audio-3.1-TTS: op instructies gebaseerde emotie, tempo en stijl, met overname van de 86 inline voordrachtstags die met 3.0 zijn geïntroduceerd. ElevenLabs Eleven v3: audiotags plus het omliggende platform (dubbing, agents, studio).

Onafhankelijke benchmark — Qwen-Audio-3.1-TTS: nog geen. ElevenLabs Eleven v3: 1.168 Elo op de Provider Voice Arena-ranglijst van Artificial Analysis per augustus 2026.

Waar de challenger echt wint

Drie dingen, en slechts één ervan is prijs.

Prijs, uiteraard. Een verlaging van 70% ten opzichte van een gevestigde aanbieder die $100 per miljoen tekens rekent, is geen afrondingsverschil. Het is het verschil tussen een product waarmee je prototypeert en een product dat je aan elke gebruiker uitlevert. Als je op grote schaal narratie genereert, is de jaarlijkse besparing geen begrotingspost waarvoor je intern hoeft te pleiten — die pleit voor zichzelf.

Chinees, ondubbelzinnig. Twintig Chinese dialectregio's vormen een slotgracht waar niets van wat ElevenLabs biedt in de buurt komt. Als je product Chinese gebruikers op het vasteland bedient, of Kantonees-sprekers, of een diaspora-publiek dat midden in een zin van taal wisselt, is de vergelijking al voorbij voordat ze begint.

Cross-linguale timbre-overdracht. Qwen-Audio-3.1-TTS neemt één stem en draagt die op natuurlijke wijze over tussen Mandarijn, Kantonees, Engels en Japans. Dat is een specifieke capaciteit met een specifieke use case — één merkstem die een taalwissel overleeft — en het is een echt onderscheidend vermogen voor iedereen die één presentator lokaliseert in plaats van voor elke markt een nieuwe te casten.

Waar ElevenLabs nog steeds wint, en het is niet eens close

Taalbreedte is het eerste, en het is het grootste. Vierenzeventig talen tegenover zestien is geen kloof die je dicht met een prijsaankondiging. Als je uitbrengt in het Pools, Turks, Vietnamees en Portugees, dekt ElevenLabs je vandaag en Qwen-Audio-3.1-TTS niet.

Het tweede is het ecosysteem. ElevenLabs is geen synthese-endpoint; het is een contentplatform. Een gedeelde stemmenbibliotheek die je kunt licentiëren in plaats van klonen, dubbing-workflows, agentinfrastructuur, een studioproduct, een gedocumenteerd API-oppervlak met jaren aan clientbibliotheken erachter. Weg migreren daarvan is een project, geen configuratiewijziging, en de teams die erop hebben gebouwd weten precies wat ze zouden opgeven.

Het derde is iets moeilijker te benoemen en toch de moeite waard om te benoemen: de perceptie van natuurlijkheid bij één enkele Engelse stem. Qwens synthese was historisch uitstekend in het Chinees en slechts zeer goed in het Engels, en hoewel de release van 3.1 beweert de meertalige weergave te verbeteren, is er nog geen onafhankelijke luistertest van het nieuwe model. Iedereen die je vertelt dat hij weet hoe de nieuwe Qwen-stem in het Engels klinkt, gokt.

Het getal dat nog niemand zou moeten citeren

Dit is het deel van het verhaal dat in de berichtgeving wordt verminkt, dus hier staat het ronduit. Qwen-Audio-3.1-TTS heeft geen onafhankelijke benchmarkscore. Zijn voorganger, Qwen-Audio-3.0-TTS-Plus, stond medio augustus 2026 op 1.234 Elo op het Provider Voice Arena-leaderboard van Artificial Analysis, tussen de tweede en vijfde plaats op die ranglijst. Qwen-Audio-3.1-TTS is nog niet aan een arena toegevoegd. Elke kwaliteitsclaim in Alibaba's lanceringsmateriaal is door de leverancier gerapporteerd en niet gereproduceerd.

Dat maakt de beweringen niet onwaar. Het maakt ze ongeverifieerd, en het betekent dat de eerlijke voorstelling van deze confrontatie op dit moment is: het ene model met een prijs en geen score, tegenover het andere model met een score en een veel hogere prijs. Alles wat sterker is dan dat, is speculatie gehuld in de kleren van een benchmark.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard in its August 2026 state, ranking text-to-speech models by Elo: Cartesia Sonic 3.6 first at 1,277, Alibaba's Qwen-Audio-3.0-TTS-Plus at 1,234 and ElevenLabs Eleven v3 at 1,168.

Dezelfde discipline geldt voor latentie. Het meest in het oog springende first-tokencijfer van Alibaba voor de ASR-kant van deze familie — 92 milliseconden — komt uit de eigen benchmark voor hoge gelijktijdigheid van het bedrijf op een 0,6B-specificatie, niet uit tests door derden, en sinds de lancering gepubliceerde analyse merkt op dat ASR en TTS afzonderlijke producten in een pijplijn zijn in plaats van één end-to-endmodel, en dat meldingen uit de community beschrijven dat latentie zich in lange dialogen opstapelt volgens een pseudo-streamingpatroon. Behandel de latentiecijfers van leveranciers voor deze hele familie als bovengrenzen, niet als gemeten ervaring.

Wat de prijsverlaging in de praktijk waard is

Neem een realistische werklast: een product dat per maand 20 miljoen tekens aan narratie synthetiseert in het Engels en het Mandarijn. Bij het tarief van ongeveer $100 per miljoen tekens voor ElevenLabs Eleven v3 komt dat neer op ongeveer $2.000 per maand, of $24.000 per jaar. Bij het tarief van Qwen-Audio-3.0-TTS-Plus van ongeveer $27,60 per miljoen was datzelfde volume al ongeveer $552 per maand. Pas de korting van ~70% toe die Alibaba op 23 september aankondigde, en dezelfde werklast komt uit op een paar honderd dollar per maand.

Geen van die cijfers zijn lijstprijzen waarop je een overeenkomst kunt sluiten — ElevenLabs factureert in credits via abonnementsniveaus, en Alibaba's kortingen zijn procentuele verlagingen ten opzichte van tarieven die per regio en per niveau verschillen. Maar de vorm van de vergelijking is ondubbelzinnig, en op die vorm baseer je je budget.

Eén kanttekening die het waard is om te noemen voor iedereen die dit zorgvuldig modelleert: Alibaba Cloud heeft zijn facturering voor realtime transcriptie op het Singapore-knooppunt verplaatst van meting op basis van duur naar meting op basis van tokens, tegen $0,93 per miljoen invoertokens en $0,70 per miljoen uitvoertokens. Tokenfacturering is minder voorspelbaar dan facturering op basis van duur wanneer je geen controle hebt over hoeveel tokens een bepaald audiofragment wordt, en ruis, stilte en context over meerdere beurten blazen het tokenverbruik allemaal op. Een aangekondigde korting van 70% vertaalt zich niet automatisch in een besparing van 70% op jouw specifieke verkeer.

Hoe je de switch daadwerkelijk kunt gebruiken

Als je dit evalueert, is het nuttige om te weten wat een migratie je aan engineeringtijd kost. Beide modellen zijn gesloten, gehoste API's, dus je integreert hoe dan ook met een HTTP-endpoint, en het werk bestaat uit een client, een retrybeleid en een steminventaris — geen herarchitectuur.

Dat is waar de vorm van OrcaRouter helpt, met eerst één eerlijke kanttekening: wij routeren Qwen-Audio-3.1-TTS of welk Qwen-Audio-model dan ook niet. De spraakeindpunten van Alibaba vallen buiten ons bereik, en hetzelfde geldt voor ElevenLabs. Wat wij wél dekken, is de inferentielaag eromheen — één API-sleutel voor meer dan 200 tekstmodellen tegen 0% opslag, wat betekent dat de lijstprijs van de provider rechtstreeks wordt doorgegeven, zodat een prijsverlaging van een leverancier dezelfde dag al bij ons actief is in plaats van pas na een herprijzingsronde. Voor teams die de applicatie bouwen die de aanjager is van een spraakpijplijn — de samenvatter, de scriptgenerator, de contentplanner — betekent dat één contract in plaats van meerdere, automatische failover wanneer een upstream verslechtert, en een routerings-DSL om modellen tot één enkele aanroep samen te stellen. Het betekent niet dat je de stem van Qwen via ons aanroept. Wie je iets anders vertelt, heeft de catalogus niet gelezen.

Wie moet zich verplaatsen, en wie moet wachten

Stap nu over als je werklast Chinees-eerst is, als dialectdekking op je eisenlijst staat, als volumekosten de beperking zijn die je op een goedkopere-maar-slechtere stem heeft gehouden, of als je één merkstem nodig hebt die een taalwisseling overleeft. De prijsstelling van 23 september maakt de kosten-batenafweging moeilijk te betwisten, en de kwaliteit van het Chinees was daarvoor al concurrerend.

Wacht als je in meer dan ongeveer zestien talen uitbrengt, als je product afhankelijk is van een licentieerbare stemmenbibliotheek in plaats van klonen, als je diep zit in de dubbing- of agent-tooling van een platform, of als je inkoopproces een onafhankelijke kwaliteitsscore vereist vóór goedkeuring. Geen daarvan is een permanente blokkade, maar geen ervan werd aangepakt door een prijsverlaging.

En let op één ding in het bijzonder: of Qwen-Audio-3.1-TTS op een blind-listeningarena verschijnt. Op het moment dat dat gebeurt, gaat deze vergelijking niet meer over prijs en aantallen talen, maar over de vraag of de goedkopere stem echt net zo goed is. Dat is de vraag die de launch niet heeft beantwoord.