
Qwen-Audio-3.1-TTS vs Qwen-Audio-3.0-TTS: wat twee maanden opleverden
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 495 tok/s
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 186 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 114 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
Qwen-Audio-3.0-TTS werd op 20 juli 2026 uitgebracht en schoot meteen naar de top van de onafhankelijke spraakranglijsten — de Plus-tier bereikte 1.238 Elo op de Provider Voice Arena-ranglijst van Artificial Analysis, de tweede plaats op de lijst. Negen weken later, op 23 september 2026, kondigde de leverancier Qwen-Audio-3.1-TTS aan tijdens de Apsara Conference in Hangzhou, met een prijsverlaging van ongeveer 70%. Die timing maakt dit een ongewone vergelijking: het model dat wordt vervangen is niet verouderd, het is gebenchmarkt, bewezen en nog steeds bijna aan de top. De echte vraag is dus niet welk model beter is. Het is wat er specifiek is veranderd, of iets daarvan relevant is voor jouw workload, en wat er gebeurt met de score die je al vertrouwt wanneer de opvolger helemaal niet is gescoord.
Twee maanden, vijf eindpunten, één familie
Alibaba heeft niet één enkel model uitgebracht. De release 3.1 omvat er vijf: Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next, Qwen-Audio-3.1-TTS, Qwen-Audio-3.1-TTS-Next en Qwen-Audio-3.1-Realtime. Voor iedereen die momenteel Qwen-Audio-3.0-TTS aanroept, is slechts één daarvan een drop-invervanging — de gewone TTS-laag — en één is een echt nieuw product in plaats van een upgrade.
Die tweede is het waard om te begrijpen, zelfs als je hem nooit aanroept. Qwen-Audio-3.1-TTS-Next is wat Alibaba een "Audiogen"-model noemt: één enkele doorgang die spraak, geluidseffecten en achtergrondambiance samen produceert op basis van tekst, tijdstempels en referentieaudio. Dialoog met meerdere sprekers, podcastmontage, geluidslandschappen voor scènes, 48 kHz-uitvoer. De Model Studio-documentatie van Alibaba Cloud vermeldt de limieten duidelijk — 3.000 tekens invoer, 240 seconden gegenereerde audio voor podcasts en 120 seconden anders, 3 verzoeken per seconde, uitvoer in WAV, MP3 of PCM, en het accepteert tot drie referentieclips van elk 30 seconden in WAV, MP3 of OGG Opus. Ruwe PCM-referentie-invoer wordt niet ondersteund. Het kost $0,848 per miljoen invoertokens en $1,696 per miljoen uitvoertokens op de Beijing-node, exclusief promotietarieven, en het ondersteunt alleen Chinees en Engels.
Als je op 3.0-TTS zit en je taak is "dit script omzetten in een stem", dan verandert niets daarvan je integratie. Als je taak is "een podcast met twee hosts en muziekbedden samenstellen", dan is 3.1-TTS-Next een andere productcategorie en mogelijk de reden om deze release überhaupt te bekijken.
De upgrade, regel voor regel

• Talen — Qwen-Audio-3.1-TTS: door de leverancier opgegeven 16 talen, waarvan zeven toegevoegd ten opzichte van de vorige generatie. Qwen-Audio-3.0-TTS: 16 talen zoals vermeld in gepubliceerde berichtgeving over de release van juli.
• Chinese dialecten — Qwen-Audio-3.1-TTS: 20 dialectregio's, overgenomen. Qwen-Audio-3.0-TTS: 20 dialectregio's.
• Timbretransfer tussen talen — Qwen-Audio-3.1-TTS: ja, één stem overgedragen naar Mandarijn, Kantonees, Engels en Japans. Qwen-Audio-3.0-TTS: niet aangeboden.
• Voordrachtssturing — Qwen-Audio-3.1-TTS: instructiegestuurde controle over emotie, tempo en stijl. Qwen-Audio-3.0-TTS: 86 inline-tags voor de voordracht.
• Ruisende referentie-invoer — Qwen-Audio-3.1-TTS: verwerkt ruisende of galmende referentieaudio rechtstreeks, geen aparte ruisonderdrukkingsmodus. Qwen-Audio-3.0-TTS: schone referentieaudio verwacht.
• Onafhankelijke score — Qwen-Audio-3.1-TTS: nog geen. Qwen-Audio-3.0-TTS-Plus: 1.238 Elo op de Provider Voice Arena-ranglijst van Artificial Analysis per augustus 2026.
Het aantal talen klopt niet, en dat maakt uit
Dit is iets kleins dat overal elders zal worden gladgestreken, dus het is de moeite waard om te vermelden. Het lanceringsmateriaal van Alibaba zegt dat de 3.1-TTS-tier zeven talen toevoegt. Gepubliceerde berichtgeving over de 3.0-generatie van juli — waaronder onze eigen vergelijkende stukken uit die maand — vermeldde 16 talen voor de 3.0-tier. Zeven opgeteld bij zestien is drieëntwintig, niet zestien, en Alibaba heeft geen reconciliatie van de twee cijfers gepubliceerd.
Mogelijke verklaringen zijn weinig glamoureus: het aantal voor 3.1 kan een andere set meetellen, het cijfer voor 3.0 kan bij de lancering te hoog zijn voorgesteld, of "voegt zeven toe" kan op de ASR-laag duiden in plaats van op TTS. We weten niet welke. Wat we wel weten, is dat het aantal talen aan beide zijden van deze vergelijking een door de leverancier opgegeven aantal is dat nooit onafhankelijk is gecontroleerd, en dat iedereen die "16 talen" als een hard feit over een van beide modellen citeert, een marketingdia citeert. Controleer de specifieke talen die je nodig hebt aan de hand van de Model Studio-documentatie voordat je een planning op een aantal baseert.

Instructiecontrole is de verandering die daadwerkelijk in code terug te zien is.
Van alles in de 3.1 TTS-release is dit het onderdeel dat verandert hoe je je prompts schrijft. De 3.0-generatie stuurde de voordracht aan via 86 inline-tags — een vaste woordenschat die je moest leren, op de juiste posities moest invoegen, en die precies deed wat er stond en niets meer. De 3.1-versie vervangt dat door instructies in natuurlijke taal: je beschrijft de emotie, het tempo, de stijl die je wilt, en het model interpreteert het.
Het praktische verschil is expressiviteit versus voorspelbaarheid. Een tagvocabulaire is een contract — dezelfde tag levert elke keer dezelfde voordracht op, wat je wilt in een productiepijplijn waarin een stem consistent moet zijn over tienduizend clips. Vrijvormige instructie is breder maar losser, en ze erft het gebruikelijke probleem van promptgevoeligheid: twee formuleringen van "warm maar niet sentimenteel" zullen niet identiek uitpakken, en twee aanroepen van dezelfde formulering op verschillende dagen zullen evenmin identiek uitpakken.
Als je huidige pipeline op die 86 tags is gebouwd, is de upgrade niet gratis. Je ruilt een deterministisch controlevlak in voor een probabilistisch controlevlak, en het werk van het porteren is niet de API-aanroep — het is het opnieuw valideren van elk promptsjabloon dat je hebt tegen de interpretatie van het nieuwe model. Calculeer dat in voordat je de besparingen incalculeert.
Taaloverschrijdende timbre-overdracht, en waar het eigenlijk voor dient
Eén referentiestem, meegenomen over Mandarijn, Kantonees, Engels en Japans heen, die de identiteit behoudt wanneer de taal verandert. Op papier leest dit als een functieopsomming. In de praktijk lost het een specifiek en duur probleem op: één presentator die in meer dan één taal moet bestaan zonder in elke taal als een ander persoon te klinken.
De traditionele workaround is om per taal een aparte stemacteur te casten en te accepteren dat je merkstem nu uit vier stemmen bestaat die één script delen. Het alternatief was om één spreker in elke taal te klonen, precies de workflow waarin gekloonde stemmen de neiging hebben af te dwalen — het accent gaat mee, het timbre wordt dunner, en luisteraars merken het al binnen één zin. Taaloverschrijdende timbreoverdracht is de bewering dat geen van beide compromissen nodig is.
Het is op dit moment ook volledig ongeverifieerd. Er bestaat geen luistertest door derden van Qwen-Audio-3.1-TTS in welke taal dan ook, en de eigen demo's van Alibaba zijn het enige bewijs dat de overdracht standhoudt. Als deze mogelijkheid de reden is dat je de upgrade overweegt, test het dan op je eigen referentieaudio voordat je definitief beslist — dat is een experiment van vijf minuten en het is het enige dat de vraag beantwoordt.
Wat de prijsverlaging doet met een 3.0-rekening
Alibaba verlaagde de spraakprijzen over de hele linie: synthese met ongeveer 70%, realtime met ongeveer 85%, herkenning met maar liefst 95%. De aanpassing trad op 22 september 2026 om 00:00 uur Pekingtijd in werking op Alibaba Cloud Model Studio, bestrijkt de regio's Peking en Singapore en geldt voor de 3.1 TTS- en 3.0 realtime-endpoints. Na de aanpassing staat de TTS Flash-tier op 1,5 yuan per miljoen inputtokens en 12 yuan per miljoen outputtokens; de realtime Flash-tier staat op 1,5 voor tekstinvoer, 6 voor audio-invoer, 4,5 voor tekstuitvoer en 12 voor gecombineerde tekst- en audio-uitvoer, per miljoen tokens.
Dit is het deel dat ertoe doet als je al 3.0-TTS draait. De 3.0 Plus-tier zat tot en met augustus op Artificial Analysis rond $27,60 per miljoen tekens, met de Flash-tier rond $15. Als de verlaging van ~70% geldt voor de tier die je gebruikt, daalt je factuur voor dezelfde workload naar ongeveer een derde van wat die was — zonder dat je ook maar één regel code hoeft te wijzigen. Dat is het ongebruikelijke aan deze release: voor een 3.0-klant is de prijsverlaging meer waard dan de model-upgrade, en die komt er of je nu migreert of niet.
Twee kanttekeningen die het waard zijn om te onthouden. Percentuele kortingen worden genoemd ten opzichte van tarieven die per regio en per tier verschillen, dus de 70% in de kop is geen belofte voor uw specifieke verkeer. En Alibaba Cloud heeft de facturering van realtime transcriptie op het Singapore-knooppunt verplaatst van meting op basis van duur naar meting op basis van tokens — $0,93 per miljoen invoertokens en $0,70 per miljoen uitvoertokens — wat een minder voorspelbare basis is wanneer stilte, ruis en context met meerdere beurten het tokenverbruik allemaal opdrijven. Leg de nieuwe tariefkaart naast uw eigen audio, niet naast het persbericht.
Waar Qwen-Audio-3.0-TTS nog steeds de juiste keuze is
Drie gevallen, en het zijn geen randgevallen.
Wanneer je een getal nodig hebt dat je kunt verdedigen. Qwen-Audio-3.0-TTS-Plus heeft een onafhankelijke Elo van 1.238 — hetzelfde scorebord vermeldt 1.259 voor dat model in september, nog steeds tweede, dus de score is eerder omhooggegaan dan afgezwakt — uit een arena voor blind luisteren met duizenden stemmen erachter. Qwen-Audio-3.1-TTS heeft helemaal geen arenascore. Als je goedkeuringsproces bewijs van derden vereist, is het het oudere model dat dat heeft, en een prijsverlaging verandert dat niet.

Wanneer determinisme het wint van expressiviteit. Als je productiepijplijn is gebouwd op het bedieningsoppervlak met 86 tags, heb je een systeem waarvan je de output kunt beredeneren. Op instructies gebaseerde bediening is krachtiger en minder voorspelbaar, en de migratiekosten zijn reëel.
Wanneer niets in de upgrade je werkbelasting raakt. Als je Mandarijn en Engels synthetiseert op matig volume met een schone referentiestem en een vaste set delivery-tags, dan lossen timbreoverdracht tussen talen, robuustheid bij ruisige input en zeven extra talen allemaal problemen op die je niet hebt. Profiteer van de prijsverlaging, houd het model.
Beide uitvoeren zonder twee integraties te draaien
Het lastige aan een switch van generatie op generatie is dat je beide modellen vaak tegelijk live wilt hebben — 3.0 voor het productiepad met de score erachter, 3.1 voor de nieuwe talen en de transferfunctie, en een manier om verkeer tussen beide te verplaatsen zonder opnieuw te deployen. Beide zijn closed hosted API's op Alibaba Cloud Model Studio, dus dat zijn twee endpoints, twee rate limits en twee faalmodi achter één functie.
Een eerlijke noot over waar wij staan: OrcaRouter routeert Qwen-Audio-3.1-TTS of welk Qwen-Audio-model dan ook niet, en we routeren de spraakeindpunten van Alibaba helemaal niet. Wat wij bieden is de tekst-inferentielaag rond een pijplijn zoals deze — één API-sleutel voor meer dan 200 modellen met 0% opslag, de listprijs van de provider wordt rechtstreeks doorgegeven, zodat een prijsverlaging van een leverancier dezelfde dag bij ons terechtkomt in plaats van na een herprijzingscyclus. Als de dienst die uw spraakpijplijn aandrijft een scriptgenerator, een samenvattingstool of een contentplanner is, betekent dat één contract in plaats van meerdere, automatische failover wanneer een upstream verslechtert, en een routing-DSL om modellen in één aanroep samen te stellen. Het betekent niet dat u de stem van Qwen via ons aanroept, en elke pagina die anders suggereert, heeft het mis over onze eigen catalogus.
De eerlijke samenvatting
Qwen-Audio-3.1-TTS is een echte upgrade met drie toevoegingen die ertoe doen — op instructies gebaseerde sturing van de voordracht, timbre-overdracht tussen talen, en robuustheid tegen slechte referentieaudio — plus een prijsverlaging die meer waard is dan elk van die drie. Qwen-Audio-3.0-TTS is niet achterhaald op de manier waarop een model van twee maanden oud dat gewoonlijk is: het behoudt nog steeds een onafhankelijke benchmarkscore die zijn opvolger niet heeft verdiend, en het bestrijkt nog steeds het bereik aan Chinese dialecten waarop het grootste deel van de differentiatie binnen deze familie berust.
Dus de beslissing is beperkter dan de marketing doet vermoeden. Als je in grote volumes genereert, geldt de prijswijziging al voor jou. Als je de nieuwe talen of de timbre-overdracht nodig hebt, migreer dan en valideer de functie eerst op je eigen audio. Als je een verdedigbaar kwaliteitscijfer nodig hebt, wacht dan tot Qwen-Audio-3.1-TTS op een blind-listeningarena verschijnt — dat is de enige gebeurtenis die dit zou beslechten, en totdat het gebeurt, is de eerlijke positie dat het nieuwere model het goedkopere is en het oudere model het bewezen model.
