
StepAudio 3 TTS vs Qwen-Audio-3.0-TTS: Een van deze heeft een Arena-score, en dat is niet de nieuwe.
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
Hier is de hele vergelijking in één regel. Qwen-Audio-3.0-TTSstaat op de Text-to-Speech Arena met een Elo van 1.234 voor zijn Plus-tier — een score behaald met 2.502 blinde luisterstemmen. StepAudio 3 TTS, uitgebracht door StepFun op 15 september 2026, staat helemaal niet op die ranglijst. Zijn voorganger wel: StepAudio 2.5 TTS heeft een Elo van 1.209 uit 1.306 stemmen.
De eerlijke vraag is dus niet "wat beter klinkt". Het gaat erom of een Elo-verschil van 25 punten, gemeten op de vorige generatie, standhoudt bij een release waarvan StepFun zegt dat die de prosodie heeft verbeterd en de prijs met meer dan de helft heeft verlaagd. Niemand heeft die stemming nog gehouden, en alles hieronder is opgebouwd rond dat gat in het bewijs in plaats van te doen alsof het er niet is.
Het bord, zoals het er vandaag daadwerkelijk staat
Het loont de moeite de echte ranglijst te bekijken, want verschillende circulerende artikelen verwijzen naar een verouderde versie ervan. De blindeluisterarena rangschikt synthesemodellen op basis van welk sample de stemmers verkozen. Lees de bovenste rij van het provider-stemmenbord:
• Cartesia Sonic 3.6 — Elo 1.277, augustus 2026, $ 49,0 per miljoen tekens
• Inworld Realtime TTS-2 — Elo 1.243, augustus 2026, $20,8 per miljoen tekens
• SpeechifyAI Simba 3.2 — Elo 1.238, juli 2026, $6,6 per miljoen tekens
• Alibaba Qwen-Audio-3.0-TTS-Plus — Elo 1.234, juli 2026, $ 27,6 per miljoen tekens, 8 arena-stemmen
• VUI Labs Luna TTS — Elo 1.229, juni 2026, $80,0 per miljoen tekens
• Inworld Realtime TTS-2 Flash — Elo 1.213, augustus 2026, $10,4 per miljoen tekens
• StepFun StepAudio 2.5 TTS — Elo 1.209, augustus 2026, $85,0 per miljoen tekens, 8 arenastemmen
• Google Gemini 3.1 Flash TTS — Elo 1.204, april 2026, $18,3 per miljoen tekens

Twee dingen vallen meteen op uit die lijst. Het eerste is dat Qwens Plus-tier niet de leider is — hij staat vierde, achter Cartesia, Inworld en Speechify, en het getal 1.234 dat als kroon wordt aangehaald, is een middenmootscore op een ranglijst die sindsdien is verschoven. Het tweede is dat StepAudio 2.5 TTS in augustus 2026 opnieuw is uitgevoerd en als zevende eindigde, 25 Elo achter Qwen, voor meer dan drie keer de prijs.
En een derde ding dat meer uitmaakt dan al het andere: kijk naar de betrouwbaarheidsintervallen. De Plus-tier van Qwen staat vermeld als −14/+14 over 2.502 samples. StepAudio 2.5 TTS staat vermeld als −16/+16 over 1.306. Die intervallen overlappen elkaar. Een verschil van 25 punten tussen twee modellen waarvan de foutmarges zich 14 en 16 punten in beide richtingen uitstrekken, is geen aangetoond kwaliteitsverschil — het zijn twee modellen die de arena momenteel niet kan onderscheiden, gerangschikt in een volgorde die een paar honderd extra stemmen zou kunnen omkeren.

Wat het ontbrekende datapunt je kost
StepAudio 3 TTS is het model waarmee StepFun StepAudio 2.5 TTS heeft vervangen, en de lancering claimt controle over timbre, intonatie, ritme en adempauzes, plus paralinguïstisch gedrag — lachen, aarzeling, stotteren, herhaling, zelfcorrectie — geleverd via een streamingarchitectuur waarin generatie en weergave elkaar overlappen.
Dat is precies de set eigenschappen die de arena meet. Dat is ook precies waarom het ontbreken van een score frustrerend is in plaats van fataal: de benchmark die de vraag zou beantwoorden bestaat, wordt publiekelijk uitgevoerd, en is simpelweg niet opnieuw uitgevoerd sinds het nieuwe model is uitgebracht. Iedereen die je vertelt dat StepAudio 3 TTS beter klinkt dan Qwen-Audio-3.0-TTS, extrapoleert op basis van een voorganger die verloor met een marge die binnen zijn eigen foutmarges lag.
De prijs is het deel dat volledig gedocumenteerd is, en die is flink veranderd.
StepAudio 3 TTS factureert 2,5 yuan per 10.000 tekens op het eigen platform van StepFun. StepAudio 2.5 TTS factureerde tegen 5,8. In de eigen, op tekens gebaseerde prijskolom van de arena kostte het oudere model $85,00 per miljoen tekens; 2,5 yuan per 10.000 tekens komt bij recente wisselkoersen neer op ongeveer $35 per miljoen — een omrekening die van ons is en niet een gepubliceerd cijfer, en die het waard is om opnieuw te doen voor je eigen regio en wisselkoers. Dat is een verlaging van bijna 60% op dezelfde regel.
Het ligt nog steeds boven Qwen. Qwen-Audio-3.0-TTS-Plus staat vermeld voor $27,6 per miljoen tekens, en de Flash-tier is nog goedkoper, waarbij Alibaba Cloud Model Studio de synthese factureert op basis van invoertekens in plaats van geproduceerde audio — output wordt niet apart in rekening gebracht. Platforms van derden die de Flash-tier vermelden, noemen tarieven van tegen de twintig per miljoen, hoewel regionale variatie elk afzonderlijk kopcijfer onbetrouwbaar maakt.
De strekking hiervan is dus: StepFun halveerde de synthesekosten ruwweg, overbrugde het grootste deel van de afstand tot Qwen, maar ging er niet overheen. Als prijs per karakter je bindende beperking is, wordt het argument smaller, maar het antwoord verandert niet. Als dat niet zo is, is prijs niet langer de reden om voor een van beide modellen te kiezen.
Spraakinventaris en taaldekking liggen niet dicht bij elkaar.
Dit is het punt waarop de vergelijking ophoudt een kwestie van persoonlijke inschatting te zijn en een specificatievraagstuk wordt.
• Stemmenaanbod — Qwen-Audio-3.0-TTS: meer dan 1.000 stemmen verspreid over zijn niveaus vs StepAudio 3 TTS: geen vergelijkbaar aantal gepubliceerd
• Talen — Qwen-Audio-3.0-TTS 16 talen plus 20 Chinese dialecten, waarbij de Flash-tier is afgestemd op laagresource-talen en dialectauthenticiteit, tegenover StepAudio 3 TTS dat Chinees vooropstelt, zonder een vergelijkbare dekkingsclaim
• Aanvraaggrootte — Qwen-Audio-3.0-TTS 20.000 tekens per aanvraag vs StepAudio 3 TTS niet gepubliceerd
• Latentie — Qwen-Audio-3.0-TTS Flash streeft naar een first-packet-latentie binnen 200 ms volgens Alibaba's eigen documentatie, tegenover StepAudio 3 TTS-streaming, waarvoor geen gepubliceerd cijfer beschikbaar is
• Indeling in tiers — Qwen-Audio-3.0-TTS Plus voor expressiviteit en Flash voor realtime, zes flagshipstemmen die aan de ene of de andere tier zijn vergrendeld versus StepAudio 3 TTS met één enkele tier
• Bedieningsoppervlak — voordrachtsaanwijzingen in natuurlijke taal van Qwen-Audio-3.0-TTS plus inline-expressietags zoals [excited], [laughing], [whispers] die in de invoertekst zijn ingebed, tegenover door het StepAudio 3 TTS-model uit context afgeleide prosodie
• Stemklonen — StepAudio 3 TTS hanteert een vast tarief van 9,9 yuan per gekloonde stem voor al zijn TTS-niveaus, tegenover klonen met Qwen-Audio-3.0-TTS via Alibaba Cloud Model Studio
• Uitvoer — Qwen-Audio-3.0-TTS standaard samplefrequentie van 24 kHz vs. StepAudio 3 TTS niet gepubliceerd
Die rij met bedieningselementen is het echte ontwerpverschil, en het is geen kwaliteitskwestie. De expressietags van Qwen zijn expliciet en synchroon: je schrijft de emotie in de tekst en het model geeft die weer, waardoor ze testbaar en regressievriendelijk zijn. De beschrijving van StepFun is die van een model dat de passende aarzeling of lach uit de context afleidt, wat beter klinkt wanneer het klopt en veel moeilijker vast te stellen is wanneer het ernaast zit. Kies op basis van of je de performance liever zelf schrijft of delegeert.

Hoe te beslissen zonder de meting
Je kunt niet via gepubliceerde cijfers tot een antwoord redeneren, omdat het beslissende cijfer niet bestaat. Dan blijft testen over, en het testen van deze twee heeft een specifieke vorm waarvoor het de moeite loont om te plannen.
Beide zijn uitsluitend gehoste commerciële API's — Qwen-Audio-3.0-TTS via Alibaba Cloud Model Studio, StepAudio 3 TTS via het open platform van StepFun. Geen van beide heeft open gewichten, dus er is geen self-hosted route om te evalueren. Om precies te zijn wat OrcaRouter hier dekt: de tekst-naar-spraakmodellen in onze catalogus van vandaag zijn de OpenAI tts-1-familie, gpt-4o-mini-tts en Google's Gemini TTS-previews. Geen van de modellen in dit artikel staat erin, en Qwen-Audio-3.0-TTS ook niet — niets hier mag worden gelezen als een claim dat wij ze aanbieden.
Het deel dat wel op OrcaRouter draait, is de teksthelft van de pijplijn. De scripts die je syntheselaag leest, worden gegenereerd door een taalmodel, en dat is de component die het vaakst verandert, het duurst is om opnieuw te contracteren, en het gemakkelijkst om niet vastgepind te laten — bijna 200 tekstmodellen achter één API, automatische failover, een routing-DSL die er meerdere samenvoegt tot één aanroep, en modelfusie waarbij het oordeel van één model niet volstaat, met de listprijs van de provider doorgegeven zonder markup. Als je een blinde evaluatie tussen deze twee synthesemodellen uitvoert, genereer dan het corpus via één endpoint zodat beide kandidaten identieke input lezen, en houd de syntheselaag achter een interface die je kunt uitwisselen.
Waar dit de beslissing brengt
Neem vandaag Qwen-Audio-3.0-TTS als je breedte nodig hebt — meer dan duizend stemmen, 16 talen en 20 dialecten, een gedocumenteerd plafond van 20.000 tekens per aanvraag, een latentieklasse en een expressiviteitsklasse, een streefwaarde van 200 ms voor het eerste pakket, en een tarief onder dat van StepFun. Het is het model met een meting erachter en het bredere oppervlak, en zijn vierde plaats in Elo is een echt resultaat, ook al is het niet de kroon waarvoor het wordt aangehaald.
Kies StepAudio 3 TTS als je Chinese-first bouwt, één tier wilt in plaats van een keuze tussen tiers, cloning wilt tegen een vast gepubliceerd tarief, en bereid bent vroeg in te stappen op een model dat niet blind is getest. Je betaalt ongeveer 27% meer per teken dan voor Qwen's Plus-tier, in ruil voor een generatie van beweerde prosodieverbetering ten opzichte van een model dat 25 Elo achterlag met overlappende foutbalken.
Wat uitsluitsel zou geven, is één nieuwe run van de arena met StepAudio 3 TTS in de pool. Tot die stemming plaatsvindt, staat hier een gemeten model tegenover een ongemeten model, en de 25 punten die hun voorgangers scheiden, vallen binnen de ruis — wat geen rangschikking is, en ook niet als zodanig mag worden verkocht.
