
StepAudio 3 TTS vs Qwen-Audio-3.0-TTS: En av dessa har ett Arena-betyg, och det är inte den nya
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
Här är hela jämförelsen på en rad. Qwen-Audio-3.0-TTSligger på Text-to-Speech Arena med en Elo på 1 234 för sin Plus-nivå – en poäng som samlats in genom 2 502 blinda lyssnarröster. StepAudio 3 TTS, som släpptes av StepFun den 15 september 2026, finns inte med på den listan alls. Dess föregångare gör det: StepAudio 2.5 TTS har en Elo på 1 209 från 1 306 röster.
Den ärliga frågan är alltså inte ”vilket låter bättre”. Den är huruvida en Elo-skillnad på 25 punkter, mätt på den föregående generationen, överlever en lansering som StepFun säger förbättrade prosodin och sänkte priset med mer än hälften. Ingen har genomfört den omröstningen ännu, och allt nedan är uppbyggt kring den luckan i bevisningen i stället för att låtsas bort den.
Styrelsen, så som den faktiskt lyder i dag
Det är värt att se den verkliga ställningen, eftersom flera cirkulerande texter citerar en inaktuell version av den. Blindlyssningsarenan rangordnar syntesmodeller efter vilket ljudprov de röstande föredrog. Läs tvärs över översta raden på leverantörens rösttavla:
• Cartesia Sonic 3.6 — Elo 1 277, augusti 2026, $49,0 per miljon tecken
• Inworld Realtime TTS-2 – Elo 1 243, augusti 2026, $20,8 per miljon tecken
• SpeechifyAI Simba 3.2 — Elo 1 238, juli 2026, 6,6 USD per miljon tecken
• Alibaba Qwen-Audio-3.0-TTS-Plus — Elo 1 234, juli 2026, 27,6 $ per miljon tecken, 8 arenaröster
• VUI Labs Luna TTS — Elo 1 229, juni 2026, 80,0 USD per miljon tecken
• Inworld Realtime TTS-2 Flash — Elo 1 213, augusti 2026, $10,4 per miljon tecken
• StepFun StepAudio 2.5 TTS — Elo 1 209, augusti 2026, 85,0 USD per miljon tecken, 8 röster i arenan
• Google Gemini 3.1 Flash TTS — Elo 1 204, april 2026, 18,3 $ per miljon tecken

Två saker framgår omedelbart av den listan. Den första är att Qwens Plus-nivå inte är ledaren – den är fjärde, efter Cartesia, Inworld och Speechify, och siffran 1 234 som citeras som en krona är en poäng i mitten av tabellen på en resultattavla som har förändrats sedan dess. Den andra är att StepAudio 2.5 TTS kördes om i augusti 2026 och placerade sig sjua, 25 Elo efter Qwen, till ett pris som är mer än tre gånger så högt.
Och en tredje sak som betyder mer än allt annat: titta på konfidensintervallen. Qwens Plus-nivå anges till −14/+14 över 2 502 prover. StepAudio 2.5 TTS anges till −16/+16 över 1 306. Dessa intervall överlappar varandra. Ett gap på 25 punkter mellan två modeller vars felmarginaler sträcker sig 14 respektive 16 punkter i vardera riktningen är inte en påvisad kvalitetsskillnad — det är två modeller som arenan för närvarande inte kan skilja åt, rangordnade i en ordning som ytterligare några hundra röster skulle kunna vända.

Vad den saknade datapunkten kostar dig
StepAudio 3 TTS är den modell som StepFun ersatte StepAudio 2.5 TTS med, och lanseringen utlovar kontroll över klangfärg, intonation, rytm och andningspauser, plus paralingvistiskt beteende – skratt, tvekan, stamning, upprepning, självkorrigering – levererat genom en strömmande arkitektur där generering och uppspelning överlappar.
Det är exakt den uppsättning egenskaper som arenan mäter. Det är också precis varför avsaknaden av ett resultat är frustrerande snarare än fatal: benchmarken som skulle besvara frågan finns, körs offentligt, och har helt enkelt inte körts om sedan den nya modellen släpptes. Den som säger att StepAudio 3 TTS låter bättre än Qwen-Audio-3.0-TTS extrapolerar från en föregångare som förlorade med en marginal inom sina egna felstaplar.
Priset är den del som är fullständigt dokumenterad, och det rörde sig mycket.
StepAudio 3 TTS debiteras 2,5 yuan per 10 000 tecken på StepFuns egen plattform. StepAudio 2.5 TTS debiterades 5,8. I arenans egen teckenbaserade priskolumn kostade den äldre modellen 85,00 USD per miljon tecken; 2,5 yuan per 10 000 tecken motsvarar ungefär 35 USD per miljon vid aktuella växelkurser – en omräkning som är vår och inte en publicerad siffra, och som är värd att göra om utifrån din egen region och valutakurs. Det är en sänkning på nära 60 % för samma radpost.
Det ligger fortfarande över Qwen. Qwen-Audio-3.0-TTS-Plus listas till $27,6 per miljon tecken, och Flash-nivån är ännu billigare, där Alibaba Cloud Model Studio fakturerar syntes per inmatningstecken i stället för per producerat ljud — utdata debiteras inte separat. Tredjepartsplattformar som listar Flash-nivån anger priser i den högre delen av tonåren per miljon, men regionala variationer gör att en enskild rubriksiffra är opålitlig.
Så ser formen på detta ut: StepFun halverade ungefär synteskostnaden, minskade större delen av avståndet till Qwen och tog sig inte förbi det. Om pris per tecken är din bindande begränsning, blir argumentet snävare men svaret förändras inte. Om det inte är det, har priset slutat vara anledningen att välja någon av modellerna.
Röstutbud och språktäckning är inte nära varandra
Det är här jämförelsen slutar vara en bedömningsfråga och blir en specifikationsfråga.
• Röstutbud — Qwen-Audio-3.0-TTS har över 1 000 röster fördelade över sina nivåer, jämfört med StepAudio 3 TTS som inte har något jämförbart publicerat antal
• Språk — Qwen-Audio-3.0-TTS: 16 språk plus 20 kinesiska dialekter, med Flash-nivån optimerad för lågresursspråk och dialektautenticitet, jämfört med StepAudio 3 TTS som är kinesisk-först, utan motsvarande täckningsanspråk
• Begäransstorlek — Qwen-Audio-3.0-TTS 20 000 tecken per begäran vs StepAudio 3 TTS inte publicerad
• Latens — Qwen-Audio-3.0-TTS Flash siktar på en första paketlatens inom 200 ms enligt Alibabas egna dokumentation, jämfört med StepAudio 3 TTS-strömning, ingen publicerad siffra
• Nivåindelning — Qwen-Audio-3.0-TTS Plus för uttrycksfullhet och Flash för realtid, sex flaggskeppsröster låsta till antingen den ena eller den andra nivån mot StepAudio 3 TTS som har en enda nivå
• Styryta – Qwen-Audio-3.0-TTS naturligt språkliga framförandeanvisningar plus infogade uttryckstaggar som [excited], [laughing], [whispers] inbäddade i indatatexten kontra StepAudio 3 TTS-modellens infererade prosodi från kontext
• Röstkloning – StepAudio 3 TTS ett fast pris på 9,9 yuan per klonad röst över alla dess TTS-nivåer jämfört med Qwen-Audio-3.0-TTS-kloning via Alibaba Cloud Model Studio
• Utdata — Qwen-Audio-3.0-TTS 24 kHz standard samplingsfrekvens vs StepAudio 3 TTS inte publicerad
Den där raden på kontrolytan är den verkliga designskillnaden, och det är inte en kvalitetsfråga. Qwens uttryckstaggar är explicita och synkrona: du skriver in känslan i texten och modellen återger den, vilket gör dem testbara och regressionsvänliga. StepFuns beskrivning avser en modell som sluter sig till lämplig tvekan eller lämpligt skratt utifrån kontexten, vilket låter bättre när det stämmer och är mycket svårare att ringa in när det inte stämmer. Välj utifrån om du hellre vill utforma framförandet själv eller delegera det.

Hur man fattar beslut utan mätningen
Du kan inte resonera dig fram till ett svar utifrån publicerade siffror, eftersom den avgörande siffran inte finns. Då återstår testning, och att testa dessa två har en särskild form som är värd att planera för.
Båda är kommersiella API:er som endast erbjuds som hostade tjänster — Qwen-Audio-3.0-TTS via Alibaba Cloud Model Studio, StepAudio 3 TTS via StepFuns öppna plattform. Ingen av dem har öppna vikter, så det finns ingen självhostad väg att utvärdera. För att vara exakta om vad OrcaRouter täcker här: de text-till-tal-modeller som finns i vår katalog idag är OpenAI tts-1-familjen, gpt-4o-mini-tts och Googles Gemini TTS-förhandsvisningar. Ingen av modellerna i den här artikeln finns med där, och inte heller Qwen-Audio-3.0-TTS — inget här bör tolkas som ett påstående att vi erbjuder dem.
Den del som faktiskt ligger på OrcaRouter är texthalvan av pipelinen. Skripten som ditt synteslager läser genereras av en språkmodell, och det är den komponent som ändras oftast, kostar mest att teckna om avtal för och är enklast att lämna utan versionslåsning — nästan 200 textmodeller bakom ett och samma API, automatisk failover, ett routing-DSL som komponerar flera till ett anrop och modellfusion där en modells omdöme inte räcker, med leverantörens listpris vidarebefordrat utan påslag. Om du kör en blind utvärdering mellan dessa två syntesmodeller, generera korpusen via en och samma endpoint så att båda kandidaterna läser identisk indata, och håll synteslagret bakom ett gränssnitt som du kan byta ut.
Var detta lämnar beslutet
Ta Qwen-Audio-3.0-TTS idag om du behöver bredd – över tusen röster, 16 språk och 20 dialekter, ett dokumenterat tak på 20 000 tecken per begäran, en latensnivå och en uttrycksfullhetsnivå, ett mål på 200 ms för första paketet, och ett pris under StepFuns. Det är modellen med en mätning bakom sig och den bredare ytan, och dess fjärdeplats i Elo är ett riktigt resultat även om det inte är den krona som det citeras som.
Välj StepAudio 3 TTS om du bygger kinesiska i första hand, vill ha en nivå i stället för ett beslut om nivåval, vill ha kloning till en fast publicerad avgift och är beredd att vara tidig med en modell som inte har blindtestats. Du betalar ungefär 27 % mer per tecken än Qwens Plus-nivå i utbyte mot en generations påstådda prosodiförbättring jämfört med en modell som låg 25 Elo bakom med överlappande felmarginaler.
Det som skulle avgöra saken är en ny körning av arenan med StepAudio 3 TTS i poolen. Fram till dess att den röstningen sker är detta en mätt modell mot en omätt, och de 25 poäng som skiljer deras föregångare åt ligger inom bruset — vilket inte är en rangordning och inte bör säljas som en.
