Ett hero-kort som jämför Qwen-Audio-3.0-TTS och Qwen-Audio-3.1-TTS, och listar den äldre modellens lansering den 20 juli 2026, Elo på 1 238 och 86 inline-leveranstaggar mot den nyare modellens tillkännagivande den 23 september 2026, 70 % prissänkning och instruktionsbaserad styrning, med en pil märkt 'nio veckor' mellan dem.
Guides & Insights

Qwen-Audio-3.1-TTS vs Qwen-Audio-3.0-TTS: Vad två månader gav

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Qwen-Audio-3.0-TTS lanserades den 20 juli 2026 och gick rakt till toppen av de oberoende topplistorna för tal — Plus-nivån nådde 1 238 Elo på Artificial Analysis Provider Voice Arena-topplistan, tvåa på listan. Nio veckor senare, den 23 september 2026, meddelade leverantören Qwen-Audio-3.1-TTS på Apsara-konferensen i Hangzhou, med en prissänkning på ungefär 70 %. Den tidpunkten gör detta till en ovanlig jämförelse: modellen som ersätts är inte föråldrad, den är benchmarkad, beprövad och fortfarande nära toppen. Så den verkliga frågan är inte vilken som är bättre. Det är vad som specifikt har förändrats, om något av det spelar roll för din arbetsbelastning, och vad som händer med den poäng du redan litar på när efterträdaren inte har fått någon poäng alls.

Två månader, fem slutpunkter, en familj

Alibaba släppte inte bara en enda modell. Version 3.1 omfattar fem: Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next, Qwen-Audio-3.1-TTS, Qwen-Audio-3.1-TTS-Next och Qwen-Audio-3.1-Realtime. För alla som för närvarande anropar Qwen-Audio-3.0-TTS är bara en av dessa en direkt ersättning – den vanliga TTS-nivån – och en är en helt ny produkt snarare än en uppgradering.

Den där andra är värd att förstå även om du aldrig anropar den. Qwen-Audio-3.1-TTS-Next är vad Alibaba kallar en "Audiogen"-modell: en enda körning som producerar röst, ljudeffekter och bakgrundsambiens tillsammans utifrån text, tidsstämplar och referensljud. Dialog med flera talare, podcastsammansättning, scenljudlandskap, 48 kHz-utdata. Alibaba Clouds dokumentation för Model Studio listar dess gränser tydligt – 3 000 tecken indata, 240 sekunder genererat ljud för poddar och 120 sekunder i övriga fall, 3 förfrågningar per sekund, utdata i WAV, MP3 eller PCM, och den tar emot upp till tre referensklipp på 30 sekunder vardera i WAV, MP3 eller OGG Opus. Rå PCM-referensindata stöds inte. Priset är $0,848 per miljon indatatoken och $1,696 per miljon utdatatoken på Beijing-noden, exklusive kampanjpriser, och den hanterar endast kinesiska och engelska.

Om du använder 3.0-TTS och ditt jobb är att "förvandla det här manuset till en röst", innebär inget av detta någon förändring för din integration. Om ditt jobb är att "sätta ihop en podcast med två programledare och musikbäddar", är 3.1-TTS-Next en annan produktkategori och möjligen anledningen till att överhuvudtaget titta på den här utgåvan.

Uppgraderingen, rad för rad

A two-column scoreboard for Qwen-Audio-3.1-TTS and Qwen-Audio-3.0-TTS across languages, dialects, timbre transfer, delivery control, noisy reference audio and arena score, with a footer stating that the 3.1 figures are vendor-reported and unscored and the 3.0 Plus Elo is per Artificial Analysis.

• Språk — Qwen-Audio-3.1-TTS: 16 språk enligt leverantören, varav sju tillkom jämfört med föregående generation. Qwen-Audio-3.0-TTS: 16 språk enligt publicerad rapportering om julisläppet.

• Kinesiska dialekter — Qwen-Audio-3.1-TTS: 20 dialektregioner, vidareförda. Qwen-Audio-3.0-TTS: 20 dialektregioner.

• Klangfärgsöverföring mellan språk — Qwen-Audio-3.1-TTS: ja, en och samma röst överförs mellan mandarin, kantonesiska, engelska och japanska. Qwen-Audio-3.0-TTS: erbjuds inte.

• Kontroll av framförandet — Qwen-Audio-3.1-TTS: instruktionsbaserad styrning av känsla, tempo och stil. Qwen-Audio-3.0-TTS: 86 inline-taggar för framförandet.

• Brusig referensinmatning — Qwen-Audio-3.1-TTS: hanterar brusigt eller ekande referensljud direkt, inget separat brusreduceringsläge. Qwen-Audio-3.0-TTS: rent referensljud förväntas.

• Oberoende poäng — Qwen-Audio-3.1-TTS: inga ännu. Qwen-Audio-3.0-TTS-Plus: 1 238 Elo på Provider Voice Arena-topplistan från Artificial Analysis per augusti 2026.

Antalet språk går inte ihop, och det spelar roll

Det här är en liten sak som kommer att slätas över överallt annars, så det är värt att säga. Alibabas lanseringsmaterial säger att 3.1 TTS-nivån lägger till sju språk. Publicerad bevakning av 3.0-generationen i juli – inklusive våra egna jämförelseartiklar från den månaden – angav 16 språk för 3.0-nivån. Sju adderat till sexton är tjugotre, inte sexton, och Alibaba har inte publicerat någon avstämning av de två siffrorna.

Möjliga förklaringar är oglamorösa: siffran 3.1 kan avse en annan uppsättning, siffran för 3.0 kan ha överdrivits vid lanseringen, eller så kan "lägger till sju" beskriva ASR-nivån snarare än TTS. Vi vet inte vilket. Vad vi vet är att språkantalet på båda sidor av denna jämförelse är en av leverantören rapporterad siffra som aldrig har oberoende granskats, och att den som citerar "16 språk" som ett hårt faktum om någon av modellerna citerar en marknadsföringsbild. Kontrollera de specifika språk du behöver mot Model Studio-dokumentationen innan du planerar utifrån en siffra.

A screenshot of Alibaba Cloud Model Studio's English documentation site with the Speech-to-Speech branch of the navigation open, showing the reference page for qwen3.8-livetranslate-flash-realtime with its model capabilities and context limit tables, under an Apsara 2026 Conference banner.

Instruktionsstyrning är den förändring som faktiskt syns i koden

Av allt i 3.1 TTS-släppet är detta det som förändrar hur du skriver dina prompter. 3.0-generationen styrde framförandet genom 86 inline-taggar – en fast vokabulär som du var tvungen att lära dig, infoga på rätt positioner, och som gjorde exakt det den sa och inget mer. 3.1-nivån ersätter det med instruktioner i naturligt språk: du beskriver känslan, tempot och stilen du vill ha, och modellen tolkar det.

Den praktiska skillnaden är uttrycksfullhet kontra förutsägbarhet. Ett taggvokabulär är ett kontrakt – samma tagg ger samma framförande varje gång, vilket är vad du vill ha i en produktionspipeline där en röst måste vara konsekvent över tiotusen klipp. Fritt formulerad instruktion är bredare men lösare, och den ärver det vanliga problemet med promptkänslighet: två formuleringar av "varm men inte sentimental" kommer inte att landa identiskt, och inte heller två anrop av samma formulering olika dagar.

Om din nuvarande pipeline bygger på de där 86 taggarna är uppgraderingen inte gratis. Du byter en deterministisk kontrollmekanism mot en probabilistisk, och arbetet med att porta är inte API-anropet – det är att validera om alla promptmallar du äger mot den nya modellens tolkning. Budgetera för det innan du budgeterar för besparingarna.

Tvärspråklig klangfärgsöverföring, och vad den faktiskt är till för

En referensröst som följer med genom mandarin, kantonesiska, engelska och japanska och behåller sin identitet när språket ändras. På papper låter det som en funktionspunkt. I praktiken löser det ett specifikt och kostsamt problem: en enda presentatör som måste existera på mer än ett språk utan att låta som en annan person i varje.

Den traditionella lösningen är att anlita en separat röstskådespelare per språk och acceptera att din varumärkesröst nu är fyra röster som delar ett manus. Alternativet har varit att klona en talare till varje språk, vilket är precis det arbetsflöde där klonade röster tenderar att glida — accenten följer med, klangfärgen tunnas ut och lyssnarna märker det inom en mening. Tvärspråklig klangfärgsöverföring är påståendet att ingen av kompromisserna är nödvändig.

Den är också just nu helt overifierad. Det finns inget tredjepartslyssningstest på Qwen-Audio-3.1-TTS på något språk, och Alibabas egna demos är det enda beviset för att överföringen håller. Om den här förmågan är anledningen till att du överväger uppgraderingen, testa den på ditt eget referensljud innan du bestämmer dig – det är ett femminutersexperiment och det enda som besvarar frågan.

Vad prissänkningen gör med en 3.0-räkning

Alibaba sänkte talpriserna över hela linjen: syntes med omkring 70 %, realtid med omkring 85 %, igenkänning med så mycket som 95 %. Justeringen trädde i kraft på Alibaba Cloud Model Studio den 22 september 2026 kl. 00:00 pekingtid, och omfattar regionerna Peking och Singapore, och den gäller för 3.1 TTS- och 3.0 realtime-slutpunkter. Efter justeringen prissätts TTS Flash-nivån till 1,5 yuan per miljon input-tokens och 12 yuan per miljon output-tokens; realtime Flash-nivån prissätts till 1,5 för textinmatning, 6 för ljudinmatning, 4,5 för textutmatning och 12 för kombinerad text- och ljudutmatning, per miljon tokens.

Här är delen som spelar roll om du redan kör 3.0-TTS. 3.0 Plus-nivån låg på nära 27,60 $ per miljon tecken på Artificial Analysis under augusti, medan Flash-nivån låg nära 15 $. Om minskningen på ~70 % gäller den nivå du använder, sjunker din räkning för samma arbetsbelastning till ungefär en tredjedel av vad den var – utan att du ändrar en enda rad kod. Det är det ovanliga med den här lanseringen: för en 3.0-kund är prissänkningen värd mer än modelluppgraderingen, och den kommer oavsett om du migrerar eller inte.

Två förbehåll värda att hålla fast vid. Procentsänkningar anges mot priser som skiljer sig mellan regioner och nivåer, så rubrikens 70 % är inte ett löfte om just din trafik. Och Alibaba Cloud har flyttat faktureringen för realtidstranskription på Singapore-noden från varaktighetsbaserad mätning till tokenbaserad mätning – 0,93 USD per miljon indatatoken och 0,70 USD per miljon utdatatoken – vilket är en mindre förutsägbar grund när tystnad, brus och flerturskontext alla blåser upp tokenförbrukningen. Läs den nya prislistan mot din egen ljuddata, inte mot pressmeddelandet.

När Qwen-Audio-3.0-TTS fortfarande är rätt val

Tre fall, och de är inte gränsfall.

När du behöver en siffra du kan försvara. Qwen-Audio-3.0-TTS-Plus har ett oberoende Elo på 1 238 — samma tavla visar 1 259 för den modellen i september, fortfarande på andra plats, så poängen har driftat uppåt snarare än förfallit — från en blindlyssningsarena med tusentals röster bakom sig. Qwen-Audio-3.1-TTS har ingen arenapoäng alls. Om din godkännandeprocess kräver tredjepartsbevis är det den äldre modellen som har det, och en prissänkning ändrar inte på det.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, ranking text-to-speech models by Elo with vote counts and API pricing: Cartesia Sonic 3.6 first at 1,277, Alibaba's Qwen-Audio-3.0-TTS-Plus at 1,259 on a rank range of 2-3, and ElevenLabs Eleven v3 at 1,166.

När determinism slår uttrycksfullhet. Om din produktionspipeline är byggd på den 86-taggars kontrollpanelen har du ett system vars utdata du kan resonera kring. Instruktionsbaserad styrning är mer kapabel och mindre förutsägbar, och migreringskostnaden är verklig.

När inget i uppgraderingen påverkar din arbetsbelastning. Om du syntetiserar mandarin och engelska i måttlig volym med en ren referensröst och en fast uppsättning framförandetaggar, så löser tvärspråklig klangfärgsöverföring, robusthet mot brusiga indata och sju ytterligare språk problem som du inte har. Ta prissänkningen, behåll modellen.

Köra båda utan att köra två integrationer

Det besvärliga med ett byte från en generation till nästa är att man ofta vill ha båda modellerna live samtidigt — 3.0 för produktionsvägen med poängen bakom sig, 3.1 för de nya språken och överföringsfunktionen, och ett sätt att flytta trafik mellan dem utan att behöva driftsätta igen. Båda är slutna hostade API:er på Alibaba Cloud Model Studio, så det innebär två slutpunkter, två hastighetsbegränsningar och två felmoder bakom en och samma funktion.

En ärlig kommentar om var vi står: OrcaRouter routar inte Qwen-Audio-3.1-TTS eller någon annan Qwen-Audio-modell, och vi routar inte Alibabas taländpunkter alls. Det vi tillhandahåller är textinferenslagret runt en pipeline som denna – en API-nyckel för över 200 modeller med 0 % påslag, leverantörens listpris förs vidare direkt, så en leverantörs prissänkning slår igenom hos oss samma dag i stället för efter en omprissättningscykel. Om tjänsten som driver din talpipeline är en manusgenerator, en sammanfattare eller en innehållsplanerare, innebär det ett avtal i stället för flera, automatisk redundansväxling när en uppströmsberoende försämras, och ett routnings-DSL för att komponera modeller till ett enda anrop. Det betyder inte att du anropar Qwens röst via oss, och alla sidor som antyder något annat har fel om vår egen katalog.

Den ärliga sammanfattningen

Qwen-Audio-3.1-TTS är en riktig uppgradering med tre tillägg som spelar roll – instruktionsbaserad styrning av framförandet, överföring av klangfärg mellan språk och robusthet mot dåligt referensljud – plus en prissänkning som är värd mer än något av dem. Qwen-Audio-3.0-TTS har inte blivit överspelad på det sätt som en två månader gammal modell vanligtvis blir: den har fortfarande en oberoende benchmarkpoäng som dess efterträdare inte har förtjänat, och den täcker fortfarande det kinesiska dialektspektrum som merparten av den här familjens differentiering vilar på.

Så beslutet är snävare än marknadsföringen antyder. Om du genererar i volym gäller prisändringen redan dig. Om du behöver de nya språken eller klangfärgsöverföringen bör du migrera och validera funktionen med ditt eget ljud först. Om du behöver en försvarbar kvalitetssiffra, vänta tills Qwen-Audio-3.1-TTS dyker upp i en blindlyssningsarena – det är den enda händelsen som skulle avgöra saken, och tills den inträffar är den ärliga hållningen att den nyare modellen är den billigare och den äldre modellen är den beprövade.