Ett hero-kort som jämför Qwen-Audio-3.1-TTS med ElevenLabs Eleven v3 och listar Qwens 16 språk plus 20 dialekter, 70 % prissänkning och avsaknad av ett arena-betyg mot ElevenLabs 74 språk, cirka 100 USD per miljon tecken och Elo på 1 168, ovanför ett band med texten "Tillkännagavs på Apsara, 23 september 2026".
Guides & Insights

Qwen-Audio-3.1 vs ElevenLabs: En prissänkning på 70 % möter den etablerade aktören

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Leverantören sänkte priset på sitt Qwen-Audio-3.1-TTS-API med ungefär 70 % den 23 september 2026 och tillkännagav det på scen vid Apsara Conference i Hangzhou tillsammans med fyra andra talmodeller. Den siffran är anledningen till att den här jämförelsen är värd att skriva: ElevenLabs Eleven v3 har varit standardrösten för produktion hos de flesta västerländska team till en effektiv taxa på nära 100 dollar per miljon tecken, och en trovärdig utmanare har just satt ett nytt pris för samma jobb till en bråkdel av det samtidigt som den breddar språktäckningen. De två systemen är inte likvärdiga – Qwen-Audio-3.1-TTS är ett API som endast finns som hostad tjänst från leverantörens Tongyi Lab med ett mindre röstekosystem, medan ElevenLabs är en komplett innehållsplattform med branschens djupaste röstbibliotek. Men om ditt beslut någonsin har avgjorts av fakturan förändrades kalkylen den här veckan.

Vad som faktiskt släpptes den 23 september

Qwen-Audio-3.1 är inte en enda modell. Det är en uppdatering av hela Alibabas talstack med fem modeller, och nivåerna spelar roll eftersom de har olika prissättning och olika uppgifter:

Qwen-Audio-3.1-TTS — den direkta efterföljaren till syntesmodellen som de flesta team använder. Lägger till sju språk för totalt 16, behåller de 20 kinesiska dialektregionerna, lägger till naturlig tvärspråklig klangfärgsöverföring (en röst som bär över mandarin, kantonesiska, engelska och japanska), instruktionsbaserad styrning av känsla, tempo och framföringsstil, och hanterar brusigt, ekande eller på annat sätt bristfälligt referensljud utan ett separat brusreduceringsläge.

Qwen-Audio-3.1-TTS-Next — en ny nivå, och en annan produkt. Alibaba kallar den för en "Audiogen"-modell: den genererar röst, ljudeffekter och bakgrundsambiens i en enda omgång utifrån text, tidsstämplar och referensljud. Dialog med flera talare, poddar, film- och TV-ljudlandskap, 48 kHz-utdata. Enligt Alibaba Clouds dokumentation för Model Studio tar den emot upp till 3 000 tecken indata, begränsar genererat ljud till 240 sekunder för poddar och 120 sekunder i övriga fall, körs med 3 förfrågningar per sekund och returnerar WAV, MP3 eller PCM.

Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next och Qwen-Audio-3.1-Realtime — igenkänning, ljudförståelse (känslor, musik, miljöljud, händelselokalisering) respektive full-duplex-konversation. Realtime är den som Alibaba pressar in i hårdvara: Qwen Office, Qoder, QwenNote A2, skrivbordsroboten QwenNote Eva och Qwen AI-glasögonen.

Prissänkningarna omfattade hela produktlinjen, inte bara TTS: syntes ned med cirka 70 %, realtid ned med cirka 85 %, igenkänning ned med så mycket som 95 %. Alibaba har också släppt Qwen-Audio-Agent med öppen källkod, ett ramverk för att bygga realtidsröstagenter, och lanserade Qwen3.8-LiveTranslate med latensen pressad till under 2,5 sekunder.

A screenshot of Alibaba Cloud Model Studio's English documentation site showing the reference page for qwen3.8-livetranslate-flash-realtime, a real-time audio and video translation model that accepts audio and images and outputs text and audio across 60 input languages and 29 speech output languages, under an Apsara 2026 Conference banner, with the Speech-to-Speech branch of the navigation listing the qwen-audio-3.0 realtime models.

Resultattavlan

A two-column scoreboard for Qwen-Audio-3.1-TTS and ElevenLabs Eleven v3 across price, languages, weights, voice library, delivery control and arena score, with a footer stating that the Qwen figures are vendor-reported and unscored and the ElevenLabs figures are per Artificial Analysis.

Pris — Qwen-Audio-3.1-TTS: ungefär 70 % lägre än den föregående Qwen-Audio-generationen, som placerade 3.0 Plus-nivån på nära 27,60 USD per 1 miljon tecken och Flash-nivån på nära 15 USD. ElevenLabs Eleven v3: omkring 100 USD per 1 miljon tecken enligt Artificial Analysis, med Flash på ungefär 50 USD.

Språk — Qwen-Audio-3.1-TTS: 16 språk plus 20 kinesiska dialektområden. ElevenLabs Eleven v3: 74 språk.

Vikter — Qwen-Audio-3.1-TTS: stängd, endast hostad på Alibaba Cloud Model Studio. ElevenLabs Eleven v3: stängd, endast hostad.

Röstbibliotek — Qwen-Audio-3.1-TTS: inbyggd kloning plus klangfärgsöverföring mellan språk; ingen jämförbar offentlig marknadsplats. ElevenLabs: branschens största delade röstbibliotek, plus omedelbar kloning från cirka 30 sekunders ljud.

Styrning av framförandet – Qwen-Audio-3.1-TTS: instruktionsbaserad känsla, tempo och stil, som ärver de 86 inline-taggar för framförande som introducerades med 3.0. ElevenLabs Eleven v3: ljudtaggar plus den omgivande plattformen (dubbning, agenter, studio).

Oberoende benchmark — Qwen-Audio-3.1-TTS: inga än så länge. ElevenLabs Eleven v3: 1 168 Elo på Artificial Analysiss topplista för Provider Voice Arena i augusti 2026.

Där utmanaren verkligen vinner

Tre saker, och bara en av dem är priset.

Priset, förstås. En sänkning på 70 % jämfört med en etablerad aktör som tar 100 dollar per miljon tecken är ingen avrundningsskillnad. Det är skillnaden mellan en produkt du prototypar med och en produkt du levererar till varje användare. Om du genererar berättarröst i stor volym är den årliga besparingen inte en post du behöver argumentera för internt – den argumenterar för sig själv.

Kinesiska, otvetydigt. Tjugo kinesiska dialektregioner är en vallgrav som inget ElevenLabs erbjuder kommer i närheten av. Om din produkt betjänar kinesiska användare på fastlandet, eller kantonesisktalande, eller en diasporapublik som kodväxlar mitt i meningar, är jämförelsen över innan den ens har börjat.

Tvärspråklig överföring av klangfärg. Qwen-Audio-3.1-TTS tar en röst och bär den naturligt över mandarin, kantonesiska, engelska och japanska. Det är en specifik förmåga med ett specifikt användningsområde – en enda varumärkesröst som överlever ett språkbyte – och det är en verklig särskiljare för alla som lokaliserar en och samma presentatör i stället för att casta en ny per marknad.

Där ElevenLabs fortfarande vinner, och det är inte ens nära

Språkbredden är det första, och den är det största. Sjuttiofyra språk mot sexton är inte en klyfta som du sluter med ett prisbesked. Om du släpper på polska, turkiska, vietnamesiska och portugisiska täcker ElevenLabs dig i dag och Qwen-Audio-3.1-TTS gör det inte.

Det andra är ekosystemet. ElevenLabs är inte en syntes-endpoint; det är en innehållsplattform. Ett delat röstbibliotek som du kan licensiera i stället för att klona, dubbningsarbetsflöden, agentinfrastruktur, en studio-produkt, en dokumenterad API-yta med års av klientbibliotek bakom sig. Att migrera bort från det är ett projekt, inte en konfigurationsändring, och teamen som har byggt på det vet exakt vad de skulle ge upp.

Den tredje är något svårare att sätta fingret på och ändå värd att nämna: upplevelsen av naturlighet hos en enskild engelsk röst. Qwens syntes har historiskt varit utmärkt på kinesiska och bara mycket bra på engelska, och även om version 3.1 sägs förbättra flerspråkig återgivning finns det ännu inget oberoende lyssningstest av den nya modellen. Den som säger sig veta hur den nya Qwen-rösten låter på engelska gissar.

Siffran som ingen borde citera ännu

Det här är den del av historien som kommer att förvanskas i bevakningen, så här är den utan omsvep. Qwen-Audio-3.1-TTS har ingen oberoende benchmarkpoäng. Dess föregångare, Qwen-Audio-3.0-TTS-Plus, låg på 1 234 Elo på topplistan Provider Voice Arena från Artificial Analysis i mitten av augusti 2026 och rankades mellan andra och femte plats på den tavlan. Qwen-Audio-3.1-TTS har ännu inte lagts till i någon arena. Alla kvalitetsanspråk i Alibabas lanseringsmaterial är leverantörsrapporterade och inte reproducerade.

Det gör inte påståendena falska. Det gör dem overifierade, och det betyder att den ärliga beskrivningen av den här jämförelsen just nu är: en modell med ett pris och ingen poäng, mot en modell med en poäng och ett mycket högre pris. Allt starkare än så är spekulation klädd i en benchmarks kläder.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard in its August 2026 state, ranking text-to-speech models by Elo: Cartesia Sonic 3.6 first at 1,277, Alibaba's Qwen-Audio-3.0-TTS-Plus at 1,234 and ElevenLabs Eleven v3 at 1,168.

Samma disciplin gäller för latens. Alibabas rubriksiffra för första token för ASR-sidan av den här familjen – 92 millisekunder – kommer från företagets egen benchmark för hög samtidighet på en 0,6B-specifikation, inte från tredjepartstestning, och analys som publicerats sedan lanseringen noterar att ASR och TTS är separata produkter i en pipeline snarare än en end-to-end-modell, och att communityrapporter beskriver hur latens ackumuleras i långa dialoger under ett pseudoströmningsmönster. Betrakta leverantörens latenssiffror för hela den här familjen som tak, inte som uppmätt upplevelse.

Vad prissänkningen är värd i praktiken

Ta en realistisk arbetsbelastning: en produkt som syntetiserar 20 miljoner tecken berättarröst per månad på både engelska och mandarin. Med priset för ElevenLabs Eleven v3 på cirka 100 USD per miljon tecken blir det ungefär 2 000 USD i månaden, eller 24 000 USD om året. Med priset för Qwen-Audio-3.0-TTS-Plus på cirka 27,60 USD per miljon låg samma volym redan på omkring 552 USD i månaden. Tillämpa den cirka 70-procentiga prissänkningen som Alibaba tillkännagav den 23 september, så landar samma arbetsbelastning på några hundra dollar i månaden.

Ingen av dessa siffror är listpriser som du kan skriva under på — ElevenLabs fakturerar i krediter via prenumerationsnivåer, och Alibabas sänkningar är procentuella minskningar av priser som varierar beroende på region och nivå. Men jämförelsens form är otvetydig, och det är formen du budgeterar utifrån.

En sak som är värd att påpeka för alla som modellerar detta noggrant: Alibaba Cloud har flyttat sin fakturering för transkribering i realtid på Singapore-noden från varaktighetsbaserad mätning till tokenbaserad mätning, till 0,93 USD per miljon indatatokens och 0,70 USD per miljon utdatatokens. Tokenfakturering är mindre förutsägbar än varaktighetsfakturering när du inte kan styra hur många tokens ett givet ljudsegment blir, och brus, tystnad och kontext över flera turer blåser alla upp tokenförbrukningen. En sänkning på 70 % i rubrikerna översätts inte automatiskt till en besparing på 70 % för din specifika trafik.

Hur man faktiskt kör switchen

Om du utvärderar detta är det som är användbart att veta vad en migrering kostar dig i utvecklingstid. Båda modellerna är stängda, hostade API:er, så du integrerar mot en HTTP-slutpunkt oavsett, och arbetet är en klient, en återförsökspolicy och en röstinventering – inte en omarkitekturering.

Det är där OrcaRouters upplägg hjälper till, med ett ärligt förbehåll först: vi dirigerar inte Qwen-Audio-3.1-TTS eller någon Qwen-Audio-modell. Alibabas röstslutpunkter ligger utanför vårt område, och samma sak gäller ElevenLabs. Det vi täcker är inferenslagret runt dem — en API-nyckel över 200+ textmodeller med 0 % påslag, vilket innebär att leverantörens listpris går rakt igenom, så en leverantörs prissänkning är live hos oss samma dag i stället för efter en omprissättningscykel. För team som bygger applikationen som driver en talpipeline — sammanfattaren, manusgeneratorn, innehållsplaneraren — betyder det ett avtal i stället för flera, automatisk failover när en uppströmstjänst försämras, och ett routing-DSL för att komponera modeller till ett enda anrop. Det betyder inte att du anropar Qwens röst genom oss. Den som säger något annat har inte läst katalogen.

Vem ska flytta, och vem ska vänta

Byt nu om din arbetsbelastning är kinesiska i första hand, om dialekttäckning finns på din kravlista, om volymkostnad är den begränsning som har hållit dig kvar vid en billigare men sämre röst, eller om du behöver en varumärkesröst som klarar ett språkbyte. Prissättningen den 23 september gör ekonomin svår att argumentera emot, och den kinesiskspråkiga kvaliteten var redan konkurrenskraftig innan dess.

Vänta om du levererar på fler än ungefär sexton språk, om din produkt är beroende av ett licensierbart röstbibliotek i stället för kloning, om du är djupt inne i en plattforms dubbnings- eller agentverktyg, eller om din upphandlingsprocess kräver ett oberoende kvalitetsbetyg före godkännande. Inget av detta är permanenta hinder, men inget av det åtgärdades av en prissänkning.

Och håll särskilt koll på en sak: huruvida Qwen-Audio-3.1-TTS dyker upp på en blindlyssningsarena. I samma stund som den gör det slutar den här jämförelsen handla om pris och antal språk och börjar handla om huruvida den billigare rösten faktiskt är lika bra. Det är frågan som lanseringen inte besvarade.