
Eleven v4 vs Qwen Audio 3.1: Den billigaste rösten på tavlan vann
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 982 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 197 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
På tavlan där varje deltagare får samma åtta klonade röster, Alibaba Qwen-Audio-3.1-TTS-Plusslutade etta på Elo 1 178 och ElevenLabs Eleven v4slutade tvåa på 1 157. Modellen som vann kostar 19,30 dollar per miljon tecken på den tavlan. Modellen som kom tvåa kostar 80,00 dollar. Det är ett kvalitetsgap på 21 punkter och en fyrfaldig prisskillnad som pekar i motsatta riktningar, och det är det mest intressanta resultatet under hela lanseringsveckan — mer intressant än förstaplatsen som ElevenLabs tog på den andra arenan, eftersom rangordningen där är konventionell och vinnaren är den dyraste rösten i topp tio.
De två resultattavlorna är inte utbytbara, och anledningen till att den här jämförelsen läses som den gör ligger helt och hållet i vilken av dem man tittar på. Provider Voice låter lyssnare bedöma varje leverantörs egna röster. Controlled Voice klonar samma åtta röster – fyra amerikanska, fyra brittiska – för varje modell, så ingen kan vinna på sin förvalda röstuppsättning. ElevenLabs vinner den första med 61 poäng. Alibaba vinner den andra med 21. Ingen av resultattavlorna är fel, och det är den andra som förutsäger en produkt som levererar en klonad varumärkesröst.

Resultattavlan för kontrollerad röst, i sin helhet
• Blind preferens, matchade kloner — Qwen-Audio-3.1-TTS-Plus rang 1, Elo 1 178, $19,30 per miljon tecken mot Eleven v4 rang 2, Elo 1 157, $80,00.
• Blind preferens, varje leverantörs egna röster — Eleven v4 rang 1, Elo 1 319 mot Qwen-Audio-3.0-TTS-Plus rang 4, Elo 1 258. En skillnad på 61 poäng åt andra hållet.
• Pris, arenanormalisering — Qwen 19,30 $ vs Eleven v4 80,00 $. Qwen är 76 % billigare.
• Pris, leverantörens prislista — Eleven v4 $0,022 per tusen tecken i kampanjpris och $0,08 efter den 12 oktober. Qwen Audio 3.1:s egen prislista kunde vi inte läsa, så arena-normaliseringen är det enda pris vi kan jämföra med.
• Version på varje kort — 3.1 på Controlled Voice, 3.0 på Provider Voice. De är olika modeller och korten är inte utbytbara.
• 3.0-posten för Controlled Voice – rang 5, Elo 1 124, samma pris på 19,30 $. 3.1-versionen är värd 54 Elo mer än sin egen föregångare till ett identiskt pris.
• Qwens tidigare generationer på Provider Voice — Qwen3 TTS Flash rang 79, Elo 944; Qwen3 TTS rang 82, Elo 930.
• ElevenLabs eget tidigare flaggskepp på Controlled Voice – Eleven v3 placering 7, Elo 1 073.
• Rimlighetskontroll av grupperade staplar — den åttavägsspridning som går från rang 1 till rang 10 i Controlled Voice är 121 Elo. Qwens 21-poängsledning över Eleven v4 är under en femtedel av hela fältets spann, vilket är rätt skala att hålla den på.

Två rader där gör det mesta av jobbet. Den första är jämförelsen mellan 3.0 och 3.1: Alibaba flyttade 54 Elo i en enda versionsuppdatering utan att ändra priset alls. Det är en snabbare takt än ElevenLabs flytt på 84 punkter från v3 till v4, och det betyder att den specifika rangordningen i den här artikeln är en ögonblicksbild som båda leverantörerna aktivt håller i rörelse.
Det andra är den totala spridningen på 121 punkter. En lucka på 21 punkter på en resultattavla vars användbara spann är ungefär 120 punkter är en verklig men blygsam skillnad – ungefär av samma storleksordning som skillnaden mellan Qwens egen 3.1 och dess 3.0. Om ditt användningsfall är på ett språk som ingen av modellerna har finjusterats mot, ligger den marginalen väl inom det intervall som några svåra testskript kan kullkasta.
Versionsproblemet som ingen flaggar
Resultatet som cirkulerar som "Eleven v4 är tvåa på Controlled Voice" är korrekt och ofullständigt, och utelämnandet har betydelse för alla som planerar utifrån det. Modellen som ligger ovanför Eleven v4 på den tavlan är Alibabas 3.1-släpp. På Provider Voice-tavlan är Qwen-posten däremot 3.0-släppet — 3.1-modellen finns inte med i de översta raderna på den tavlan så som vi läser den. Så de två rubrikerna — "Eleven v4 är nummer ett" och "Eleven v4 är nummer två" — är påståenden om två olika Qwen-modeller i två olika uppgifter, och den Qwen-version som besegrade den på en tavla är inte den Qwen-version som den besegrade på den andra.
Det här är inte en kuggfråga om någon av leverantörerna; det är en anledning att misstro varje sammanfattning i en enda mening av en vecka som den här. Om du väljer mellan dessa två system är jämförelsen du vill ha 3.1 mot v4 på din egen klonade röst, på ditt eget språk, och ingen av leverantörerna har publicerat den.
Vad vi kan och inte kan säga om Qwen Audio 3.1
Ärlighet om bevis väger tyngre här än en fullständig specifikationstabell, så här är gränsen för vad den här artikeln vilar på. Från arenans resultattavlor har vi, för Qwen-Audio-3.1-TTS-Plus: ett kontrollerat röst-Elo på 1 178, en prisnormalisering på 19,30 dollar per miljon tecken och det faktum att det är den aktuella utgåvan i en serie vars tidigare version fick 54 poäng lägre till samma pris.
Vi har inte, och kommer inte att gissa oss till: dess språktäckning, dess latens, dess gräns för indata per begäran, huruvida den stöder inline-leveransdirektiv, huruvida den erbjuder röstkloning utöver arenans åtta röster, eller vad den debiterar enligt sin egen prislista. Allt detta är dokumenterat för Eleven v4 – över 90 språk, en gräns på 10 000 tecken, ljudtaggar, omedelbara kloner på tio sekunder, stöd för IPA-fonem – och deras frånvaro på Qwen-sidan är en lucka i det som är offentligt läsbart, inte ett underbetyg för modellen. Ett köpbeslut som fattas enbart utifrån den här artikeln skulle vara ett beslut fattat på två siffror.

En kontrast överlever ändå den begränsningen, eftersom båda sidorna är leverantörsuppgivna eller båda är angivna av resultattavlan. När det gäller pris är resultattavlans normalisering den gemensamma nämnaren och den gynnar Qwen med 76 %. När det gäller kvalitet under matchade talare gynnar samma resultattavla Qwen med 21 Elo. De två raderna är jämförbara. Allt annat här är det inte, och artikeln kommer inte att låtsas något annat.
Varför en kontrollerad styrelse bör väga tyngre än vanligt
De flesta röstjämförelser utgår som standard från vilken topplista som helst som placerar modellen du redan gillar i toppen. I den här duellen finns det en principiell anledning att föredra Controlled Voice, och den är specifik snarare än allmän.
Alibaba och ElevenLabs tävlar med vitt skilda tillgångar. ElevenLabs fördel är ett röstbibliotek som byggts upp under flera års kurerad casting; Alibabas är en forskningsorganisation som släpper modellversioner i snabb takt. En resultattavla där varje deltagare får ta med sina egna röster mäter biblioteket lika mycket som syntetiseraren, och på den tavlan vinner ElevenLabs med 61 poäng. Ta bort biblioteken — samma åtta klonade talare för alla — och fördelen byter sida. Om rösten dina användare hör är en klon av en specifik person köper du inte ElevenLabs bibliotek, så den kontrollerade resultattavlan är den som beskriver ditt köp. Om du väljer från en meny med standardröster gäller motsatsen, och Eleven v4:s marginal på 61 punkter är siffran som avgör.
Det finns en andra, mindre bekväm anledning att vikta det kontrollerade resultatet. En panel med leverantörsröster belönar en särpräglad standardbesättning, och en särpräglad besättning kan polarisera på sätt som ett genomsnittligt Elo döljer – det som är karaktärsfullt för en lyssnare är tillgjort för en annan. En panel med klonade röster och matchade talare tar bort den variabeln helt, vilket gör den till den mer reproducerbara av de två mätningarna.
Att köra endera, och vad vi faktiskt routar
OrcaRouter tillhandahåller varken ElevenLabs eller Alibabas talmodeller. Ingen av leverantörerna finns med i vår katalog, så det finns inget sätt att anropa någon av dem via oss, och den här artikeln kommer inte att antyda något annat – du vänder dig till leverantörens eget API och flera tredjepartsplattformar för båda.
Det vi täcker är lagret ovanför. Om din talstack är en nod i en större pipeline betjänar vi över 200 modeller bakom en enda API-nyckel med leverantörernas listpriser vidareförmedlade med 0 % påslag, så en prisändring hos någon uppströms aktör – inklusive ElevenLabs kampanjperiod och det betydligt högre listpris som följer den den 12 oktober – återspeglas hos oss samma dag som den sker, i stället för vid nästa faktureringscykel. För ett beslut som hänger på en priskvot på 4x är den tidpunkten skillnaden mellan en jämförelse som håller över tid och en som framstår som fel om tre veckor.
Och där röstvägen inte kan gå ner, flyttar automatisk failover trafiken till en frisk uppströmsnod i stället för att låta begäran misslyckas. I en matchning som är så jämn i kvalitet och så skev i pris är den förnuftiga arkitekturen båda modellerna bakom en enda slutpunkt med routning som avgör fördelningen – inte ett permanent val gjort från en ögonblicksbild av en topplista som båda leverantörerna kommer att ogiltigförklara inom ett kvartal.
Domen, och dess utgångsdatum
Välj Qwen-Audio-3.1-TTS-Plus om du klonar en röst och håller koll på kostnaden. Den ligger först på resultattavlan som håller rösterna konstanta, den kostar ungefär en fjärdedel av priset, och dess kurva rör sig snabbare – 54 Elo i ett versionssteg till oförändrat pris tyder på att nästa version är ett bättre val än den nuvarande är på papper.
Välj Eleven v4 om dina användare hör standardröster, om du behöver täckning i språk som du kan verifiera före lansering, eller om den dokumenterade funktionsuppsättningen – ljudtaggar, fonemstyrning, förfrågningar på 10 000 tecken, kloner på tio sekunder – gör arbete i din produkt som arena-tavlorna inte mäter. Dess ledning med 61 poäng på tavlan för leverantörsröster är inte att förakta, och de två funktioner du kan skriva in i ett skript är förmågor, inte poäng.
Sätt ett granskningsdatum. Alibaba flyttade 54 Elo i en versionsuppdatering den här cykeln och ElevenLabs flyttade 84 över en hel generation, och Eleven v4:s kampanjpris går ut den 12 oktober. Vad den här jämförelsen än säger i dag, de två fakta som med störst sannolikhet vänder den – en 3.2-utgåva och ett återställt pris – inträffar båda före kvartalets slut.
