Ett genererat hero-kort med titeln 'HeyGen Voice vs Qwen-Audio-3.0-TTS' som visar 79-poängsgapet i Elo för kontrollerad röst mot de två priserna per miljon tecken, med en notering om att det ena priset är publicerat av leverantören och det andra är arenans härledda omvandling av kreditprissättning, enligt Artificial Analysis, 9 oktober 2026. OrcaRouter-logotypen visas i det nedre högra hörnet.
Engineering & Research

HeyGen Voice vs Qwen-Audio-3.0-TTS: Vad du betalar för Elo, och vilken Qwen-nivå du faktiskt benchmarkade

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Kör aritmetiken först, eftersom den är mindre obalanserad än resultattavlan antyder. Qwen-Audio-3.0-TTS-Plus kostar 19,30 dollar per miljon tecken på plattformen Model Studio – en taxa som leverantören publicerar. HeyGen Voice ligger på 30,00 dollar per miljon tecken i Artificial Analysiss egen prislista, en siffra som webbplatsen härleder från HeyGens kreditprissättning, eftersom HeyGens offentliga prissida säljer krediter utan att ange vad en röstgenerering förbrukar. Samtidigt är gapet i kontrollerad röst mellan dem 79 Elo: HeyGen Voice fick 1 202 i arenan som håller alla åtta referensröster konstanta, Qwen-Audio-3.0-TTS-Plus 1 123. Så den billigare modellen rankas långt efter den bättre, förhållandet mellan dem är ungefär 1,55×, och bara ett av de två priserna är en siffra som leverantören som säljer den har satt sitt namn på.

Fällan i namnet

Innan något av det: se till att få rätt nivå, för det här är en familj som gladeligen låter dig benchmarka fel modell. Två Alibaba-poster spelar roll här, och de är inte utbytbara.

Qwen-Audio-3.0-TTS-Plus är modellen som den här artikeln jämför mot. Den får 1 123 på den kontrollerade tavlan – sjunde av fyrtiotvå – och 1 264 på Provider Voices-tavlan, där den rankas som sexa av nittiosex. Det är en verklig, aktuell streaming-TTS-produkt med ett publicerat pris på 19,30 USD per miljon tecken.

Qwen-Audio-3.1-TTS-Plus är dess efterföljarnivå, och det är den som ligger tvåa på den kontrollerade resultattavlan med 1 186 – modellen som kom närmast att slå HeyGen Voice vid sin debut. Dess pris anges till samma 19,30 dollar, även om Alibabas dokumentation varnar för att olika modellversioner kräver matchande röster, så ”samma pris, nyare nivå” betyder inte ”drop-in”.

Den som läser "#1 före Qwen" och sedan benchmarkar Qwen-Audio-3.0-TTS kommer att testa en modell som är 63 Elo svagare än den som rubriken handlade om. Invändningen om nivån är värd 63 poäng, vilket är mer än gapet mellan HeyGen Voice och tredjeplatsen.

Resultattavlan

A generated two-column scoreboard titled 'HeyGen Voice vs Qwen-Audio-3.0-TTS — the scoreboard'. The HeyGen Voice column reads 'Controlled Voice Elo: 1,202, #1 of 42', 'Provider Voices Elo: not ranked', 'Price per 1M characters: $30.00, arena conversion of credit pricing', 'Cost of 100 hours of narration: roughly $1,440, derived', 'Voice control: design from a description, instant clone, professional clone' and 'Audio output: speed 0.5 to 1.5, pitch plus or minus 50 semitones'. The Qwen-Audio-3.0-TTS-Plus column reads 'Controlled Voice Elo: 1,123, #7 of 42', 'Provider Voices Elo: 1,264, #6 of 96', 'Price per 1M characters: $19.30 on Alibaba Cloud', 'Cost of 100 hours of narration: roughly $926', 'Voice control: instruction parameter, emotion and language tags, cloning and design' and 'Audio output: PCM, WAV, MP3 and Opus up to 48kHz'. A footer states that the Qwen price is Alibaba Cloud Model Studio's published rate at default settings while the HeyGen figure is the arena's conversion of credit pricing.

• Kontrollerat röst-Elo (samma 8 klonade röster) — HeyGen Voice: 1 202, #1 av 42. Qwen-Audio-3.0-TTS-Plus: 1 123, #7.

• Leverantörsröster Elo (inhemska röster) — Qwen-Audio-3.0-TTS-Plus: 1 264, nr 6 av 96. HeyGen Voice: inte rankad.

• Pris per 1 miljon tecken — Qwen-Audio-3.0-TTS-Plus: 19,30 USD, publicerat av leverantören på Alibaba Cloud. HeyGen Voice: 30,00 USD enligt arenans egen omräkning av kreditpriser; HeyGen publicerar ingen rösttaxa.

• Kostnad för 100 timmars uppläsning — Qwen-Audio-3.0-TTS-Plus: cirka 926 $ vid ~480 000 tecken per talad timme. HeyGen Voice: cirka 1 440 $ utifrån arenans omvandling på 30,00 $ — framräknat, inte angivet.

• Röststyrning — Qwen-Audio-3.0-TTS-Plus: instruktionsparameter, känslo- och språktaggar, röstkloning och röstdesign. HeyGen Voice: text-till-röst-design från en beskrivning på ≤1 000 tecken, omedelbar klon, professionell klon tränad på 20+ minuter.

• Utdata — Qwen-Audio-3.0-TTS-Plus: PCM, WAV, MP3 och Opus i upp till 48 kHz, med justerbar hastighet, tonhöjd, volym och bithastighet. HeyGen Voice: hastighet 0,5–1,5 och tonhöjd ±50 semitoner per begäran.

A screenshot of Artificial Analysis's Controlled Voice arena leaderboard, captured 10 October 2026, showing the language selector set to 'English (US & UK)' with HeyGen Voice first at 1,202 Elo, Qwen-Audio-3.1-TTS-Plus second at 1,186 and Qwen-Audio-3.0-TTS-Plus seventh at 1,123, alongside samples, release dates and per-1M-character API pricing columns showing $30.0 and $19.3 respectively.

Vad Alibabas ingenjörskonst faktiskt ger dig

Qwen-Audio-3.0-TTS-familjen är en streamingprodukt, och dokumentationen är skriven därefter. Förfrågningar går över ett WebSocket-protokoll som delas med CosyVoice, med händelseflödet run-task, continue-task och finish-task samt svaren task-started, result-generated, task-finished och task-failed tillsammans med dem. Avbrott stöds på alla Qwen-Audio-TTS-modeller i både regionen Beijing och Singapore via streaming_cancel(). Utdata når 48 kHz, och formaten inkluderar Opus, vilket spelar roll om du flyttar ljud till en webbläsare eller ett telefonsamtal i stället för en WAV-fil.

Två detaljer i den dokumentationen är lätta att missa och dyra att upptäcka sent. Taggar för emotion och rikt språk gäller endast Plus- och Flash-nivåerna – inte hela familjen – och de fungerar bara i enkelriktat streamingläge. Och API-nycklar skiljer sig mellan regionerna Singapore och Peking, med arbetsytor som adresseras på URL:er av formen wss://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api-ws/v1/inference. Regionala nycklar är en provisioning-detalj tills den dag de blir ett avbrott.

HeyGens sida är en produkt av annan form: ett REST-liknande v3-API där POST /v3/voices/speech genererar tal, GET /v3/voices listar katalogen bakom ett motor filter, och röstdesign returnerar upp till tre rangordnade alternativ från en textprompt med en seed för reproducerbarhet. Dokumentationen avslöjar också att motor filtret accepterar värden bortom HeyGens egna — så HeyGen dirigerar dig gladeligen till en röstmotor från tredje part via sitt API. En leverantör som levererar en konkurrents modell som ett valbart alternativ berättar något om var den anser att dess egen styrka ligger.

A screenshot of HeyGen's public landing page, captured 10 October 2026, showing the headline 'The video you imagine, delivered into your system.' with the line about orchestrating avatars, voices, images, editing, music and assets into deterministic, repeatable renders.

Vart 79 Elo tar vägen

Ett gap på 79 poäng på en kontrollerad resultattavla är betydande – större än den marginal på 16 poäng som skiljer HeyGen Voice från andraplatsen, och ungefär avståndet mellan tredje- och åttondeplats i det fältet. Det mäts dessutom på en enda axel.

Den kontrollerade arenan klonar åtta röster och håller dem fixerade. Den säger ingenting om den instruktionsstyrda kontrollsyta som Qwen exponerar, ingenting om 48 kHz Opus-utdata via en avbrytbar WebSocket och ingenting om regional driftsättning. Det är tekniska egenskaper, och de är anledningen till att ett team som bygger ett mandarinspråkigt kontaktcenter inte skulle byta till en modell som får 79 poäng högre på åtta engelskspråkiga referensröster.

Vad det kontrollerade resultatet faktiskt säger är snävare och fortfarande användbart: när båda motorerna får samma klonade röst föredrog lyssnarna HeyGen Voice-renderingen. Om din produkt klonar röster är det din axel. Om din produkt väljer en röst från en katalog och strömmar den in i ett samtal, ligger leverantörsrankingen närmare din verklighet – och där har HeyGen Voice ingen placering alls medan Qwen-Audio-3.0-TTS-Plus ligger på sjätte plats av nittiosex.

Prisargumentet, taget på allvar

Till $19,30 per miljon tecken är Qwen-Audio-3.0-TTS-Plus ungefär hälften så dyrt som ElevenLabs nivå på $40 och omkring 40 % av Cartesia Sonic 3.6:s $49. För en arbetsmängd på 100 timmars uppläsning — cirka 48 miljoner tecken vid ett typiskt taltempo — rör det sig om i storleksordningen $926. Samma volym med Eleven v4 Turbo skulle kosta omkring $1 920 och med Sonic 3.6 omkring $2 352. HeyGen Voice, med arenans $30,00, hamnar nära $1 440: mellan den billiga nivån och de två etablerade aktörerna, närmare mitten än toppen.

Den uträkningen har en brasklapp som de andra inte behöver. 19,30 $ är Alibabas egen publicerade taxa. 30,00 $ är Artificial Analysis omvandling av ett kreditsystem som HeyGen aldrig har översatt till tecken, så det är en uppskattning i god tro snarare än en prisuppgift. Om det verkliga förhållandet tecken per kredit är sämre än vad diagrammet antar, kostar 79-Elo-fördelen mer än vad 1,55× antyder; om det är bättre, mindre. En modell vars pris man måste sluta sig till är en modell man pilottestar på en uppmätt trafikandel snarare än en man standardiserar på. Det är inte en kritik av motorn — det är en beskrivning av den information som finns tillgänglig den 10 oktober 2026.

Att besluta

Välj Qwen-Audio-3.0-TTS-Plus när kostnad och streaminginfrastruktur styr beslutet. Under 20 USD per miljon tecken, en avbrytbar WebSocket med 48kHz Opus-utdata, en instruktionsparameter och känslotaggar samt en sjätteplats på leverantörsboarden gör den till den mest kostnadseffektiva välbetygade rösten i den här jämförelsen. Välj i stället 3.1-nivån om du vill ha modellen som faktiskt kom tvåa på den kontrollerade boarden, och verifiera röstlistan innan du antar att bytet är gratis.

Testa HeyGen Voice när kloningsfidelitet är själva produkten. En talare, många repliker, en röst som måste vara *den* rösten varje gång — det är den axel som den kontrollerade panelen mäter och den axel där den leder hela fältet. Budgetera för en mätperiod, eftersom kreditmodellen innebär att du lär dig din verkliga kostnad genom att köra din egen text i stället för att läsa en prislista.

Och ignorera jämförelsen helt om arbetsbelastningen är kinesiskspråkig och i realtid. Inget av Elo-talen mättes på dina röster, på ditt språk, vid din latensbudget.

Att hålla båda nåbara

Detta är en av kombinationerna där routningslagret förtjänar sin plats i stället för att vara ett påhäng. En enda API-nyckel som täcker båda leverantörerna – leverantörens listpris förs vidare utan påslag, så Alibabas publicerade $19.30 är vad du betalar och en Qwen-prisändring slår igenom samma dag – tar bort behovet av att välja en vinnare innan du har bevis. Automatisk failover täcker den uppenbara risken i en röstpipeline, där en avstannad ström hörs av lyssnaren, och routnings-DSL:en låter dig skicka massuppläsning till den billiga motorn och klonningskritiska rader till den som får 79 poäng högre, utan två klientbibliotek och två faktureringsrelationer. OrcaRouters värde här är inte att den hostar en röstmodell; det är att den gör kostnaden för att ta reda på vilken du vill ha i stort sett noll.

De öppna frågorna

Tre saker skulle avgöra saken. En rösttaxa på HeyGens egen prissida skulle förvandla de $30.00 som arenan härleder till en siffra du kan granska. En HeyGen-post på Provider Voices-tavlan skulle tala om för oss huruvida den klonade röstens ledning står sig mot nativa röster — testet som Qwen-Audio-3.0-TTS-Plus klarar på sjätte plats av nittiofyra. Och ett resultat för kontrollerad röst för Qwen-Audio-3.1-TTS-Plus mot HeyGen Voice efter fler röster skulle tala om för oss huruvida 16 Elo är en stabil rangordning. Fram till dess: Qwen är det prissatta, streamningsbara, välrankade alternativet; HeyGen Voice är det högre poängsatta, icke prissättbara alternativet; och nivån du benchmarkar spelar större roll än rubriken du läser.