Een gegenereerde heldkaart met de titel 'HeyGen Voice vs Qwen-Audio-3.0-TTS' die het Elo-verschil van 79 punten voor gecontroleerde stem toont tegenover de twee prijzen per miljoen tekens, met een opmerking dat de ene prijs door de leverancier is gepubliceerd en de andere de afgeleide omrekening van creditprijzen door de arena is, volgens Artificial Analysis, 9 oktober 2026. Het OrcaRouter-logo verschijnt in de rechteronderhoek.
Engineering & Research

HeyGen Voice vs Qwen-Audio-3.0-TTS: Wat je betaalt voor de Elo, en welke Qwen-tier je daadwerkelijk hebt gebenchmarkt

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Doe eerst de rekensom, want die is minder scheef dan het scorebord suggereert. Qwen-Audio-3.0-TTS-Plus kost $19,30 per miljoen tekens op het Model Studio-platform — een tarief dat de leverancier publiceert. HeyGen Voice staat op $30,00 per miljoen tekens in de eigen prijsgrafiek van Artificial Analysis, een cijfer dat de site afleidt uit HeyGen's creditprijzen, omdat de openbare prijspagina van HeyGen credits verkoopt zonder te vermelden wat een stemgeneratie verbruikt. Ondertussen is het verschil in gecontroleerde stemmen tussen hen 79 Elo: HeyGen Voice scoorde 1.202 in de arena die alle acht referentiestemmen constant houdt, Qwen-Audio-3.0-TTS-Plus 1.123. Dus het goedkopere model staat ver achter het betere, de verhouding tussen hen is ongeveer 1,55×, en slechts één van die twee prijzen is een getal waar de verkopende leverancier zijn naam aan heeft verbonden.

De val in de naam

Voordat je aan dat alles begint: zorg dat je de juiste tier kiest, want dit is een familie die je maar al te graag het verkeerde model laat benchmarken. Twee Alibaba-vermeldingen zijn hier van belang, en ze zijn niet onderling verwisselbaar.

Qwen-Audio-3.0-TTS-Plus is het model dat in dit artikel als vergelijking dient. Het scoort 1.123 op de gecontroleerde ranglijst — de zevende van de tweeënveertig — en 1.264 op de Provider Voices-ranglijst, waar het op de zesde plaats van de zesennegentig staat. Het is een echt, actueel streaming-TTS-product met een gepubliceerd tarief van $19,30 per miljoen tekens.

Qwen-Audio-3.1-TTS-Plus is de opvolgende tier, en het is degene die tweede staat op de gecontroleerde ranglijst met 1.186 — het model dat bij zijn debuut het dichtst bij het verslaan van HeyGen Voice kwam. Het tarief staat vermeld op hetzelfde bedrag van $19,30, hoewel de documentatie van Alibaba waarschuwt dat verschillende modelversies bijpassende stemmen vereisen, dus "dezelfde prijs, nieuwere tier" betekent niet "direct inzetbaar".

Iedereen die "#1 vóór Qwen" leest en vervolgens Qwen-Audio-3.0-TTS benchmarkt, test een model dat 63 Elo zwakker is dan het model waar de kop over ging. De tier-kwestie is 63 punten waard, wat meer is dan de kloof tussen HeyGen Voice en de derde plaats.

Het scorebord

A generated two-column scoreboard titled 'HeyGen Voice vs Qwen-Audio-3.0-TTS — the scoreboard'. The HeyGen Voice column reads 'Controlled Voice Elo: 1,202, #1 of 42', 'Provider Voices Elo: not ranked', 'Price per 1M characters: $30.00, arena conversion of credit pricing', 'Cost of 100 hours of narration: roughly $1,440, derived', 'Voice control: design from a description, instant clone, professional clone' and 'Audio output: speed 0.5 to 1.5, pitch plus or minus 50 semitones'. The Qwen-Audio-3.0-TTS-Plus column reads 'Controlled Voice Elo: 1,123, #7 of 42', 'Provider Voices Elo: 1,264, #6 of 96', 'Price per 1M characters: $19.30 on Alibaba Cloud', 'Cost of 100 hours of narration: roughly $926', 'Voice control: instruction parameter, emotion and language tags, cloning and design' and 'Audio output: PCM, WAV, MP3 and Opus up to 48kHz'. A footer states that the Qwen price is Alibaba Cloud Model Studio's published rate at default settings while the HeyGen figure is the arena's conversion of credit pricing.

• Gecontroleerde stem-Elo (dezelfde 8 gekloonde stemmen) — HeyGen Voice: 1.202, #1 van 42. Qwen-Audio-3.0-TTS-Plus: 1.123, #7.

• Provider Voices Elo (native stemmen) — Qwen-Audio-3.0-TTS-Plus: 1.264, #6 van 96. HeyGen Voice: niet gerangschikt.

•Prijs 1 Qwen-Audio-3.0-TTS-Plus-30, door de leverancier gepubliceerd op Alibaba Cloud. HeyGen Voice: $30.00 op basis van de omrekening van creditprijzen door de arena; HeyGen publiceert geen tarief voor spraak.

• Kosten van 100 uur voice-over — Qwen-Audio-3.0-TTS-Plus: ongeveer $926 bij ~480.000 tekens per gesproken uur. HeyGen Voice: ongeveer $1.440 op basis van de conversie van $30,00 van de arena — afgeleid, niet geciteerd.

• Spraakbesturing — Qwen-Audio-3.0-TTS-Plus: instructieparameter, emotie- en taaltags, spraakkloonering en spraakontwerp. HeyGen Voice: tekst-naar-stem-ontwerp op basis van een beschrijving van ≤1.000 tekens, directe kloon, professionele kloon getraind op 20+ minuten.

• Uitvoer — Qwen-Audio-3.0-TTS-Plus: PCM, WAV, MP3 en Opus tot 48kHz, met aanpasbare snelheid, toonhoogte, volume en bitrate. HeyGen Voice: snelheid 0,5–1,5 en toonhoogte ±50 halve tonen per verzoek.

A screenshot of Artificial Analysis's Controlled Voice arena leaderboard, captured 10 October 2026, showing the language selector set to 'English (US & UK)' with HeyGen Voice first at 1,202 Elo, Qwen-Audio-3.1-TTS-Plus second at 1,186 and Qwen-Audio-3.0-TTS-Plus seventh at 1,123, alongside samples, release dates and per-1M-character API pricing columns showing $30.0 and $19.3 respectively.

Wat de engineering van Alibaba je daadwerkelijk oplevert

De Qwen-Audio-3.0-TTS-familie is een streamingproduct en de documentatie leest als zodanig. Verzoeken verlopen via een WebSocket-protocol dat wordt gedeeld met CosyVoice, met de run-task, continue-task en finish-task gebeurtenissenstroom en de task-started, result-generated, task-finished en task-failed-responses daarnaast. Annulering wordt ondersteund op elk Qwen-Audio-TTS-model in zowel de regio Beijing als Singapore via streaming_cancel(). De uitvoer gaat tot 48 kHz en de formaten omvatten Opus, wat van belang is als je audio naar een browser of een telefoongesprek verplaatst in plaats van naar een WAV-bestand.

Twee details in die documentatie zijn gemakkelijk te missen en duur om laat te ontdekken. Tags voor emotie en rijke taal gelden alleen voor de Plus- en Flash-tiers — niet voor de hele familie — en ze werken alleen in unidirectionele streamingmodus. En API-sleutels verschillen tussen de regio's Singapore en Beijing, waarbij werkruimten worden geadresseerd op URL's van de vorm wss://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api-ws/v1/inference. Regionale sleutels zijn een provisioningdetail tot de dag dat ze een storing zijn.

De kant van HeyGen is een ander soort product: een REST-achtige v3-API waarbij POST /v3/voices/speech spraak genereert, GET /v3/voices de catalogus achter een engine filter toont, en stemontwerp maximaal drie gerangschikte opties op basis van een tekstprompt met een seed voor reproduceerbaarheid retourneert. De documentatie onthult ook dat het engine filter waarden accepteert die verder gaan dan die van HeyGen zelf — dus HeyGen zal je met alle plezier via zijn API naar een spraakengine van een derde partij sturen. Een leverancier die het model van een concurrent als selecteerbare optie levert, zegt je iets over waar volgens hem zijn eigen kracht ligt.

A screenshot of HeyGen's public landing page, captured 10 October 2026, showing the headline 'The video you imagine, delivered into your system.' with the line about orchestrating avatars, voices, images, editing, music and assets into deterministic, repeatable renders.

Waar de 79 Elo naartoe gaat

Een verschil van 79 punten op een gecontroleerd scorebord is aanzienlijk — groter dan de marge van 16 punten die HeyGen Voice scheidt van de tweede plaats, en ongeveer de afstand tussen de derde en de achtste plaats in dat veld. Het wordt ook op één as gemeten.

De gecontroleerde arena kloont acht stemmen en houdt ze constant. Het zegt niets over het instructiegestuurde bedieningsoppervlak dat Qwen beschikbaar stelt, niets over 48kHz Opus-uitvoer via een annuleerbare WebSocket, en niets over regionale uitrol. Dat zijn technische eigenschappen, en ze zijn de reden dat een team dat een Mandarijnstalig contactcentrum bouwt niet zou overstappen naar een model dat 79 punten hoger scoort op acht Engelstalige referentiestemmen.

Wat het gecontroleerde resultaat wél zegt, is beperkter en toch nuttig: wanneer beide engines dezelfde gekloonde stem krijgen, gaven luisteraars de voorkeur aan de weergave van HeyGen Voice. Als jouw product stemmen kloont, is dat jouw as. Als jouw product een stem uit een catalogus kiest en die naar een gesprek streamt, ligt de providerlijst dichter bij jouw realiteit — en daar heeft HeyGen Voice helemaal geen rang, terwijl Qwen-Audio-3.0-TTS-Plus zesde van zesennegentig staat.

Het prijsargument, serieus genomen

Bij $19,30 per miljoen tekens kost Qwen-Audio-3.0-TTS-Plus ruwweg de helft van ElevenLabs’ $40-prijsniveau en ongeveer 40% van de $49 van Cartesia Sonic 3.6. Voor een werklast van 100 uur narratie — ongeveer 48 miljoen tekens bij een typisch spreektempo — komt dat neer op zo’n $926. Hetzelfde volume op Eleven v4 Turbo zou ongeveer $1.920 kosten en op Sonic 3.6 ongeveer $2.352. HeyGen Voice, met het tarief van $30,00 in de arena, komt uit op bijna $1.440: tussen de goedkope prijsklasse en de twee gevestigde aanbieders, dichter bij het midden dan bij de top.

Die berekening heeft een voorbehoud dat de andere niet nodig hebben. $19,30 is het door Alibaba zelf gepubliceerde tarief. $30,00 is de omrekening door Artificial Analysis van een creditsysteem dat HeyGen nooit naar tekens heeft omgezet, dus het is een schatting te goeder trouw in plaats van een prijsopgave. Als de werkelijke tekens-per-creditverhouding slechter is dan de grafiek aanneemt, kost het 79-Elo-voordeel meer dan de 1,55× die het impliceert; als die beter is, minder. Een model waarvan je de prijs moet afleiden, is een model dat je laat proefdraaien op een gemeten deel van het verkeer, in plaats van een model waarop je standaardiseert. Dat is geen kritiek op de engine — het is een beschrijving van de informatie die op 10 oktober 2026 beschikbaar is.

Beslissen

Kies Qwen-Audio-3.0-TTS-Plus wanneer kosten en streaminginfrastructuur de beslissing bepalen. Minder dan $20 per miljoen tekens, een annuleerbare WebSocket met 48kHz Opus-uitvoer, een instructieparameter en emotietags, en een zesde plaats op de provider-board maken het de meest economische, goed beoordeelde stem in deze vergelijking. Kies in plaats daarvan de 3.1-tier als je het model wilt dat daadwerkelijk tweede werd op de gecontroleerde board, en verifieer de stemmenlijst voordat je aanneemt dat de wissel gratis is.

Test HeyGen Voice wanneer kloongetrouwheid het product is. Eén spreker, veel regels, een stem die elke keer *die* stem moet zijn — dat is de as die het gecontroleerde panel meet en de as waarop HeyGen Voice het hele veld leidt. Reserveer budget voor een meetperiode, want het creditsmodel betekent dat je je werkelijke kosten leert kennen door je eigen tekst te verwerken in plaats van door een tariefkaart te lezen.

En negeer de vergelijking volledig als de werklast Chineestalig en realtime is. Geen van beide Elo-getallen is gemeten op jullie stemmen, in jullie taal, binnen jullie latentiebudget.

Beide bereikbaar houden

Dit is een van die koppelingen waarin de routeringslaag zijn bestaansrecht verdient in plaats van een extra laag die er later op is geschroefd. Eén API-sleutel voor beide providers — de listprijs van de provider wordt zonder opslag doorgegeven, dus het door Alibaba gepubliceerde tarief van $19,30 is wat je betaalt en een prijswijziging van Qwen is dezelfde dag nog actief — maakt het overbodig om een winnaar te kiezen voordat je bewijs hebt. Automatische failover dekt het voor de hand liggende risico in een spraakpipeline, waar een vastgelopen stream hoorbaar is voor de luisteraar, en met de routerings-DSL kun je bulk-narratie naar de goedkope engine sturen en regels die cruciaal zijn voor het klonen naar degene die 79 punten hoger scoort, zonder twee clientbibliotheken en twee facturatierelaties. De waarde van OrcaRouter zit hier niet in dat het een spraakmodel host; het zit erin dat het de kosten om erachter te komen welke je wilt vrijwel nul maakt.

De openstaande vragen

Drie dingen zouden dit beslechten. Een stemtarief op HeyGens eigen prijspagina zou de $30,00 die de arena afleidt, omzetten in een getal dat je kunt controleren. Een HeyGen-vermelding op het Provider Voices-board zou ons vertellen of de voorsprong van gekloonde stemmen standhoudt tegenover native stemmen — de test die Qwen-Audio-3.0-TTS-Plus als zesde van zesennegentig doorstaat. En een resultaat met gecontroleerde stem voor Qwen-Audio-3.1-TTS-Plus tegen HeyGen Voice na meer stemmen zou ons vertellen of 16 Elo een stabiele ordening is. Tot dan: Qwen is de geprijsde, streambare, goed gerangschikte optie; HeyGen Voice is de hoger scorende, niet te beprijzen optie; en het niveau dat je benchmarkt, is belangrijker dan de kop die je leest.