
HeyGen Voice debuteert op #1 in de Controlled Voice TTS Arena — verslaat Qwen en ElevenLabs op het gebied van gekloonde stemmen
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 51 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 404 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Op 9 oktober 2026 voegde Artificial Analysis HeyGen Voice toe aan zijn Controlled Voice-arena en het model ging meteen naar de top. HeyGen Voice — het eerste text-to-speechmodel van HeyGen dat op de ranglijst wordt geëvalueerd — scoorde 1.202 Elo, vóór Qwen-Audio-3.1-TTS-Plus met 1.186 en ElevenLabs' Eleven v4 Turbo met 1.167. Cartesia Sonic 3.6, dat de open Provider Voices-ranglijst van de site aanvoert, staat hier vijfde met 1.143. Dat is een echt resultaat op een ranglijst die is gebouwd om de allergrootste verstorende factor in stembeoordeling weg te nemen, en het is ook een resultaat met een heel specifieke betekenis die makkelijk te overinterpreteren valt: HeyGen Voice is de beste stem in deze arena op acht gekloonde referentiestemmen, nog geen gemeten kampioen van de ranglijst met zesennegentig modellen erop.
Wat het Controlled Voice board meet, en waarom het ertoe doet
Artificial Analysis beheert twee spraakboards en die beantwoorden verschillende vragen. De Provider Voices-arena laat elke leverancier zijn eigen native stemmen aanleveren — de gepolijste demostenmen die een bedrijf kiest om zichzelf te vertegenwoordigen — en rangschikt modellen op hoe goed die klinken. De ranglijst is breed en volwassen: zesennegentig inzendingen, met Eleven v4 Turbo bovenaan met 1.328 Elo en Cartesia Sonic 3.6 op de vierde plaats met 1.280.
De Controlled Voice-arena doet iets nauwers en, voor iedereen die een product op de markt brengt, iets nuttigers. Elk model erop genereert spraak op basis van dezelfde acht gekloonde stemmen — vier uit de VS, vier uit het VK — dus de vergelijking is niet 'wiens marketingstem leuker is', maar 'hoe gaat elke engine om met dezelfde stem, dezelfde tekst en dezelfde opnameomstandigheden'. Het is het dichtste dat de industrie heeft bij een like-for-like-test van de engine in plaats van de demo reel, en het is het leaderboard dat ertoe doet als je van plan bent een stem te klonen en die aan een TTS-model te geven.
HeyGen Voice leidt nu. De marge is 16 Elo ten opzichte van Qwen-Audio-3.1-TTS-Plus en 35 ten opzichte van Eleven v4 Turbo, met een gerapporteerd 95%-betrouwbaarheidsinterval van ongeveer 1.185 tot 1.219 op de HeyGen-score. Zestien Elo is een echte kloof, maar geen afgrond — op een ranglijst die zo dichtbezet is, is het het verschil tussen eerste en tweede, niet tussen bruikbaar en onbruikbaar.

Waar HeyGen Voice nog niet is gerangschikt
De eerlijke kant van dit resultaat is dat HeyGen Voice helemaal niet voorkomt op de Provider Voices-ranglijst, en het ontbreken ervan is geen signaal over kwaliteit. Artificial Analysis merkt op dat modellen kunnen worden weggelaten omdat ze nog niet genoeg stemmen hebben. Een model dat pas enkele dagen oud is, met slechts één arena met een andere score achter zich, heeft simpelweg niet het volume aan blinde luisteraars verzameld dat de grotere ranglijst vereist.
De juiste interpretatie op 10 oktober 2026 is dus: HeyGen Voice is de hoogst gerangschikte stem in de gecontroleerde vergelijking van gekloonde stemmen, en een onbekende factor tegenover het bredere veld. Wie op basis van dit cijfer citeert dat het "het beste TTS-model ter wereld" is, citeert een kleinere ranglijst dan de zin impliceert.

De twee getallen achter de Elo
• Gecontroleerde Voice Elo — HeyGen Voice: 1.202 (95%-BI ruwweg 1.185–1.219). Qwen-Audio-3.1-TTS-Plus: 1.186. Eleven v4 Turbo: 1.167.
• Providerstemmen Elo — HeyGen Voice: niet opgenomen (onvoldoende stemmen). Eleven v4 Turbo: 1.328 op #1. Sonic 3.6: 1.280 op #4.
• Rang in het gecontroleerde veld — HeyGen Voice: #1 van 42 gerangschikte vermeldingen (#42 is OpenVoice v2 op 812).
• Prijs op de basis van de arena — HeyGen Voice: $30,00 per 1 miljoen tekens, de eigen omrekening van de arena van HeyGen's creditprijzen. Qwen-Audio-3.1-TTS-Plus: $19,30 per 1 miljoen tekens. Eleven v4 Turbo: $40,00 per 1 miljoen tekens.
• Elo-anker — OpenAudio S1 is het vaste referentiepunt op 1.000, dus HeyGen Voice ligt 202 punten boven het anker.
• Wie staan er nog meer in de top vijf — Eleven v4 met 1.160 en Sonic 3.6 met 1.143 maken de top vijf compleet achter de koplopers.

Wat HeyGen daadwerkelijk heeft uitgebracht
De engine achter het item is HeyGen's interne TTS, beschikbaar in de v3-API van het bedrijf. Een GET /v3/voices aanroep neemt een engine-filter waarvan de waarden onder meer orca — HeyGen's eigen spraakengine — naast starfish en een doorvoer naar ElevenLabs-stemmen. Spraaksynthese verloopt via POST /v3/voices/speech; afstemming per verzoek biedt speed van 0,5 tot 1,5 en pitch van −50 tot +50 semitonen, met een BCP-47 locale hint.
De catalogus vermeldt 300+ vooraf gebouwde stemmen in tientallen talen. Aangepaste stemmen komen in drie varianten: tekst-naar-stem-ontwerp dat maximaal drie gerangschikte opties genereert op basis van een beschrijving van maximaal 1.000 tekens, een directe kloon van één opname, en een professionele kloon die is getraind op twintig minuten of meer audio. Dat laatste is het onderdeel waarop de Controlled Voice-ranglijst in feite een stresstest uitvoert — die acht referentiestemmen zijn klonen, en kloonkwaliteit is waar TTS-engines zich van elkaar onderscheiden.
Engines worden in de documentatie ook genoemd als per stem selecteerbaar, wat betekent dat HeyGen je niet verplicht om zijn model te gebruiken: je kunt via de API naar een stemengine van een derde partij routeren waar je dat verkiest. Dat is een leverancier die een slag om de arm houdt met zijn eigen model, en het is goed om te weten wanneer je een claim als "#1 voice" over HeyGen leest.
Wat dit verandert voor iedereen die een stem kiest
Uit het landen van een controlled-voice-resultaat volgen drie praktische consequenties, en geen daarvan is "alles omzetten".
Ten eerste: als jouw use case een gekloonde merkstem is — één spreker, veel regels — dan is dit nu het board dat je moet lezen, en HeyGen Voice is het model dat je als eerste moet testen. Een leaderboard dat de stem constant houdt, meet precies wat je daadwerkelijk gaat doen.
Ten tweede, als je gebruiksscenario een brede cast van native klinkende personages in talen die je kloon niet dekt, is, dan blijven het Provider Voices-board en de zesennegentig vermeldingen daarin nog steeds de relevante referentie, en HeyGen Voice heeft daar nog geen ranking. Niets in een resultaat met een gekloonde stem vertelt je hoe de engine honderd verschillende stemmen verwerkt.
Ten derde, de prijs heeft nu een getal, maar niet een dat de leverancier heeft gepubliceerd. De arena vermeldt HeyGen Voice tegen $30,00 per 1 miljoen tekens, een omrekening door Artificial Analysis van een creditsysteem dat de eigen pagina van HeyGen nooit omzet in een spraaktarief. Daarmee staat de nieuwe koploper onder de $40,00 van Eleven v4 Turbo en boven de $19,30 van het Qwen-niveau — een prijs in de middenmoot gekoppeld aan een score voor de eerste plaats, en een die is afgeleid in plaats van opgegeven.
De routingvraag
Stemselectie heeft een eigenschap die de meeste modelkeuzes niet hebben: het falen is binnen één lettergreep hoorbaar voor de eindgebruiker. Dat maakt de migratie goedkoop om te testen en duur als het in productie fout gaat. Een nieuwe engine achter dezelfde interface als de zittende aanbieder draaien — één API-oppervlak, de lijstprijs van de provider doorgegeven in plaats van er een opslag op te zetten, met automatische failover naar een tweede stemprovider wanneer een request mislukt — is hoe je een echt antwoord krijgt over je eigen audio in plaats van het antwoord van een Elo-grafiek over acht referentiestemmen. De routeringslaag van OrcaRouter bestaat precies voor dat soort beslissing: zet de uitdager op een fractie van het verkeer, houd de zittende aanbieder warm, en laat failover het venster opvangen waarin het nieuwe model nog onbewezen is. Het leaderboard vertelt je waar je moet kijken. Het kan je niet vertellen hoe je script klinkt.
Wat nu te kijken
Twee getallen zullen dit verhaal beslechten. Het eerste is of HeyGen Voice genoeg stemmen verzamelt om de Provider Voices-ranglijst binnen te komen, en waar het uitkomt tegenover de 1.328 van Eleven v4 Turbo — een model dat die ranglijst aanvoert maar achterblijft in de gecontroleerde arena, precies de kloof die de twee ranglijsten beogen bloot te leggen. Het tweede is of HeyGen een eigen stemtarief publiceert, zodat de $30,00 die de arena heeft berekend kan worden getoetst aan een getal van de leverancier in plaats van te worden afgeleid uit credits. Zolang beide niet bestaan, is een #1-debuut op de gecontroleerde ranglijst een sterke claim over de kwaliteit van gekloonde stemmen en een open vraag over al het andere.
