Een gegenereerde hero-kaart met de titel 'HeyGen Voice vs Sesame Preview', die een gedocumenteerde spraak-API met een gemeten Elo afzet tegen een consumentendemo zonder openbaar endpoint, gemarkeerd met de Artificial Analysis-datum van 9 oktober 2026. Het OrcaRouter-logo verschijnt in de rechteronderhoek.
Guides & Insights

HeyGen Voice vs Sesame Preview: De stem die je kunt kopen tegenover de stem waarmee je alleen maar kunt praten

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Dit is geen modelvergelijking, en doen alsof dat wel zo is, zou hier de enige echte fout zijn die je kunt maken. HeyGen Voice is een API-engine — op de eerste plaats in de Controlled Voice-arena van Artificial Analysis met 1.202 Elo, ontsloten via HeyGen's v3-endpoints, verkocht per credit, kloonbaar vanaf één opname. Sesame Preview is een gratis stemassistent voor consumenten die je bereikt door een webpagina te openen en tegen een van vier persona's met een naam te praten, zonder publiek endpoint, zonder model-ID en zonder prijs waarvoor je hem kunt huren. Een van de twee kun je uitbrengen. De andere is de reden dat je weet hoe een goede gespreksstem klinkt, en nooit het ding dat je uitrolt.

Wat elk ervan eigenlijk is

Sesame Preview is een demonstratie van conversationele spraak. Je bereikt het via de eigen site van het bedrijf, je praat met Maya, Miles, Simone of Charlie, en de ervaring is bewust geoptimaliseerd voor vriendelijkheid en expressiviteit — dat zegt het bedrijf ook wanneer het beschrijft waarom de metgezellen zich gedragen zoals ze doen. Het is momenteel alleen Engelstalig, waarbij het team opmerkt dat meertaligheid incidenteel opduikt door datacontaminatie en "presteert nog niet goed", en dat uitbreiding naar meer dan twintig talen een toekomstplan is. De eigen framing van het bedrijf is werk in uitvoering: "We zijn er nog niet."

Onder de demo bevindt zich het Conversational Speech Model, een multimodale tekst-en-spraakarchitectuur opgebouwd uit twee autoregressieve Llama-achtige transformers. Het komt in drie groottes — Tiny met een 1B-backbone en 100M-decoder, Small met 3B en 250M, Medium met 8B en 300M — elk getraind op een sequentielengte van 2.048 tokens, ruwweg twee minuten audio, gedurende vijf epochs op ongeveer een miljoen uur grotendeels Engelstalige spraak. Belangrijke onderzoekscomponenten zijn open source gemaakt onder Apache 2.0, en er is een GitHub-repository voor. De demo — het ding dat mensen daadwerkelijk prijzen — is dat niet. De demo heeft geen openbare API.

HeyGen Voice is de omgekeerde opzet. Er is geen gratis consumenten-app om uit te proberen; er is een gedocumenteerde API met een stemcatalogus, een spraakeindpunt, kloonpaden en een rekening. Wat je niet kunt doen, is het in een browser openen en er in een opwelling een gesprek mee voeren.

Waarom de twee toch vergeleken worden

Ze worden met elkaar vergeleken omdat beide worden aangevoerd als bewijs dat synthetische spraak een grens heeft overschreden. Sesame Preview herdefinieerde de verwachtingen van hoe conversationele audio kon klinken — de reacties toen het uitkwam gingen erover hoezeer het als een persoon klonk in plaats van als tekst-naar-spraak. De 1.202 van HeyGen Voice op de gecontroleerde ranglijst is dezelfde bewering in numerieke vorm: de eerste plaats onder tweeënveertig inzendingen, waarbij elk model dezelfde acht gekloonde referentiestemmen spreekt.

Het verschil is wat je daarna met de claim kunt doen. Een positie op een leaderboard is reproduceerbaar, testbaar en gekoppeld aan een endpoint. Een demo-indruk is geen van die dingen — en, belangrijker, Sesame Preview staat helemaal niet op het gecontroleerde leaderboard, dus er is geen Elo om te vergelijken met de 1.202. De vergelijking die mensen willen maken is niet beschikbaar, niet omdat Sesame die verloren heeft, maar omdat het model nooit is ingeschreven.

Het scorebord

A generated two-column scoreboard titled 'HeyGen Voice vs Sesame Preview — the scoreboard'. The HeyGen Voice column reads 'Controlled Voice Elo: 1,202, #1 of 42', 'Access: documented v3 API with a speech endpoint', 'Price: $30.00 per 1M characters on the arena's conversion of credit pricing', 'Voice selection: 300+ pre-built voices, design and cloning', 'Languages: dozens of languages, count unpublished' and 'Open weights: none'. The Sesame Preview column reads 'Controlled Voice Elo: not listed', 'Access: consumer web and iOS app, no public endpoint', 'Price: free, not purchasable at any price', 'Voice selection: four fixed personas', 'Languages: English only, multilingual underperforming' and 'Open weights: CSM under Apache 2.0 in 1B, 3B and 8B'. A footer notes the arena price is a conversion of credit pricing rather than a vendor-quoted rate.

• Gecontroleerde stem-Elo — HeyGen Voice: 1.202, #1 van 42. Sesame Preview: niet vermeld.

• Toegang — HeyGen Voice: gedocumenteerde v3-API, POST /v3/voices/speech. Sesame Preview: consumentenwebapp en iOS-app; geen openbaar eindpunt.

• Prijs — HeyGen Voice: $30,00 per 1 miljoen tekens, op basis van de eigen omrekening van de creditprijzen door de arena; HeyGen publiceert geen stemtarief. Sesame Preview: gratis, en voor geen enkele prijs te koop.

• Stemselectie — HeyGen Voice: 300+ kant-en-klare stemmen, stemontwerp via tekstbeschrijving, direct en professioneel klonen. Sesame Preview: vier vaste persona's.

• Talen — HeyGen Voice: "tientallen talen", aantal niet gepubliceerd. Sesame Preview: alleen Engels, waarbij meertalige ondersteuning volgens het bedrijf zelf vandaag de dag ondermaats presteert.

• Open gewichten — HeyGen Voice: geen. Sesame Preview: CSM vrijgegeven onder Apache 2.0 in 1B-, 3B- en 8B-groottes.

A screenshot of Artificial Analysis's Controlled Voice arena leaderboard, captured 10 October 2026, showing the language selector set to 'English (US & UK)' and the ranked field with HeyGen Voice first at 1,202 Elo and Qwen-Audio-3.1-TTS-Plus second at 1,186; no Sesame entry appears anywhere on the board.

Het Apache 2.0-detail is wat ertoe doet.

Onder de conclusie 'geen API' schuilt het feit dat Sesame het onderzoeksmodel open source heeft gemaakt onder Apache 2.0 — een permissieve licentie, in drie groottes, met een 1B-variant die klein genoeg is om zonder datacenter te draaien. Dat is een werkelijk andere propositie dan de demo, en het is de enige route waarlangs iets dat op de stem van Sesame Preview lijkt, in een uitgebracht product terechtkomt.

Twee kanttekeningen houden het eerlijk. De vrijgegeven CSM-componenten zijn onderzoeksartefacten: het bedrijf merkt op dat de modellen spraakinhoud aankunnen, maar niet de gespreksstructuur, en wijst naar volledig duplexe modellen als toekomstig werk — dus de vrijgegeven gewichten zijn niet de interactieve ervaring. En een 8B-backbone die lokaal draait, heeft een andere kostenstructuur dan $19,30 per miljoen tekens voor gehoste inferentie, wat de goedkoopste topklasse-rivaal op de arena in rekening brengt. Zelf hosten kent geen factuur per teken, maar wel een zeer reële per GPU-uur.

Voor een bouwer herformuleert dat de vraag. Als het gesprek was wat indruk op je maakte bij Sesame Preview, dan geven de open gewichten je dat niet. Als het de stemkwaliteit van het spraakmodel zelf was die indruk op je maakte, dan zouden ze dat weleens kunnen — en dat is testbaar op een manier waarop een demo dat niet is.

Hoe de verzending op HeyGen Voice eruitziet

De praktische verschillen zijn de gebruikelijke. De HeyGen-API neemt een stemselectie, tekst en optionele snelheid tussen 0,5 en 1,5 en optionele toonhoogte over ±50 semitonen, met een BCP-47-localehint. Aangepaste stemmen komen op drie manieren: een ontwerproute op basis van een beschrijving die maximaal drie gerangschikte opties retourneert uit een prompt van maximaal 1.000 tekens, een directe kloon van één opname, en een professionele kloon die is getraind op twintig minuten of meer. De enginefilter op het voices-endpoint accepteert ook niet-HeyGen-engines, dus het platform is geen ommuurde tuin rond zijn eigen model.

Niets daarvan bestaat aan de Sesame-kant, en het is geen tekortkoming van Sesame Preview — het is wat het ding is. Een demo die is geoptimaliseerd om te laten zien wat mogelijk is, zou geen SLA moeten hebben.

De rekening is echter het zachtere deel. HeyGen verkoopt credits — 600 voor $29/maand, 1.000 voor $49, 1.500 voor $149 — en stelt dat het verbruik varieert per model, duur en complexiteit, zonder een stemtarief te publiceren. De $30,00 per miljoen tekens die de arena vermeldt, is de omrekening van die credits door Artificial Analysis, niet een prijsopgave van HeyGen. Dus het model dat je kunt uitleveren heeft een prijs, maar op basis van andermans rekenwerk — wat een argument is voor een afgewogen pilot in plaats van kritiek op de engine.

A screenshot of HeyGen's developer documentation sidebar, captured 10 October 2026, showing the Voice Management group with the entries Voices, Browse Voices, Design a Voice, Voice Clone and Text to Speech.

Wat je eigenlijk moet doen met een demo die je bewondert

De nuttige zet is om de twee dingen die Sesame Preview demonstreert te scheiden. Het gespreksgedrag — beurtwisseling, geheugen, het gevoel dat je met iemand praat — is het product van een systeem dat nog niet is uitgebracht en geen eindpunt heeft. De spraakkwaliteit is het deel met Apache 2.0-gewichten erachter, en het deel dat je op je eigen audio kunt evalueren zonder iemands toestemming te vragen.

Voor alles daartussenin is het migratiepad het alledaagse pad: ga live op een engine die een API en een ranking heeft, en ontwerp zo dat het adopteren van het model van Sesame, als het ooit commercieel wordt uitgebracht, een configuratiewijziging is in plaats van een herschrijving. Dat betekent vanaf dag één een abstractie bovenop de stemprovider — één interface, één sleutel, engine geselecteerd via configuratie. De routeringslaag van OrcaRouter is precies hiervoor gebouwd: veel providers achter één endpoint tegen de lijstprijs van de provider, zonder opslag, automatische failover wanneer een leverancier stagneert, en een routerings-DSL waarmee je de engine achter een stem kunt omwisselen zonder applicatiecode aan te raken. Het punt is niet dat het een Sesame-model host — dat doet het niet — maar dat op de dag dat een stem die je bewondert te koop wordt, de kosten om die uit te proberen een regel in een configuratiebestand zouden moeten zijn.

De eerlijke afsluiting

Sesame Preview is geen concurrent van HeyGen Voice en moet ook niet als zodanig worden beoordeeld. Het is een gratis, alleen Engelstalige demonstratie met vier persona's die toevallig de verwachtingen voor conversationele audio opnieuw heeft ingesteld en toevallig onder permissieve licenties vrijgegeven onderzoeksgewichten in drie groottes heeft uitgebracht. HeyGen Voice is de best gerangschikte engine op de enige spraakleaderboard die de stem constant houdt, verkocht via een API die je vandaag kunt aanroepen, tegen een prijs die je nog niet kunt berekenen.

Als je een stem nodig hebt die je dit kwartaal kunt uitbrengen, gaat de beslissing niet tussen deze twee — maar tussen HeyGen Voice en de andere betaalde engines in de arena. Als je op Sesame wacht, wacht dan op de weights, niet op de app.