Ett genererat hero-kort med titeln "HeyGen Voice vs Sesame Preview" som kontrasterar ett dokumenterat tal-API med ett uppmätt Elo mot en konsumentdemo utan publik endpoint, märkt med Artificial Analysis-datumet 9 oktober 2026. OrcaRouter-logotypen visas i det nedre högra hörnet.
Guides & Insights

HeyGen Voice vs Sesame Preview: Rösten du kan köpa kontra rösten du bara kan prata med

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Det här är inte en modelljämförelse, och att låtsas något annat vore det enda verkliga misstaget som finns här. HeyGen Voice är en API-motor – rankad etta i Artificial Analysis Controlled Voice-arena med 1 202 Elo, exponerad via HeyGens v3-endpoints, såld per kredit och kan klonas från en enda inspelning. Sesame Preview är en kostnadsfri röstassistent för konsumenter som du når genom att öppna en webbsida och tala med en av fyra namngivna personas, utan offentlig endpoint, utan modellidentifierare och utan något pris till vilket den kan hyras. En av dem kan du leverera. Den andra är anledningen till att du vet hur en bra samtalsröst låter – och aldrig det du driftsätter.

Vad var och en faktiskt är

Sesame Preview är en demonstration av konversationellt tal. Du når det via företagets egen webbplats, du pratar med Maya, Miles, Simone eller Charlie, och upplevelsen är avsiktligt optimerad för vänlighet och uttrycksfullhet – det säger företaget själva när de beskriver varför följeslagarna beter sig som de gör. Det är i dag endast på engelska, och teamet noterar att flerspråkig förmåga dyker upp indirekt från datakontaminering och "presterar ännu inte bra", och att en utökning bortom tjugo språk är en framtidsplan. Företagets egen formulering är ett pågående arbete: "Vi är inte där ännu."

Under demot finns Conversational Speech Model, en multimodal text- och talarkitektur uppbyggd av två autoregressiva transformatorer i Llama-stil. Den finns i tre storlekar – Tiny med en 1B-backbone och 100M-dekoder, Small på 3B och 250M, Medium på 8B och 300M – var och en tränad med en sekvenslängd på 2 048 tokens, ungefär två minuters ljud, i fem epoker över omkring en miljon timmar av mestadels engelskt tal. Viktiga forskningskomponenter har släppts som öppen källkod under Apache 2.0, och det finns ett GitHub-repositorium för dem. Demot – det som folk faktiskt berömmer – är inte det. Demot har inget publikt API.

HeyGen Voice är den omvända konstruktionen. Det finns ingen gratis konsumentapp att testa; det finns ett dokumenterat API med en röstkatalog, en slutpunkt för tal, kloningsvägar och en faktura. Det du inte kan göra är att öppna det i en webbläsare och föra ett samtal med det när andan faller på.

Varför jämförs de två ens?

De jämförs eftersom båda lyfts fram som bevis för att syntetiskt tal har passerat en gräns. Sesame Preview nollställde förväntningarna på hur samtalsljud kunde låta – reaktionerna när det lanserades handlade om hur mycket det lät som en människa snarare än en text-till-tal-motor. HeyGen Voices 1 202 på den kontrollerade resultattavlan är samma påstående i sifferform: första plats bland fyrtiotvå bidrag när varje modell talar med samma åtta klonade referensröster.

Skillnaden är vad man kan göra med påståendet efteråt. En position på en resultattavla är reproducerbar, testbar och kopplad till en slutpunkt. Ett demo-intryck är inget av dessa — och, viktigt nog, Sesame Preview förekommer inte alls på den kontrollerade resultattavlan, så det finns ingen Elo att jämföra med 1 202. Jämförelsen som folk vill göra är inte tillgänglig, inte för att Sesame förlorade den, utan för att modellen aldrig anmäldes.

Resultattavlan

A generated two-column scoreboard titled 'HeyGen Voice vs Sesame Preview — the scoreboard'. The HeyGen Voice column reads 'Controlled Voice Elo: 1,202, #1 of 42', 'Access: documented v3 API with a speech endpoint', 'Price: $30.00 per 1M characters on the arena's conversion of credit pricing', 'Voice selection: 300+ pre-built voices, design and cloning', 'Languages: dozens of languages, count unpublished' and 'Open weights: none'. The Sesame Preview column reads 'Controlled Voice Elo: not listed', 'Access: consumer web and iOS app, no public endpoint', 'Price: free, not purchasable at any price', 'Voice selection: four fixed personas', 'Languages: English only, multilingual underperforming' and 'Open weights: CSM under Apache 2.0 in 1B, 3B and 8B'. A footer notes the arena price is a conversion of credit pricing rather than a vendor-quoted rate.

• Kontrollerat röst-Elo — HeyGen Voice: 1 202, nr 1 av 42. Sesame Preview: inte listad.

• Åtkomst — HeyGen Voice: dokumenterat v3-API, POST /v3/voices/speech. Sesame Preview: webbapp för konsumenter och iOS-app; ingen offentlig slutpunkt.

• Pris — HeyGen Voice: 30,00 USD per 1 miljon tecken enligt arenans egen omräkning av kreditprissättning; HeyGen publicerar ingen rösttaxa. Sesame Preview: gratis och kan inte köpas till något pris.

• Röstval — HeyGen Voice: 300+ färdiga röster, textbeskriven röstdesign, omedelbar och professionell kloning. Sesame Preview: fyra fasta personas.

• Språk — HeyGen Voice: "dussintals språk", antalet ej offentliggjort. Sesame Preview: endast engelska, med flerspråkigt stöd som i dag presterar under förväntan enligt företagets egen uppgift.

• Öppna vikter — HeyGen Voice: inga. Sesame Preview: CSM släppt under Apache 2.0 i storlekarna 1B, 3B och 8B.

A screenshot of Artificial Analysis's Controlled Voice arena leaderboard, captured 10 October 2026, showing the language selector set to 'English (US & UK)' and the ranked field with HeyGen Voice first at 1,202 Elo and Qwen-Audio-3.1-TTS-Plus second at 1,186; no Sesame entry appears anywhere on the board.

Apache 2.0-detaljen är den som spelar roll

Under domen ”inget API” ligger det faktum att Sesame släppte forskningsmodellen som öppen källkod under Apache 2.0 – en tillåtande licens, i tre storlekar, med en 1B-variant som är tillräckligt liten för att köras utan ett datacenter. Det är en i grunden annan sak än demon, och det är den enda vägen genom vilken något som liknar Sesame Previews röst hamnar i en produkt som faktiskt släpps.

Två förbehåll håller det ärligt. De släppta CSM-komponenterna är forskningsartefakter: företaget påpekar att modellerna hanterar talinnehåll men inte samtalsstruktur, och pekar mot fullt duplexa modeller som framtida arbete – så de släppta vikterna är inte den interaktiva upplevelsen. Och en 8B-stomme som körs lokalt har en annan kostnadsstruktur än 19,30 dollar per miljon tecken för hostad inferens, vilket är vad den billigaste toppkonkurrenten på arenan tar. Självhosting har ingen räkning per tecken och en mycket verklig sådan per GPU-timme.

För den som bygger ger det frågan en ny innebörd. Om det som imponerade på dig med Sesame Preview var samtalet, ger de öppna vikterna dig inte det. Om det som imponerade på dig var röstkvaliteten hos själva talmodellen, kanske de gör det — och det är testbart på ett sätt som en demo inte är.

Så här ser leveransen på HeyGen Voice ut

De praktiska skillnaderna är de vanliga. HeyGens API tar ett röstval, text och valfri hastighet mellan 0,5 och 1,5 och tonhöjd inom ±50 semitoner, med ett BCP-47-språkvariantstips. Anpassade röster kommer på tre sätt: en beskrivningsdriven designväg som returnerar upp till tre rangordnade alternativ från en prompt begränsad till 1 000 tecken, en omedelbar klon från en inspelning och en professionell klon tränad på tjugo minuter eller mer. Motorfiltret på voices-endpointen accepterar även icke-HeyGen-motorer, så plattformen är inte en sluten trädgård kring sin egen modell.

Inget av det finns på Sesame-sidan, och det är inte en brist hos Sesame Preview – det är vad saken är. En demo som är optimerad för att visa vad som är möjligt bör inte ha något SLA.

Notan är dock den mjukare halvan. HeyGen säljer krediter – 600 för 29 dollar/månad, 1 000 för 49, 1 500 för 149 – och uppger att förbrukningen varierar beroende på modell, längd och komplexitet, utan att publicera en rösttaxa. De 30,00 dollar per miljon tecken som arenan listar är Artificial Analysiss omvandling av dessa krediter, inte en offert från HeyGen. Så modellen du kan leverera är prissatt, men utifrån någon annans aritmetik – vilket är ett argument för en avvägd pilot snarare än en kritik av motorn.

A screenshot of HeyGen's developer documentation sidebar, captured 10 October 2026, showing the Voice Management group with the entries Voices, Browse Voices, Design a Voice, Voice Clone and Text to Speech.

Vad man egentligen ska göra med en demo man beundrar

Det användbara greppet är att separera de två saker som Sesame Preview demonstrerar. Samtalsbeteendet – turtagning, minne, känslan av att prata med någon – är produkten av ett system som inte har släppts och som inte har någon slutpunkt. Röstkvaliteten är den del som har Apache 2.0-vikter bakom sig, och den del du kan utvärdera på ditt eget ljud utan att be någon om tillåtelse.

För allt däremellan är migreringsvägen den vardagliga: leverera på en motor som har ett API och en ranking, och designa så att ett införande av Sesames modell, om den någonsin släpps kommersiellt, är en konfigurationsändring snarare än en omskrivning. Det innebär en abstraktion över röstleverantören från dag ett – ett gränssnitt, en nyckel, motorn vald via konfiguration. OrcaRouters routinglager är byggt för just detta: många leverantörer bakom en enda slutpunkt till leverantörens listpris utan påslag, automatisk failover när en leverantör går i stå, och en routing-DSL som låter dig byta ut motorn bakom en röst utan att röra applikationskoden. Poängen är inte att den är värd för en Sesame-modell – det är den inte – utan att den dag en röst du beundrar blir köpbar bör kostnaden för att prova den vara en rad i en konfigurationsfil.

Det ärliga avslutet

Sesame Preview är inte en konkurrent till HeyGen Voice och bör inte utvärderas som en sådan. Det är en gratis, endast engelskspråkig demonstration med fyra personor som råkar ha satt nya förväntningar för samtalsljud och råkar ha släppt forskningsvikter med tillåtande licens i tre storlekar. HeyGen Voice är den högst rankade motorn på den enda tal-leaderboarden som håller rösten konstant, såld via ett API som du kan anropa idag, till ett pris du ännu inte kan beräkna.

Om du behöver en röst du kan leverera det här kvartalet står valet inte mellan dessa två – det står mellan HeyGen Voice och de andra prissatta motorerna på arenan. Om du väntar på Sesame, vänta på vikterna, inte på appen.