Una scheda hero generata intitolata 'HeyGen Voice vs Sesame Preview' che contrappone un'API vocale documentata con un Elo misurato a una demo consumer priva di endpoint pubblico, contrassegnata con la data di Artificial Analysis del 9 ottobre 2026. Il logo OrcaRouter appare nell'angolo in basso a destra.
Guides & Insights

HeyGen Voice vs Sesame Preview: La voce che puoi comprare contro la voce con cui puoi solo parlare

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Questa non è una comparazione tra modelli, e fingere il contrario sarebbe l'unico vero errore possibile qui. HeyGen Voice è un motore API — primo classificato nell'arena Controlled Voice di Artificial Analysis con 1.202 Elo, esposto tramite gli endpoint v3 di HeyGen, venduto a crediti, clonabile da una singola registrazione. Sesame Preview è un assistente vocale consumer gratuito a cui si accede aprendo una pagina web e parlando con uno di quattro personaggi con nome, senza endpoint pubblico, senza identificatore di modello e senza un prezzo al quale possa essere noleggiato. Uno di questi puoi rilasciarlo. L'altro è il motivo per cui sai come suona una buona voce conversazionale, e mai la cosa che distribuisci.

Cosa sia in realtà ognuno

Sesame Preview è una dimostrazione di conversazione parlata. Ci si arriva attraverso il sito dell'azienda stessa, si parla con Maya, Miles, Simone o Charlie, e l'esperienza è deliberatamente ottimizzata per cordialità ed espressività — l'azienda lo dice esplicitamente quando descrive perché i compagni si comportano in quel modo. Oggi è solo in inglese, con il team che nota che la capacità multilingue emerge incidentalmente dalla contaminazione dei dati e "non funziona ancora bene", e che espandersi oltre venti lingue è un piano futuro. L'inquadramento dell'azienda stessa è un lavoro in corso: "Non siamo ancora arrivati."

Sotto la demo c'è il Conversational Speech Model, un'architettura multimodale testo-e-voce costruita da due transformer autoregressivi in stile Llama. È disponibile in tre dimensioni — Tiny con un backbone da 1B e un decoder da 100M, Small a 3B e 250M, Medium a 8B e 300M — ciascuna addestrata con una lunghezza di sequenza di 2.048 token, circa due minuti di audio, per cinque epoche su circa un milione di ore di parlato prevalentemente in inglese. I componenti di ricerca chiave sono open source sotto Apache 2.0, e c'è un repository GitHub per essi. La demo — la cosa che le persone effettivamente lodano — non è quello. La demo non ha alcuna API pubblica.

HeyGen Voice è la disposizione inversa. Non c'è un'app consumer gratuita da provare; c'è un'API documentata con un catalogo vocale, un endpoint di sintesi vocale, percorsi di clonazione e una fattura. Quello che non puoi fare è aprirlo in un browser e avere una conversazione con esso quando ti pare.

Perché i due vengono comunque confrontati?

Vengono confrontati perché entrambi sono addotti come prova che la voce sintetica ha superato una certa soglia. Sesame Preview ha ridefinito le aspettative su come poteva suonare l'audio conversazionale — le reazioni quando è arrivato riguardavano quanto sembrasse una persona anziché un motore di sintesi vocale. Il 1.202 di HeyGen Voice sulla classifica controllata è la stessa affermazione in forma numerica: primo posto tra quarantadue partecipanti quando ogni modello si esprime con le stesse otto voci di riferimento clonate.

La differenza sta in ciò che puoi fare con l'affermazione in seguito. Una posizione in classifica è riproducibile, verificabile e collegata a un endpoint. Un'impressione da demo non ha nessuna di queste caratteristiche — e, cosa importante, Sesame Preview non compare affatto nella classifica controllata, quindi non c'è alcun Elo da confrontare con il 1.202. Il confronto che le persone vogliono fare non è disponibile, non perché Sesame l'abbia perso, ma perché il modello non è mai stato inserito.

Il tabellone

A generated two-column scoreboard titled 'HeyGen Voice vs Sesame Preview — the scoreboard'. The HeyGen Voice column reads 'Controlled Voice Elo: 1,202, #1 of 42', 'Access: documented v3 API with a speech endpoint', 'Price: $30.00 per 1M characters on the arena's conversion of credit pricing', 'Voice selection: 300+ pre-built voices, design and cloning', 'Languages: dozens of languages, count unpublished' and 'Open weights: none'. The Sesame Preview column reads 'Controlled Voice Elo: not listed', 'Access: consumer web and iOS app, no public endpoint', 'Price: free, not purchasable at any price', 'Voice selection: four fixed personas', 'Languages: English only, multilingual underperforming' and 'Open weights: CSM under Apache 2.0 in 1B, 3B and 8B'. A footer notes the arena price is a conversion of credit pricing rather than a vendor-quoted rate.

• Elo voce controllata — Voce HeyGen: 1.202, n. 1 di 42. Sesame Preview: non elencato.

• Accesso — HeyGen Voice: API v3 documentata, POST /v3/voices/speech. Sesame Preview: app web per consumatori e app iOS; nessun endpoint pubblico.

• Prezzo — HeyGen Voice: 30,00 $ per 1 milione di caratteri secondo la conversione interna dell'arena dei prezzi in crediti; HeyGen non pubblica alcuna tariffa per la voce. Sesame Preview: gratuito e non acquistabile a nessun prezzo.

• Selezione voce — HeyGen Voice: oltre 300 voci predefinite, progettazione vocale descritta tramite testo, clonazione istantanea e professionale. Sesame Preview: quattro personaggi fissi.

• Lingue — HeyGen Voice: "dozzine di lingue", numero non divulgato. Sesame Preview: solo inglese, con il supporto multilingue che, per ammissione della stessa azienda, oggi non è all'altezza.

• Pesi aperti — HeyGen Voice: nessuno. Sesame Preview: CSM rilasciato con licenza Apache 2.0 nelle dimensioni 1B, 3B e 8B.

A screenshot of Artificial Analysis's Controlled Voice arena leaderboard, captured 10 October 2026, showing the language selector set to 'English (US & UK)' and the ranked field with HeyGen Voice first at 1,202 Elo and Qwen-Audio-3.1-TTS-Plus second at 1,186; no Sesame entry appears anywhere on the board.

Il dettaglio di Apache 2.0 è quello che conta

Sotto il verdetto "no API" si nasconde il fatto che Sesame ha reso open source il modello di ricerca con licenza Apache 2.0 — una licenza permissiva, in tre dimensioni, con una variante da 1B abbastanza piccola da poter essere eseguita senza un data center. Questa è una proposta davvero diversa dalla demo, ed è l'unica via attraverso cui qualcosa che assomiglia alla voce di Sesame Preview finisce in un prodotto rilasciato.

Due avvertenze lo mantengono onesto. I componenti CSM rilasciati sono artefatti di ricerca: l'azienda osserva che i modelli gestiscono il contenuto vocale ma non la struttura della conversazione, e indica i modelli completamente duplex come lavoro futuro — quindi i pesi rilasciati non sono l'esperienza interattiva. E un backbone da 8B in esecuzione locale ha una struttura di costi diversa da $19.30 per milione di caratteri di inferenza ospitata, che è quanto fa pagare il rivale più economico di fascia alta nell'arena. L'auto-hosting non ha un costo per carattere ma uno molto reale per GPU-ora.

Per chi sviluppa, questo riformula la domanda. Se ciò che ti ha colpito di Sesame Preview è stata la conversazione, i pesi aperti non te la danno. Se ciò che ti ha colpito è stata la qualità della voce del modello vocale stesso, potrebbero farlo — e questo è verificabile in un modo in cui una demo non lo è.

Come sarà il rilascio su HeyGen Voice

Le differenze pratiche sono quelle ordinarie. L'API di HeyGen accetta una selezione vocale, un testo e una velocità facoltativa compresa tra 0,5 e 1,5 e intonazione su ±50 semitoni, con un suggerimento di locale BCP-47. Le voci personalizzate si ottengono in tre modi: un percorso di progettazione guidato da descrizione che restituisce fino a tre opzioni classificate da un prompt limitato a 1.000 caratteri, un clone istantaneo da una registrazione e un clone professionale addestrato con venti minuti o più. Il engine filtro sull'endpoint delle voci accetta anche motori non HeyGen, quindi la piattaforma non è un giardino recintato attorno al proprio modello.

Niente di tutto ciò esiste dal lato Sesame, e non è una mancanza di Sesame Preview — è la sua stessa natura. Una demo ottimizzata per mostrare ciò che è possibile non dovrebbe comportare un SLA.

Il conto, però, è la metà più morbida. HeyGen vende crediti — 600 a 29 $/mese, 1.000 a 49 $, 1.500 a 149 $ — e dichiara che il consumo varia in base al modello, alla durata e alla complessità, senza pubblicare una tariffa per la voce. I 30,00 $ per milione di caratteri riportati dall’arena sono la conversione di quei crediti fatta da Artificial Analysis, non un preventivo di HeyGen. Quindi il modello che puoi mettere in produzione ha un prezzo, ma basato sui calcoli di qualcun altro — il che è un argomento a favore di un progetto pilota misurato, non una critica al motore.

A screenshot of HeyGen's developer documentation sidebar, captured 10 October 2026, showing the Voice Management group with the entries Voices, Browse Voices, Design a Voice, Voice Clone and Text to Speech.

Cosa fare effettivamente con una demo che ammiri

La mossa utile è separare le due cose che Sesame Preview dimostra. Il comportamento conversazionale — l'alternanza dei turni, la memoria, la sensazione di parlare con qualcuno — è il prodotto di un sistema che non è stato rilasciato e non ha un endpoint. La qualità del parlato è la parte supportata dai pesi Apache 2.0, e la parte che puoi valutare sul tuo audio senza chiedere il permesso a nessuno.

Per tutto ciò che sta nel mezzo, il percorso di migrazione è quello ordinario: distribuire su un motore che abbia un'API e una classifica, e progettare in modo che adottare il modello di Sesame, qualora venga mai commercializzato, sia un cambio di configurazione anziché una riscrittura. Ciò significa un'astrazione sul provider vocale fin dal primo giorno — un'unica interfaccia, un'unica chiave, motore selezionato dalla configurazione. Il livello di routing di OrcaRouter è costruito esattamente per questo: molti provider dietro un unico endpoint al prezzo di listino del provider, senza ricarico, failover automatico quando un fornitore si blocca, e un DSL di routing che consente di scambiare il motore dietro una voce senza toccare il codice dell'applicazione. Il punto non è che ospiti un modello Sesame — non lo fa — ma che il giorno in cui una voce che ammiri diventa acquistabile, il costo di provarla dovrebbe essere una riga in un file di configurazione.

La chiusura onesta

Sesame Preview non è un concorrente di HeyGen Voice e non dovrebbe essere valutato come tale. È una dimostrazione gratuita, solo in inglese, a quattro personaggi, che per caso ha ridefinito le aspettative per l'audio conversazionale e per caso ha rilasciato pesi di ricerca con licenza permissiva in tre dimensioni. HeyGen Voice è il motore ai primi posti nell'unica classifica vocale che mantiene costante la voce, venduto tramite un'API che puoi chiamare oggi, a un prezzo che non puoi ancora calcolare.

Se ti serve una voce che puoi rilasciare questo trimestre, la decisione non è tra questi due — è tra HeyGen Voice e gli altri motori a pagamento presenti nell'arena. Se stai aspettando Sesame, aspetta i pesi, non l'app.