
HeyGen Voice vs Sesame Preview: La voce che puoi comprare contro la voce con cui puoi solo parlare
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 51 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 404 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Questa non è una comparazione tra modelli, e fingere il contrario sarebbe l'unico vero errore possibile qui. HeyGen Voice è un motore API — primo classificato nell'arena Controlled Voice di Artificial Analysis con 1.202 Elo, esposto tramite gli endpoint v3 di HeyGen, venduto a crediti, clonabile da una singola registrazione. Sesame Preview è un assistente vocale consumer gratuito a cui si accede aprendo una pagina web e parlando con uno di quattro personaggi con nome, senza endpoint pubblico, senza identificatore di modello e senza un prezzo al quale possa essere noleggiato. Uno di questi puoi rilasciarlo. L'altro è il motivo per cui sai come suona una buona voce conversazionale, e mai la cosa che distribuisci.
Cosa sia in realtà ognuno
Sesame Preview è una dimostrazione di conversazione parlata. Ci si arriva attraverso il sito dell'azienda stessa, si parla con Maya, Miles, Simone o Charlie, e l'esperienza è deliberatamente ottimizzata per cordialità ed espressività — l'azienda lo dice esplicitamente quando descrive perché i compagni si comportano in quel modo. Oggi è solo in inglese, con il team che nota che la capacità multilingue emerge incidentalmente dalla contaminazione dei dati e "non funziona ancora bene", e che espandersi oltre venti lingue è un piano futuro. L'inquadramento dell'azienda stessa è un lavoro in corso: "Non siamo ancora arrivati."
Sotto la demo c'è il Conversational Speech Model, un'architettura multimodale testo-e-voce costruita da due transformer autoregressivi in stile Llama. È disponibile in tre dimensioni — Tiny con un backbone da 1B e un decoder da 100M, Small a 3B e 250M, Medium a 8B e 300M — ciascuna addestrata con una lunghezza di sequenza di 2.048 token, circa due minuti di audio, per cinque epoche su circa un milione di ore di parlato prevalentemente in inglese. I componenti di ricerca chiave sono open source sotto Apache 2.0, e c'è un repository GitHub per essi. La demo — la cosa che le persone effettivamente lodano — non è quello. La demo non ha alcuna API pubblica.
HeyGen Voice è la disposizione inversa. Non c'è un'app consumer gratuita da provare; c'è un'API documentata con un catalogo vocale, un endpoint di sintesi vocale, percorsi di clonazione e una fattura. Quello che non puoi fare è aprirlo in un browser e avere una conversazione con esso quando ti pare.
Perché i due vengono comunque confrontati?
Vengono confrontati perché entrambi sono addotti come prova che la voce sintetica ha superato una certa soglia. Sesame Preview ha ridefinito le aspettative su come poteva suonare l'audio conversazionale — le reazioni quando è arrivato riguardavano quanto sembrasse una persona anziché un motore di sintesi vocale. Il 1.202 di HeyGen Voice sulla classifica controllata è la stessa affermazione in forma numerica: primo posto tra quarantadue partecipanti quando ogni modello si esprime con le stesse otto voci di riferimento clonate.
La differenza sta in ciò che puoi fare con l'affermazione in seguito. Una posizione in classifica è riproducibile, verificabile e collegata a un endpoint. Un'impressione da demo non ha nessuna di queste caratteristiche — e, cosa importante, Sesame Preview non compare affatto nella classifica controllata, quindi non c'è alcun Elo da confrontare con il 1.202. Il confronto che le persone vogliono fare non è disponibile, non perché Sesame l'abbia perso, ma perché il modello non è mai stato inserito.
Il tabellone

• Elo voce controllata — Voce HeyGen: 1.202, n. 1 di 42. Sesame Preview: non elencato.
• Accesso — HeyGen Voice: API v3 documentata, POST /v3/voices/speech. Sesame Preview: app web per consumatori e app iOS; nessun endpoint pubblico.
• Prezzo — HeyGen Voice: 30,00 $ per 1 milione di caratteri secondo la conversione interna dell'arena dei prezzi in crediti; HeyGen non pubblica alcuna tariffa per la voce. Sesame Preview: gratuito e non acquistabile a nessun prezzo.
• Selezione voce — HeyGen Voice: oltre 300 voci predefinite, progettazione vocale descritta tramite testo, clonazione istantanea e professionale. Sesame Preview: quattro personaggi fissi.
• Lingue — HeyGen Voice: "dozzine di lingue", numero non divulgato. Sesame Preview: solo inglese, con il supporto multilingue che, per ammissione della stessa azienda, oggi non è all'altezza.
• Pesi aperti — HeyGen Voice: nessuno. Sesame Preview: CSM rilasciato con licenza Apache 2.0 nelle dimensioni 1B, 3B e 8B.

Il dettaglio di Apache 2.0 è quello che conta
Sotto il verdetto "no API" si nasconde il fatto che Sesame ha reso open source il modello di ricerca con licenza Apache 2.0 — una licenza permissiva, in tre dimensioni, con una variante da 1B abbastanza piccola da poter essere eseguita senza un data center. Questa è una proposta davvero diversa dalla demo, ed è l'unica via attraverso cui qualcosa che assomiglia alla voce di Sesame Preview finisce in un prodotto rilasciato.
Due avvertenze lo mantengono onesto. I componenti CSM rilasciati sono artefatti di ricerca: l'azienda osserva che i modelli gestiscono il contenuto vocale ma non la struttura della conversazione, e indica i modelli completamente duplex come lavoro futuro — quindi i pesi rilasciati non sono l'esperienza interattiva. E un backbone da 8B in esecuzione locale ha una struttura di costi diversa da $19.30 per milione di caratteri di inferenza ospitata, che è quanto fa pagare il rivale più economico di fascia alta nell'arena. L'auto-hosting non ha un costo per carattere ma uno molto reale per GPU-ora.
Per chi sviluppa, questo riformula la domanda. Se ciò che ti ha colpito di Sesame Preview è stata la conversazione, i pesi aperti non te la danno. Se ciò che ti ha colpito è stata la qualità della voce del modello vocale stesso, potrebbero farlo — e questo è verificabile in un modo in cui una demo non lo è.
Come sarà il rilascio su HeyGen Voice
Le differenze pratiche sono quelle ordinarie. L'API di HeyGen accetta una selezione vocale, un testo e una velocità facoltativa compresa tra 0,5 e 1,5 e intonazione su ±50 semitoni, con un suggerimento di locale BCP-47. Le voci personalizzate si ottengono in tre modi: un percorso di progettazione guidato da descrizione che restituisce fino a tre opzioni classificate da un prompt limitato a 1.000 caratteri, un clone istantaneo da una registrazione e un clone professionale addestrato con venti minuti o più. Il engine filtro sull'endpoint delle voci accetta anche motori non HeyGen, quindi la piattaforma non è un giardino recintato attorno al proprio modello.
Niente di tutto ciò esiste dal lato Sesame, e non è una mancanza di Sesame Preview — è la sua stessa natura. Una demo ottimizzata per mostrare ciò che è possibile non dovrebbe comportare un SLA.
Il conto, però, è la metà più morbida. HeyGen vende crediti — 600 a 29 $/mese, 1.000 a 49 $, 1.500 a 149 $ — e dichiara che il consumo varia in base al modello, alla durata e alla complessità, senza pubblicare una tariffa per la voce. I 30,00 $ per milione di caratteri riportati dall’arena sono la conversione di quei crediti fatta da Artificial Analysis, non un preventivo di HeyGen. Quindi il modello che puoi mettere in produzione ha un prezzo, ma basato sui calcoli di qualcun altro — il che è un argomento a favore di un progetto pilota misurato, non una critica al motore.

Cosa fare effettivamente con una demo che ammiri
La mossa utile è separare le due cose che Sesame Preview dimostra. Il comportamento conversazionale — l'alternanza dei turni, la memoria, la sensazione di parlare con qualcuno — è il prodotto di un sistema che non è stato rilasciato e non ha un endpoint. La qualità del parlato è la parte supportata dai pesi Apache 2.0, e la parte che puoi valutare sul tuo audio senza chiedere il permesso a nessuno.
Per tutto ciò che sta nel mezzo, il percorso di migrazione è quello ordinario: distribuire su un motore che abbia un'API e una classifica, e progettare in modo che adottare il modello di Sesame, qualora venga mai commercializzato, sia un cambio di configurazione anziché una riscrittura. Ciò significa un'astrazione sul provider vocale fin dal primo giorno — un'unica interfaccia, un'unica chiave, motore selezionato dalla configurazione. Il livello di routing di OrcaRouter è costruito esattamente per questo: molti provider dietro un unico endpoint al prezzo di listino del provider, senza ricarico, failover automatico quando un fornitore si blocca, e un DSL di routing che consente di scambiare il motore dietro una voce senza toccare il codice dell'applicazione. Il punto non è che ospiti un modello Sesame — non lo fa — ma che il giorno in cui una voce che ammiri diventa acquistabile, il costo di provarla dovrebbe essere una riga in un file di configurazione.
La chiusura onesta
Sesame Preview non è un concorrente di HeyGen Voice e non dovrebbe essere valutato come tale. È una dimostrazione gratuita, solo in inglese, a quattro personaggi, che per caso ha ridefinito le aspettative per l'audio conversazionale e per caso ha rilasciato pesi di ricerca con licenza permissiva in tre dimensioni. HeyGen Voice è il motore ai primi posti nell'unica classifica vocale che mantiene costante la voce, venduto tramite un'API che puoi chiamare oggi, a un prezzo che non puoi ancora calcolare.
Se ti serve una voce che puoi rilasciare questo trimestre, la decisione non è tra questi due — è tra HeyGen Voice e gli altri motori a pagamento presenti nell'arena. Se stai aspettando Sesame, aspetta i pesi, non l'app.
