
HeyGen Voice debutta al n. 1 nella Controlled Voice TTS Arena — superando Qwen ed ElevenLabs sulle voci clonate
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 51 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 404 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Il 9 ottobre 2026, Artificial Analysis ha aggiunto HeyGen Voice alla sua arena Controlled Voice e il modello è andato dritto in cima. HeyGen Voice — il primo modello text-to-speech di HeyGen a essere valutato sulla board — ha totalizzato 1.202 Elo, davanti a Qwen-Audio-3.1-TTS-Plus a 1.186 e a Eleven v4 Turbo di ElevenLabs a 1.167. Cartesia Sonic 3.6, che guida la board aperta Provider Voices del sito, qui è quinto con 1.143. È un risultato autentico su una classifica costruita per eliminare il singolo più grande fattore di confondimento nella valutazione delle voci, ed è anche un risultato dal significato molto specifico che è facile sovrainterpretare: HeyGen Voice è la migliore voce in questa arena su otto voci di riferimento clonate, non ancora un campione misurato della board con novantasei modelli.
Cosa misura la scheda Controlled Voice e perché è importante
Artificial Analysis gestisce due classifiche vocali e rispondono a domande diverse. L'arena Provider Voices consente a ciascun fornitore di fornire le proprie voci native — le voci dimostrative rifinite che un'azienda sceglie per rappresentarsi — e classifica i modelli in base a quanto bene suonano. La sua classifica è ampia e matura: novantasei voci, con Eleven v4 Turbo in cima a 1.328 Elo e Cartesia Sonic 3.6 al quarto posto a 1.280.
L'arena Controlled Voice fa qualcosa di più circoscritto e, per chiunque metta in commercio un prodotto, più utile. Ogni modello presente genera parlato dalle stesse otto voci clonate — quattro statunitensi, quattro britanniche — quindi il confronto non è «quale voce di marketing è più bella» ma «come gestisce ciascun motore la stessa voce, lo stesso testo e le stesse condizioni di registrazione». È la cosa più vicina che l'industria abbia a un test omogeneo del motore anziché della demo reel, ed è la classifica che conta se prevedi di clonare una voce e affidarla a un modello TTS.
HeyGen Voice ora è in testa. Il margine è di 16 Elo su Qwen-Audio-3.1-TTS-Plus e di 35 su Eleven v4 Turbo, con un intervallo di confidenza al 95% dichiarato di circa 1.185-1.219 sul valore di HeyGen. Sedici Elo sono un divario reale ma non un abisso — su una classifica così densa, è la differenza tra il primo e il secondo posto, non tra utilizzabile e inutilizzabile.

Dove HeyGen Voice non è ancora classificato
Il lato più onesto di questo risultato è che HeyGen Voice non compare affatto nella classifica Provider Voices, e la sua assenza non è un segnale sulla qualità. Artificial Analysis osserva che i modelli possono essere omessi perché non hanno ancora abbastanza voti. Un modello che esiste da pochi giorni, con una sola arena con un punteggio diverso alle spalle, semplicemente non ha accumulato il volume di ascoltatori in cieco che la classifica più grande richiede.
Quindi la lettura corretta al 10 ottobre 2026 è questa: HeyGen Voice è la voce in cima alla classifica nel confronto controllato tra voci clonate, ma resta un'incognita rispetto al campo più ampio. Chi cita «il miglior modello TTS al mondo» basandosi su questo dato sta citando una classifica più ristretta di quanto la frase lasci intendere.

I due numeri dietro l'Elo
• Elo vocale controllato — HeyGen Voice: 1.202 (IC al 95% circa 1.185–1.219). Qwen-Audio-3.1-TTS-Plus: 1.186. Eleven v4 Turbo: 1.167.
• Elo delle voci dei provider — HeyGen Voice: non in classifica (voti insufficienti). Eleven v4 Turbo: 1.328 al 1° posto. Sonic 3.6: 1.280 al 4° posto.
• Posizione nel campo controllato — HeyGen Voice: n. 1 su 42 voci classificate (la n. 42 è OpenVoice v2 con 812).
• Prezzo in base ai criteri dell'arena — HeyGen Voice: 30,00 $ per 1 milione di caratteri, conversione propria dell'arena del prezzo in crediti di HeyGen. Qwen-Audio-3.1-TTS-Plus: 19,30 $ per 1 milione di caratteri. Eleven v4 Turbo: 40,00 $ per 1 milione di caratteri.
• Ancora Elo — OpenAudio S1 è il punto di riferimento fisso a 1.000, quindi HeyGen Voice si trova 202 punti sopra l'ancora.
• Chi altro c'è nella top five — Eleven v4 a 1.160 e Sonic 3.6 a 1.143 completano la top five alle spalle dei leader.

Che cosa ha effettivamente rilasciato HeyGen
Il motore dietro la voce è il TTS proprietario di HeyGen, esposto nell'API v3 dell'azienda. Una chiamata GET /v3/voices accetta un filtro engine i cui valori includono orca — il motore vocale proprietario di HeyGen — insieme a starfish e un pass-through verso le voci ElevenLabs. Il rendering vocale avviene tramite POST /v3/voices/speech; la regolazione per singola richiesta espone speed da 0,5 a 1,5 e pitch da −50 a +50 semitoni, con un suggerimento locale in formato BCP-47.
Il catalogo è indicato come oltre 300 voci predefinite in decine di lingue. Le voci personalizzate sono disponibili in tre varianti: progettazione text-to-voice che genera fino a tre opzioni classificate a partire da una descrizione limitata a 1.000 caratteri, un clone istantaneo da una singola registrazione e un clone professionale addestrato su venti minuti o più di audio. Quest'ultima è la parte che la classifica Controlled Voice sta effettivamente mettendo alla prova: quelle otto voci di riferimento sono cloni, e la qualità dei cloni è ciò che distingue i motori TTS.
Nei documenti i motori sono anche indicati come selezionabili per voce, il che significa che HeyGen non ti obbliga a usare il suo modello: puoi indirizzare verso un motore vocale di terze parti tramite la sua API, laddove ne preferisci uno. È un fornitore che non punta tutto sul proprio modello, ed è utile saperlo quando leggi un'affermazione «#1 voice» su HeyGen.
Cosa cambia questo per chi sceglie una voce
Tre conseguenze pratiche derivano dall'arrivo di un risultato con voce controllata, e nessuna di esse è "cambiare tutto".
Innanzitutto, se il tuo caso d'uso è una voce di marca clonata — un solo speaker, molte righe — questa è ora la classifica da leggere, e HeyGen Voice è il modello da testare per primo. Una classifica che mantiene costante la voce misura proprio ciò che farai davvero.
Secondo, se il tuo caso d'uso è un ampio cast di personaggi dall'accento madrelingua in lingue che il tuo clone non copre, la classifica Provider Voices e le sue novantasei voci restano comunque il riferimento pertinente, e HeyGen Voice non vi ha ancora alcuna posizione. Nulla in un risultato di voce clonata ti dice come il motore gestisce cento voci distinte.
Terzo, ora il prezzo ha un numero, ma non uno pubblicato dal fornitore. L'arena elenca HeyGen Voice a 30,00 $ per 1 milione di caratteri, una conversione di Artificial Analysis di un sistema a crediti che la pagina di HeyGen stessa non traduce mai in una tariffa vocale. Questo colloca il nuovo leader sotto i 40,00 $ di Eleven v4 Turbo e sopra i 19,30 $ del livello Qwen — un prezzo di fascia media associato a un punteggio da primo posto, e per di più derivato anziché quotato.
La questione del routing
La selezione della voce ha una proprietà che la maggior parte delle scelte di modello non ha: l'errore è udibile all'utente finale nel giro di una sillaba. Ciò rende la migrazione economica da testare e costosa da sbagliare in produzione. Eseguire un nuovo motore dietro la stessa interfaccia di quello esistente — una sola superficie API, una sola chiave, il prezzo di listino del fornitore passato tal quale invece che maggiorato, con failover automatico verso un secondo fornitore di voce quando una richiesta fallisce — è il modo per ottenere una risposta reale sul tuo audio invece della risposta di un grafico Elo su otto voci di riferimento. Il livello di routing di OrcaRouter esiste esattamente per quel tipo di decisione: mettere lo sfidante su una frazione del traffico, mantenere caldo quello esistente e lasciare che il failover copra la finestra in cui il nuovo modello non è ancora collaudato. La classifica ti dice dove guardare. Non può dirti come suona il tuo script.
Cosa guardare dopo
Due numeri chiariranno questa storia. Il primo è se HeyGen Voice accumulerà abbastanza voti da entrare nella classifica Provider Voices, e dove si posizionerà rispetto ai 1.328 di Eleven v4 Turbo — un modello che guida quella classifica ma è indietro nell'arena controllata, che è esattamente il divario che le due classifiche esistono per mettere in luce. Il secondo è se HeyGen pubblicherà una tariffa vocale propria, così che i 30,00 $ derivati dall'arena possano essere verificati rispetto a un dato del fornitore anziché essere dedotti dai crediti. Finché non esistono entrambi, un debutto al n. 1 nella classifica controllata è una forte affermazione sulla qualità delle voci clonate e una questione aperta su tutto il resto.
