
HeyGen Voice vs Qwen-Audio-3.0-TTS: quanto paghi per l'Elo e quale tier di Qwen hai effettivamente benchmarkato
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 51 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 404 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
Facciamo prima i conti, perché il divario è meno sbilanciato di quanto suggerisca il tabellone. Qwen-Audio-3.0-TTS-Plus costa 19,30 $ per milione di caratteri sulla piattaforma Model Studio — una tariffa pubblicata dal fornitore. HeyGen Voice si attesta a 30,00 $ per milione di caratteri sul grafico dei prezzi di Artificial Analysis, una cifra che il sito ricava dal prezzo dei crediti di HeyGen, perché la pagina dei prezzi pubblica di HeyGen vende crediti senza dichiarare quanto consuma una generazione vocale. Nel frattempo, il divario a voce controllata tra i due è di 79 Elo: HeyGen Voice ha ottenuto 1.202 sull'arena che mantiene costanti tutte e otto le voci di riferimento, Qwen-Audio-3.0-TTS-Plus 1.123. Quindi il modello più economico è classificato ben dietro quello migliore, il rapporto tra i due è di circa 1,55×, e solo uno di questi due prezzi è un numero a cui il fornitore che lo vende ha messo il proprio nome.
La trappola nel nome
Prima di tutto questo, scegli il livello giusto, perché questa è una famiglia che ti lascerà volentieri fare benchmark sul modello sbagliato. Due voci Alibaba contano qui e non sono intercambiabili.
Qwen-Audio-3.0-TTS-Plus è il modello con cui questo articolo viene confrontato. Ottiene 1.123 sulla classifica controllata — settimo su quarantadue — e 1.264 sulla classifica Provider Voices, dove si posiziona sesto su novantasei. È un prodotto TTS in streaming reale e attuale, con una tariffa pubblicata di 19,30 $ per milione di caratteri.
Qwen-Audio-3.1-TTS-Plus è il suo tier successivo, ed è quello che occupa il secondo posto nella classifica controllata a quota 1.186 — il modello che al debutto si è avvicinato di più a battere HeyGen Voice. La sua tariffa è indicata allo stesso prezzo di 19,30 $, anche se la documentazione di Alibaba avverte che versioni diverse del modello richiedono voci corrispondenti, quindi "stesso prezzo, tier più recente" non significa "sostituibile senza problemi".
Chiunque legga "#1 davanti a Qwen" e poi esegua il benchmark di Qwen-Audio-3.0-TTS starà testando un modello più debole di 63 Elo rispetto a quello a cui si riferiva il titolo. Il cavillo sul tier vale 63 punti, più del divario tra HeyGen Voice e il terzo posto.
Il tabellone

• Elo vocale controllato (stesse 8 voci clonate) — HeyGen Voice: 1.202, n. 1 su 42. Qwen-Audio-3.0-TTS-Plus: 1.123, n. 7.
• Elo delle voci dei provider (voci native) — Qwen-Audio-3.0-TTS-Plus: 1.264, n. 6 su 96. HeyGen Voice: non classificata.
• Prezzo per 1M di caratteri — Qwen-Audio-3.0-TTS-Plus: 19,30 $, pubblicato dal fornitore su Alibaba Cloud. HeyGen Voice: 30,00 $ secondo la conversione interna dell'arena dei prezzi in crediti; HeyGen non pubblica alcuna tariffa per la voce.
• Costo di 100 ore di narrazione — Qwen-Audio-3.0-TTS-Plus: circa 926 $ a ~480.000 caratteri per ora di parlato. HeyGen Voice: circa 1.440 $ sulla conversione di 30,00 $ dell'arena — valore derivato, non dichiarato.
• Controllo vocale — Qwen-Audio-3.0-TTS-Plus: parametro instruction, tag di emozione e lingua, clonazione vocale e progettazione vocale. HeyGen Voice: progettazione text-to-voice da una descrizione di ≤1.000 caratteri, clone istantaneo, clone professionale addestrato su oltre 20 minuti.
• Output — Qwen-Audio-3.0-TTS-Plus: PCM, WAV, MP3 e Opus fino a 48kHz, con velocità, tono, volume e bitrate regolabili. HeyGen Voice: velocità 0,5–1,5 e tono ±50 semitoni per richiesta.

Cosa ti offre davvero l'ingegneria di Alibaba
La famiglia Qwen-Audio-3.0-TTS è un prodotto in streaming e la documentazione è impostata allo stesso modo. Le richieste passano su un protocollo WebSocket condiviso con CosyVoice, con il run-task, continue-task e finish-task come flusso di eventi e task-started, result-generated, task-finished e task-failed come risposte a corredo. La cancellazione è supportata su ogni modello Qwen-Audio-TTS sia nella regione di Pechino sia in quella di Singapore tramite streaming_cancel(). L'output raggiunge i 48kHz e tra i formati c'è anche Opus, cosa che conta se si sposta l'audio in un browser o in una chiamata telefonica anziché in un file WAV.
Due dettagli in quella documentazione sono facili da trascurare e costosi da scoprire in ritardo. I tag Emotion e rich language si applicano solo ai tier Plus e Flash — non all'intera famiglia — e funzionano solo in modalità streaming unidirezionale. E le chiavi API differiscono tra le regioni Singapore e Beijing, con workspace indirizzati a URL nella forma wss://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api-ws/v1/inference. Le chiavi regionali sono un dettaglio di provisioning fino al giorno in cui diventano un disservizio.
Quello di HeyGen è un prodotto di forma diversa: un'API v3 in stile REST in cui POST /v3/voices/speech sintetizza il parlato, GET /v3/voices elenca il catalogo dietro un filtro engine, e il voice design restituisce fino a tre opzioni ordinate a partire da un prompt testuale con un seed per la riproducibilità. La documentazione rivela inoltre che il filtro engine accetta valori oltre a quelli di HeyGen — quindi HeyGen ti indirizzerà senza problemi verso un motore vocale di terze parti tramite la sua API. Un fornitore che include il modello di un concorrente come opzione selezionabile ti sta dicendo qualcosa su dove ritiene che risieda la propria forza.

Dove va il 79 Elo
Un divario di 79 punti su una classifica controllata è considerevole — più ampio del margine di 16 punti che separa HeyGen Voice dal secondo posto, e all'incirca la distanza tra il terzo e l'ottavo posto in quel campo. Inoltre, è misurato su un solo asse.
L'arena controllata clona otto voci e le mantiene fisse. Non dice nulla sulla superficie di controllo guidata dalle istruzioni che Qwen espone, nulla sull'output Opus a 48 kHz tramite un WebSocket annullabile, e nulla sul deployment regionale. Queste sono proprietà ingegneristiche, e sono il motivo per cui un team che costruisce un contact centre in lingua mandarina non passerebbe a un modello che ottiene 79 punti in più su otto voci di riferimento in lingua inglese.
Ciò che il risultato controllato effettivamente dice è più ristretto e comunque utile: quando a entrambi i motori viene fornita la stessa voce clonata, gli ascoltatori hanno preferito il rendering di HeyGen Voice. Se il tuo prodotto clona voci, quello è il tuo asse. Se il tuo prodotto sceglie una voce da un catalogo e la trasmette in streaming in una chiamata, la classifica dei fornitori è più vicina alla tua realtà — e lì HeyGen Voice non ha alcun posizionamento, mentre Qwen-Audio-3.0-TTS-Plus occupa il sesto posto su novantasei.
L'argomento del prezzo, preso sul serio
A 19,30 $ per milione di caratteri, Qwen-Audio-3.0-TTS-Plus costa circa la metà della fascia da 40 $ di ElevenLabs e circa il 40% dei 49 $ di Cartesia Sonic 3.6. Per un carico di lavoro di 100 ore di narrazione — circa 48 milioni di caratteri a una tipica velocità di eloquio — si tratta di circa 926 $. Lo stesso volume con Eleven v4 Turbo costerebbe circa 1.920 $ e con Sonic 3.6 circa 2.352 $. HeyGen Voice, ai 30,00 $ dell'arena, si colloca vicino a 1.440 $: tra la fascia economica e i due operatori consolidati, più vicino al centro che alla cima.
Quel calcolo comporta un'avvertenza di cui gli altri non hanno bisogno. 19,30 $ è la tariffa pubblicata da Alibaba stessa. 30,00 $ è la conversione di Artificial Analysis di un sistema di crediti che HeyGen non ha mai tradotto in caratteri, quindi è una stima in buona fede più che una quotazione. Se il rapporto reale caratteri-per-credito è peggiore di quanto presupponga il grafico, il vantaggio di 79-Elo costa più del 1,55× che implica; se è migliore, meno. Un modello di cui devi dedurre il prezzo è un modello che sperimenti su una fetta misurata di traffico anziché uno su cui standardizzi. Non è una critica al motore — è una descrizione delle informazioni disponibili al 10 ottobre 2026.
Decisione
Scegli Qwen-Audio-3.0-TTS-Plus quando sono il costo e l'infrastruttura di streaming a guidare la decisione. Meno di 20 $ per milione di caratteri, un WebSocket annullabile con output Opus a 48 kHz, un parametro di istruzione e tag di emozione, e un sesto posto nella classifica dei fornitori lo rendono la voce più economica e ben valutata di questo confronto. Scegli invece il tier 3.1 se vuoi il modello che si è effettivamente classificato secondo nella board controllata, e verifica l'elenco delle voci prima di dare per scontato che lo scambio sia gratuito.
Metti alla prova HeyGen Voice quando la fedeltà del clone è il prodotto. Un solo speaker, molte battute, una voce che deve essere *quella* voce ogni volta — questo è l'asse che il panel controllato misura e l'asse sul quale guida l'intero settore. Prevedi nel budget un periodo di misurazione, perché il modello a crediti significa che scoprirai il tuo costo reale eseguendo il tuo testo invece di leggere un listino prezzi.
E ignora del tutto il confronto se il carico di lavoro è in lingua cinese e in tempo reale. Nessuno dei due numeri Elo è stato misurato sulle tue voci, nella tua lingua, con il tuo budget di latenza.
Mantenendo entrambi raggiungibili
Questo è uno degli abbinamenti in cui il livello di routing si guadagna il suo posto invece di essere un'aggiunta posticcia. Una singola chiave API che copre entrambi i fornitori — prezzo di listino del fornitore passato senza ricarico, quindi i 19,30 $ pubblicati da Alibaba sono ciò che paghi e una variazione di prezzo di Qwen è attiva lo stesso giorno — elimina la necessità di scegliere un vincitore prima di avere prove. Il failover automatico copre il rischio evidente in una pipeline vocale, dove uno stream bloccato è udibile dall'ascoltatore, e il DSL di routing consente di inviare la narrazione in blocco al motore economico e le righe critiche per il clone a quello che totalizza 79 punti in più, senza due librerie client e due rapporti di fatturazione. Il valore di OrcaRouter qui non sta nel fatto che ospiti un modello vocale; sta nel fatto che rende praticamente zero il costo per scoprire quale si vuole.
Le domande aperte
Tre cose risolverebbero la questione. Una tariffa vocale sulla pagina dei prezzi di HeyGen trasformerebbe i 30,00 $ che l'arena ricava in un numero verificabile. Una scheda HeyGen nella classifica Provider Voices ci direbbe se il vantaggio delle voci clonate sopravvive alle voci native — il test che Qwen-Audio-3.0-TTS-Plus supera al sesto posto su novantasei. E un risultato su voce controllata per Qwen-Audio-3.1-TTS-Plus contro HeyGen Voice dopo più voti ci direbbe se 16 Elo è un ordinamento stabile. Fino ad allora: Qwen è l'opzione prezzata, riproducibile in streaming e ben classificata; HeyGen Voice è quella con il punteggio più alto, non prezzabile; e il livello che prendi come riferimento conta più del titolo che leggi.
