
GPT-Live-1 vs Qwen-Audio-3.0-TTS: una conversazione e un narratore non sono la stessa voce
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice

Metti GPT-Live-1 e Qwen-Audio-3.0-TTS uno accanto all'altro sul prezzo per ora di audio e il divario appare netto: Qwen-Audio-3.0-TTS-Plus di Alibaba sintetizza il parlato a 27,6 dollari per milione di caratteri, circa 1,66 dollari di audio all'ora, mentre GPT-Live-1 di OpenAI fattura 3,00 dollari per un'ora di linea aperta continua. Il narratore costa meno, quindi vince il narratore — tranne che questo è il confronto sbagliato, e il motivo per cui è sbagliato è la cosa più utile che chiunque possa trarre dal confronto. Qwen-Audio-3.0-TTS è un modello text-to-speech. GPT-Live-1 è un modello conversazionale full-duplex. Uno dei due legge ciò che hai scritto. L'altro deve decidere, più volte al secondo, se hai finito di parlare.
Uno esegue il rendering, uno conversa
La sintesi vocale prende in input del testo e restituisce audio. Non c'è audio in input, nessun turno da prendere, nessuna nozione di essere interrotti e nessuna trascrizione da restituire, perché il modello non ha mai sentito nulla. Il suo modello di costo è una macchina da stampa: pagine in input, audio in output, qualità e throughput sono gli unici due numeri che contano, e puoi misurarli entrambi prima di rilasciare.
Un modello conversazionale full-duplex elabora l'audio in entrata mentre produce l'audio in uscita. Il suo compito include le parti di una conversazione che non hanno nulla a che fare con le parole — mettersi in pausa quando l'utente si mette in pausa, continuare attraverso un backchannel come "yeah" invece di trattarlo come un'interruzione, cedere la parola a metà frase e lanciare una chiamata a uno strumento senza perdere il filo. GPT-Live-1 fa tutto questo e restituisce le trascrizioni di riconoscimento vocale insieme alla sessione, cosa che può fare solo perché ha ascoltato per tutto il tempo.
Se il tuo prodotto legge articoli ad alta voce, converte documentazione in audio o narra un video, GPT-Live-1 è lo strumento sbagliato, a quattro volte il prezzo orario. Se il tuo prodotto riceve una chiamata telefonica, Qwen-Audio-3.0-TTS è un terzo di una pipeline che necessita ancora di un modello ASR e di un modello linguistico per diventare una conversazione.
Dove Qwen-Audio-3.0-TTS è davvero la risposta migliore
La tesi a favore del modello di Alibaba non è marketing. Rilasciato il 20 luglio 2026 dal Tongyi Lab di Alibaba e reso disponibile come API ospitata e chiusa tramite Alibaba Cloud Model Studio, il tier Plus ha conquistato la vetta dell'arena text-to-speech di Artificial Analysis al suo arrivo. Una classifica è però un bersaglio mobile, e questa si è mossa: a settembre 2026 Qwen-Audio-3.0-TTS-Plus si trova quarto nella Provider Voice Arena con un Elo di 1.232 su 2.306 campioni, dietro Cartesia Sonic 3.6 a 1.275, Inworld Realtime TTS-2 a 1.244 e Simba 3.2 di Speechify a 1.233 — tre modelli di agosto e luglio usciti dopo di esso. Quarto su oltre venti, con il primato perduto e il vantaggio di prezzo intatto, resta comunque una posizione forte. Semplicemente non è la posizione descritta dalla copertura del lancio.

È leader in 10 delle 16 lingue che copre, aggiunge 20 regioni dialettali cinesi, supporta la clonazione vocale da campioni brevi, inclusa la clonazione interlinguistica, e include 86 tag inline di emozione e interpretazione.
Le avvertenze sono abbastanza specifiche da poter pianificare tenendone conto.
• Throughput — Plus genera circa 16 caratteri al secondo, contro 30,2 di Simba 3.2, 27 di Gemini 3.1 Flash TTS e circa 120 di Sonic 3.5. Per il rendering in batch questo è invisibile; per un prodotto in tempo reale è il numero che decide il tuo buffer.
• Documentazione dei prezzi — il valore ampiamente citato di 27,6 $ per milione di caratteri non corrisponde alla pagina dei prezzi di Alibaba stessa in ogni rilevazione, che in alcuni punti ha riportato cifre inferiori per entrambi i livelli. Controlla il numero attuale a livello di account prima di fare previsioni, non quello della classifica.
• Libreria vocale — nonostante i 16 linguaggi supportati, le voci preimpostate pubbliche sono quasi interamente cinesi e inglesi. Le altre quattordici lingue esistono attraverso il flusso di lavoro di clonazione anziché essere disponibili già pronte.
• Gating delle funzionalità — gli 86 tag emozionali inline funzionano solo in modalità streaming unidirezionale, quindi il controllo espressivo non si mantiene in tutti i percorsi di integrazione.
• Livelli — Flash punta a circa 300 ms di latenza del primo pacchetto per l'uso in tempo reale; Plus è il livello di qualità. Sono prodotti diversi con lo stesso nome, e scegliere quello sbagliato è un errore comune all'inizio.
La versione onesta del disegno di legge a cascata
Ecco cosa omette il confronto su base oraria. Un prodotto conversazionale basato su un modello TTS è una cascata: un modello ASR converte il parlato del chiamante in testo, un modello linguistico decide cosa dire e il modello TTS lo pronuncia. Tre fornitori, tre fatture, tre budget di latenza che si sommano e un passaggio di consegne a ogni confine in cui la prosodia muore. Il segmento TTS può costare 1,66 $ all'ora di audio. Le altre due componenti sono dove si trovano davvero i soldi e gli errori — e il modello a cascata non riesce a sentire una pausa nel mezzo di una frase che sta già pronunciando.
GPT-Live-1 riduce le tre componenti a un'unica sessione e a un unico contatore, a 0,05 $ al minuto di voce, con il backend di ragionamento fatturato separatamente. Due dettagli mantengono onesto quel conto. L'inizializzazione della sessione fattura 15 secondi di voce in anticipo, accreditati sulla durata successiva anziché aggiunti a essa. E il backend è un secondo contatore: ogni chiamata di ragionamento delegata, invocazione di strumenti e ricerca web viene fatturata alle tariffe normali di quel modello, quindi indirizzare la delega verso un motore di ragionamento di frontiera che cerca a ogni turno produce una chiamata costosa dietro uno strato vocale economico.
Ciò che dicono le classifiche indipendenti sui due è istruttivo proprio perché misurano cose diverse e nessuna delle due lusinga il proprio oggetto. Qwen-Audio-3.0-TTS-Plus è quarto per qualità e quasi in fondo quanto a throughput. GPT-Live-1 è settimo su undici nell'Artificial Analysis's Speech to Speech Index con il 69,8% — dietro il GPT-Realtime-2.1 che sostituisce, al 73,9% — pur essendo tariffato all'estremo inferiore della fascia di costo per ora di audio in input dell'indice, 4,42 $ contro i 10,75 $ di GPT-Realtime-2.1. Nessuno dei due modelli conquista il primo posto nella propria categoria. Entrambi costano meno di ciò che sono stati creati per battere.

Quel secondo contatore è il punto in cui un livello di routing diventa una decisione di progettazione anziché un'ottimizzazione. OrcaRouter non include né GPT-Live-1 né Qwen-Audio-3.0-TTS — il livello vocale, in entrambi i casi, è fuori dalla nostra portata e non ne instradiamo nulla. Il segmento del ragionamento no. Circa 190 modelli provenienti da undici fornitori upstream si trovano dietro una sola chiave al prezzo di listino del fornitore, senza alcun ricarico, e un taglio di prezzo da parte di un fornitore arriva lo stesso giorno, anziché al rinnovo contrattuale successivo. Per una cascata, questo copre direttamente il segmento intermedio: tieni due opzioni ASR e tre motori di ragionamento dietro un unico endpoint, mettili a confronto A/B su traffico reale e lascia che il failover automatico assorba una brutta giornata di un upstream senza far cadere una chiamata.
La questione del consenso va nella direzione opposta.
La clonazione vocale è la capacità più utile a livello commerciale di Qwen-Audio-3.0-TTS e la sua più ampia superficie di conformità. Dieci secondi di audio di riferimento sono sufficienti per riprodurre un parlante, in modo interlinguistico, il che è rivoluzionario per la localizzazione e un rischio ovunque l'identità conti. OpenAI ha rilasciato GPT-Live-1 senza alcuna clonazione e senza alcuna voce personalizzata — 12 voci API tra cui scegliere, e questa è la lista.
Quell'asimmetria è facile da trascurare in un confronto tra funzionalità e difficile da trascurare in una revisione dei rischi. Un prodotto che parla sempre e solo con una delle dodici voci del fornitore ha una risposta molto più breve a «di chi è quella voce, e chi ha dato il consenso» rispetto a un prodotto che può riprodurre qualsiasi voce da un campione. Se hai bisogno della clonazione, la decisione sulla pipeline è già presa per te, e la domanda diventa che cosa la governa. Se non ne hai bisogno, vale la pena leggere la limitazione di GPT-Live-1 come un controllo che non hai dovuto costruire.
Quale comprare
Acquista Qwen-Audio-3.0-TTS se l'output è contenuto: narrazione, localizzazione, audio per l'accessibilità, doppiaggio o qualsiasi flusso di lavoro in cui il testo esiste prima dell'audio e la metrica è la qualità per ora di rendering. Inizia con Flash se ti serve la riproduzione in tempo reale, passa a Plus quando la voce stessa è il prodotto finale, e applica un prezzo separato al flusso di clonazione rispetto alle voci preimpostate.
Acquista GPT-Live-1 se l'input è una persona. Linee di supporto, flussi di prenotazione, colloqui di ammissione, qualsiasi caso in cui la prima sillaba dell'utente arriva mentre il modello è a metà frase e il sistema deve comportarsi come un ascoltatore e non come chi parla. Costa di più per ora di audio ed è l'unico dei due che può essere interrotto.
I due sono complementari molto più spesso di quanto siano rivali: molti prodotti vogliono Qwen-Audio-3.0-TTS che legga un documento e un modello duplex che gestisca la chiamata che segue. Quello che non dovrebbero condividere è un modello di costo. La metrica per ora di audio è quella giusta per esattamente uno dei due.
