Card del titolo principale per «GPT-Live-1 vs Qwen-Audio-3.0-TTS», con sottotitolo «Uno sostiene una conversazione, l'altro rende un copione», con un badge che recita «Non sostituti - lavori diversi, bollette diverse» e tre card: «Qwen-Audio-3.0-TTS Plus — Elo 1.232, quarto nell'AA Provider Voice Arena, 27,6 $ per 1M caratteri», «GPT-Live-1 — 0,05 $ per minuto vocale, full duplex, 3,00 $ per ora di linea aperta» e «Il problema — circa 16 caratteri al secondo sul lato narratore, testo in ingresso e audio in uscita», sopra una striscia a piè di pagina che recita «I dati di Qwen secondo Artificial Analysis; i dati di GPT-Live-1 riportati da OpenAI.» Il logo OrcaRouter è composto in basso a destra.
Guides & Insights

GPT-Live-1 vs Qwen-Audio-3.0-TTS: una conversazione e un narratore non sono la stessa voce

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli
A two-column scoreboard titled 'GPT-Live-1 vs Qwen-Audio-3.0-TTS - the scoreboard'. Left column GPT-Live-1: 'Job: full-duplex conversation', 'Input: audio and text', 'Price: $0.05 per voice minute', 'Interruption handling: native', 'Voices: 12, no cloning', 'Independent score: 69.8% on the AA Speech to Speech Index'. Right column Qwen-Audio-3.0-TTS: 'Job: text-to-speech rendering', 'Input: text only', 'Price: $27.6 per 1M characters, about $1.66 per hour of audio', 'Interruption handling: not applicable, it never hears', 'Voices: 16 languages, cloning from short samples', 'Independent score: Elo 1,232, fourth on the AA Provider Voice Arena'. Footer: 'Qwen pricing and Elo per Artificial Analysis; GPT-Live-1 voice benchmarks Ope​nAI-reported and unreproduced.'

Metti GPT-Live-1 e Qwen-Audio-3.0-TTS uno accanto all'altro sul prezzo per ora di audio e il divario appare netto: Qwen-Audio-3.0-TTS-Plus di Aliba​ba sintetizza il parlato a 27,6 dollari per milione di caratteri, circa 1,66 dollari di audio all'ora, mentre GPT-Live-1 di Ope​nAI fattura 3,00 dollari per un'ora di linea aperta continua. Il narratore costa meno, quindi vince il narratore — tranne che questo è il confronto sbagliato, e il motivo per cui è sbagliato è la cosa più utile che chiunque possa trarre dal confronto. Qwen-Audio-3.0-TTS è un modello text-to-speech. GPT-Live-1 è un modello conversazionale full-duplex. Uno dei due legge ciò che hai scritto. L'altro deve decidere, più volte al secondo, se hai finito di parlare.

Uno esegue il rendering, uno conversa

La sintesi vocale prende in input del testo e restituisce audio. Non c'è audio in input, nessun turno da prendere, nessuna nozione di essere interrotti e nessuna trascrizione da restituire, perché il modello non ha mai sentito nulla. Il suo modello di costo è una macchina da stampa: pagine in input, audio in output, qualità e throughput sono gli unici due numeri che contano, e puoi misurarli entrambi prima di rilasciare.

Un modello conversazionale full-duplex elabora l'audio in entrata mentre produce l'audio in uscita. Il suo compito include le parti di una conversazione che non hanno nulla a che fare con le parole — mettersi in pausa quando l'utente si mette in pausa, continuare attraverso un backchannel come "yeah" invece di trattarlo come un'interruzione, cedere la parola a metà frase e lanciare una chiamata a uno strumento senza perdere il filo. GPT-Live-1 fa tutto questo e restituisce le trascrizioni di riconoscimento vocale insieme alla sessione, cosa che può fare solo perché ha ascoltato per tutto il tempo.

Se il tuo prodotto legge articoli ad alta voce, converte documentazione in audio o narra un video, GPT-Live-1 è lo strumento sbagliato, a quattro volte il prezzo orario. Se il tuo prodotto riceve una chiamata telefonica, Qwen-Audio-3.0-TTS è un terzo di una pipeline che necessita ancora di un modello ASR e di un modello linguistico per diventare una conversazione.

Dove Qwen-Audio-3.0-TTS è davvero la risposta migliore

La tesi a favore del modello di Alibaba non è marketing. Rilasciato il 20 luglio 2026 dal Tongyi Lab di Alibaba e reso disponibile come API ospitata e chiusa tramite Alibaba Cloud Model Studio, il tier Plus ha conquistato la vetta dell'arena text-to-speech di Artificial Analysis al suo arrivo. Una classifica è però un bersaglio mobile, e questa si è mossa: a settembre 2026 Qwen-Audio-3.0-TTS-Plus si trova quarto nella Provider Voice Arena con un Elo di 1.232 su 2.306 campioni, dietro Cartesia Sonic 3.6 a 1.275, Inworld Realtime TTS-2 a 1.244 e Simba 3.2 di Speechify a 1.233 — tre modelli di agosto e luglio usciti dopo di esso. Quarto su oltre venti, con il primato perduto e il vantaggio di prezzo intatto, resta comunque una posizione forte. Semplicemente non è la posizione descritta dalla copertura del lancio.

A screenshot of the Artificial Analysis Provider Voice Arena Leaderboard for text-to-speech, captured September 2026, showing the top four: Cartesia Sonic 3.6 first at Elo 1,275 and $49.0 per million characters, Inworld Realtime TTS-2 second at 1,244, SpeechifyAI Simba 3.2 third at 1,233, and Alibaba's Qwen-Audio-3.0-TTS-Plus fourth at Elo 1,232 with a confidence interval of -14/14, 2,306 samples, a July 2026 release and $27.6 per million characters.

È leader in 10 delle 16 lingue che copre, aggiunge 20 regioni dialettali cinesi, supporta la clonazione vocale da campioni brevi, inclusa la clonazione interlinguistica, e include 86 tag inline di emozione e interpretazione.

Le avvertenze sono abbastanza specifiche da poter pianificare tenendone conto.

• Throughput — Plus genera circa 16 caratteri al secondo, contro 30,2 di Simba 3.2, 27 di Gemini 3.1 Flash TTS e circa 120 di Sonic 3.5. Per il rendering in batch questo è invisibile; per un prodotto in tempo reale è il numero che decide il tuo buffer.

• Documentazione dei prezzi — il valore ampiamente citato di 27,6 $ per milione di caratteri non corrisponde alla pagina dei prezzi di Alibaba stessa in ogni rilevazione, che in alcuni punti ha riportato cifre inferiori per entrambi i livelli. Controlla il numero attuale a livello di account prima di fare previsioni, non quello della classifica.

• Libreria vocale — nonostante i 16 linguaggi supportati, le voci preimpostate pubbliche sono quasi interamente cinesi e inglesi. Le altre quattordici lingue esistono attraverso il flusso di lavoro di clonazione anziché essere disponibili già pronte.

• Gating delle funzionalità — gli 86 tag emozionali inline funzionano solo in modalità streaming unidirezionale, quindi il controllo espressivo non si mantiene in tutti i percorsi di integrazione.

• Livelli — Flash punta a circa 300 ms di latenza del primo pacchetto per l'uso in tempo reale; Plus è il livello di qualità. Sono prodotti diversi con lo stesso nome, e scegliere quello sbagliato è un errore comune all'inizio.

La versione onesta del disegno di legge a cascata

Ecco cosa omette il confronto su base oraria. Un prodotto conversazionale basato su un modello TTS è una cascata: un modello ASR converte il parlato del chiamante in testo, un modello linguistico decide cosa dire e il modello TTS lo pronuncia. Tre fornitori, tre fatture, tre budget di latenza che si sommano e un passaggio di consegne a ogni confine in cui la prosodia muore. Il segmento TTS può costare 1,66 $ all'ora di audio. Le altre due componenti sono dove si trovano davvero i soldi e gli errori — e il modello a cascata non riesce a sentire una pausa nel mezzo di una frase che sta già pronunciando.

GPT-Live-1 riduce le tre componenti a un'unica sessione e a un unico contatore, a 0,05 $ al minuto di voce, con il backend di ragionamento fatturato separatamente. Due dettagli mantengono onesto quel conto. L'inizializzazione della sessione fattura 15 secondi di voce in anticipo, accreditati sulla durata successiva anziché aggiunti a essa. E il backend è un secondo contatore: ogni chiamata di ragionamento delegata, invocazione di strumenti e ricerca web viene fatturata alle tariffe normali di quel modello, quindi indirizzare la delega verso un motore di ragionamento di frontiera che cerca a ogni turno produce una chiamata costosa dietro uno strato vocale economico.

Ciò che dicono le classifiche indipendenti sui due è istruttivo proprio perché misurano cose diverse e nessuna delle due lusinga il proprio oggetto. Qwen-Audio-3.0-TTS-Plus è quarto per qualità e quasi in fondo quanto a throughput. GPT-Live-1 è settimo su undici nell'Artificial Analysis's Speech to Speech Index con il 69,8% — dietro il GPT-Realtime-2.1 che sostituisce, al 73,9% — pur essendo tariffato all'estremo inferiore della fascia di costo per ora di audio in input dell'indice, 4,42 $ contro i 10,75 $ di GPT-Realtime-2.1. Nessuno dei due modelli conquista il primo posto nella propria categoria. Entrambi costano meno di ciò che sono stati creati per battere.

A screenshot of the Artificial Analysis Speech to Speech Index chart updated September 2026: Grok Voice Think Fast 2.0 79.0%, GPT-Realtime-2.1 73.9%, GPT-Realtime-2 73.6%, Grok Voice Think Fast 72.3%, Gemini 3.1 Flash Live 71.5%, GPT-Live-1 mini 70.3%, GPT-Live-1 69.8%, Qwen-Audio-Omni 66.8%, RealTime Omni 64.2%, Qwen 3.x Omni 63.9%, Gemini 2.5 Flash 52.6%, with companion cost and speed charts showing GPT-Live-1 at $4.42 per hour of input audio and 0.78 seconds to first audio.

Quel secondo contatore è il punto in cui un livello di routing diventa una decisione di progettazione anziché un'ottimizzazione. OrcaRouter non include né GPT-Live-1 né Qwen-Audio-3.0-TTS — il livello vocale, in entrambi i casi, è fuori dalla nostra portata e non ne instradiamo nulla. Il segmento del ragionamento no. Circa 190 modelli provenienti da undici fornitori upstream si trovano dietro una sola chiave al prezzo di listino del fornitore, senza alcun ricarico, e un taglio di prezzo da parte di un fornitore arriva lo stesso giorno, anziché al rinnovo contrattuale successivo. Per una cascata, questo copre direttamente il segmento intermedio: tieni due opzioni ASR e tre motori di ragionamento dietro un unico endpoint, mettili a confronto A/B su traffico reale e lascia che il failover automatico assorba una brutta giornata di un upstream senza far cadere una chiamata.

La clonazione vocale è la capacità più utile a livello commerciale di Qwen-Audio-3.0-TTS e la sua più ampia superficie di conformità. Dieci secondi di audio di riferimento sono sufficienti per riprodurre un parlante, in modo interlinguistico, il che è rivoluzionario per la localizzazione e un rischio ovunque l'identità conti. Ope​nAI ha rilasciato GPT-Live-1 senza alcuna clonazione e senza alcuna voce personalizzata — 12 voci API tra cui scegliere, e questa è la lista.

Quell'asimmetria è facile da trascurare in un confronto tra funzionalità e difficile da trascurare in una revisione dei rischi. Un prodotto che parla sempre e solo con una delle dodici voci del fornitore ha una risposta molto più breve a «di chi è quella voce, e chi ha dato il consenso» rispetto a un prodotto che può riprodurre qualsiasi voce da un campione. Se hai bisogno della clonazione, la decisione sulla pipeline è già presa per te, e la domanda diventa che cosa la governa. Se non ne hai bisogno, vale la pena leggere la limitazione di GPT-Live-1 come un controllo che non hai dovuto costruire.

Quale comprare

Acquista Qwen-Audio-3.0-TTS se l'output è contenuto: narrazione, localizzazione, audio per l'accessibilità, doppiaggio o qualsiasi flusso di lavoro in cui il testo esiste prima dell'audio e la metrica è la qualità per ora di rendering. Inizia con Flash se ti serve la riproduzione in tempo reale, passa a Plus quando la voce stessa è il prodotto finale, e applica un prezzo separato al flusso di clonazione rispetto alle voci preimpostate.

Acquista GPT-Live-1 se l'input è una persona. Linee di supporto, flussi di prenotazione, colloqui di ammissione, qualsiasi caso in cui la prima sillaba dell'utente arriva mentre il modello è a metà frase e il sistema deve comportarsi come un ascoltatore e non come chi parla. Costa di più per ora di audio ed è l'unico dei due che può essere interrotto.

I due sono complementari molto più spesso di quanto siano rivali: molti prodotti vogliono Qwen-Audio-3.0-TTS che legga un documento e un modello duplex che gestisca la chiamata che segue. Quello che non dovrebbero condividere è un modello di costo. La metrica per ora di audio è quella giusta per esattamente uno dei due.