Una hero card che confronta Qwen-Audio-3.0-TTS e Qwen-Audio-3.1-TTS, elencando il rilascio del modello più vecchio del 20 luglio 2026, Elo di 1.238 e 86 tag di delivery inline contro l'annuncio del modello più recente del 23 settembre 2026, riduzione del prezzo del 70% e controllo basato su istruzioni, con una freccia etichettata 'nove settimane' tra i due.
Guides & Insights

Qwen-Audio-3.1-TTS vs Qwen-Audio-3.0-TTS: cosa hanno fruttato due mesi

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Qwen-Audio-3.0-TTS è stato rilasciato il 20 luglio 2026 ed è andato dritto in cima alle classifiche indipendenti del parlato: il tier Plus ha raggiunto 1.238 Elo nella classifica Provider Voice Arena di Artificial Analysis, al secondo posto. Nove settimane dopo, il 23 settembre 2026, il fornitore ha annunciato Qwen-Audio-3.1-TTS alla Conferenza Apsara di Hangzhou, con un taglio di prezzo di circa il 70%. Questo tempismo rende il confronto insolito: il modello che viene sostituito non è obsoleto, è stato sottoposto a benchmark, è collaudato ed è ancora vicino alla vetta. Quindi la vera domanda non è quale dei due sia migliore. È cosa è cambiato esattamente, se qualcosa di tutto ciò conta per il tuo carico di lavoro, e cosa succede al punteggio di cui ti fidi già quando il successore non è stato valutato affatto.

Due mesi, cinque endpoint, una famiglia

Alibaba non ha rilasciato un solo modello. La release 3.1 ne copre cinque: Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next, Qwen-Audio-3.1-TTS, Qwen-Audio-3.1-TTS-Next e Qwen-Audio-3.1-Realtime. Per chiunque al momento chiami Qwen-Audio-3.0-TTS, solo uno di questi è una sostituzione diretta — il livello TTS semplice — e uno è un vero nuovo prodotto più che un aggiornamento.

Vale la pena capire anche il secondo, anche se non lo chiamerai mai. Qwen-Audio-3.1-TTS-Next è quello che Alibaba definisce un modello "Audiogen": un'unica passata che produce voce, effetti sonori e ambiente sonoro di sottofondo insieme, a partire da testo, timestamp e audio di riferimento. Dialoghi con più parlanti, montaggio di podcast, paesaggi sonori di scena, output a 48 kHz. La documentazione di Model Studio di Alibaba Cloud elenca chiaramente i suoi limiti: 3.000 caratteri di input, 240 secondi di audio generato per i podcast e 120 secondi negli altri casi, 3 richieste al secondo, output in WAV, MP3 o PCM, e accetta fino a tre clip di riferimento da 30 secondi ciascuna in WAV, MP3 o OGG Opus. L'input di riferimento in PCM raw non è supportato. Il prezzo è di $0,848 per milione di token di input e $1,696 per milione di token di output sul nodo di Pechino, escluse le tariffe promozionali, e gestisce solo cinese e inglese.

Se usi 3.0-TTS e il tuo lavoro è "trasformare questo copione in una voce", nulla di tutto ciò cambia la tua integrazione. Se il tuo lavoro è "assemblare un podcast con due conduttori e basi musicali", 3.1-TTS-Next è una categoria di prodotto diversa e forse il motivo stesso per cui vale la pena considerare questa release.

L'aggiornamento, riga per riga

A two-column scoreboard for Qwen-Audio-3.1-TTS and Qwen-Audio-3.0-TTS across languages, dialects, timbre transfer, delivery control, noisy reference audio and arena score, with a footer stating that the 3.1 figures are vendor-reported and unscored and the 3.0 Plus Elo is per Artificial Analysis.

• Lingue — Qwen-Audio-3.1-TTS: 16 lingue dichiarate dal fornitore, con sette aggiunte rispetto alla generazione precedente. Qwen-Audio-3.0-TTS: 16 lingue come elencate nella copertura pubblicata della versione di luglio.

• Dialetti cinesi — Qwen-Audio-3.1-TTS: 20 regioni dialettali, mantenute. Qwen-Audio-3.0-TTS: 20 regioni dialettali.

• Trasferimento del timbro tra lingue — Qwen-Audio-3.1-TTS: sì, una voce trasferita tra mandarino, cantonese, inglese e giapponese. Qwen-Audio-3.0-TTS: non disponibile.

• Controllo della resa — Qwen-Audio-3.1-TTS: controllo di emozione, ritmo e stile basato su istruzioni. Qwen-Audio-3.0-TTS: 86 tag di resa inline.

• Input di riferimento rumoroso — Qwen-Audio-3.1-TTS: gestisce direttamente audio di riferimento rumoroso o con eco, senza una modalità di denoising separata. Qwen-Audio-3.0-TTS: richiede un audio di riferimento pulito.

• Punteggio indipendente — Qwen-Audio-3.1-TTS: ancora nessuno. Qwen-Audio-3.0-TTS-Plus: 1.238 Elo nella classifica Provider Voice Arena di Artificial Analysis ad agosto 2026.

Il conteggio delle lingue non torna, e questo è importante

Questa è una piccola cosa che verrà fatta passare sotto silenzio ovunque altrove, quindi vale la pena dichiararla. Il materiale di lancio di Alibaba afferma che il livello TTS 3.1 aggiunge sette lingue. La copertura pubblicata della generazione 3.0 di luglio — inclusi i nostri articoli di confronto di quel mese — elencava 16 lingue per il livello 3.0. Sette aggiunte a sedici fanno ventitré, non sedici, e Alibaba non ha pubblicato una riconciliazione delle due cifre.

Le spiegazioni possibili sono poco affascinanti: il numero 3.1 potrebbe riferirsi a un insieme diverso, il dato 3.0 potrebbe essere stato sopravvalutato al lancio, oppure "aggiunge sette" potrebbe descrivere il livello ASR anziché il TTS. Non sappiamo quale. Quello che sappiamo è che il conteggio delle lingue su entrambi i lati di questo confronto è un numero dichiarato dal fornitore che non è mai stato verificato in modo indipendente, e che chiunque citi "16 lingue" come un dato di fatto su uno dei due modelli sta citando una slide di marketing. Verifica le lingue specifiche di cui hai bisogno nella documentazione di Model Studio prima di pianificare in base a un conteggio.

A screenshot of Alibaba Cloud Model Studio's English documentation site with the Speech-to-Speech branch of the navigation open, showing the reference page for qwen3.8-livetranslate-flash-realtime with its model capabilities and context limit tables, under an Apsara 2026 Conference banner.

Il controllo delle istruzioni è il cambiamento che si vede concretamente nel codice

Di tutto ciò che è incluso nella release di TTS 3.1, questo è l'elemento che cambia il modo in cui scrivi i tuoi prompt. La generazione 3.0 controllava la resa tramite 86 tag inline — un vocabolario fisso che dovevi imparare, inserire nelle posizioni giuste e che faceva esattamente ciò che diceva e nulla di più. Il livello 3.1 lo sostituisce con istruzioni in linguaggio naturale: descrivi l'emozione, il ritmo, lo stile che vuoi, e il modello le interpreta.

La differenza pratica è tra espressività e prevedibilità. Un vocabolario di tag è un contratto: lo stesso tag produce la stessa resa ogni volta, che è ciò che si vuole in una pipeline di produzione in cui una voce deve rimanere coerente su diecimila clip. L'istruzione in forma libera è più ampia ma meno rigorosa, e eredita il solito problema di sensibilità ai prompt: due formulazioni di "caldo ma non sentimentale" non daranno lo stesso risultato, e nemmeno lo daranno due chiamate della stessa formulazione in giorni diversi.

Se la tua pipeline attuale si basa su quei 86 tag, l'aggiornamento non è gratuito. Stai scambiando una superficie di controllo deterministica con una probabilistica, e il lavoro di porting non è la chiamata API — è rivalidare ogni template di prompt che possiedi rispetto all'interpretazione del nuovo modello. Prevedi un budget per questo prima di prevederne uno per i risparmi.

Trasferimento di timbro tra lingue diverse, e a cosa serve davvero

Una voce di riferimento, portata attraverso mandarino, cantonese, inglese e giapponese, che conserva la propria identità mentre la lingua cambia. Sulla carta si legge come un punto elenco di funzionalità. In pratica risolve un problema specifico e costoso: un unico conduttore che deve esistere in più di una lingua senza sembrare una persona diversa in ciascuna.

La soluzione tradizionale consiste nello scritturare un doppiatore diverso per ogni lingua e accettare che la voce del tuo brand sia ora quattro voci che condividono un copione. L'alternativa è stata clonare un singolo speaker in ogni lingua, che è esattamente il flusso di lavoro in cui le voci clonate tendono a snaturarsi — l'accento si trascina, il timbro si assottiglia, e gli ascoltatori se ne accorgono nel giro di una frase. Il trasferimento di timbro cross-lingua è l'affermazione che nessuno dei due compromessi sia necessario.

Inoltre, al momento, è del tutto non verificato. Non esiste alcun test di ascolto di terze parti su Qwen-Audio-3.1-TTS in nessuna lingua, e le demo di Alibaba stesso sono l'unica prova che il trasferimento funzioni. Se questa capacità è il motivo per cui stai considerando l'aggiornamento, provala sul tuo audio di riferimento prima di procedere — è un esperimento di cinque minuti ed è l'unico che risponde alla domanda.

Che effetto ha il taglio dei prezzi su un disegno di legge 3.0

Alibaba ha tagliato i prezzi del parlato su tutta la linea: la sintesi di circa il 70%, il tempo reale di circa l'85%, il riconoscimento fino al 95%. L'adeguamento è entrato in vigore su Alibaba Cloud Model Studio il 22 settembre 2026 alle 00:00 ora di Pechino, coprendo le regioni di Pechino e Singapore, e si applica agli endpoint TTS 3.1 e realtime 3.0. Dopo l'adeguamento, il livello TTS Flash ha un prezzo di listino di 1,5 yuan per milione di token di input e 12 yuan per milione di token di output; il livello realtime Flash ha un prezzo di listino di 1,5 per l'input di testo, 6 per l'input audio, 4,5 per l'output di testo e 12 per l'output combinato testo e audio, per milione di token.

Ecco la parte che conta se stai già eseguendo 3.0-TTS. Il tier 3.0 Plus si aggirava intorno ai 27,60 $ per milione di caratteri su Artificial Analysis per tutto agosto, con il tier Flash vicino ai 15 $. Se la riduzione del ~70% si applica al tier che usi, la tua bolletta sullo stesso carico di lavoro scende a circa un terzo di quella che era — senza che tu debba cambiare una riga di codice. Questa è la cosa insolita di questo rilascio: per un cliente 3.0, il taglio di prezzo vale più dell'aggiornamento del modello, e arriva indipendentemente dal fatto che tu migri o meno.

Due avvertenze che vale la pena tenere a mente. I tagli percentuali sono indicati rispetto a tariffe che differiscono per regione e per livello, quindi il 70% in evidenza non è una promessa riguardo al vostro traffico specifico. E Alibaba Cloud ha spostato la fatturazione della trascrizione in tempo reale sul nodo di Singapore da una misurazione basata sulla durata a una basata sui token — 0,93 $ per milione di token di input e 0,70 $ per milione di token di output — che è una base meno prevedibile quando silenzio, rumore e contesto multi-turno concorrono tutti a gonfiare il consumo di token. Confrontate il nuovo listino prezzi con il vostro audio, non con il comunicato stampa.

Quando Qwen-Audio-3.0-TTS è ancora la scelta giusta

Tre casi, e non sono casi limite.

Quando ti serve un numero che puoi difendere. Qwen-Audio-3.0-TTS-Plus ha un Elo indipendente di 1.238 — la stessa classifica riporta 1.259 per quel modello a settembre, ancora secondo, quindi il punteggio è salito anziché decadere — da un'arena di ascolto alla cieca con migliaia di voti alle spalle. Qwen-Audio-3.1-TTS non ha alcun punteggio d'arena. Se il tuo processo di approvazione richiede prove di terze parti, il modello più vecchio è quello che le ha, e un taglio di prezzo non cambia questo.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, ranking text-to-speech models by Elo with vote counts and API pricing: Cartesia Sonic 3.6 first at 1,277, Alibaba's Qwen-Audio-3.0-TTS-Plus at 1,259 on a rank range of 2-3, and ElevenLabs Eleven v3 at 1,166.

Quando il determinismo batte l'espressività. Se la tua pipeline di produzione si basa sull'interfaccia di controllo a 86 tag, hai un sistema sul cui output puoi ragionare. Il controllo basato su istruzioni è più capace e meno prevedibile, e il costo di migrazione è reale.

Quando nulla nell'aggiornamento tocca il tuo carico di lavoro. Se sintetizzi cinese mandarino e inglese a volume moderato con una voce di riferimento pulita e un set fisso di tag di delivery, allora il trasferimento timbrico tra lingue, la robustezza agli input rumorosi e sette lingue aggiuntive servono tutti a risolvere problemi che non hai. Accetta il taglio di prezzo, tieni il modello.

Eseguire entrambi senza eseguire due integrazioni

La parte scomoda di un passaggio da una generazione all'altra è che spesso si desidera che entrambi i modelli siano attivi contemporaneamente — 3.0 per il percorso di produzione con lo score dietro, 3.1 per le nuove lingue e la funzionalità di trasferimento, e un modo per spostare il traffico tra di essi senza un nuovo deploy. Entrambi sono API hosted chiuse su Alibaba Cloud Model Studio, quindi sono due endpoint, due limiti di velocità e due modalità di errore dietro un'unica funzionalità.

Una nota onesta su dove ci troviamo: OrcaRouter non instrada Qwen-Audio-3.1-TTS né alcun modello Qwen-Audio, e non instradiamo affatto gli endpoint vocali di Alibaba. Ciò che offriamo è il livello di inferenza testuale attorno a una pipeline come questa — una chiave API per oltre 200 modelli con 0% di markup, il prezzo di listino del fornitore trasferito direttamente, così un taglio di prezzo del fornitore si riflette dalla nostra parte lo stesso giorno invece che dopo un ciclo di riprezzamento. Se il servizio che alimenta la tua pipeline vocale è un generatore di script, un riassuntore o un pianificatore di contenuti, ciò significa un solo contratto invece di diversi, failover automatico quando un upstream si degrada, e un DSL di routing per comporre modelli in un'unica chiamata. Non significa che tu possa chiamare la voce di Qwen tramite noi, e qualsiasi pagina suggerisca il contrario è in errore riguardo al nostro stesso catalogo.

Il riassunto onesto

Qwen-Audio-3.1-TTS è un vero aggiornamento con tre aggiunte che contano — controllo della resa basato su istruzioni, trasferimento di timbro tra lingue e robustezza a un audio di riferimento scadente — più una riduzione di prezzo che vale più di ognuna di esse. Qwen-Audio-3.0-TTS non è superato nel modo in cui di solito lo è un modello vecchio di due mesi: conserva ancora un punteggio di benchmark indipendente che il suo successore non ha ottenuto, e copre ancora la gamma di dialetti cinesi su cui si basa gran parte della differenziazione di questa famiglia.

Quindi la decisione è più ristretta di quanto suggerisca il marketing. Se generi a volume, il cambiamento di prezzo è già tuo. Se hai bisogno delle nuove lingue o del trasferimento di timbro, migra e convalida la funzione prima sul tuo audio. Se ti serve un numero di qualità difendibile, aspetta che Qwen-Audio-3.1-TTS compaia su un'arena di ascolto cieco — è l'unico evento che risolverebbe la questione, e finché non accade, la posizione onesta è che il modello più recente è quello più economico e il modello più vecchio è quello collaudato.