
Qwen-Audio-3.1 vs ElevenLabs: un taglio di prezzo del 70% incontra l'incumbent
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 177 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1323 tok/s
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
Il fornitore ha tagliato il prezzo della sua API Qwen-Audio-3.1-TTS di circa il 70% il 23 settembre 2026, annunciandolo sul palco dell'Apsara Conference di Hangzhou insieme ad altri quattro modelli vocali. Quel singolo numero è il motivo per cui vale la pena scrivere questo confronto: ElevenLabs Eleven v3 è stata la voce di produzione predefinita per la maggior parte dei team occidentali a una tariffa effettiva vicina ai 100 $ per milione di caratteri, e un concorrente credibile ha appena riprezzato lo stesso lavoro a una frazione di quel costo, ampliando allo stesso tempo la copertura linguistica. I due sistemi non sono equivalenti — Qwen-Audio-3.1-TTS è un'API solo hosted del Tongyi Lab del fornitore, con un ecosistema vocale più piccolo, mentre ElevenLabs è una piattaforma di contenuti completa con la libreria vocale più ampia del settore. Ma se la vostra decisione è mai stata determinata dalla fattura, l'aritmetica è cambiata questa settimana.
Cosa è stato effettivamente rilasciato il 23 settembre
Qwen-Audio-3.1 non è un solo modello. È un rinnovamento in cinque modelli dell'intero stack vocale di Alibaba, e i livelli contano perché hanno prezzi diversi e compiti diversi:
• Qwen-Audio-3.1-TTS — il successore diretto del modello di sintesi che la maggior parte dei team utilizza. Aggiunge sette lingue per un totale di 16, conserva le 20 regioni dialettali cinesi, aggiunge il trasferimento naturale del timbro tra lingue diverse (una sola voce che attraversa mandarino, cantonese, inglese e giapponese), il controllo basato su istruzioni di emozione, ritmo e stile di interpretazione, e gestisce audio di riferimento rumoroso, con eco o altrimenti scadente senza una modalità separata di riduzione del rumore.
• Qwen-Audio-3.1-TTS-Next — un nuovo livello, e un prodotto diverso. Alibaba lo definisce un modello "Audiogen": genera voce, effetti sonori e ambienza di fondo in un'unica passata da testo, timestamp e audio di riferimento. Dialoghi multi-speaker, podcast, paesaggi sonori per cinema e TV, output a 48 kHz. Secondo la documentazione di Model Studio di Alibaba Cloud, accetta fino a 3.000 caratteri di input, limita l'audio generato a 240 secondi per i podcast e 120 secondi negli altri casi, funziona a 3 richieste al secondo e restituisce WAV, MP3 o PCM.
• Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next e Qwen-Audio-3.1-Realtime — rispettivamente riconoscimento, comprensione audio (emozione, musica, suono ambientale, localizzazione degli eventi) e conversazione full-duplex. Realtime è quella che Alibaba sta spingendo nell'hardware: Qwen Office, Qoder, QwenNote A2, il robot desktop QwenNote Eva e gli occhiali Qwen AI.
I tagli di prezzo hanno interessato l'intera gamma, non solo TTS: la sintesi è diminuita di circa il 70%, il tempo reale di circa l'85%, il riconoscimento fino al 95%. Alibaba ha anche reso open source Qwen-Audio-Agent, un framework per costruire agenti vocali in tempo reale, e ha presentato Qwen3.8-LiveTranslate con latenza ridotta sotto i 2,5 secondi.

Il tabellone

• Prezzo — Qwen-Audio-3.1-TTS: circa il 70% in meno rispetto alla precedente generazione di Qwen-Audio, che collocava il tier 3.0 Plus vicino a 27,60 $ per 1M di caratteri e il tier Flash vicino a 15 $. ElevenLabs Eleven v3: circa 100 $ per 1M di caratteri secondo il monitoraggio di Artificial Analysis, con Flash a circa 50 $.
• Lingue — Qwen-Audio-3.1-TTS: 16 lingue più 20 regioni dialettali cinesi. ElevenLabs Eleven v3: 74 lingue.
• Pesi — Qwen-Audio-3.1-TTS: chiuso, disponibile esclusivamente tramite hosting su Alibaba Cloud Model Studio. ElevenLabs Eleven v3: chiuso, disponibile esclusivamente tramite hosting.
• Libreria vocale — Qwen-Audio-3.1-TTS: clonazione nativa più trasferimento di timbro tra lingue; nessun marketplace pubblico comparabile. ElevenLabs: la più grande libreria di voci condivisa del settore, oltre alla clonazione istantanea da circa 30 secondi di audio.
• Controllo della resa — Qwen-Audio-3.1-TTS: emozione, ritmo e stile basati su istruzioni, che eredita gli 86 tag di resa inline introdotti con la 3.0. ElevenLabs Eleven v3: tag audio più la piattaforma circostante (doppiaggio, agenti, studio).
• Benchmark indipendente — Qwen-Audio-3.1-TTS: nessuno al momento. ElevenLabs Eleven v3: 1.168 Elo nella classifica Provider Voice Arena di Artificial Analysis ad agosto 2026.
Dove lo sfidante vince veramente
Tre cose, e solo una riguarda il prezzo.
Il prezzo, ovviamente. Un taglio del 70% rispetto a un concorrente consolidato che costa 100 $ per milione di caratteri non è una differenza di arrotondamento. È la differenza tra un prodotto con cui fai prototipazione e un prodotto che rilasci a ogni utente. Se generi narrazione in grandi volumi, il risparmio annuale non è una voce di costo che devi giustificare internamente: parla da sé.
Cinese, senza ambiguità. Venti regioni dialettali cinesi sono un fossato a cui nulla di ciò che ElevenLabs offre si avvicina minimamente. Se il tuo prodotto serve utenti cinesi continentali, o parlanti cantonese, o un pubblico della diaspora che alterna le lingue a metà frase, il confronto è finito prima ancora di iniziare.
Trasferimento del timbro tra lingue. Qwen-Audio-3.1-TTS prende una voce e la porta naturalmente attraverso mandarino, cantonese, inglese e giapponese. È una capacità specifica con un caso d'uso specifico — un'unica voce di marca che sopravvive a un cambio di lingua — ed è un vero fattore di differenziazione per chiunque localizzi un singolo presentatore invece di sceglierne uno nuovo per ogni mercato.
Dove ElevenLabs vince ancora, e non c'è partita
L'ampiezza linguistica è la prima cosa, ed è la più grande. Settantaquattro lingue contro sedici non è un divario che si colma con un annuncio sui prezzi. Se pubblichi in polacco, turco, vietnamita e portoghese, ElevenLabs ti copre oggi e Qwen-Audio-3.1-TTS no.
Il secondo è l'ecosistema. ElevenLabs non è un endpoint di sintesi; è una piattaforma di contenuti. Una libreria vocale condivisa che puoi ottenere in licenza invece di clonare, flussi di lavoro di doppiaggio, infrastruttura per agenti, un prodotto studio, una superficie API documentata con anni di librerie client alle spalle. Migrare da tutto questo è un progetto, non un cambio di configurazione, e i team che ci hanno costruito sopra sanno esattamente a cosa rinuncerebbero.
Il terzo è qualcosa di più difficile da definire e che vale comunque la pena definire: la percezione di naturalezza su una singola voce inglese. La sintesi di Qwen è stata storicamente eccellente in cinese e solo molto buona in inglese, e mentre il rilascio 3.1 dichiara di migliorare la resa multilingue, non esiste ancora alcun test di ascolto indipendente sul nuovo modello. Chiunque ti dica di sapere come suona la nuova voce Qwen in inglese sta tirando a indovinare.
Il numero che nessuno dovrebbe ancora citare
Questa è la parte della storia che verrà travisata nella copertura mediatica, quindi eccola detta chiaramente. Qwen-Audio-3.1-TTS non ha alcun punteggio di benchmark indipendente. Il suo predecessore, Qwen-Audio-3.0-TTS-Plus, si attestava a 1.234 Elo nella classifica Provider Voice Arena di Artificial Analysis a metà agosto 2026, posizionandosi tra il secondo e il quinto posto in quella graduatoria. Qwen-Audio-3.1-TTS non è ancora stato inserito in alcuna arena. Ogni dichiarazione sulla qualità contenuta nei materiali di lancio di Alibaba è fornita dall'azienda e non è stata riprodotta.
Ciò non rende false le affermazioni. Le rende non verificate, e significa che il modo onesto di inquadrare questo confronto, adesso, è: un modello con un prezzo e nessun punteggio, contro un modello con un punteggio e un prezzo molto più alto. Qualsiasi affermazione più forte di così è speculazione travestita da benchmark.

La stessa disciplina si applica alla latenza. Il valore di punta del primo token di Alibaba per il lato ASR di questa famiglia — 92 millisecondi — proviene dal benchmark ad alta concorrenza dell'azienda stessa su una specifica 0,6B, non da test di terze parti, e le analisi pubblicate dopo il lancio rilevano che ASR e TTS sono prodotti separati in una pipeline anziché un unico modello end-to-end, e che le segnalazioni della comunità descrivono una latenza che si accumula nei dialoghi lunghi con un pattern pseudo-streaming. Considera i numeri di latenza dei fornitori per tutta questa famiglia come tetti massimi, non come esperienza misurata.
Quanto vale in pratica il taglio dei prezzi
Considera un carico di lavoro realistico: un prodotto che sintetizza 20 milioni di caratteri di narrazione al mese tra inglese e mandarino. Al costo di circa $100 per milione di caratteri di ElevenLabs Eleven v3, sono circa $2.000 al mese, ovvero $24.000 all'anno. Alla tariffa di Qwen-Audio-3.0-TTS-Plus, di circa $27,60 per milione, lo stesso volume ammontava già a circa $552 al mese. Applica il taglio del ~70% annunciato da Alibaba il 23 settembre e lo stesso carico di lavoro si attesta su poche centinaia di dollari al mese.
Nessuno di quei numeri è un prezzo di listino su cui puoi firmare — ElevenLabs fattura in crediti tramite livelli di abbonamento, e i tagli di Alibaba sono riduzioni percentuali su tariffe che variano da regione a regione e da livello a livello. Ma la forma del confronto è inequivocabile, ed è sulla forma che si basa il tuo budget.
Un'avvertenza che vale la pena segnalare a chiunque modelli questo aspetto con attenzione: Alibaba Cloud ha spostato la fatturazione della trascrizione in tempo reale sul nodo di Singapore da una misurazione basata sulla durata a una basata sui token, a 0,93 $ per milione di token di input e 0,70 $ per milione di token di output. La fatturazione a token è meno prevedibile di quella a durata quando non si controlla in quanti token si traduce una determinata porzione audio, e rumore, silenzio e contesto multi-turno gonfiano tutti il consumo di token. Un taglio del 70% annunciato non si traduce automaticamente in un risparmio del 70% sul tuo traffico specifico.
Come eseguire effettivamente lo switch
Se stai valutando questa opzione, la cosa utile da sapere è quanto ti costa una migrazione in termini di tempo di sviluppo. Entrambi i modelli sono API chiuse e ospitate, quindi in ogni caso ti integri con un endpoint HTTP, e il lavoro consiste in un client, una politica di retry e un inventario di voci — non una riarchitettura.
È qui che la struttura di OrcaRouter aiuta, con una precisazione onesta innanzitutto: non instradiamo Qwen-Audio-3.1-TTS né alcun modello Qwen-Audio. Gli endpoint vocali di Alibaba sono fuori dal nostro ambito, e lo stesso vale per ElevenLabs. Ciò che copriamo è il livello di inferenza attorno a essi — una chiave API unica per oltre 200 modelli di testo a markup 0%, il che significa che il prezzo di listino del provider viene passato direttamente, quindi un taglio di prezzo del fornitore è attivo dalla nostra parte lo stesso giorno anziché dopo un ciclo di riprezzamento. Per i team che costruiscono l'applicazione che guida una pipeline vocale — il riassuntore, il generatore di script, il pianificatore di contenuti — significa un solo contratto invece di diversi, failover automatico quando un upstream si degrada, e un DSL di routing per comporre modelli in un'unica chiamata. Non significa che chiami la voce di Qwen tramite noi. Chiunque ti dica il contrario non ha letto il catalogo.
Chi dovrebbe muoversi, e chi dovrebbe aspettare
Passa subito all'azione se il tuo carico di lavoro è incentrato principalmente sul cinese, se la copertura dei dialetti è nella tua lista di requisiti, se il costo per volume è il vincolo che ti ha tenuto su una voce più economica ma peggiore, o se hai bisogno di un'unica voce brandizzata che sopravviva a un cambio di lingua. Il prezzo del 23 settembre rende la valutazione economica difficile da contestare, e la qualità in lingua cinese era già competitiva prima.
Aspetta se distribuisci in più di circa sedici lingue, se il tuo prodotto dipende da una libreria vocale licenziabile anziché dalla clonazione, se sei profondamente coinvolto nel doppiaggio o negli strumenti per agenti di una piattaforma, o se il tuo processo di approvvigionamento richiede un punteggio di qualità indipendente prima dell'approvazione finale. Nessuno di questi è un ostacolo permanente, ma nessuno di essi è stato affrontato da un taglio di prezzo.
E osserva una cosa in particolare: se Qwen-Audio-3.1-TTS compare in un'arena di ascolto alla cieca. Nel momento in cui lo farà, questo confronto smetterà di riguardare il prezzo e il numero di lingue e inizierà a riguardare se la voce più economica sia davvero altrettanto buona. Questa è la domanda a cui il lancio non ha risposto.
