Una hero card per 'ElevenLabs Eleven v4 vs Qwen-Audio-3.1-TTS-Plus' con due schede punteggio: Qwen-Audio-3.1-TTS-Plus a Elo 1.178, posizione 1 e 19,30 $ per 1 milione di caratteri; ElevenLabs Eleven v4 a Elo 1.157, posizione 2 e 80,00 $ per 1 milione di caratteri; con didascalia '21 punti Elo a fronte di un divario di prezzo quadruplo'. Piè di pagina: 'Controlled Voice Arena, secondo Artificial Analysis, settembre 2026.' Il logo OrcaRouter si trova nell'angolo in basso a destra.
Engineering & Research

Eleven v4 vs Qwen Audio 3.1: La voce più economica sul tabellone ha vinto

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Nella classifica in cui a ogni concorrente vengono assegnate le stesse otto voci clonate, Alibaba Qwen-Audio-3.1-TTS-Plus si è classificato primo con un Elo di 1.178 e ElevenLabs Eleven v4 si è classificato secondo con 1.157. Il modello che ha vinto costa 19,30 $ per milione di caratteri in quella classifica. Il modello che è arrivato secondo costa 80,00 $. Si tratta di un divario di qualità di 21 punti e di un divario di prezzo di quattro volte che puntano in direzioni opposte, ed è il risultato più interessante dell'intera settimana di lancio — più interessante del primo posto che ElevenLabs ha ottenuto nell'altra arena, perché su quella l'ordinamento è convenzionale e il vincitore è la voce più costosa tra le prime dieci.

Le due classifiche non sono intercambiabili, e il motivo per cui questo confronto si legge in questo modo sta interamente in quale delle due si guarda. Provider Voice fa giudicare agli ascoltatori le voci di ciascun fornitore. Controlled Voice clona le stesse otto voci — quattro statunitensi, quattro britanniche — per ogni modello, così nessuno può vincere grazie al proprio cast vocale predefinito. ElevenLabs vince la prima con un margine di 61 punti. Alibaba vince la seconda con un margine di 21. Nessuna delle due classifiche è sbagliata, e la seconda è quella che predice un prodotto che immette sul mercato una voce di marca clonata.

A two-column scoreboard for Qwen-Audio-3.1-TTS-Plus and ElevenLabs Eleven v4. Qwen: Controlled Voice rank 1 Elo 1,178; Provider Voice rank 4 Elo 1,258 on the 3.0 build; $19.30 per 1M chars; rate card not publicly readable; 3.1 on one board and 3.0 on the other; documentation not readable publicly. Eleven v4: Controlled Voice rank 2 Elo 1,157; Provider Voice rank 1 Elo 1,319; $80.00 per 1M chars; $0.022 per 1K until Oct 12; v4 on both boards; 90-plus languages and a 10,000-character cap. Footer: 'All ranks, Elo and board prices per Artificial Analysis; Qwen rate card not readable.'

Il tabellone della voce controllata, per intero

• Preferenza alla cieca, cloni abbinati — Qwen-Audio-3.1-TTS-Plus al 1º posto, Elo 1.178, 19,30 $ per milione di caratteri vs Eleven v4 al 2º posto, Elo 1.157, 80,00 $.

• Preferenza alla cieca, le voci di ciascun fornitore — Eleven v4 al 1° posto, Elo 1.319 contro Qwen-Audio-3.0-TTS-Plus al 4° posto, Elo 1.258. Un divario di 61 punti nella direzione opposta.

• Prezzo, normalizzazione dell'arena — Qwen $19,30 vs Eleven v4 $80,00. Qwen costa il 76% in meno.

• Prezzo, listino tariffe del fornitore — Eleven v4 0,022 $ per mille caratteri in promozione e 0,08 $ dopo il 12 ottobre. Il listino tariffe di Qwen Audio 3.1 non è qualcosa che abbiamo potuto consultare, quindi la normalizzazione dell'arena è l'unico prezzo sul quale possiamo fare un confronto.

• Versione su ciascuna scheda — 3.1 su Controlled Voice, 3.0 su Provider Voice. Sono modelli diversi e le schede non sono intercambiabili.

• La voce 3.0 su Controlled Voice — posizione 5, Elo 1.124, stesso prezzo di $19,30. Il rilascio 3.1 vale 54 Elo in più rispetto al proprio predecessore a un prezzo identico.

• Le generazioni precedenti di Qwen su Provider Voice — Qwen3 TTS Flash posizione 79, Elo 944; Qwen3 TTS posizione 82, Elo 930.

• Il precedente flagship di ElevenLabs su Controlled Voice — Eleven v3 al 7° posto, Elo 1.073.

• Controllo di plausibilità del grafico a barre raggruppate — la forbice a otto vie dal 1º al 10º posto su Controlled Voice è di 121 Elo. Il vantaggio di 21 punti di Qwen su Eleven v4 è inferiore a un quinto dell'ampiezza dell'intero campo, che è la scala giusta alla quale mantenerlo.

A screenshot of the Artificial Analysis Controlled Voice Arena leaderboard, captured in English, showing Alibaba Qwen-Audio-3.1-TTS-Plus first at Elo 1,178 and $19.3 per 1M chars with 1,269 samples, ElevenLabs Eleven v4 second at Elo 1,157 and $80.0 with 1,483 samples, Cartesia Sonic 3.6 fourth at Elo 1,138, and Alibaba Qwen-Audio-3.0-TTS-Plus fifth at Elo 1,124 at the same $19.3 price, over the page subtitle 'Compare Text to Speech (TTS) models using the same 8 cloned voices (4 US, 4 UK)'.

Due righe lì fanno la maggior parte del lavoro. La prima è il confronto tra 3.0 e 3.1: Alibaba ha guadagnato 54 punti Elo con un solo incremento di versione senza cambiare affatto il prezzo. È un ritmo più rapido del passaggio da v3 a v4 di ElevenLabs, da 84 punti, e significa che l'ordinamento specifico delle posizioni in questo articolo è un'istantanea che entrambi i fornitori stanno attivamente rimescolando.

Il secondo è lo scarto totale di 121 punti. Un divario di 21 punti in una classifica il cui intervallo utile è di circa 120 punti è una differenza reale ma modesta — più o meno dello stesso ordine di grandezza del divario tra il 3.1 di Qwen e il suo 3.0. Se il tuo caso d'uso riguarda una lingua per la quale nessuno dei due modelli è stato messo a punto, quel margine rientra ampiamente nella gamma che pochi script di test impegnativi possono ribaltare.

Il problema di versione che nessuno segnala

Il risultato che circola come "Eleven v4 è secondo su Controlled Voice" è accurato e incompleto, e l'omissione conta per chiunque stia pianificando su questa base. Il modello che si trova sopra Eleven v4 in quella classifica è la release 3.1 di Alibaba. La voce Qwen nella classifica Provider Voice, invece, è la release 3.0 — il modello 3.1 non compare nelle prime righe di quella classifica, per come la leggiamo. Quindi i due titoli — "Eleven v4 è al primo posto" e "Eleven v4 è al secondo posto" — sono affermazioni su due diversi modelli Qwen in due compiti diversi, e la versione di Qwen che lo ha battuto su una classifica non è la versione di Qwen che esso ha battuto sull'altra.

Non è un trabocchetto ai danni di nessuno dei due fornitori; è un motivo per diffidare di qualunque riassunto in una sola frase di una settimana come questa. Se stai scegliendo tra questi due sistemi, il confronto che ti serve è 3.1 contro v4 sulla tua voce clonata, nella tua lingua, e nessuno dei due fornitori lo ha pubblicato.

Cosa possiamo e non possiamo dire su Qwen Audio 3.1

L'onestà riguardo alle evidenze vale più, qui, di una tabella completa delle specifiche, quindi ecco il limite di ciò su cui poggia questo articolo. Dai tabelloni dell'arena abbiamo, per Qwen-Audio-3.1-TTS-Plus: un Elo per voce controllata di 1.178, una normalizzazione del prezzo di $19,30 per milione di caratteri, e il fatto che sia la release attuale di una linea la cui versione precedente ha totalizzato 54 punti in meno allo stesso prezzo.

Non abbiamo, e non azzarderemo: la sua copertura linguistica, la sua latenza, il suo limite di input per richiesta, se supporta direttive di consegna inline, se offre clonazione vocale oltre le otto voci dell'arena, o su cosa fattura secondo il proprio listino. Tutti questi dati sono documentati per Eleven v4 — oltre 90 lingue, un limite di 10.000 caratteri, tag audio, cloni istantanei da dieci secondi, supporto per fonemi IPA — e la loro assenza sul fronte Qwen è una lacuna in ciò che è pubblicamente leggibile, non un colpo contro il modello. Una decisione d'acquisto presa basandosi solo su questo articolo sarebbe una decisione presa su due numeri.

A screenshot of Artificial Analysis' Eleven v4 model page, captured in English, headed 'Eleven v4 Quality Elo, Speed & Price Analysis' and labelled 'ElevenLabs, Family ElevenLabs, Elo 1318.77', with the Provider Voice Arena Preference Elo chart showing Eleven v4 first at 1,319 ahead of Sonic 3.6 at 1,276 and Gemini 3.8 Flash TTS at 1,267, a '27 of 96 models' selector, and the Pricing section heading below.

Un contrasto, però, sopravvive a quella limitazione, perché entrambe le parti sono dichiarate dal fornitore o entrambe sono dichiarate dalla board. Sul prezzo, la normalizzazione della board è il denominatore comune e favorisce Qwen del 76%. Sulla qualità con speaker appaiati, la stessa board favorisce Qwen di 21 Elo. Quelle due righe sono confrontabili. Tutto il resto, qui, non lo è, e l'articolo non fingerà il contrario.

Perché un consiglio controllato dovrebbe avere più peso del solito

La maggior parte dei confronti tra voci si affida per impostazione predefinita alla classifica che mette in cima il modello che già ti piace. In questo confronto c'è una ragione di principio per preferire Controlled Voice, ed è specifica anziché generale.

Alibaba ed ElevenLabs competono con risorse estremamente diverse. Il vantaggio di ElevenLabs è una libreria vocale costruita in anni di casting curato; quello di Alibaba è un'organizzazione di ricerca che rilascia versioni del modello con cadenza rapida. Una classifica che consente a ogni concorrente di portare le proprie voci misura la libreria tanto quanto il sintetizzatore, e su quella classifica ElevenLabs vince di 61 punti. Togli le librerie — gli stessi otto speaker clonati per tutti — e il vantaggio cambia mano. Se la voce che i tuoi utenti sentono è il clone di una persona specifica, non stai comprando la libreria di ElevenLabs, quindi la classifica controllata è quella che descrive il tuo acquisto. Se scegli da un menu di voci predefinite, vale il contrario e il margine di 61 punti di Eleven v4 è il numero che conta.

C'è una seconda ragione, meno comoda, per dare peso al risultato controllato. Un panel con voci del fornitore premia un cast predefinito distintivo, e un cast distintivo può essere polarizzante in modi che un Elo medio nasconde: quello che per un ascoltatore è ricco di carattere, per un altro è affettato. Un panel con voci clonate e speaker appaiati elimina del tutto quella variabile, il che lo rende la misurazione più riproducibile delle due.

Eseguendo uno dei due, e ciò che effettivamente instradiamo

OrcaRouter non ospita né i modelli vocali di ElevenLabs né quelli di Alibaba. Nessuno dei due fornitori è presente nel nostro catalogo, quindi non c'è modo di chiamare l'uno o l'altro tramite noi, e questo articolo non suggerirà il contrario — per entrambi ci si rivolge all'API del fornitore stesso e a diverse piattaforme di terze parti.

Quello che copriamo è lo strato superiore. Se il tuo stack vocale è un nodo in una pipeline più ampia, serviamo oltre 200 modelli dietro un'unica chiave API, con i prezzi di listino dei provider trasferiti senza alcun ricarico, allo 0% di markup, così un cambiamento di prezzo a monte — inclusa la finestra promozionale di ElevenLabs e il prezzo di listino molto più alto che la segue il 12 ottobre — si riflette dalla nostra parte il giorno stesso in cui avviene, anziché al ciclo di fatturazione successivo. Per una decisione che ruota attorno a un rapporto di prezzo di 4x, questa tempestività è la differenza tra un confronto che invecchia bene e uno che risulta sbagliato nel giro di tre settimane.

E dove il percorso vocale non può permettersi di andare giù, il failover automatico sposta il traffico verso un upstream sano invece di far fallire la richiesta. In un confronto così ravvicinato sulla qualità e così sbilanciato sul prezzo, l'architettura sensata prevede entrambi i modelli dietro un unico endpoint, con il routing che decide la ripartizione — non una scelta permanente basata sull'istantanea di una classifica che entrambi i fornitori renderanno obsoleta entro un trimestre.

Il verdetto, e la sua data di scadenza

Scegli Qwen-Audio-3.1-TTS-Plus se stai clonando una voce e tenendo d'occhio i costi. È primo nella classifica che mantiene costanti i parlanti, costa circa un quarto del prezzo e la sua linea si muove più rapidamente: 54 Elo in un solo passo di versione a una tariffa invariata suggerisce che la prossima versione sia una scommessa migliore di quanto lo sia sulla carta quella attuale.

Scegli Eleven v4 se i tuoi utenti sentono voci standard, se hai bisogno di copertura in lingue che puoi verificare prima della pubblicazione, o se il set di funzionalità documentato — tag audio, controllo dei fonemi, richieste da 10.000 caratteri, cloni da dieci secondi — sta facendo un lavoro nel tuo prodotto che le classifiche dell'arena non misurano. Il suo vantaggio di 61 punti sulla classifica delle voci dei fornitori non è da poco, e le due funzionalità che puoi scrivere in uno script sono capacità, non punteggi.

Fissa una data di revisione. Alibaba ha guadagnato 54 punti Elo con un aggiornamento di versione in questo ciclo ed ElevenLabs ne ha guadagnati 84 nell'arco di un'intera generazione, e la tariffa promozionale di Eleven v4 scade il 12 ottobre. Qualunque cosa dica oggi questo confronto, i due fattori più suscettibili di ribaltarlo — una release 3.2 e un prezzo ripristinato — arriveranno entrambi prima della fine del trimestre.