
Gemini 3.8 TTS vs Qwen Audio 3.0 TTS: due risposte diverse a "Fallo suonare bene"
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
Un solo punto Elo separa questi due modelli sull'Artificial Analysis Provider Voice Arena, e ci arrivano risolvendo problemi completamente diversi. Qwen-Audio-3.0-TTS-Plus è al 3° posto con un Elo di 1.259 su 1.447 campioni e 15 voci dell'arena, rilasciato a settembre 2026 e listato a 27,60 $ per milione di caratteri. Gemini 3.8 Flash TTS è al 2° posto con 1.260 su 1.999 campioni e 8 voci dell'arena, rilasciato il 23 settembre 2026 e listato a 33,00 $ per milione di caratteri. Statisticamente indistinguibili, con un divario di prezzo del venti percento, e basati su teorie opposte su ciò che rende buona la sintesi vocale.
La teoria è la parte interessante. La risposta di Qwen è il controllo inline: 86 tag di resa che si disseminano nel testo così che il modello sappia dove respirare, dove porre l'accento e dove cambiare registro. La risposta di Google è uno strato di regia: istruzioni riga per riga, messa in scena a due parlanti e un piccolo insieme di segnali non verbali. Se hai già costruito una pipeline che emette annotazioni simili a SSML, una delle due si adatterà e l'altra no, e quella compatibilità conta più di un singolo punto Elo.
Dove i due si trovano effettivamente sul tabellone
Leggere onestamente il Provider Voice Arena richiede di guardare gli intervalli, non le posizioni in classifica.
• Qwen-Audio-3.0-TTS-Plus — posizione 3, Elo 1.259, 1.447 campioni, 15 voci arena, settembre 2026, $27,6 per 1 milione di caratteri.
• Gemini 3.8 Flash TTS — posizione 2, Elo 1.260, 1.999 campioni, 8 voci dell'arena, settembre 2026, 33,0 $ per 1 milione di caratteri.
• Cartesia Sonic 3.6 — posizione 1, Elo 1.273, 1.757 campioni, 8 voci dell'arena, agosto 2026, 49,0 $ per 1 milione di caratteri.
I primi tre sono un unico gruppo. Gli intervalli pubblicati sui primi due si estendono di diciassette punti da entrambi i lati, il che è più ampio dell'intera forbice tra il primo e il terzo, quindi l'ordine tra loro non è una prova stabile. Ciò che la classifica stabilisce è che tutti e tre fanno parte del gruppo di testa e che nulla al di sotto di loro è vicino — il rango 10, Gemini 3.1 Flash TTS, è a 1.199.
L'unica asimmetria degna di nota è il numero di voci nell'arena. Qwen schiera 15 voci contro le 8 di Gemini, quindi il punteggio di Qwen è una media su un campione più ampio del prodotto dello stesso fornitore. Questo ha un doppio effetto: è una stima più equa di come suona nel complesso il catalogo di Qwen, e dà a Qwen più occasioni di schierare una voce debole che abbassa la media. Nessuna delle due letture cambia la conclusione che i due sono alla pari.

86 tag di consegna rispetto a un livello di direzione
Questa è la differenza sostanziale e decide la maggior parte delle integrazioni.
Qwen-Audio-3.0-TTS include 86 tag inline di resa: annotazioni incorporate nel testo che controllano il modo in cui viene pronunciato un segmento. È un approccio basato su markup: è il tuo script a sostenere l'interpretazione. Questo è familiare a chiunque abbia lavorato con SSML e si integra bene con strumenti che generano testo a livello programmatico, perché la superficie di controllo è una trasformazione di stringhe anziché una chiamata API.
Gemini 3.8 Flash TTS segue l'altra strada. Dai indicazioni su una battuta come faresti con un attore — ritmo, enfasi, registro emotivo — sotto forma di istruzione separata anziché di markup inline. Le scene con due voci possono essere messe in scena all'interno di una singola chiamata. E un piccolo insieme di segnali non verbali è scritto direttamente nel copione: <laughs>, <sigh>, <gasp> come indicazioni inline, più |mhm| e |yeah| per i rumori di riscontro.
Quindi entrambi i modelli accettano annotazioni nel testo; la differenza è la dimensione del vocabolario e dove risiede il resto del controllo. Quello di Qwen è più ampio e piatto — 86 tag, tutti nel testo. Quello di Google è più ristretto nel testo e più ampio al di fuori di esso, con la direzione dell'eloquio e la disposizione dei parlanti come parametri a livello di chiamata. Se stai portando un sistema che emette già markup inline ricco, Qwen è il porting più breve. Se stai comunque costruendo la logica di direzione nel codice dell'applicazione, la suddivisione di Google è più pulita.

Copertura linguistica rispetto alla copertura dialettale
I numeri di copertura non sono comparabili, e confrontarli ingenuamente è un errore.
Gemini 3.8 Flash TTS copre 130 lingue, rilevate automaticamente dal testo; Flash-Lite TTS ne copre 101. Si tratta di un'ampiezza che abbraccia intere famiglie linguistiche, ciò che serve per una fase di localizzazione che deve raggiungere una lunga coda di mercati.
Qwen-Audio-3.0-TTS copre 16 lingue più 20 regioni dialettali cinesi. Questa è profondità all'interno di una sola famiglia linguistica. Venti regioni dialettali non è un numero inferiore a 130 lingue nel modo in cui sembra — è un tipo diverso di rivendicazione, e per un prodotto che serve utenti di lingua cinese in tutte le regioni della Cina continentale è quella più utile. Un modello con 130 lingue e una sola voce mandarina non serve un utente in Sichuan come fa un modello con 20 regioni dialettali.
Quale dei due sia importante dipende interamente dal tuo pubblico. Se il tuo requisito è "almeno passabile in venti mercati", Gemini. Se è "davvero corretto nel mercato cinese", Qwen.
Prezzo, e cosa nasconde il dato per carattere
• Qwen-Audio-3.0-TTS-Plus — 27,60 $ per 1 milione di caratteri su base normalizzata della classifica; la variante Flash è di circa 15 $ per 1 milione di caratteri, con una latenza dichiarata del primo pacchetto di circa 300 ms.
• Gemini 3.8 Flash TTS — $33,00 per 1M caratteri normalizzati; fatturato da Google a $0,50 per milione di token di testo in input e $9,00 per milione di token audio in output fino al 31 dicembre 2026, poi $1,00 e $18,00.
• Gemini 3.8 Flash-Lite TTS — 22,10 $ per 1 milione di caratteri normalizzati al rango 6 con un Elo di 1.235; con fatturazione a 6,00 $ per milione di token audio fino al 31 dicembre 2026.
Entrambi i valori per carattere sono normalizzazioni di Artificial Analysis, non prezzi di listino dei fornitori — Qwen fattura tramite Alibaba Cloud Model Studio e Google fattura in token, e nessuno dei due pubblica una tariffa per carattere per questi modelli. Usali per il rapporto, che è all'incirca 1,2x a favore di Qwen, e non come quotazioni.
I tier divergono nella forma. Qwen si divide in Plus e Flash, con il tier Flash che sacrifica la qualità in cambio di un tempo al primo pacchetto dichiarato di ~300 ms. Google si divide in Flash e Flash-Lite, e poi ulteriormente in Standard, Batch e Flex, e Priority — 4,50 $, 9,00 $ e 16,20 $ per milione di token audio su Flash TTS. Il modello di Google premia la classificazione del tuo carico di lavoro; quello di Qwen premia la scelta in anticipo di un tier di qualità.
La disponibilità è l'altra vera differenza. Gemini 3.8 Flash TTS è in disponibilità generale sulla Gemini Developer API. Qwen-Audio-3.0-TTS è chiuso e solo in hosting, erogato tramite Alibaba Cloud Model Studio senza pesi aperti. Se hai bisogno di eseguire il modello da solo, nessuno dei due fa per te — ma se la tua infrastruttura è già su Alibaba Cloud, il modello Qwen è quello per cui non c'è alcun problema di egress da risolvere.
Rivendicazioni del fornitore da entrambe le parti
Nessuno dei due modelli dispone di un benchmark indipendente al di fuori dell'arena, ed entrambi i fornitori hanno pubblicato affermazioni che dovrebbero essere etichettate come tali.
Quello di Google, per Gemini 3.8 Flash TTS: primo nel Hume AI Voice Design Benchmark con 71,4, primo nella modellazione degli accenti con 60,8, primo e secondo nel Hume Overall Quality Index per Flash e Flash-Lite, e migliori piazzamenti nelle preferenze alla cieca rivendicati in giapponese, portoghese brasiliano, vietnamita, arabo standard moderno, spagnolo messicano e hindi. Le esecuzioni non sono pubbliche.
Di Alibaba, per Qwen-Audio-3.0-TTS: il sistema di resa a 86 tag, le 20 regioni dialettali e il dato di ~300 ms al primo pacchetto sulla variante Flash. Anche non riprodotto.
L'Elo dell'arena è l'unico numero di qualità raccolto in modo indipendente in questo articolo, e dice che i due sono a pari merito in cima alla classifica.

Cosa aggiunge Gemini che Qwen non ha
La creazione vocale è la lacuna più evidente. Gemini 3.8 Flash TTS supporta la progettazione vocale a partire da una descrizione in linguaggio naturale e la replica vocale da un campione di 30 secondi, con verifica del consenso e una filigrana SynthID più credenziali C2PA sull'output. Le voci personalizzate si presentano in due forme: 200 voci stateful per progetto con un tempo di vita di un anno, oppure voci stateless indirizzate da un handle voicekey_... che scadono dopo sette giorni. Il remix vocale è indicato come prossimamente disponibile.
Il controllo del formato di output è il secondo. WAV PCM mono a 24 kHz con segno a 16 bit sull'endpoint unario, PCM senza intestazione (audio/l16) sull'endpoint di streaming, più audio/mulaw e audio/alaw e una frequenza di campionamento configurabile. Per lavori affini alla telefonia, il supporto mulaw elimina un passaggio di transcodifica.
Quale chiamare
Scegli Qwen-Audio-3.0-TTS se i tuoi utenti parlano cinese e la copertura dei dialetti è un requisito, se vuoi un ricco vocabolario di markup inline che il tuo generatore possa emettere direttamente, o se sei già su Alibaba Cloud e vuoi il percorso più breve verso un endpoint funzionante. È anche il più economico dei due su base normalizzata, e la variante Flash è ancora più economica se un primo pacchetto a ~300 ms è accettabile.
Scegli Gemini 3.8 Flash TTS se ti serve ampiezza su molte lingue invece che profondità in una sola, se devi creare o replicare una voce specifica, se ti serve un output mulaw o alaw, oppure se «generalmente disponibile anziché solo in hosting» è un requisito di approvvigionamento.
Nessuna delle due è una scelta sbagliata e nessuna è chiaramente migliore — ed è proprio questo il senso di un divario di un punto Elo. La decisione riguarda la compatibilità, non la qualità.
È anche questo l'argomento per non impegnarsi ancora a fondo su nessuno dei due. OrcaRouter ti offre oltre 200 modelli dietro un'unica chiave al prezzo di listino del provider, senza ricarichi, così una variazione di tariffa da uno dei due laboratori arriva sulla tua fattura lo stesso giorno invece che al rinnovo, e il failover automatico fa sì che un endpoint di sintesi che vacilla sotto carico passi a un altro invece di scartare la richiesta. Non ospitiamo Qwen-Audio-3.0-TTS — viene erogato tramite Alibaba Cloud Model Studio — e non ospitiamo gli endpoint TTS di Gemini 3.8, che provengono dall'API di Google. Quello che forniamo è il livello testuale e il routing al di sopra di esso, ed è ciò che ti permette di provare entrambi su traffico reale per un mese prima di scegliere.
Il numero da tenere d'occhio è la prossima revisione dell'arena. Con 1.447 campioni su Qwen e 1.999 su Gemini, entrambi gli intervalli sono ancora abbastanza ampi che un solo mese di voti potrebbe separarli — o confermare che il pareggio è la risposta.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
