Una hero card generata per 'Gemini 3.8 Live vs Qwen-Audio-3.1-TTS' su sfondo bianco con morbidi accenti sfumati blu e ciano. Due pannelli si trovano sotto un titolo che recita 'Due metà, aggiornate a otto giorni di distanza'. Il pannello di sinistra riguarda '15 settembre 2026 — Gemini 3.8 Live ed Extended Thinking sulla Live API'. Il pannello di destra riguarda '23 settembre 2026 — Qwen-Audio-3.1-TTS ad Apsara, sintesi ridotta di circa il 70%'. Una riga a piè di pagina recita 'Si incontrano nel mezzo di una pipeline, non sullo stesso lavoro'. Il logo OrcaRouter è composto nell'angolo in basso a destra.
Guides & Insights

Gemini 3.8 Live vs Qwen-Audio-3.1-TTS: due metà di uno stack vocale, riprezzate a otto giorni di distanza

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Gemini 3.8 Live è il modello speech-to-speech di Google, distribuito il 15 settembre 2026 come gemini-3.8-live e gemini-3.8-live-extended-thinking sulla Live API. Qwen-Audio-3.1-TTS è il modello text-to-speech di Alibaba, annunciato alla Apsara Conference di Hangzhou il 23 settembre 2026, otto giorni dopo, con un taglio di prezzo di circa il 70% sulla sintesi vocale abbinato ad esso. Quel divario di otto giorni è il motivo per cui vale la pena leggere questo confronto ora anziché a luglio. Nulla è cambiato nei ruoli dei due prodotti — uno ascolta e parla, l'altro legge il testo ad alta voce — ma entrambe le metà di una pipeline vocale di produzione sono state ricostruite o riprezzate nell'arco di una sola quindicina di giorni, e l'aritmetica che un tempo risolveva questo confronto si è spostata in silenzio.

Due metà, rinfrescate a otto giorni di distanza

Inizia da ciò che rende insolito questo abbinamento: i due modelli non competono. Un prodotto vocale ha una bocca e ha un orecchio, e questi due ne rappresentano uno ciascuno. Gemini 3.8 Live chiude il ciclo — audio e video in ingresso, audio in uscita, interruzioni gestite, chiamate agli strumenti in esecuzione sotto la conversazione. Qwen-Audio-3.1-TTS prende una stringa e una voce di riferimento e restituisce una performance. È una bocca migliore di qualsiasi altra cosa, e non cerca di essere un orecchio.

Ciò che rende interessante la tempistica di settembre è che i due annunci sono rivolti a estremi opposti della stessa voce di budget. Il lancio di Google del 15 settembre era una storia di capacità, senza alcun movimento di prezzo associato; l'annuncio di Alibaba del 23 settembre era soprattutto una storia di margini, con nuove capacità al seguito. Un team che ha costruito una pipeline ibrida ad agosto si è trovato, nell'arco di otto giorni, ad avere una ragione per riesaminare entrambe le gambe — e solo una di quelle gambe è diventata più economica.

Cosa ha effettivamente cambiato la release 3.1 sul fronte Qwen

Alibaba non ha rilasciato un unico modello il 23 settembre. La generazione 3.1 copre cinque endpoint — Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next, Qwen-Audio-3.1-TTS, Qwen-Audio-3.1-TTS-Next e Qwen-Audio-3.1-Realtime — e solo uno di essi, il livello TTS semplice, è un sostituto diretto per chiunque già chiami il modello TTS 3.0.

Su quel tier, sono cambiate tre cose e una di esse è un autentico costo di migrazione. Il controllo della delivery è passato da un vocabolario fisso di 86 tag inline a istruzioni in linguaggio naturale: descrivi l'emozione, il ritmo e lo stile che desideri invece di inserire la parentesi giusta nella posizione giusta. È arrivato il trasferimento di timbro cross-lingua, che permette a una voce di riferimento di mantenere la propria identità in mandarino, cantonese, inglese e giapponese. E il modello ora tollera direttamente audio di riferimento rumoroso o con eco, senza un passaggio separato di denoising. La copertura linguistica è invariata a 16 lingue dichiarate dal fornitore più 20 regioni dialettali cinesi, e — vale la pena segnalarlo perché altrove viene sorvolato — il materiale di Alibaba stesso dice che il tier 3.1 aggiunge sette lingue, il che non si concilia con le 16 elencate dalla copertura pubblicata della generazione di luglio. Considera entrambi i conteggi come dichiarati dal fornitore finché non verifichi le lingue specifiche che ti servono su Model Studio.

Il prodotto davvero nuovo di questa release è Qwen-Audio-3.1-TTS-Next, che Alibaba definisce un modello "Audiogen": una singola passata che produce insieme voce, effetti sonori e ambiente di sottofondo, per dialoghi multi-speaker, assemblaggio di podcast e lavoro su scene. Ha un prezzo di listino di $0,848 per milione di token di input e $1,696 per milione di token di output sul nodo di Pechino, con un tetto di 3.000 caratteri di input, 240 secondi di audio generato per i podcast e 120 secondi negli altri casi, tre richieste al secondo, e accetta fino a tre clip di riferimento da 30 secondi ciascuna. Gestisce solo cinese e inglese. Se la tua pipeline è un singolo narratore che legge un copione, quel prodotto è irrilevante per te; se è composta da due conduttori e una base musicale, è il motivo per cui vale la pena guardare questa release.

La cucitura è ciò che stai effettivamente scegliendo

Poiché i due modelli non svolgono lo stesso compito, la decisione non è una gara comparativa. È una questione di dove collochi il passaggio di consegne e di quanto sei disposto a pagare perché la giuntura sia invisibile.

Esistono due architetture oneste. La prima è un'unica rete: Gemini 3.8 Live gestisce l'intero turno, ascolta chi chiama, decide cosa dire e lo dice, e tu accetti la voce che ti offre — che non puoi clonare né brandizzare. La seconda è una cascata: riconoscimento, poi ragionamento, poi Qwen-Audio-3.1-TTS come bocca, che ti offre mille voci, inclusa una registrata dal tuo talento, al prezzo della latenza attraverso due o tre confini tra fornitori e della prosodia che si perde quando una frase viene spezzata tra una chiamata API e l'altra.

La maggior parte dei team finisce per avere entrambi, e non è una mancanza di coraggio. Usa il modello realtime dove la latenza si sente — l'interruzione, la conferma, il "mm-hm" che dice a chi chiama che sei ancora lì — e il modello di sintesi dove si sente la qualità: la lunga rilettura di una policy, il numero di conferma letto a un ritmo deliberato, la voce di marca che deve essere identica in ogni singola chiamata. L'ibrido è la risposta corretta per un'ampia classe di prodotti. È anche il punto in cui il modello di costo diventa difficile, perché ora stai misurando due unità diverse.

A screenshot of the Artificial Analysis Speech to Speech leaderboard in English, captured 25 September 2026, showing the AA Speech to Speech Index panel with index values of 82.6, 81.5, 81.3, 80.1, 76.0, 73.9 and 71.5, with the cost-per-hour-of-input-audio axis running to roughly $10.75. The bar labels are set vertically and are not legible at capture size. No Alibaba Qwen-Audio model appears on the board, because the board scores speech-to-speech models and Qwen-Audio-3.1-TTS is a synthesis model.

Con prezzo per ora audio, che è l'unica unità adatta a entrambi

Google fattura la Live API al minuto; Alibaba fattura i livelli di Qwen TTS per carattere e per token. Per confrontarli devi scegliere un normalizzatore, e l'unico difendibile per la voce è l'ora di audio finito.

• A consumo in ingresso — Gemini 3.8 Live per minuto di audio, 0,005 $ in entrata e 0,018 $ in uscita, contro Qwen-Audio-3.1-TTS per milione di caratteri, con il tier 3.0 Plus che si aggira intorno ai 27,60 $ e il tier Flash intorno ai 15 $ prima del taglio, e il tier TTS Flash listato a 1,5 yuan per milione di token di input e 12 yuan per milione di token di output dopo di esso
• A consumo in uscita — Gemini 3.8 Live, conversazione bidirezionale, costa circa 1,38 $ per un'ora di conversazione a orologio reale a listino, prima di qualsiasi caching, contro Qwen-Audio-3.1-TTS, un flusso unidirezionale, con il tier 3.1-Next a 0,848 $ per milione di token di input e 1,696 $ per milione di output sul nodo di Pechino
• Sente l'interlocutore — Gemini 3.8 Live sì, input audio e video nativo contro Qwen-Audio-3.1-TTS no, testo in ingresso e audio in uscita
• Voci — Gemini 3.8 Live una sola voce, non clonabile, non brandizzabile contro Qwen-Audio-3.1-TTS oltre mille, con clonazione zero-shot da audio di riferimento rumoroso
• Lingue — Gemini 3.8 Live 97 secondo il fornitore, con cambio a metà conversazione contro Qwen-Audio-3.1-TTS 16 secondo il fornitore più 20 regioni dialettali cinesi, con trasferimento del timbro tra mandarino, cantonese, inglese e giapponese
• Controllo dell'eloquio — Gemini 3.8 Live prompt e contesto della conversazione contro Qwen-Audio-3.1-TTS istruzioni in linguaggio naturale, che sostituiscono gli 86 tag inline della generazione 3.0
• Punteggio indipendente — Gemini 3.8 Live 82,6 sull'Artificial Analysis Speech to Speech Index per la variante Extended Thinking e 76,0 per quella standard contro Qwen-Audio-3.1-TTS nessuno; il numero Qwen più vicino è 1.259 Elo per il tier 3.0 Plus di generazione precedente sul Provider Voice Arena, che è una valutazione del predecessore e non di questo modello

La riduzione percentuale è riferita a tariffe che variano in base alla regione e al livello, quindi il 70% in evidenza non è una promessa sul tuo traffico, e Alibaba Cloud ha anche spostato la trascrizione in tempo reale sul nodo di Singapore da una misurazione basata sulla durata a una basata sui token — una base meno prevedibile, dato che sia il silenzio sia il contesto multi-turn aumentano il consumo di token. Confronta il nuovo listino prezzi con il tuo audio.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard in English, captured 25 September 2026, showing Cartesia Sonic 3.6 first at Elo 1,273 with a 17-point interval over 1,757 samples and $49.0 per million characters, Google Gemini 3.8 Flash TTS second at 1,260 on 1,999 samples at $16.5, Alibaba Qwen-Audio-3.0-TTS-Plus third at 1,259 on 1,447 samples at $27.6, and Google Gemini 3.8 Flash-Lite TTS sixth at 1,235 on 2,000 samples at $11.0. The board scores synthesis models and carries no row for Qwen-Audio-3.1-TTS or for any Gemini 3.8 Live endpoint.

Ciò che l'aggiornamento 3.1 non risolve

Ecco la parte che è facile sbagliare in entrambe le direzioni. I miglioramenti della 3.1 non rendono Qwen-Audio-3.1-TTS un candidato per il lavoro che svolge Gemini 3.8 Live — il controllo basato su istruzioni, il trasferimento di timbro e la tolleranza agli input rumorosi lo rendono una bocca migliore, e nessuno di essi gli dà un orecchio. Allo stesso modo, la posizione di Gemini 3.8 Live nei benchmark non ti dice nulla sul fatto che la tua voce brandizzata sopravviva a una frase in cantonese.

C'è anche una lacuna nelle prove che un taglio di prezzo rende più allettante ignorare. Qwen-Audio-3.1-TTS non ha un punteggio indipendente. Il punteggio Elo di 1.259 che compare accanto al nome Qwen nella Provider Voice Arena appartiene a Qwen-Audio-3.0-TTS-Plus, il modello che viene sostituito, misurato su 1.447 campioni. La riga Arena del successore non esiste ancora. Se il tuo processo di approvazione richiede un numero di terze parti — e per una voce di brand probabilmente dovrebbe — il modello più recente è quello che ne è privo, e la fascia più economica è quella che non puoi ancora difendere. L'unico evento che risolverebbe la questione è la comparsa di Qwen-Audio-3.1-TTS su una board di ascolto cieco.

Dove una chiave aiuta e dove no

Una conseguenza del rilascio 3.1 è facile da trascurare perché sembra un dettaglio di prompt engineering piuttosto che di infrastruttura. Sostituire 86 tag hardcoded con istruzioni in forma libera trasforma le tue indicazioni di consegna in artefatti testuali. Ora le generi, le versioni e le riconvalidi tutte rispetto all'interpretazione del nuovo modello — e la modalità di guasto è la deriva, non un errore, perché due formulazioni di "caloroso ma non sentimentale" non verranno recepite allo stesso modo.

Questo è un problema di inferenza testuale avvolto attorno a una pipeline vocale, ed è qui che siamo utili. OrcaRouter non instrada Qwen-Audio-3.1-TTS né alcun modello Qwen-Audio, e non instradiamo nemmeno gli endpoint Gemini 3.8 Live — nessuna delle due metà di questo stack è richiamabile tramite noi, e nulla di quanto detto qui va letto come un'affermazione che lo sia. Ciò che offriamo è il livello che scrive e verifica il testo di direzione: qwen/qwen3.8-flash e google/gemini-3.8-flash tra oltre 200 modelli, da una singola chiave al prezzo di listino del provider senza ricarico, con un DSL di routing che compone diversi modelli in una singola chiamata e failover automatico quando un upstream si degrada. Quando stai per rivalidare diecimila prompt di consegna rispetto a un modello che ha appena cambiato il modo in cui li legge, generare le varianti e valutarle per coerenza è la parte che dovrebbe essere un unico contratto, non quattro.

Cosa misurare prima di scegliere

Tre esperimenti rispondono più di qualsiasi consiglio di amministrazione. Fai passare una voce di riferimento e un paragrafo del tuo script attraverso Qwen-Audio-3.1-TTS, poi ascolta se il controllo basato su istruzioni ti dà due volte la stessa resa — questo è il rischio di migrazione, ed è più economico misurarlo che pianificarci intorno. Fai passare una registrazione reale di una chiamata, con il tuo rumore di fondo, attraverso Gemini 3.8 Live e verifica se l'alternanza dei turni regge quando il chiamante interrompe a metà parola — è ciò che l'indice speech-to-speech sta cercando di quantificare, e non sopravvive al contatto con una linea telefonica reale in modo abbastanza affidabile da poter essere accettato sulla fiducia. E fai i conti sul tuo volume in ore audio invece che nelle unità in cui i due fornitori fatturano, perché su questo particolare abbinamento la differenza di prezzo prevista tra "TTS cinese economico" e "Goog​le flagship" non è mai stata tanto grande quanto sembra, e dopo il 23 settembre è ancora più piccola.

A generated summary card for Gemini 3.8 Live vs Qwen-Audio-3.1-TTS on a white background with soft blue-and-cyan gradient accents. Five rows read 'Gemini 3.8 Live — speech-to-speech, Live API, 15 September 2026', 'Qwen-Audio-3.1-TTS — text-to-speech, Apsara, 23 September 2026', 'The gap: eight days, and only one of them got cheaper', 'Independent score: Gemini 82.6 on AA Speech to Speech; Qwen 3.1-TTS none', and 'Verdict: not substitutes — pick which half you are shopping for'. A footer line reads 'Vendor-reported figures where stated; independently measured where a board is named.' The OrcaRouter logo is composited in the bottom-right corner.

Confrontati in questo articolo2

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno