Una hero card generata per 'Gemini 3.8 TTS vs Gemini 3.1 Flash TTS' su sfondo bianco con morbidi accenti gradiente blu e ciano. La card di sinistra 'Gemini 3.1 Flash TTS' elenca Elo 1.199, 3.430 campioni, 7 voci arena e aprile 2026; la card di destra 'Gemini 3.8 Flash TTS' elenca Elo 1.260, 1.999 campioni, 8 voci arena e settembre 2026. Una riga a piè di pagina recita 'Elo per Artificial Analysis Provider Voice Arena, settembre 2026.' Il logo OrcaRouter è compositato nell'angolo in basso a destra.
Engineering & Research

Gemini 3.8 TTS vs Gemini 3.1 Flash TTS: l'unico divario in questa famiglia che è reale

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Passare a un modello superiore all'interno della stessa famiglia è di solito la decisione facile, e questa presenta una complicazione che la rende meno facile di quanto sembri. Gemini 3.1 Flash TTS — ancora indicato nell'API del fornitore come anteprima — occupa la 10ª posizione nella Artificial Analysis Provider Voice Arena con un Elo di 1.199 e un intervallo di 12 punti. Gemini 3.8 Flash TTS, rilasciato il 23 settembre 2026, occupa la 2ª posizione con un Elo di 1.260 e un intervallo di 17 punti. Si tratta di un guadagno di 61 punti e, a differenza della maggior parte dei divari presenti in quella classifica, resiste alle barre di errore: l'intervallo di 3.1 va da 1.187 a 1.211, quello di 3.8 va da 1.243 a 1.277, e tra i due c'è una zona morta di trentadue punti. Il miglioramento della qualità è reale. È sul fronte del prezzo che la faccenda si fa strana.

A generated two-column scoreboard for Gemini 3.1 Flash TTS and Gemini 3.8 Flash TTS — 3.1 at Arena Elo 1,199, $20.00 per 1M audio tokens, 7 arena voices, 3,430 samples and an April 2026 release; 3.8 at Elo 1,260, $9.00 per 1M audio tokens, 8 arena voices, 1,999 samples and a September 2026 release — over the footer 'Prices per Google; Elo per Artificial Analysis, Sept 2026.'

Il tariffario di Google stesso dice che la tariffa di output audio è scesa da 20,00 $ per milione di token sulla 3.1 a 9,00 $ sulla 3.8 — un taglio del 55%. Artificial Analysis normalizza gli stessi due modelli rispettivamente a 18,30 $ e 33,00 $ per milione di caratteri, il che dice l'opposto. Entrambi i numeri sono pubblicati; nessuno dei due è sbagliato; misurano cose diverse, e la riconciliazione è la parte più utile di questo confronto per chiunque stia pianificando una migrazione.

Cosa ha effettivamente cambiato l'aggiornamento

La generazione 3.8 non è una ritaratura. Tre superfici sono cambiate in modo sostanziale.

• Numero di voci e creazione di voci — 3.1 Flash TTS ha introdotto un set di voci predefinite. 3.8 Flash TTS introduce 30 voci studio predefinite, tra cui Kore e Puck, oltre alla progettazione vocale da una descrizione in linguaggio naturale e alla replica vocale da un campione di 30 secondi con verifica del consenso, un watermark SynthID e credenziali C2PA sull'output. Il remix vocale è elencato come prossimamente anziché come già disponibile.

• Controllo dell'interpretazione — istruzioni riga per riga, messa in scena di scene a due interlocutori all'interno di una singola chiamata e segnali non verbali scritti direttamente nel copione come <risate>, <sospiro>, <sussulto>, |mhm| e |sì|. Il materiale di lancio di Google sostiene una maggiore coerenza sui testi lunghi e il controllo della sceneggiatura a due voci rispetto a 3.1 in particolare. Si tratta di un'affermazione del fornitore senza alcun test pubblico alle spalle.

• Copertura linguistica — 130 lingue su Flash TTS e 101 su Flash-Lite TTS, rilevate automaticamente dal testo. La copertura dichiarata di 3.1 Flash TTS è inferiore.

Il cambiamento strutturale è la scissione. Non esiste un unico successore di 3.1 Flash TTS; ce ne sono due, e la documentazione di Google posiziona Flash-Lite TTS come il «sostituto affidabile su cui contare». Questo conta perché significa che una migrazione è una decisione di livello, non un aggiornamento di versione. Il livello più economico non è la versione più recente di ciò che hai — è un punto diverso sulla curva.

Perché il prezzo è sceso e la classifica dice che è salito

Inizia con quello che pubblica Google, perché è quello che ti verrà effettivamente addebitato.

Gemini 3.1 Flash TTS Preview — 1,00 $ per milione di token di testo in input, 20,00 $ per milione di token audio in output. In batch: 0,50 $ e 10,00 $.

• Gemini 3.8 Flash TTS Standard — $0,50 e $9,00 fino al 31 dicembre 2026, poi $1,00 e $18,00. Batch e Flex $0,25 e $4,50. Priority $0,90 e $16,20.

• Gemini 3.8 Flash-Lite TTS Standard — 0,50 $ e 6,00 $ fino al 31 dicembre 2026, poi 1,00 $ e 12,00 $. Batch e Flex 0,25 $ e 3,00 $. Priority 0,90 $ e 10,80 $.

A screenshot of Google's Gemini API text-to-speech documentation, captured in English, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts, and a Python sample that passes speech_metadata style annotations and the Kore voice.

Sulla sola linea di output audio, 3.8 Flash TTS a $9,00 contro 3.1 a $20,00 è un taglio del 55 percento, e 3.8 Flash-Lite TTS a $6,00 è un taglio del 70 percento. Anche al prezzo post-promozione di $18,00, Flash TTS resta comunque al di sotto del modello che sostituisce. Questo è il numero che finisce su una fattura, ed è inequivocabile.

Ora la classifica. Artificial Analysis pubblica una cifra per milione di caratteri, così che i modelli che fatturano in unità diverse possano essere classificati fianco a fianco, e per questa coppia indica 18,30 $ per 3.1 Flash TTS e 33,00 $ per 3.8 Flash TTS. Letto da solo, ciò dice che l'aggiornamento è quasi raddoppiato di prezzo.

La riconciliazione sta nel fatto che una tariffa per carattere è una conversione, non un prezzo, e il fattore di conversione non è lo stesso per i due modelli. Convertire i token audio in caratteri richiede di presupporre sia una velocità del parlato sia un rapporto di token audio — Google misura l'audio a 25 token per secondo di output — e richiede di scegliere rispetto a quale livello di servizio normalizzare. Se il consiglio normalizza 3,8 alla tariffa post-promozione di $18,00 mentre normalizza 3,1 al proprio $20,00, i due sono abbastanza vicini che qualsiasi differenza nei secondi per carattere presunti domina il risultato. Una tariffa per carattere basata su un'assunzione generosa di velocità del parlato favorisce il modello a cui viene applicata.

L'istruzione pratica è quindi: usate le tariffe per token di Google per il budget, e usate le tariffe per carattere della classifica solo per il rapporto tra i modelli che la classifica ha misurato allo stesso modo. Non mescolatele, e non citate il passaggio da $18,30 a $33,00 come un aumento di prezzo — è un artefatto di una normalizzazione che i due modelli non condividono.

Il vero costo di migrazione è un altro, ed è la finestra promozionale. Entrambi i nuovi livelli sono a metà tariffa fino al 31 dicembre 2026 e raddoppiano il 1° gennaio. Una migrazione pianificata sui numeri di settembre ed eseguita a novembre sarà ricalcolata nel primo trimestre. La tariffa di gennaio 2027 per Flash TTS, $18,00 per milione di token audio, è ancora inferiore ai $20,00 di 3.1 — quindi il taglio è reale oltre la promo, solo molto più piccolo di quanto sembri oggi.

Il guadagno di qualità, e ciò che non c’è dietro

L'Elo dell'arena è l'unico numero qui raccolto da qualcuno diverso dal fornitore, ed è quello che supera le sue barre di errore. Sessantuno punti da 1.199 a 1.260, con 3.430 campioni su 3.1 e 1.999 su 3.8, e 7 voci dell'arena contro 8. Il numero di campioni sul modello più recente è inferiore, il che amplia il suo intervallo, e anche così gli intervalli non si sovrappongono.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, captured in English, showing the top rows with Cartesia Sonic 3.6 first at Elo 1,273, Google's Gemini 3.8 Flash TTS second at 1,260, Alibaba's Qwen-Audio-3.0-TTS-Plus third at 1,259, and Google's Gemini 3.1 Flash TTS tenth at 1,199 across 3,430 samples.

Cosa non c'è dietro: nessun benchmark indipendente oltre all'arena. I numeri di lancio di Google — primi su Hume AI Voice Design Benchmark con 71,4, primi nella modellazione degli accenti con 60,8, primi e secondi sull'Hume Overall Quality Index per Flash e Flash-Lite, e le migliori posizioni nelle preferenze alla cieca dichiarate in giapponese, portoghese brasiliano, vietnamita, arabo standard moderno, spagnolo messicano e hindi — sono il fornitore che cita il benchmark di una terza parte. Le esecuzioni sottostanti non sono pubbliche. Vanno lette come dichiarazioni, nella stessa direzione del risultato dell'arena ma senza aggiungere peso indipendente ad esso.

La questione della deprecazione e una checklist di migrazione

Google non ha annunciato una data di dismissione per Gemini 3.1 Flash TTS Preview. Ha dichiarato che Flash-Lite TTS è posizionato come suo sostituto di riferimento, il tipo di linguaggio che precede un avviso di deprecazione anziché seguirlo. Se sei ancora sul modello preview, la lettura corretta è che hai una migrazione da pianificare, non una scadenza da rispettare — e che aspettare la scadenza è la strategia sbagliata per un modello il cui sostituto è già avanti di 61 punti Elo.

• Verifica di quale livello ha bisogno il tuo carico di lavoro. Flash TTS per 130 lingue e l'intera superficie di distribuzione; Flash-Lite TTS per 101 lingue a 6,00 $ per milione di token audio. L'elenco delle lingue è la linea di demarcazione, non la qualità.

• Ricalcola il prezzo in base alla tariffa di gennaio 2027, non a quella promozionale. $18,00 per milione di token audio su Flash TTS, $12,00 su Flash-Lite.

• Decidi se il job può essere eseguito in batch. Batch e Flex dimezzano la tariffa audio su entrambi i livelli — 4,50 $ e 3,00 $ per milione di token. Tutto ciò che non è interattivo non dovrebbe trovarsi nel livello Standard.

• Ricontrolla tutto ciò che dipendeva dal set di voci. Il catalogo predefinito comprende 30 voci precompilate; la voce che stavi usando su 3.1 potrebbe dover essere ricreata, tramite voice design o tramite un campione di replica di 30 secondi.

• Ricontrolla la configurazione delle richieste. Non esiste un limite di caratteri per richiesta pubblicato per i modelli 3.8, e l'audio viene conteggiato al secondo anziché per carattere, quindi un enunciato lungo costa più di quanto suggerirebbe un preventivo basato sui caratteri.

• Pianifica il ciclo di vita delle voci personalizzate. 200 voci con stato per progetto con una durata di un anno, oppure senza stato voicekey_... handle che scadono in sette giorni.

Eseguire entrambi mentre decidi

Un aggiornamento all'interno della stessa famiglia, con una scadenza promozionale e un disaccordo sulla normalizzazione, è esattamente il caso in cui non conviene passare in un solo passo. OrcaRouter instrada oggi il modello più vecchio — models/google/gemini-3.1-flash-tts-preview è nella nostra lista di modelli — così puoi mettere in piedi il nuovo modello accanto a quello e confrontarlo sul tuo traffico prima di spostare il percorso di produzione. Non ospitiamo gli endpoint Gemini 3.8 TTS; quelli provengono dall'API di Google stessa. Quello che offriamo è la chiave unica su oltre 200 modelli al prezzo di listino del provider, senza ricarico, così una variazione delle tariffe del fornitore arriva sulla tua fattura lo stesso giorno invece che al rinnovo, e il failover automatico, così che un modello nuovissimo sia qualcosa che puoi provare senza scommetterci un percorso rivolto ai clienti.

La cosa da tenere d'occhio è se Google attribuisce una data alla preview di 3.1 Flash TTS. Quella singola riga di documentazione vale più per un piano di migrazione di qualunque benchmark in questo articolo, e non è ancora stata scritta.