
Gemini 3.8 TTS: Due pellicani, due modelli e un prezzo che raddoppia a gennaio
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
Il modo più rapido per capire cosa ha rilasciato il fornitore il 23 settembre 2026 è guardare la demo che l'ha accompagnata: due pellicani che discutono se trasferirsi a Pacifica Pier, una voce per uccello, con battute scriptate turno per turno. Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS sono i due modelli alla base di quella demo, entrambi generalmente disponibili sull'API Gemini, e i pellicani non sono una trovata. Sono la prima cosa in questa generazione che i precedenti modelli vocali Gemini non riuscivano affatto a fare: due parlanti, una generazione, uno script che controlla chi dice cosa.
Il prezzo è l'altra metà della storia, ed è qui che i due modelli si dividono. Flash TTS fattura 0,50 $ per milione di token di testo in ingresso e 9,00 $ per milione di token audio in uscita fino al 31 dicembre 2026, poi 18,00 $; Flash-Lite TTS fattura 0,50 $ e 6,00 $ con lo stesso calendario, poi 12,00 $. Queste sono le tariffe di Google stesso. Convertite da Artificial Analysis su base per milione di caratteri, così da poter stare sulla stessa classifica di tutti gli altri, risultano pari a 16,50 $ e 11,00 $ — circa un terzo in meno per il modello Lite, ed entrambe ben al di sotto di quanto fa pagare la vetta di quella classifica.
Quindi la domanda interessante non è se i modelli siano buoni. È su quale dei due dovresti basarti, perché il divario tra loro non è quello che si intuirebbe dai nomi.
Cosa contiene realmente l'annuncio del 23 settembre
Due modelli, non uno, e Google è esplicito sul fatto che si tratta di una suddivisione, non di una versione piccola e di una grande della stessa cosa. L'annuncio cita cinque ambiti in cui approdano — Google AI Studio, l'API Gemini, Gemini Enterprise, Gemini Notebook e Google Vids — e gli identificatori API sono semplici: gemini-3.8-flash-tts e gemini-3.8-flash-lite-tts.

L'elenco delle funzionalità è più lungo di quanto suggerisca il titolo. Dall'annuncio di Google e dalla documentazione sulla generazione vocale dell'API Gemini:
• Voice design — descrivi una voce a parole e ricevi in cambio un ID voce personalizzato, invece di sceglierne una da un elenco fisso.
• Replicazione vocale — un campione di 30 secondi produce un ID vocale, ovvero il percorso che la maggior parte dei team utilizzerà effettivamente per una voce di brand o un narratore.
• Dialogo a due voci — il caso del pellicano. Il copione contiene turni di parola invece di un unico blocco di prosa.
• Stile a livello di turno — la documentazione descrive un'annotazione speech_metadata che associa la direzione a un turno specifico anziché all'intera richiesta.
• Voci predefinite, più una Libreria vocale estesa accessibile tramite GET /v1beta/voices.
• Tre codifiche audio — WAV per impostazione predefinita, con mulaw e alaw disponibili per pipeline di tipo telefonico.
• Solo testo in input, solo audio in output. La documentazione è categorica al riguardo: i modelli TTS non accettano alcun'altra modalità di input e non producono alcun altro output, e c'è una sezione Limitazioni separata che elenca le restrizioni.
Nell'annuncio non c'è nessuno dei numeri di cui ha bisogno un pianificatore di capacità. I limiti di frequenza, le quote e la durata di archiviazione di una voce progettata sono tutti nella documentazione e nella pagina dei prezzi, non nel post di lancio: è la solita ragione per cui la settimana di lancio fila liscia per le demo e male per la produzione.

I pellicani sono la vera notizia
Il TTS a singolo parlante è un problema risolto quanto basta da due anni. Quello che mancava era un modello capace di tenere separate due identità lungo un lungo copione senza deriva, ed è questo che la demo sta davvero mettendo alla prova — non se la voce suoni umana, ma se il parlante A è ancora il parlante A dopo quattro minuti.
Ne conseguono due cose, ed è proprio per questo che la questione conta al di là dei giocattoli per podcast.
Il primo è che l'unità di lavoro cambia. Con un modello a singolo parlante, un dialogo di venti minuti è venti minuti di audio che si cuce a partire da due esecuzioni indipendenti, e ogni giunzione è un punto in cui la prosodia si azzera. Con un modello a due parlanti, è una sola chiamata, un solo contesto, e il modello può reagire alla battuta che la precede. È una differenza di qualità che non puoi recuperare con la post-elaborazione.
Il secondo è che il formato dello script diventa l'interfaccia. Se la tua pipeline emette già qualcosa a forma di SSML — un'annotazione per frase — questa generazione è quasi una sostituzione diretta. Se la tua pipeline passa a un modello un muro di testo e spera, ora hai un motivo per ristrutturarla, perché lo styling che prima era implicito ora è qualcosa che devi dire ad alta voce. È lo stesso compromesso che il resto del settore sta facendo in modi diversi, ed è l'asse su cui questi due modelli Google competono con tutto il resto in campo.
Quanto costa un'ora di audio di due pellicani
Vale la pena fare una volta il calcolo dei token, perché la cifra per milione di token audio non è una cifra per ora e la differenza ha sorpreso molti.
I token audio vengono prodotti a una velocità fissa per ogni secondo di output, quindi il costo è proporzionale alla durata dell'audio finito, non alla lunghezza del copione. Prendi la tariffa di Google stessa per Flash TTS — 9,00 $ per milione di token audio in uscita — e il calcolo per un audio finito della durata di un'ora resta sotto i dieci dollari nel livello standard, con il modello Lite a due terzi di quella cifra. I prezzi Batch e Flex, a 0,25 $ in input e 4,50 $ in output per Flash TTS contro 0,25 $ e 3,00 $ per Flash-Lite TTS, riducono ulteriormente la spesa per tutto ciò che non deve essere generato su richiesta. Priority, a 0,90 $ e 16,00 $, è per il lavoro che invece ne ha bisogno.
Tre conseguenze pratiche:
• Rigenerare un paragrafo costa poco; rigenerare una serie è una decisione. A queste tariffe, la parte costosa di una pipeline vocale smette di essere l'inferenza e torna a essere la persona che approva la take.
• La tariffa per l'input di testo è rumore di fondo. $0,50 per milione di token di testo su uno script di qualche migliaio di parole è un errore di arrotondamento rispetto alla parte audio. Non ottimizzare lo script in base alla lunghezza.
• Il salto del 31 dicembre è reale e raddoppia la tariffa audio. Se stai pianificando un rollout nel 2027, metti a budget il prezzo post-promozionale, non quello di lancio, altrimenti a gennaio dovrai rifare i piani.
Il numero che è indipendente, e quelli che non lo sono
Un dato in questo lancio proviene da una fonte diversa da Google. Nell'Artificial Analysis Provider Voice Arena, rilevato il 24 settembre 2026, Gemini 3.8 Flash TTS si trova al 2° posto con un Elo di 1.260 su 1.999 campioni e 8 voci dell'arena, e Gemini 3.8 Flash-Lite TTS si trova al 6° posto con 1.235 su 2.000 campioni. Entrambi sono all'interno degli intervalli di confidenza l'uno dell'altro a ±16 e ±17, quindi la classifica ti sta dicendo che sono statisticamente indistinguibili in termini di preferenza — il che è un risultato davvero utile, perché significa che quello più economico non è misurabilmente peggiore per gli ascoltatori.
Tutto il resto è un'affermazione di Google stessa e va letta come tale: il linguaggio dell'espressività, i conteggi delle lingue, la qualità della replicazione. L'arena ti offre una classifica di preferenze e nient'altro. Non ti dice come ciascuno dei due modelli gestisca un copione di 40 minuti senza deriva, come si comporti con un nome proprio che non ha mai visto, o cosa succeda a una voce progettata dopo una settimana.

Il modello Lite è anche l'argomento migliore a favore del fatto che la coppia sia una vera separazione anziché un livello di marketing. Un divario Elo di 25 punti che si colloca all'interno delle barre di errore, a fronte di un divario di prezzo del 33%, è la forma di una decisione che le pipeline sensibili al prezzo dovrebbero prendere a favore di Lite quasi ogni volta — e la forma di una decisione che le pipeline sensibili alla latenza dovrebbero prendere nella direzione opposta, dal momento che le due differiscono sia sul tempo sia sul costo.
Dove eseguirlo, e la versione onesta di quella risposta
OrcaRouter non ospita gli endpoint TTS di Gemini 3.8. Vale la pena dirlo chiaramente anziché lasciare intendere il contrario, perché la cosa utile che possiamo dire di questi due modelli non è che li serviamo — non lo facciamo — ma che un taglio di prezzo di un fornitore come la variazione del 31 dicembre è esattamente il tipo di evento che rende utile avere il routing.
OrcaRouter mette oltre 200 modelli dietro un'unica chiave API al prezzo di listino del provider senza ricarichi, quindi quello che paghi è la tariffa del fornitore, e una sua modifica è attiva dalla nostra parte lo stesso giorno anziché al ciclo di fatturazione successivo. Per una pipeline vocale in fase di migrazione, il livello di failover conta più del catalogo: puoi mettere un percorso di richiesta su un modello ancora in fase di valutazione senza scommettere una route di produzione su di esso, perché una chiamata che fallisce può passare a qualcosa di già collaudato. Il DSL di routing compone diversi modelli in un'unica chiamata per i casi in cui nessuna singola voce è abbastanza buona, e la fusione di modelli risponde a un prompt con un panel quando la risposta conta più della latenza.
Per i modelli TTS Gemini 3.8 stessi, il posto da cui chiamarli è l'API di Google stessa, e le superfici che Google ha indicato il 23 settembre. Quello che la coppia fa alla tua architettura — una chiamata per due parlanti, lo styling come annotazione, una voce che può essere descritta invece che scelta — è la parte che sopravvive allo sconto di lancio.
Cosa guardare dopo
Tre cose decideranno se questa generazione rappresenta un salto epocale o una semplice funzionalità.
Il primo è il drift. Nessuno ha pubblicato una valutazione long-form per stabilire se il percorso a due speaker mantenga l'identità per un'ora intera, e finché qualcuno non lo farà, la demo pelican è una demo. Il secondo è la durata di vita della voce. Una voce progettata che scade in una settimana è un prototipo; una voce che può essere ri-derivata da una configurazione salvata è un prodotto, e la risposta dipende da quale dei due identificatori si conserva. Il terzo è ciò che accade dopo il 31 dicembre, quando la tariffa promozionale termina e il costo orario di una pipeline vocale raddoppia da un giorno all'altro.
Nessuno di questi è visibile dal post di lancio. Tutti e tre sono visibili dalla documentazione, che è esattamente il punto in cui la copertura del lancio smette di leggere.
