
Gemini 3.8 Flash TTS dice ciao: Google divide in due la sua linea vocale e taglia il prezzo
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
Il fornitore ha rilasciato due modelli vocali il 23 settembre 2026, e l'annuncio è scritto come se il titolo riguardasse la qualità della voce. Non è così. Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS sono i primi modelli di sintesi vocale da testo che il fornitore ha reso disponibili sulla Gemini Developer API a un prezzo inferiore a quello del modello in anteprima che sostituiscono — e per chiunque abbia pagato per carattere altrove, è proprio questa la parte che cambia una voce di budget. La tariffa di output audio di Gemini 3.8 Flash TTS è di $9,00 per milione di token fino alla fine del 2026. L'audio viene fatturato a 25 token al secondo, il che equivale a circa 0,02 centesimi per secondo di parlato generato. Il modello che sostituisce, Gemini 3.1 Flash TTS Preview, era prezzato a $20,00 per milione di token audio.
La seconda metà della storia è che ora ci sono due modelli, non uno. Google ha diviso la linea: Flash TTS porta con sé l'intero set di lingue e la frequenza audio più elevata, Flash-Lite TTS porta un elenco di lingue più breve e un costo più basso. Questa è una configurazione diversa da quella con un unico modello in anteprima presente sull'API da aprile, e ti dice come Google immagina il mercato — un piccolo numero di applicazioni che necessitano di 130 lingue e clonazione vocale, e un numero molto più grande che necessita di una voce inglese competente per un bot di assistenza e nient'altro.
Cosa è stato effettivamente rilasciato il 23 settembre
Entrambi i modelli sono generalmente disponibili sull'API Gemini e in AI Studio al momento dell'annuncio, non vincolati a una lista d'attesa. I nomi sull'API sono gemini-3.8-flash-tts e gemini-3.8-flash-lite-tts.
• Flash TTS — 130 lingue, lingua rilevata automaticamente dal testo, 30 voci studio predefinite tra cui Kore e Puck.
• Flash-Lite TTS — 101 lingue, stessa superficie di voice design, posizionato come il livello ad alto volume.
• Entrambi — progettazione vocale da una descrizione in linguaggio naturale, indicazioni di resa riga per riga, messa in scena di una scena a due voci e segnali non verbali scritti direttamente nel copione.
• Output — WAV PCM mono a 24 kHz con segno a 16 bit sull'endpoint unario; PCM senza intestazione (audio/l16) sull'endpoint di streaming; sono accettati anche audio/mulaw e audio/alaw, con una frequenza di campionamento configurabile.
La tabella delle tariffe, per milione di token, vale la pena leggerla per intero perché i livelli differiscono per più del numero principale:
• Flash TTS Standard — $0,50 input di testo / $9,00 output audio, in aumento a $1,00 / $18,00 dopo il 31 dicembre 2026.
• Flash TTS Batch e Flex — $0,25 / $4,50.
• Priorità Flash TTS — $0.90 / $16.20.
• Flash-Lite TTS Standard — $0,50 / $6,00, che saliranno a $1,00 / $12,00 dopo il 31 dicembre 2026.
• Flash-Lite TTS Batch e Flex — $0,25 / $3,00.
• Flash-Lite TTS Priority — $0,90 / $10,80.
• Gemini 3.1 Flash TTS Preview, per confronto — 1,00 $ / 20,00 $, batch 0,50 $ / 10,00 $.
La finestra promozionale è l'elemento da notare. Google ha fissato il prezzo di entrambi i nuovi modelli a tariffa dimezzata fino alla fine dell'anno e ha pubblicato i numeri successivi alla promozione nella stessa tabella. Chiunque modelli il costo per mille minuti dovrebbe usare il dato di gennaio, non quello di settembre.

La progettazione vocale è la capacità davvero nuova
Le voci predefinite sono il minimo indispensabile. Ciò che Google ha aggiunto nella versione 3.8 è un modo per descrivere una voce a parole e ottenerla, e un modo per clonarne una da un breve campione con un controllo del consenso incluso.
La progettazione vocale accetta un prompt in linguaggio naturale — ritmo, timbro, accento, il genere di cosa per cui altrimenti passeresti un pomeriggio a fare audizioni — e restituisce una voce utilizzabile senza una registrazione di riferimento. La replica vocale funziona al contrario: fornisci un campione di 30 secondi, il sistema verifica il consenso e la voce risultante viene contrassegnata con una filigrana SynthID e credenziali C2PA sull'audio generato. Il remix vocale, che consente di fondere o modificare una voce personalizzata esistente, è indicato come prossimamente disponibile anziché già rilasciato.
Le voci personalizzate esistono in due varianti e si comportano in modo abbastanza diverso da rendere la distinzione importante in produzione. Le voci personalizzate stateful sono memorizzate a livello di progetto, con un limite massimo di 200 per progetto e un time to live di un anno. Le voci stateless vengono indirizzate tramite un voicekey_... handle e scadono dopo sette giorni. Se la tua applicazione effettua il provisioning di una voce per cliente, il limite massimo e il TTL sono i due numeri che decidono se hai bisogno di un tuo livello di archiviazione.
I controlli sulla resa sono l'altra metà del "nuovo". Puoi dirigere una battuta come dirigeresti un attore — ritmo, enfasi, registro emotivo — invece di limitarti a scegliere una voce e sperare. Le scene con due parlanti possono essere messe in scena all'interno di una singola chiamata. E le vocalizzazioni non verbali sono elementi di copione di primo livello: <laughs>, <sigh> e <gasp> come segnali inline, più |mhm| e |yeah| per i piccoli rumori di riscontro che fanno sembrare una conversazione sintetica una vera conversazione. Si sostiene che la lettura long-form mantenga l'identità del parlante con una deriva minima, che è il tipo di errore che si manifesta per primo quando generi un capitolo di audiolibro di 40 minuti.
I benchmark, e chi li ha eseguiti
Il materiale di lancio di Google si basa su due valutazioni esterne e su una serie di posizionamenti in arena. Tutti questi dati sono riportati dal fornitore — è Google a citarli, e le esecuzioni sottostanti non sono pubbliche — quindi trattateli come affermazioni anziché come misurazioni.

• Benchmark di progettazione vocale di Hume AI — Gemini 3.8 Flash TTS si è classificato al primo posto con 71,4, e primo nella modellazione dell'accento con 60,8.
• Indice di qualità complessiva Hume — Flash TTS primo, Flash-Lite TTS secondo.
• Preferenza alla cieca nella Speech Arena — prime posizioni rivendicate in giapponese, portoghese brasiliano, vietnamita, arabo standard moderno, spagnolo messicano e hindi.
• Rispetto a Gemini 3.1 Flash TTS — Google sostiene miglioramenti nella coerenza sui testi lunghi e nel controllo delle sceneggiature a due voci, che sono esattamente le due cose per cui sono pensate le funzionalità di regia della resa vocale.
Vale la pena segnalare una discrepanza documentata, perché confonderà chiunque confronti le fonti. Il post del blog descrive una libreria di oltre 2.000 voci pronte per la produzione. La documentazione per sviluppatori descrive "centinaia" di voci nella Extended Voice Library, accanto alle 30 voci studio precompilate. Le fonti di terze parti hanno citato cifre ancora superiori di un ordine di grandezza. Non è possibile conciliarle dall'esterno: la lettura onesta è che il set precompilato che si ottiene di default è di 30, la Extended Voice Library è più ampia e descritta in modo vago, e i numeri elevati si riferiscono a un catalogo che include voci create dagli utenti. Se il numero di voci è determinante per la tua decisione, prova la voce specifica di cui hai bisogno invece di fidarti di una qualsiasi delle tre cifre.
Cosa significa se ci stai costruendo sopra
Il cambiamento pratico è che la sintesi vocale è passata da una voce specialistica di costo a qualcosa che puoi inserire nello stesso modello di costo dei tuoi token linguistici. A 25 token al secondo, un’ora di audio generato equivale a 90.000 token audio, che alla tariffa promozionale di Flash-Lite sono circa 54 centesimi. È abbastanza economico che la domanda interessante smette di essere "possiamo permetterci una voce sintetica" e diventa "quale dei due livelli richiede questa superficie".
Il secondo cambiamento pratico è che un modello TTS nuovissimo è esattamente il tipo di cosa che vuoi provare senza puntarci un percorso di produzione. È il caso di mettere un nuovo modello dietro un router invece di collegarlo direttamente: OrcaRouter espone oltre 200 modelli dietro un'unica chiave al prezzo di listino del fornitore, senza ricarichi, e il suo failover automatico fa sì che un nuovo endpoint vocale che vacilla sotto carico degradi verso un modello di cui ti fidi già invece di far cadere la chiamata. Noi non ospitiamo gli endpoint TTS di Gemini 3.8 — quelli provengono dall'API di Google stessa — ma il livello testuale sotto la voce, e il percorso di fallback quando una chiamata di sintesi fallisce, sono esattamente le parti per cui serve un router.
Cosa manca ancora
Tre cose sono assenti dal lancio e ognuna di esse è un vero vincolo, non una pignoleria.
Non esiste alcuna valutazione indipendente pubblicata. I numeri Hume di Google sono il fornitore che cita il benchmark di una terza parte, il che è meglio di niente e peggio di un audit. Finché Artificial Analysis o un equivalente non pubblica la propria esecuzione sugli stessi modelli, ogni asserzione sulla qualità in questo articolo va letta come un'asserzione.
Non esiste un'opzione open-weights. Entrambi i modelli sono chiusi e solo API, il che li colloca in una categoria diversa dai modelli vocali aperti che sono approdati nella stessa arena. Se il tuo deployment richiede di eseguire il modello autonomamente, questo lancio non ti riguarda.
E la tariffazione promozionale finisce. La tariffa di gennaio 2027 per Flash TTS è il doppio della tariffa di settembre, e qualsiasi business case costruito sui numeri del lancio dovrà essere rifatto nel primo trimestre. Non è una critica — pubblicare entrambi i numeri in anticipo è più onesto di quanto facciano i più — ma è il numero che deve stare nel foglio di calcolo.
Google non ha dichiarato se Gemini 3.1 Flash TTS Preview verrà deprecato, solo che Flash-Lite TTS è posizionato come suo sostituto di riferimento. Chiunque stia ancora usando il modello preview dovrebbe pianificare una migrazione invece di aspettare un avviso di disattivazione.

