
Crea e distribuisci audio personalizzato con Gemini 3.8 Flash TTS: progettazione della voce, clonazione e i due orologi che decidono
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 506 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 184 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS ti permettono entrambi di inventare una voce a partire da una descrizione scritta invece di sceglierne una da un elenco, ed entrambi sono diventati disponibili in via generale sull'API Gemini il 23 settembre 2026. Il titolo che tutti ripetono è la progettazione della voce. La parte su cui vale la pena pianificare è ciò che accade a una voce progettata in seguito, perché il fornitore ti offre due modi per conservarne una e a ciascuno associa una durata diversa. Scegli quello sbagliato e la voce da cui dipende il tuo prodotto scade in una settimana.
Questa è la lacuna nella copertura del lancio finora. I post di annuncio spiegano che puoi far nascere una voce con un prompt, e alcuni menzionano la clonazione da un campione di 30 secondi. Nessuno di essi illustra il modello di archiviazione, che è ciò che decide se una pipeline vocale è riproducibile da un file di configurazione o deve essere riprovisionata secondo una pianificazione. Questo articolo copre l'intero percorso — progettazione, archiviazione, chiamata e pagamento — con i prezzi e le quote così come Google li pubblica.
Cosa è stato rilasciato il 23 settembre
Due modelli, un unico schema API. Gli identificatori sono gemini-3.8-flash-tts e gemini-3.8-flash-lite-tts, e la documentazione di Google è esplicita sul fatto che entrambi accettano "lo stesso identico schema API e lo stesso formato di prompting" — passare dall'uno all'altro è la modifica di un solo parametro, non una riscrittura.
• Input — solo testo. Entrambi i modelli accettano testo e restituiscono audio; non sono multimodali e non generano testo in risposta.
• Output — WAV, PCM mono a 24 kHz, 16 bit con segno sull'endpoint unary; PCM senza header (audio/l16) sull'endpoint di streaming; audio/mulaw e audio/alaw accettati con una frequenza di campionamento configurabile.
• Lingue — 130 su Flash TTS, 101 su Flash-Lite TTS, rilevate automaticamente dal testo anziché dichiarate nella richiesta.
• Voci — 30 voci studio curate elencate nella documentazione (tra cui Kore e Puck), una Libreria vocale estesa di "centinaia" di altre voci interrogabili tramite l'endpoint voices, più i due percorsi di creazione di seguito.
• Direzione — controllo della consegna riga per riga, scene a due voci messe in scena da un unico copione e segnali non verbali come <laughs>, <sigh> e |mhm| scritti direttamente nella trascrizione.
I due livelli esistono perché i carichi di lavoro si sono diversificati. Flash TTS è posizionato per la massima fedeltà acustica e recitazione complessa; Flash-Lite TTS è descritto, con le parole di Google, come il "sostituto tuttofare" per gemini-3.1-flash-tts-preview, finalizzato a doppiaggio in blocco, funzionalità di lettura ad alta voce e cascate di agenti vocali. Entrambi sostituiscono un unico modello di anteprima presente sull'API da aprile 2026, quindi se utilizzavi la versione di anteprima, la migrazione è una decisione di livello piuttosto che un incremento di versione.

Progettare una voce è un prompt, e questo cambia la fase di revisione.
La superficie di creazione è la vera novità di questa generazione. Una voce basata su prompt viene costruita a partire da una descrizione in linguaggio naturale — ruolo, accento, carattere vocale — e restituisce un identificatore che puoi riutilizzare. Nell'API questa è una chiamata di creazione di voce con store: true e un input basato su prompt; negli esempi di Google stesso, le descrizioni spaziano da un DJ di Melbourne ad alta energia a un drago giapponese. Una volta creata, la voce viene referenziata in una richiesta di sintesi vocale tramite il suo identificatore, e le istruzioni di stile per richiesta possono quindi essere minime o vuote, perché il carattere è già incorporato nella voce.
La conseguenza pratica è un cambiamento nel flusso di lavoro, non solo una funzionalità. Il casting vocale era una negoziazione di licenza o una prenotazione in studio, il che significava che la selezione della voce avveniva una volta, all'inizio, e sopravviveva alla revisione perché cambiarla era costoso. Quando una voce è un paragrafo di testo, il casting diventa un design token — qualcosa che un product manager può chiedere di rigenerare il martedì. I team che mettono la stringa di descrizione nel controllo di versione e trattano l'ID voce generato come un artefatto di build otterranno un output coerente in tutti gli ambienti. I team che creano le voci a mano in AI Studio no, e il fallimento apparirà come una differenza inspiegabile tra l'audio di staging e quello di produzione.
I due orologi
Questa è la sezione che i post di lancio saltano. Google ti consente di mantenere una voce progettata o replicata in uno di due stati, e questi scadono a ritmi estremamente diversi.
• Voci memorizzate — create con l'archiviazione abilitata, risiedono nel tuo progetto e sono soggette a una quota di 200 voci per progetto con una durata di un anno.
• Chiavi stateless — la replica vocale può restituire una chiave gestita dal client (la forma voicekey_… al posto di un identificatore memorizzato, e quella chiave ha una durata di sette giorni.
Letti insieme, quella coppia è un'istruzione di progettazione. Una voce archiviata è un impegno di un anno e un tetto massimo invalicabile di 200 per progetto, generoso per un prodotto con un cast fisso e inutile per qualsiasi cosa che generi una nuova voce per cliente. La chiave stateless è l'opposto: nessuna pressione sulle quote, ma una chiave che devi rigenerare ogni settimana, il che significa che la tua applicazione necessita di un percorso di aggiornamento e la tua infrastruttura deve archiviare credenziali che ruotano. Nessuna delle due è sbagliata. Scegliere senza rendersi conto di quale si è scelto è il motivo per cui un agente vocale ammutolisce all'ottavo giorno.
Altre due proprietà sono legate alla replica e vale la pena conoscerle prima di promettere qualsiasi cosa a un team legale. Creare una voce replicata richiede una registrazione del consenso verbale da parte del proprietario della voce, che deve corrispondere al parlante di riferimento: una verifica parlata, non una casella da spuntare. E l'output porta con sé la provenienza: ogni clip è contrassegnata da un watermark SynthID, e le voci replicate portano inoltre le credenziali di contenuto C2PA. Il percorso di progettazione è deliberatamente il più difficile da abusare, ed entrambe le barriere sono strutturali anziché semplici dichiarazioni di policy.
Una discrepanza che vale la pena segnalare anziché risolvere. La tabella dei modelli supportati di Google elenca la progettazione vocale e la replica vocale come disponibili su entrambi i modelli TTS 3.8. La maggior parte della copertura del lancio descrive la replica come parte specificamente della storia di Flash TTS. Se la replica è importante per la tua decisione tra i livelli, verificala nella documentazione del livello che intendi distribuire anziché fidarti dell'uno o dell'altro riepilogo.
Quanto costa un'ora di audio
Google fattura la voce in token, non in caratteri o secondi, e la conversione è pubblicata: l'audio viene conteggiato a 25 token per secondo di output, ovvero 90.000 token all'ora. Questo rende l'aritmetica insolitamente lineare, ed è il numero da inserire in un budget anziché la tariffa per milione.
• Flash TTS standard — 0,50 $ per milione di token di testo in ingresso, 9,00 $ per milione di token audio in uscita fino al 31 dicembre 2026, poi 1,00 $ e 18,00 $. Batch e Flex sono 0,25 $ e 4,50 $; Priority è 0,90 $ e 16,20 $.
• Flash-Lite TTS standard — $0,50 e $6,00 fino alla stessa data, poi $1,00 e $12,00. Batch e Flex $0,25 e $3,00; Priority $0,90 e $10,80.
• In secondi — Flash TTS equivale a circa $0,81 per ora di audio generato durante la finestra promozionale e a circa $1,62 dopo; Flash-Lite TTS è di circa $0,54 e poi $1,08.
• Rispetto al modello che sostituisce — gemini-3.1-flash-tts-previewha un prezzo di 1,00 $ e 20,00 $ per milione, quindi la voce relativa all'output audio è scesa del 55 per cento su Flash TTS e del 70 per cento su Flash-Lite TTS.
Non pianificare in base al numero promozionale. Google pubblica entrambe le colonne nella stessa tabella, il che significa che la tariffa di gennaio non è una voce da scoprire più avanti — è già sul listino oggi, e qualsiasi stima per mille minuti calcolata a $0.81 deve reggere il raddoppio.
Un numero indipendente, e diversi che non lo sono.
L'annuncio di Google si apre con i risultati dei benchmark, e questi vanno letti per quello che sono esattamente. L'azienda afferma che Flash TTS ha conquistato il primo posto nel Voice Design Benchmark di Hume AI con 71,4, ha primeggiato nella modellazione degli accenti con 60,8, e che Flash TTS e Flash-Lite TTS si sono classificati rispettivamente al primo e al secondo posto nell'Overall Quality Index di Hume, con forti piazzamenti nelle preferenze alla cieca su Voice Arena per giapponese, portoghese brasiliano, vietnamita, arabo standard moderno, spagnolo messicano e hindi. Tutti dati dichiarati dal fornitore, nessuna delle esecuzioni è pubblica.
C'è un dettaglio in quell'elenco che merita attenzione. Alan Cowen, accreditato come autore dell'annuncio di Google, è il fondatore di Hume AI — il laboratorio il cui Voice Design Benchmark fornisce il numero principale. Ciò non rende la cifra errata, e il benchmark di Hume è reale, ma i due non sono indipendenti tra loro, e un lettore che valuta il 71,4 dovrebbe saperlo prima di ripeterlo come convalida di terze parti.
Il dato raccolto in modo indipendente si trova su Provider Voice Arena di Artificial Analysis, catturato per questo articolo il 24 settembre 2026: Gemini 3.8 Flash TTS si colloca al secondo posto con un Elo di 1.260 e un intervallo di 17 punti su 1.999 campioni, dietro Cartesia Sonic 3.6 a 1.273. Gemini 3.8 Flash-Lite TTS è sesto a 1.235. Il modello che viene sostituito, Gemini 3.1 Flash TTS, è decimo a 1.199 su 3.430 campioni. Preferenza di ascoltatori in cieco, non una valutazione interna del laboratorio — e l'unico dato di qualità qui che Google non ha commissionato.

Dove eseguirlo, e dove non ancora
Entrambi i modelli sono disponibili oggi nell'API Gemini e in Google AI Studio, senza lista d'attesa. Le interfacce per consumatori e imprese sono introdotte per gradi anziché già rilasciate: Flash TTS arriverà su Gemini Notebook e Flash-Lite TTS su Google Vids, l'accesso a Gemini Enterprise è descritto come in arrivo, e il remix vocale — la regolazione di timbro, intonazione, velocità e accento su una voce esistente — è elencato come funzionalità futura anziché presente. Se il tuo piano dipende dal remix, non esiste ancora.
Da parte nostra, prima l'onestà: gli endpoint TTS di Gemini 3.8 non sono sulla tabella di routing di OrcaRouter. La generazione che sostituiscono invece sì — google/gemini-3.1-flash-tts-preview è nel catalogo agli stessi $1,00 e $20,00 per milione di token pubblicati da Google, perché il prezzo di listino del provider viene passato senza alcun ricarico, e risponde sullo stesso /v1/audio/speech endpoint che il tuo SDK compatibile con OpenAI già utilizza. Questo conta più di quanto sembri per un carico di lavoro vocale, perché ciò che stai effettivamente acquistando è un endpoint stabile che la tua applicazione può chiamare mentre i modelli dietro di esso cambiano. Il tuo codice contiene una stringa di modello; il catalogo contiene il routing. Quando la finestra promozionale di Google si chiuderà il 31 dicembre e Flash TTS raddoppierà, il prezzo di un modello instradato cambia lo stesso giorno invece che al prossimo rinnovo contrattuale — e un modello che va giù esegue il failover invece di portarsi via la tua coda di narrazione.

Se stai valutando questa generazione prima di impegnarti, l'esperimento a basso costo è a due livelli. Fai passare lo stesso script attraverso Flash TTS e Flash-Lite TTS, perché lo schema è identico e la differenza è un parametro — poi decidi con il tuo audio invece che con un grafico di benchmark, e controlla su Artificial Analysis se il divario di qualità sopravvive ai suoi margini di errore prima di pagare il sovrapprezzo. Per un progetto di narrazione di grande formato, il sovrapprezzo è denaro vero; per un bot di assistenza che legge ad alta voce un numero di telefono, non è ovvio che ti stia comprando qualcosa che un ascoltatore possa sentire.
