
Gemini 3.8 Live vs Gemini 3.8 TTS: un ciclo di conversazione e una voce di lettura condividono un nome di generazione
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 36 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 181 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
Gemini 3.8 Live è un modello speech-to-speech che è stato rilasciato il 15 settembre 2026 come gemini-3.8-live e gemini-3.8-live-extended-thinking. "Gemini 3.8 TTS" non è affatto un modello — è il termine ombrello che la copertura del lancio, incluso il titolo del post di Google, usa per la coppia di endpoint text-to-speech arrivati il 23 settembre 2026 come gemini-3.8-flash-tts e gemini-3.8-flash-lite-tts. Quindi questa non è la solita pagina versus, in cui due prodotti si contendono un unico compito. È una pagina su due compiti che condividono un numero di generazione, e sullo specifico errore che le persone commettono quando trattano le parole "Live" e "TTS" come due varianti della stessa cosa.
Il fork che il numero di generazione condiviso nasconde
Google traccia essa stessa la linea di demarcazione nella propria documentazione sulla generazione vocale, e la frase è facile da lasciarsi sfuggire: «La capacità TTS è diversa dalla generazione vocale fornita tramite la Live API». Lo stesso passaggio ne spiega il motivo, e la ragione è strutturale più che una questione di qualità. La Live API è pensata per «input e output audio interattivi e non strutturati, e multimodali». Il TTS tramite l'API Gemini «è pensato per scenari che richiedono la recitazione esatta del testo con un controllo granulare». Una nota successiva rende esplicita la forma dell'input: i modelli TTS accettano solo testo e restituiscono solo audio.
Quel singolo vincolo — testo in ingresso, audio in uscita, nessun ingresso audio — è l'intero confronto. Un modello Gemini 3.8 Live sente la persona che gli parla. Un modello Gemini 3.8 Flash TTS o Flash-Lite TTS non sente mai nessuno; legge una stringa e la esegue. Tutto il resto ne consegue: i benchmark che esistono per uno sono privi di significato per l'altro, la tariffazione si basa su unità diverse e le modalità di errore non sono affatto comparabili.
Questo è importante perché i due casi d'uso sembrano identici dall'esterno. Un agente vocale e una pipeline di narrazione finiscono entrambi per emettere un parlato che suona umano. Solo uno dei due può essere interrotto.
Dove "Gemini 3.8 TTS" si risolve effettivamente
Apri la tabella dei modelli supportati per la generazione vocale dell'API Gemini e troverai quattro voci TTS e nessuna voce chiamata Gemini 3.8 TTS. Due di esse appartengono a questa generazione: Gemini 3.8 Flash TTS, ID modello gemini-3.8-flash-tts, con 130 lingue, e Gemini 3.8 Flash-Lite TTS, ID modello gemini-3.8-flash-lite-tts, con 101 lingue. Le altre due — Gemini 3.1 Flash TTS Preview e Gemini 2.5 Pro Preview TTS — sono la generazione in anteprima che Flash-Lite sostituisce.
Quindi quando qualcuno dice "Gemini 3.8 TTS" di solito si riferisce al tier Flash, perché è quello con cui apre il post di lancio e quello che la classifica di Arena posiziona più in alto. Quando lo dice a proposito di un agente vocale in tempo reale, non si riferisce a nulla, perché ciò che vuole si trova su un endpoint diverso, con un nome diverso e un contratto di input diverso.
C'è una terza collisione che vale la pena menzionare, perché produce il consiglio peggiore. Gemini 3.8 Live non è un modello text-to-speech con funzionalità extra. È un modello speech-to-speech, e il motivo per cui costa di più per unità è che fa più lavoro per unità: ascolta, ragiona durante l'enunciato, gestisce le interruzioni e, nella variante Extended Thinking, delibera prima di rispondere.
L'unico numero che regge davvero il confronto
I punteggi di qualità non si trasferiscono tra queste due famiglie; non esiste un'unica classifica che valuti un narratore e un conversatore sullo stesso asse. Il denaro, invece, si trasferisce, una volta scelta l'unità in modo onesto, e l'unità onesta per tutto ciò che è voce è l'ora audio.
• Fatturazione in ingresso — Gemini 3.8 Live fattura al minuto di audio, 0,005 $ al minuto in ingresso e 0,018 $ al minuto in uscita, mentre Gemini 3.8 Flash TTS fattura per milione di token audio, 9,00 $ fino al 31 dicembre 2026 e 18,00 $ dopo
• Fatturazione in uscita — l'audio bidirezionale di Gemini 3.8 Live costa circa 1,38 $ per un'ora di input e output simultanei a listino, prima di qualsiasi prompt caching, mentre Gemini 3.8 Flash TTS è un flusso unidirezionale, e un milione di caratteri di narrazione finita arriva a 16,5 $ secondo la normalizzazione di Artificial Analysis
• Input di testo — Gemini 3.8 Live fattura testo e audio su voci separate, 0,75 $ per milione di token di testo in ingresso e 4,50 $ in uscita, mentre gli endpoint TTS fatturano l'input di testo a 0,50 $ per milione di token
• Livello Flash-Lite — Gemini 3.8 Live non ha un fratello più economico; la scelta è tra Live o Extended Thinking, mentre Gemini 3.8 Flash-Lite TTS è a listino a 6,00 $ e poi 12,00 $ per milione di token audio, con Artificial Analysis a 11,0 $ per milione di caratteri
• Forma dell'input — Gemini 3.8 Live audio, video e testo in ingresso, audio in uscita, mentre gli endpoint TTS testo in ingresso, audio in uscita
Il valore Live è il nostro calcolo basato sulle tariffe al minuto pubblicate da Google, non un numero orario pubblicato da Google. I valori per carattere sono la normalizzazione di Artificial Analysis e sono quelli da citare quando si confrontano i livelli di sintesi. Nota che la classifica Speech to Speech di Artificial Analysis presenta una colonna separata del costo per ora dell'audio in input per i modelli Live — circa $3,50 per Gemini 3.8 Live e $0,84 per la variante Extended Thinking — che è ancora una normalizzazione diversa e non va allineata al listino delle tariffe al minuto come se le due fossero la stessa misura.

Cosa si rompe quando scegli quello sbagliato
Le modalità di guasto sono istruttive perché sono così dissimili.
Chiami un endpoint TTS quando ti serviva un ciclo di conversazione e non si verificano errori. La richiesta restituisce audio valido. Ottieni una risposta fluente e ben letta a una stringa fissa, e poi silenzio — perché non c'era mai stato nulla in ascolto. I team lo scoprono quando costruiscono il loro primo test di barge-in e scoprono che l'"utente" deve aspettare che l'intero clip finisca prima che possa iniziare il turno successivo. Adattare una conversazione a un endpoint di sintesi significa aggiungere il riconoscimento vocale, una politica di turn-taking e un meccanismo di interruzione attorno ad esso, a quel punto hai ricostruito una cascata e stai pagando per due modelli invece di uno.
Chiama un endpoint Live quando ti serviva una narrazione e paghi per capacità che non usi. Un modello Live viene tariffato in entrambe le direzioni, perché si aspetta entrambe le direzioni. Per un audiolibro o la voce fuori campo di un video di formazione, il lato input è un copione che non cambia mai e il modello non ha mai bisogno di sentire nulla. Stai comprando un ciclo di conversazione per leggere un documento ad alta voce.
L'unico caso in cui la scelta è davvero difficile è la cascata: riconoscimento, poi ragionamento, poi sintesi. Quell'architettura non è obsoleta e, per molti sistemi in produzione, è ancora quella giusta, perché ti consente di sostituire ogni stadio in modo indipendente e di scegliere un fornitore diverso per ciascuno. Ti costa latenza e ti costa la prosodia che un singolo modello end-to-end mantiene attraverso il confine di un turno. Il compromesso è reale in entrambe le direzioni.
Dove la rotta esiste già
OrcaRouter non include gli endpoint Gemini 3.8 Live né gli endpoint 3.8 TTS, e vale la pena dirlo prima di qualsiasi altra cosa sul routing, perché con un catalogo così ampio è facile supporre il contrario. Ciò che il catalogo contiene è il resto della famiglia — google/gemini-3.8-flash tra 28 modelli Google e oltre 200 modelli in totale, da un'unica chiave al prezzo di listino del provider, senza ricarico.
Questo è importante in particolare per la cascata. Se la tua architettura è riconoscimento, poi ragionamento, poi sintesi, la fase di ragionamento è quella in cui un'unica chiave per molti fornitori conviene, perché è la fase che cambi più spesso e la fase in cui un taglio di prezzo di un fornitore dovrebbe arrivare sulla tua fattura lo stesso giorno anziché al prossimo rinnovo contrattuale. È anche la fase in cui failover automatico ripaga: una cascata ha tre punti in cui può rompersi, e quello centrale è il più economico da rendere ridondante.

Una breve regola decisionale
Se il modello deve rispondere a qualcosa che non aveva già sotto forma di testo, ti serve Gemini 3.8 Live, e dovresti preventivare in base alle tariffe audio al minuto di Google e aspettarti di dover riflettere su quale delle due varianti ti occorre. Se il testo è già scritto e il compito è eseguirlo, ti servono Gemini 3.8 Flash TTS o Flash-Lite TTS, e dovresti preventivare per milione di caratteri e scegliere il tier in base alla copertura linguistica e a se il divario di qualità vale il divario di prezzo.
E se ti viene chiesto di confrontare "Gemini 3.8 Live e Gemini 3.8 TTS" come se fossero due prodotti, la prima cosa utile che puoi fare è chiedere quale endpoint. Il nome riportato nel brief non corrisponde a uno solo, e la risposta cambia l'architettura, non solo la fattura.

