
Fuga di notizie in diretta su Gemini 3.8: due nuovi slug vocali e perché "Live Extended Thinking" conta di più
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
Due stringhe che non compaiono in nessuna documentazione pubblicata sono emerse questa settimana su una pagina di quota GCP: Gemini 3.8 Live, e qualcosa chiamato Live Extended Thinking. Sono state individuate dall'account di tracciamento delle release @testingcatalog e pubblicate il 15 settembre, con la secca precisazione che nessuna delle due è pubblica. Questo è l'intero registro pubblico finora — nessuna scheda del modello, nessuna riga di prezzo, nessuna voce nel changelog API, nessun riconoscimento. Ma i due nomi si trovano alla fine di una riga molto leggibile. Gemini 3.1 Flash Live è ancora il modello che la documentazione stessa dell'azienda consiglia per il lavoro con la Live API, Gemini 3.5 Live e Gemini 3.5 Live Experimental sono arrivati il 26 agosto come famiglia Gemini Audio, e il lato testuale della stessa famiglia — Gemini 3.8 Flash — è in distribuzione dal 2 settembre. Un "3.8 Live" colmerebbe quel divario. Il secondo slug è il più interessante dei due.
Prima le etichette, perché un pezzo su una fuga di notizie vive o muore su di esse. Questo non è un lancio. Nessuno dei due slug è stato annunciato, documentato, prezzato o confermato da Google, e la fonte è un singolo account che monitora le uscite. Tutto ciò che segue su Gemini 3.8 Live e Live Extended Thinking nello specifico non è verificato. Tutto ciò che segue su modelli già in distribuzione — Gemini 3.1 Flash Live, Gemini 3.5 Live, Gemini 3.8 Flash — è documentato e verificabile, e ho contrassegnato quale è quale in tutto il testo.
Cosa dice il segnale, e cosa non dice
• Segnalato — due slug, "Gemini 3.8 Live" e "Live Extended Thinking", comparsi su una pagina delle quote di Google Cloud, pubblicati il 15 settembre con la nota che sono "non pubblici"
• Non riportato — un annuncio, una scheda del modello, un prezzo, una finestra di contesto, una data di rilascio, un ID API, qualsiasi cifra di benchmark o qualsiasi conferma da Google
• Conferma — nessuna al momento della stesura. La pagina dei modelli dell'API Gemini di Google, aggiornata l'ultima volta il 4 settembre, elenca esattamente due modelli Live conversazionali, gemini-3.1-flash-live-preview e gemini-3.5-live-translate-preview, e nessuno dei due presenta una variante "Live Extended Thinking"
• Stesso brief, affermazione separata — lo stesso post del 15 settembre prevedeva inoltre che Grok 4.7 "dovrebbe collocarsi vicino a Opus 5.0, non a 5.1" e che il suo lavoro multimodale "necessita ancora di lavoro". Si tratta del modello di un altro fornitore e di una previsione più che di un artefatto; viene menzionato qui solo per completezza della fonte
• L'implicazione del nome stesso — le voci di quota di Google Cloud sono SKU per modello, il che depone a favore di un modello API a pagamento piuttosto che di una funzionalità all'interno dell'app Gemini per consumatori. Questa è un'inferenza dalla superficie su cui è apparsa la stringa, non un fatto confermato

Perché una pagina della quota è il punto in cui un modello trapela per primo
Questa è la parte che vale la pena capire, perché spiega perché un artefatto di due parole meriti un intero articolo. Le pagine delle quote non sono superfici di marketing. Sono infrastruttura di fatturazione e di rate limit: ogni modello che un cliente Cloud può chiamare necessita di una voce di quota per progetto prima che venga servita la prima richiesta a pagamento, e tali voci sono predisposte dallo stesso lavoro di ingegneria che prepara un modello alla disponibilità generale. La comparsa di uno slug lì significa che qualcuno ha costruito l'infrastruttura per uno SKU — non che qualcuno abbia redatto un comunicato stampa.
Questo vale in entrambe le direzioni, e la lettura onesta è quella cauta. Una voce di quota è più avanti rispetto a un nome in codice in un paper di ricerca, perché implica una superficie rivolta al cliente prevista. È anche esattamente il tipo di cosa che viene creata, testata e silenziosamente rinominata prima del lancio. Il lato testo di questa famiglia si è mosso abbastanza rapidamente da renderlo concreto: Gemini 3.6 Flash è arrivato il 21 luglio, Gemini 3.7 Flash il 13 agosto e Gemini 3.8 Flash il 2 settembre — tre rilasci Flash in sei settimane. Una linea di modelli che itera così rapidamente è una linea che prepara più SKU di quanti ne immetta sul mercato con quei nomi.
La linea Live è rimasta indietro di una versione
Ecco cosa rende "Gemini 3.8 Live" una vera storia e non una semplice curiosità di nome: i modelli vocali di Google non hanno affatto tenuto il passo con i suoi modelli di testo.
• Modello Live API consigliato oggi — gemini-3.1-flash-live-preview, ultimo aggiornamento marzo 2026, ancora descritto nella documentazione di Google stessa come il modello da usare per tutti i casi d'uso di Live API
• I suoi limiti — 131,072 token di input e 65,536 token di output, accetta in ingresso testo, immagini, audio e video e restituisce in uscita testo e audio
• La famiglia Gemini Audio, annunciata il 26 agosto — Gemini 3.5 Live, Gemini 3.5 Live Experimental e Gemini 3.5 Transcribe, con i modelli Transcribe che sostituiscono Chirp 3 per la conversione da voce a testo
• Nel frattempo, la linea di modelli testuali — Gemini 3.5 Flash, Gemini 3.6 Flash, Gemini 3.7 Flash e Gemini 3.8 Flash — è passata attraverso quattro versioni pubbliche in più o meno la stessa finestra temporale

Quindi la linea audio si attesta alla generazione 3.5, mentre la linea testo è alla 3.8. Uno slug "Gemini 3.8 Live" è la prima prova che Google intende riportare la voce sulla stessa generazione del testo — il che, per chiunque stia costruendo un agente vocale, significa che il ragionamento alla base di una sessione Live potrebbe saltare di tre generazioni di modelli di testo in una volta sola, anziché una.
Perché "Live Extended Thinking" è lo slug più interessante
Oggi, il pensiero su un modello Gemini Live è una manopola, non un modello. La Live API espone un thinkingLevel, parametro con quattro impostazioni — minimal, low, medium e high — e il valore predefinito è minimal, scelto esplicitamente per ottimizzare la latenza al minimo. Quel valore predefinito ti dice a cosa serve il prodotto: una conversazione in cui una pausa è un bug.
Uno slug separato chiamato "Live Extended Thinking" implica che Google si stia preparando a dividerlo in due prodotti anziché in un unico controllo, e il ragionamento è semplice. Latenza e riflessione sono in diretta tensione in un modello vocale — non puoi allo stesso tempo rispondere all'istante e pensare a fondo prima di rispondere — quindi un singolo modello con un interruttore obbliga ogni chiamante a scegliere un punto su quella linea per ogni richiesta. Due SKU permettono a un cliente di instradare il percorso veloce (gestione delle interruzioni, barge-in, ricerche rapide) e il percorso lento (un agente vocale che affronta un'attività multi-step) verso endpoint ottimizzati in modo diverso, senza che uno degradi l'altro.
Il precedente esiste già all'interno del lancio di agosto di Google stesso. Gemini 3.5 Live Experimental è stato descritto come la variante in grado di "ragionare direttamente mentre parla" e di narrare i propri progressi passo dopo passo durante un'attività — un modello vocale esplicitamente improntato al pensiero, distribuito con un proprio id anziché come un'impostazione. "Live Extended Thinking" suona come quell'istinto che si diploma da etichetta sperimentale a prodotto con un nome. Questa è un'inferenza basata su una stringa, ed è un'inferenza — ma è del tipo che questa particolare linea ha già premiato in passato.
Cosa puoi effettivamente chiamare oggi
Qui non cambia nulla di ciò a cui puoi accedere in questo momento, e vale la pena essere schietti al riguardo. Non esiste alcun endpoint Gemini 3.8 Live da chiamare, nessuna impostazione Live Extended Thinking da attivare e nessun modo per acquistare l'accesso a nessuno dei due. Qualsiasi account che oggi venda "accesso a Gemini 3.8 Live" sta vendendo un'etichetta, non un modello. I modelli Live che puoi usare davvero sono gemini-3.1-flash-live-preview e gemini-3.5-live-translate-preview, entrambi in anteprima tramite l'API di Google stessa.
Il lato testuale è un quadro diverso, ed è la parte che è effettivamente instradabile. Gemini 3.8 Flash — rilasciato il 2 settembre a $0,75 per milione di token di input e $3,75 per milione di output sul prezzo di listino di Google stesso, con raddoppio previsto a $1,50 e $7,50 il 1° gennaio 2027 — viene eseguito su OrcaRouter a quello stesso prezzo di listino, con 0% di ricarico in aggiunta. Il prezzo pass-through conta più del solito su un modello con un aumento preannunciato: quando la cifra di gennaio entrerà in vigore, cambierà qui lo stesso giorno, senza un secondo contratto da rinegoziare e senza modifiche al codice da apportare.

La linea vocale oggi non è su OrcaRouter — nessuno SKU Live o native-audio lo è, da qualsiasi fornitore — quindi nulla qui va letto come se lo ospitassimo noi. Ciò per cui un livello di routing è davvero utile è l'altra metà di questa storia. Quando un modello Live di generazione 3.8 arriverà davvero, e quando al suo fianco arriverà una seconda variante in stile thinking, scegliere tra un percorso vocale rapido e uno riflessivo diventa una decisione di routing anziché una riscrittura: due endpoint dietro una sola chiave, con failover automatico se l'ID preview su cui hai costruito viene ritirato. Su una linea che si è già rinominata una volta quest'anno, non si tratta di un'ipotesi.
Cosa confermerebbe questo — e cosa lo ucciderebbe
Un articolo su una fuga di notizie dovrebbe dirti in che modo potrebbe essere sbagliato. Per Gemini 3.8 Live e Live Extended Thinking, le prove a conferma sono specifiche e verificabili:
• La voce di quota che diventa pubblica — lo stesso slug che compare in un elenco di modelli di Google Cloud o Vertex AI con un rate limit associato, anziché solo in uno screenshot
• Una voce del changelog dell'API Gemini o una riga nella pagina dei modelli, che attualmente si ferma a gemini-3.1-flash-live-preview e gemini-3.5-live-translate-preview
• Una scheda del modello di DeepMind — i modelli audio di agosto vi erano documentati come "Gemini 3.5 Audio" anche se la copertura li chiamava Live e Transcribe, quindi la scheda è l'artefatto che stabilisce un nome
• Una riga di prezzo, l'unica cosa che trasforma uno SKU in staging in un prodotto che qualcuno può acquistare
• Disconferma — gli slug che vengono rinominati, incorporati nelle impostazioni di pensiero del modello esistente, o semplicemente che non ricompaiono mai. Tutte e tre sono esiti ordinari per una pagina di quota, e ognuna di esse significa che questo pezzo era prematuro anziché giusto
Cosa tenere d'occhio, e chi dovrebbe agire
Se stai costruendo un voice agent sull'API Live, questa settimana non deve cambiare nulla nella tua architettura — il modello su cui costruiresti è ancora gemini-3.1-flash-live-preview, e il consiglio onesto è tenere l'id del modello dietro un valore di configurazione e mantenere caldo un secondo endpoint Live, perché questa linea si è già rinominata una volta e potrebbe farlo di nuovo. Se stai scegliendo un modello testuale, questa indiscrezione è irrilevante per te; Gemini 3.8 Flash è in arrivo, ha un prezzo ed è misurabile già ora, e la domanda più utile è il cambio di prezzo di gennaio piuttosto che uno slug vocale.
La cosa da osservare davvero non è il lancio. È se "Live Extended Thinking" arriverà come secondo modello o come quinta impostazione sul primo. Se è uno SKU separato, Google sta dicendo agli sviluppatori che un agente vocale che pensa e un agente vocale che parla sono prodotti diversi — e questa è un'affermazione dalle conseguenze più rilevanti di qualsiasi numero di versione nel nome.
Ciò per cui un livello di routing è davvero utile è l'altra metà di questa storia.
Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
