
Gemini 3.8 Live Extended Thinking vs Gemini 3.8 Live: pagare 4 volte tanto per i 38 punti che contano
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Due modelli, un lancio, un listino prezzi e una decisione che la maggior parte delle analisi sbaglia nella stessa direzione. Gemini 3.8 Live Extended Thinking e Gemini 3.8 Livesono stati lanciati insieme il 15 settembre 2026, entrambi basati su Gemini 3 Pro, entrambi gestiscono 97 lingue con commutazione automatica a metà conversazione, entrambi accettano input visivi quasi in tempo reale, entrambi applicano un watermark all'audio generato con SynthID. Sul composito Speech to Speech Index pubblicato da Artificial Analysis, distano 6,6 punti — 82,6 contro 76,0. Sul costo orario dell'audio misurato da quella stessa classifica, c'è una differenza di poco più di quattro volte.
Nessuno di quei due è il numero che dovrebbe decidere la tua architettura. Il numero che dovrebbe farlo è 38: il divario tra i due su τ-Voice, il componente agentico di completamento delle attività, dove la variante di ragionamento risolve il 68,6% degli scenari di assistenza clienti replicati e la variante standard ne risolve il 30,1%. Non stai scegliendo tra un buon modello e uno migliore. Stai scegliendo tra un'interfaccia conversazionale e un sistema di ragionamento che, incidentalmente, parla, e la differenza di prezzo è l'aspetto meno interessante di quella scelta.
La forchetta di prezzo, nelle unità in cui vieni effettivamente fatturato.
Comincia dalla bolletta, perché è la parte che le persone interpretano correttamente e poi sopravvalutano. Entrambi i modelli applicano la stessa tariffa pubblicata tramite la Live API: $0,005 al minuto per l'input audio e $0,018 al minuto per l'output audio, e sul fronte Extended Thinking quei token di output includono il thinking. Stessa scheda, stesse tariffe, nessun livello premium separato per il ragionamento.
La divergenza emerge quando si misura il lavoro anziché i minuti. La colonna di Artificial Analysis relativa al costo per ora di audio in input — il costo per completare un sottoinsieme fisso di 40 domande di Big Bench Audio, normalizzato su base oraria — colloca i due modelli in fasce completamente diverse:
• Gemini 3.8 Live Extended Thinking (High) — 3,50 $ per ora di audio in input, secondo la misurazione stessa di Artificial Analysis
• Gemini 3.8 Live — 0,84 $ all'ora, la tariffa retribuita più bassa su quella bacheca
• GPT-Live-1 (backend Astra, sforzo medio) — 5,83 $ all'ora, quindi la variante di ragionamento costa comunque circa il 40% in meno rispetto al modello che batte
• Grok Voice Think Fast 2.0 High — 4,80 $ all'ora
• GPT-Realtime-2.1 High — 10,75 $ all'ora
Questo è il bivio: un costo orario dell'audio quadruplo, sulla stessa tariffa al minuto pubblicata, perché la variante di ragionamento consuma più token per fare la stessa quantità di ascolto. Gli $0,84 del modello standard non sono uno sconto, sono il minimo dell'intera classifica.
Cosa si compra con i 38 punti
Smonta il composito e i due modelli smettono di sembrare una coppia:
• Indice da Voce a Voce — Gemini 3.8 Live Extended Thinking (High) 82,6 contro Gemini 3.8 Live 76,0
• Prestazioni agentiche (completamento attività τ-Voice) — 68,6% vs 30,1%
• Ragionamento vocale (Big Bench Audio) — 98% vs 92%
• Dinamiche conversazionali — 91,9% vs 96,1%
• Preferenza arena (Elo) — 990 vs 1083
• Tasso di successo delle attività — 89,1% vs 93,2%
• Tempo al primo audio — 1,35 s vs 1,18 s
• Costo per ora di audio in ingresso — 3,50 $ vs 0,84 $
Leggilo onestamente e il modello più economico vince quattro delle otto voci. È più rapido al primo audio, preferito dall'arena, ha maggiori probabilità di completare un compito superficiale ed è valutato meglio sulla dinamica conversazionale — e quest'ultima non è un premio di consolazione, perché la dinamica conversazionale è ciò che un chiamante nota. Ciò che non riesce a fare è portare a termine un lavoro che prevede passaggi. Il 30,1% contro il 68,6% è il più grande divario singolo in tutta questa release, e cade proprio sull'unico asse che separa un agente da un'interfaccia.
Due avvertenze su quelle righe. Il valore di preferenza dell'arena all'interno dell'indice è congelato nel momento in cui un modello diventa idoneo alla pubblicazione, quindi è un'istantanea più che un Elo in continuo aggiornamento — leggilo come una valutazione riferita a un preciso momento e non come il grafico live della Speech Agent Arena. E la vetta della classifica τ-Voice è serrata: il 68,6% della variante reasoning guida GPT-Live-1 al 67,9% (backend Astra, effort medio) di 0,7 punti, con GPT-Live-1 (Sol, effort basso) al 59,3% e Grok Voice Think Fast 2.0 High al 56,5% staccati dietro. Il vantaggio di 0,7 punti su GPT-Live-1 rientra nel rumore. Il divario di 38 punti all'interno di questa coppia no.

L'altro 4x: quanto ti costa in codice il livello di reasoning
C'è un secondo fork in questa release, e non compare su nessuna classifica. I due modelli non sono intercambiabili senza modifiche, perché la variante di reasoning cambia il contratto che il tuo client deve rispettare.
Sul modello standard, Gemini 3.8 Livesi comporta come un client della Live API si aspetta: le chiamate in background agli strumenti e alle API vengono eseguite mentre il modello continua a parlare, e turnComplete: truecontinua a indicare la fine di un turno. Non c'è alcuna impostazione del livello di ragionamento da scegliere, perché non c'è nulla di separato da configurare: il modello risponde e, una volta che ha risposto, il turno è concluso.
Su Gemini 3.8 Live Extended Thinking, tre cose cambiano contemporaneamente:
• Le chiamate di funzione sono sempre asincrone. Una dichiarazione di strumento bloccante non si accoda con cortesia — restituisce un errore netto. Qualsiasi schema di strumento tu abbia scritto per il modello standard deve essere ridichiarato come non bloccante.
• Un nuovo campo di stato riporta lo stato reale. I client devono leggere interaction_status invece di fidarsi di turnComplete: il campo indica IN_PROGRESS mentre il modello sta ancora ragionando o uno strumento è ancora in esecuzione, e si stabilizza su IDLE solo quando l'intera attività è terminata. Un turno può terminare mentre l'attività non lo è.
• La profondità di pensiero è una manopola. Il modello espone livelli di ragionamento configurabili — basso, medio e alto — e le cifre 82.6 e 68.6 sul tabellone sono la (Alto) configurazione. Passare a basso cambia sia la qualità che il conto dei token, e nulla sull'indice ti dice quanto ti costa il basso in termini di completamento delle attività.
Quel terzo punto è la trappola della migrazione. Poiché Extended Thinking risponde allo stesso modo a livello di rete del modello standard finché non entra in gioco una chiamata a uno strumento, un team può sostituire l'ID del modello, vedere una demo funzionante e scoprire il contratto asincrono solo in produzione, quando uno strumento di prenotazione restituisce un errore invece di un risultato. Prevedi nel budget il refactoring del client insieme alla tariffa audio 4×; su un'integrazione matura è il maggiore dei due costi.
Quale sta effettivamente richiedendo il tuo carico di lavoro
Il modo semplice per decidere è chiedersi a cosa serve la sessione, non quanto intelligente la si vuole.
Scegli Gemini 3.8 Livequando la conversazione è il risultato da consegnare. Rispondere, mantenere il filo, prendere un messaggio, qualificare un chiamante, essere gradevole, rapido ed economico. A 0,84 $ per ora di audio in input è il modello vocale competente più economico attualmente pubblicato da chiunque, è preferito dall'arena, è più affidabile sui compiti superficiali ed è 170 millisecondi più veloce al primo audio: una differenza che chi chiama percepisce. L'unica cosa da accettare è il tetto: 30,1% nel completamento di attività multi-step significa che non porterà a termine lavori che hanno passaggi, e nessuna quantità di prompt engineering sposta quel numero.
Scegli Gemini 3.8 Live Extended Thinking quando la sessione ha un compito. Prenotazione, modifica, cancellazione, risoluzione di un problema di account, guidare un chiamante attraverso un processo in più passaggi mentre aspetta. Questa è la soglia dei 38 punti, e vale 3,50 $ l'ora — che, si noti, è comunque più economico di entrambi i modelli che supera nel punteggio composito. Ottieni anche il comportamento di narrazione che rende tollerabile l'attesa: questo modello ragiona e parla contemporaneamente, così invece del silenzio mentre cerca qualcosa, il chiamante sente "Fammi controllare…" e i progressi man mano che procede. È lo stesso problema che le architetture full-duplex risolvono non fermando mai l'audio; la risposta di Google è continuare a parlare durante il lavoro.
Altre due righe che vale la pena soppesare. Google riporta inoltre il 35,1% per il modello Extended Thinking nella classifica τ³-Banking di Sierra, contro il 32,0% di GPT-Live-1 Astra — un dato dichiarato dal fornitore e senza alcun dato indipendente a supporto, e in termini assoluti un dato che fa riflettere, dato che 35,1% significa che il miglior modello di quella classifica fallisce circa due tentativi su tre di compiti bancari realistici. E il secondo posto del modello standard nella Speech Agent Arena, che Google cita nei propri materiali, è un risultato reale su una classifica diversa che misura la preferenza anziché il completamento dei compiti. Entrambe le affermazioni reggono. Insieme dicono che il modello economico è molto bravo a farsi parlare e che il modello costoso è l'unico dei due a cui si possa dare del lavoro.
Eseguire entrambi, senza due integrazioni
L'obiezione pratica a tutto questo è che scegliere in base al singolo carico di lavoro comporta mantenere due percorsi. Non è necessario che sia così. Entrambe le varianti si trovano davanti alla stessa classe di backend — l'esecuzione di strumenti in background e la pianificazione a più fasi si risolvono in normali chiamate a modelli testuali — ed è proprio in quello strato che risiede la varianza dei costi e dove il passaggio è economico.
OrcaRouter mette 190 modelli da un'unica chiave al prezzo di listino del provider, senza ricarichi, così una variazione di prezzo del fornitore è attiva dalla nostra parte lo stesso giorno anziché al rinnovo contrattuale successivo. Per uno stack che instrada tra un livello conversazionale economico e un livello di reasoning costoso, le due proprietà che contano sono che il target di delega può essere sostituito su traffico live senza toccare l'integrazione vocale, e che il failover automatico mantiene viva una sessione quando un backend genera errori o va in timeout. Per essere precisi su ciò che ospitiamo e ciò che non ospitiamo: gli endpoint Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking non sono sul nostro router — quelli provengono dall'API di Google stessa, nella Gemini API, nella Live API e in Google AI Studio. I modelli di testo a cui questi agenti passano molto spesso il proprio lavoro sono, tra gli altri, Gemini 3.8 Flash.
Dove si colloca ciascun modello sulla scheda
La cattura di seguito è stata effettuata il 16 settembre 2026, e la parte superiore dello Speech to Speech Index recita quanto segue:
• Gemini 3.8 Live Extended Thinking (High) — 82,6, primo posto
• GPT-Live-1 (backend Astra, impegno medio) — 81.5
• Grok Voice Think Fast 2.0 High — 81.3
• GPT-Live-1 (backend Sol, sforzo basso) — 80.1
• Gemini 3.8 Live — 76.0, quinto posto
• GPT-Realtime-2.1 High — 73.9
• Gemini 3.1 Flash Live High — 71,5
Una nota sulla denominazione, mentre leggete quell'elenco: (High) è il suffisso associato a questo modello nella copertura; si tratta di un'etichetta di configurazione dello sforzo di ragionamento, non di un rilascio separato. È la stessa convenzione che la board usa per Grok Voice Think Fast 2.0 High e GPT-Realtime-2.1 High.

Cosa non è ancora stato committato?
Una cosa riguardo a questa coppia è facile da fraintendere, quindi vale la pena dirla chiaramente: nessuno dei due modelli è generalmente disponibile in senso contrattuale, anche se entrambi hanno un prezzo e sono documentati.
Gli sviluppatori ottengono Gemini 3.8 Live nell'API Gemini, nella Live API e in Google AI Studio con l'ID gemini-3.8-live; le aziende ottengono l'anteprima privata in Gemini Enterprise, con Gemini Enterprise for Customer Experience indicato come prossimamente disponibile; i consumatori lo ottengono in Search Live. Gemini 3.8 Live Extended Thinking ha la stessa superficie per gli sviluppatori con gemini-3.8-live-extended-thinking, oltre a un percorso consumer più ampio: Gemini Live, Docs Live per gli abbonati Google AI Pro e Ultra, e Gmail Live e Keep Live per tutti gli abbonati Google AI. I clienti business di Workspace sono indicati come prossimamente disponibili.
Ciò che manca è ciò di cui un'impresa ha bisogno prima di mettere una linea di ricavo su questo: un impegno di disponibilità generale, un valore di uptime pubblicato e una tariffa che Google ha promesso di mantenere. I prezzi sono pubblicati, e i prezzi in anteprima hanno la tendenza a cambiare. Realizza un prototipo ora, pianifica la migrazione e non firmare un obiettivo di disponibilità che non ti è stato fornito.

La decisione che questa coppia presenta in realtà è più ristretta di quanto l'indice lasci intendere, e non è una scala di qualità. Se il lavoro del tuo agente è parlare, il modello economico non è un compromesso — è il prodotto migliore al prezzo inferiore, e la tariffa quattro volte più bassa è un bonus più che l'argomento. Se il lavoro del tuo agente è portare a termine qualcosa, la variante di reasoning è l'unica delle due a cui si possa affidare il compito, e 3,50 $ l'ora sono un errore di arrotondamento a fronte di una prenotazione che altrimenti fallisce. L'errore da evitare è cercare una via di mezzo: pagare per la profondità di reasoning su un carico di lavoro che aveva bisogno solo di una buona conversazione, che è ciò che accade quando un team legge il divario composito di 6,6 punti e non scorre mai fino al 38.
