Card del titolo principale per Gemini 3.8 Live Extended Thinking vs GPT-Live-1, che mostra i due modelli vocali separati da 1,1 punti di indice con modelli di fatturazione diversi.
Guides & Insights

Gemini 3.8 Live Extended Thinking vs GPT-Live-1: un pareggio di 1,1 punti e due fatture diverse

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Sul punteggio composito, è un pareggio. Gemini 3.8 Live Extended Thinking si attesta a 82,6 sullo Speech to Speech Index di Artificial Analysis; GPT-Live-1, nel suo backend Astra con sforzo di ragionamento medio, si attesta a 81,5. Sulla componente agentica sottostante — il completamento delle attività τ-Voice — il divario è di 0,7 punti, 68,6% contro 67,9%. Sulla componente di ragionamento è più ampio e va nella direzione opposta: 97,7% su Big Bench Audio per il modello Gemini, 90,1% per GPT-Live-1. Niente in quella differenza regge a una seconda esecuzione del benchmark, e nessuno di questi elementi è ciò su cui dovresti basare la decisione.

Ciò che distingue questi due non è la qualità. È che non concordano su cosa sia un agente vocale, chi pensa e — la parte che incide per prima su una voce di bilancio — come viene fatturata la sessione. Gemini 3.8 Live Extended Thinking addebita in base ai token audio e ragiona nello stesso modello che parla. GPT-Live-1 addebita una tariffa fissa per il tempo della sessione, che qualcuno stia parlando o meno, e affida il pensiero effettivo a un modello di testo separato che scegli e paghi a parte. Questi sono due prodotti diversi che indossano lo stesso punteggio di benchmark, e quello che fa per te dipende da una domanda che la classifica non pone mai: come è fatta una chiamata media sulla tua linea?

Il pareggio di 1,1 punti, e dove in realtà si rompe

Comincia dai numeri, perché l'esiguità del titolo è il punto:

Indice da voce a voce — Gemini 3.8 Live Extended Thinking (Alto) 82,6 contro GPT-Live-1 (backend Astra, sforzo medio) 81,5

Prestazioni agentiche (completamento delle attività τ-Voice) — 68,6% vs 67,9%, con GPT-Live-1 al 59,3% quando esegue il backend Sol a basso sforzo

Ragionamento vocale (Big Bench Audio) — 97,7% contro 90,1%, l'unica componente in cui il divario non è rumore

Flussi di lavoro bancari complessi (Sierra τ³-Banking, segnalato dal fornitore) — 35,1% vs 32,0%

Tempo al primo audio — 1,35 s vs 1,24–1,34 s tramite l'API

Costo misurato per ora — 3,50 $ contro 5,83 $ per la configurazione Astra, entrambe sulla misurazione dell'audio in ingresso di Artificial Analysis

La lettura onesta è che i due modelli sono indistinguibili sul composito, distinguibili sul ragionamento vocale, dove il modello Gemini è in vantaggio di quasi otto punti, e distinguibili sul costo, dove è in vantaggio di circa il 40%. Dove GPT-Live-1 passa in vantaggio è nelle parti dell'esperienza che un benchmark fatica a valutare: è realmente full-duplex, ascolta mentre parla, emette backchannel, decide più volte al secondo se parlare o cedere la parola. Gemini 3.8 Live Extended Thinking è basato sui turni. Risolve lo stesso problema di fondo — un chiamante lasciato in silenzio mentre l'agente lavora — narrando invece, ragionando e parlando allo stesso tempo con segnali come «Fammi controllare…» mentre l'attività è in corso.

Entrambi gli approcci tengono viva la linea. Si percepiscono diversamente. Solo uno dei due compare su un indice.

A two-column scoreboard comparing Gemini 3.8 Live Extended Thinking and GPT-Live-1 across six dimensions: Speech to Speech Index 82.6 vs 81.5, agentic performance on tau-Voice 68.6 percent vs 67.9 percent, speech reasoning on Big Bench Audio 97.7 percent vs 90.1 percent, billing model per audio token vs per session minute, reasoning location in-model vs delegated to a backend text model, and cost per hour $3.50 vs $5.83.

Due modelli di fatturazione, e perché il tariffario trae in inganno

Questa è la sezione che decide la maggior parte dei deployment, ed è quella che la copertura salta.

Gemini 3.8 Live Extended Thinking viene fatturato come un modello a token. Tramite la Live API le tariffe pubblicate sono 3,00 $ per milione di token di input audio — circa 0,005 $ al minuto di input audio — e 12,00 $ per milione di token di output audio, circa 0,018 $ al minuto, con i token di thinking conteggiati in quell'output. Paghi per l'audio che scorre. Un chiamante che fa una pausa, riflette o viene messo in attesa non ti costa nulla finché resta in silenzio.

GPT-Live-1 viene fatturato come una linea telefonica. È un costo fisso di 0,05 $ al minuto di tempo di sessione, addebitato al secondo, indipendentemente da chi sta parlando o se qualcuno stia parlando. Il backend di ragionamento non è incluso: il modello di testo che svolge il ragionamento, e qualsiasi strumento che chiami, vengono fatturati separatamente in aggiunta. Ecco come un prezzo di 0,05 $ diventa una cifra complessiva di circa 4,47 $ all'ora sul backend Sol e 5,83 $ all'ora su Astra medium, secondo le misurazioni di Artificial Analysis.

Mettili fianco a fianco e il confronto ingenuo — 0,018 $ contro 0,05 $ al minuto, un divario di 2,8× — è sbagliato in entrambe le direzioni. I dati orari misurati collocano il divario reale a 3,50 $ contro 5,83 $, più vicino a 1,7×. Ma il modello a orologio di sessione cambia anche la forma della tua bolletta, non solo il suo livello: su GPT-Live-1 il tuo costo segue la durata della chiamata, quindi una linea con chiamate lunghe, silenziose e a basso contenuto — una coda di assistenza, una fase di verifica, un passaggio a IVR — paga quanto una densa. Sul fronte Gemini, il costo segue l'audio, quindi il silenzio è gratis e la verbosità no. Fai i calcoli sulla durata media delle tue chiamate prima di farli su una tariffa al minuto, perché è quel numero a decidere quale di questi sia più economico per te, e la risposta non è la stessa per una linea di prenotazione e una linea di triage.

Dove avviene il pensiero

La seconda differenza strutturale è la delega, ed è quella che determina quanto di questo stack puoi effettivamente scambiare.

GPT-Live-1 è un front-end. Gestisce l'audio duplex e, quando una query richiede un ragionamento reale, affida il lavoro a un modello backend separato — GPT-5.5 e GPT-6 Astra sono entrambi documentati come backend — con selettori di reasoning-effort che ti permettono di scegliere quanto di quel backend vuoi acquistare. Ecco perché la classifica elenca GPT-Live-1 due volte con punteggi diversi: 81,5 su Astra a effort medio, 80,1 su Sol a effort basso. Quel divario di 1,4 punti tra le sue due configurazioni è più ampio del divario di 1,1 punti tra i due modelli in questo confronto, il che ti dice che sul fronte OpenAI la configurazione che scegli conta più del fornitore che scegli.

Gemini 3.8 Live Extended Thinking ragiona nello stesso modello che parla. Non c'è un backend separato da selezionare né una fattura separata per uno; il compromesso è che si regola la profondità con i livelli di pensiero — basso, medio e alto — sullo stesso modello, e le cifre 82,6 e 68,6 sono la (Alta) configurazione. L'esecuzione in background degli strumenti e delle API avviene in modo asincrono su entrambi i lati, quindi nessuno dei due modelli si blocca mentre lavora.

Una conseguenza pratica: poiché l'intelligenza di GPT-Live-1 è un modello testuale acquistato dietro un front-end vocale, il suo tetto di qualità si sposta quando OpenAI rilascia un modello testuale, non quando rilascia un modello vocale. Il tetto di Gemini 3.8 Live Extended Thinking si sposta quando Google riaddestra il modello audio. Se stai scommettendo a due anni su una piattaforma vocale, quella differenza nella cadenza degli aggiornamenti merita più riflessione di 1,1 punti di indice.

Quali costi di switching, in qualunque direzione tu vada

Nessuno dei due è un semplice cambio di model ID, e i team che lo trattano come tale lo scoprono in produzione. Passare a Gemini 3.8 Live Extended Thinking significa accettare un contratto di turno diverso: le chiamate di funzione sono sempre asincrone, quindi una dichiarazione di strumento bloccante restituisce un errore grave invece di accodarsi, e i client devono leggere il campo interaction_statusIN_PROGRESS mentre il ragionamento o uno strumento è ancora in esecuzione, IDLE solo quando l'intera attività è completata — invece di fidarsi di turnComplete per significare che il lavoro è finito. Passare a GPT-Live-1 significa adottare la sua infrastruttura di selezione del backend e una seconda superficie di fatturazione, e convivere con un'API diventata disponibile in generale per gli sviluppatori solo il 10 settembre 2026, dopo il debutto in ChatGPT l'8 luglio — quindi strumenti di terze parti, SDK e osservabilità attorno a essa hanno mesi, non anni. Qualunque direzione si scelga, metti in budget il lavoro di integrazione accanto alla bolletta dei token. Su uno stack vocale maturo il refactoring è di solito il più grande dei due.

Come eseguire un confronto come questo senza scommetterci sopra

Il modo sensato per risolvere una questione da 1,1 punti è provare entrambi sul tuo traffico, e la parte scomoda è che farlo di norma comporta due integrazioni, due contratti e due set di credenziali. Non deve per forza significare due architetture. In entrambi questi sistemi il front-end vocale è uno strato sottile sopra normali chiamate a modelli testuali — per GPT-Live-1 ciò è esplicito, e per il lato Gemini l'esecuzione degli strumenti in background si risolve allo stesso modo — e quello strato testuale è dove risiede la varianza dei costi e dove il passaggio è davvero economico.

OrcaRouter offre 190 modelli da un'unica chiave al prezzo di listino del provider, senza ricarichi, così una variazione di prezzo a monte è attiva dalla nostra parte lo stesso giorno, anziché al rinnovo contrattuale successivo. Per uno stack vocale, le due proprietà che contano sono che l'obiettivo di delega può essere sostituito su traffico live senza toccare l'integrazione vocale, e che il failover automatico mantiene viva una chiamata quando un backend genera errori o va in timeout — ed è proprio questo che ti permette di provare una configurazione non collaudata su traffico reale senza metterci dietro una linea di produzione. Per essere precisi su ciò che ospitiamo e ciò che non ospitiamo: né l'endpoint Gemini 3.8 Live Extended Thinking né l'endpoint GPT-Live-1 si trovano sul nostro router — quelli provengono dalle API di Google e di OpenAI. I modelli testuali a cui delegano molto spesso invece sì, e tra questi c'è Gemini 3.8 Flash.

La vetta della classifica, e quanto poco si assesta

La cattura qui sotto è stata scattata il 16 settembre 2026:

Gemini 3.8 Live Extended Thinking (High) — 82,6, primo posto

GPT-Live-1 (Astra backend, impegno medio) — 81.5

Grok Voice Think Fast 2.0 High — 81.3

• GPT-Live-1 (backend Sol, sforzo basso) — 80.1

• Gemini 3.8 Live — 76.0

• GPT-Realtime-2.1 High — 73.9

• Gemini 3.1 Flash Live High — 71,5

Tre cose degne di nota. Primo, il primo e il terzo posto sono separati da 1,3 punti e il primo e il quinto da 6,6, quindi la vetta di questa classifica è una mischia, non una graduatoria. Secondo, il modello nel titolo di questo confronto non è la voce Gemini al quinto posto — quella è il Gemini 3.8 Live standard, un prodotto diverso e molto più economico che non va confuso con la variante di ragionamento confrontata qui. Terzo, esiste un precedente nel trattare qualsiasi singolo valore di indice come provvisorio: xAI ha riportato 82,9 per Grok Voice Think Fast 2.0 a luglio, e quel modello su questa classifica registra 81,3. I punteggi di indice riportati dai fornitori non sempre sopravvivono al contatto con una classifica in tempo reale. I valori τ-Voice del 68,6% e 67,9% ora si trovano su una classifica pubblica gestita con l'harness proprietario di Artificial Analysis, quindi sono corroborati anziché semplicemente dichiarati — ma una differenza di 0,7 punti tra due modelli sullo stesso harness non è una differenza. Verificalo sul tuo traffico o ignoralo.

Screenshot of the Artificial Analysis Speech to Speech leaderboard captured September 16, 2026, showing Gemini 3.8 Live Extended Thinking at 82.6, GPT-Live-1 at 81.5 and 80.1, Grok Voice Think Fast 2.0 at 81.3, and Gemini 3.8 Live at 76.0.

Un altro dato che vale la pena includere nella decisione, perché è il numero meno confortante in questo confronto: Google riporta il 35,1% per Gemini 3.8 Live Extended Thinking sulla classifica τ³-Banking di Sierra, contro il 32,0% per GPT-Live-1 Astra. Si tratta di dati dichiarati dal fornitore, non riprodotti, e descrivono un mondo in cui il principale agente vocale di quella classifica fallisce all'incirca due tentativi su tre di compiti bancari realistici. Se il tuo agente deve completare lavoro regolamentato e a più fasi, nessuno di questi modelli è pronto — e un vantaggio di 3,1 punti su quel benchmark non è una ragione per scegliere un fornitore, è una ragione per mantenere un umano nel ciclo.

Screenshot of an OrcaRouter model page for google/gemini-3.8-flash, showing a 1M-token context window, 65K maximum output, vision, audio and tool support, input pricing of $0.75 and output pricing of $3.75 per million tokens, and a p50 time to first token of 3.35 seconds.

Quindi: se la naturalezza della conversazione è il prodotto e le tue chiamate sono brevi e dense, il comportamento full-duplex di GPT-Live-1 è un vero vantaggio che l'indice non può vedere, e la fatturazione basata sul tempo di sessione è tollerabile a quella durata di chiamata. Se le chiamate sono lunghe, silenziose o variabili, o se il ragionamento vocale e il costo orario dominano, Gemini 3.8 Live Extended Thinking è avanti sui componenti che contano ed è circa il 40% più economico all'ora mentre lo fa — con l'avvertenza che è basato su turni, ancora in anteprima per le aziende, e richiede un refactoring del client prima di poter eseguire i tuoi strumenti. Ciò che nulla di tutto questo giustifica è scegliere l'uno o l'altro in base a 1,1 punti di indice. Sulle prove disponibili, la ragione onesta per scegliere tra questi due è il modello di fatturazione e l'architettura sottostante, ed entrambi sono cose che puoi misurare sul tuo traffico questa settimana.

Su OrcaRouter, il failover automatico mantiene attiva una chiamata quando un backend genera un errore o va in timeout.

Confrontati in questo articolo2

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno