
Gemini 3.8 Live vs GPT-Live-1: Full-Duplex vs il modello che pensa mentre parla
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
Per circa due mesi, la questione è stata risolta dall'architettura. GPT-Live-1è davvero full-duplex: ascolta mentre parla, produce segnali di risposta come "mhmm" e "capito", e decide più volte al secondo se parlare o cedere il turno. Gemini 3.8 Live, annunciato il 15 settembre 2026, è un modello a turni. Secondo la vecchia impostazione, questo rendeva il confronto facile, e oggi è il modo sbagliato di leggerlo.
Ciò che è cambiato non è che Google abbia eguagliato il full-duplex. È che Google ha rilasciato proprio ciò che il full-duplex veniva usato per compensare: un modello vocale in grado di sostenere una conversazione mentre un'attività a più passaggi viene eseguita in background, e una seconda variante che ragiona ad alta voce mentre lavora. La differenza architetturale è reale. Semplicemente non è più l'asse che decide l'acquisto.
Due modi per mantenere viva una conversazione
La scommessa del full-duplex è che la qualità della conversazione sia il prodotto. GPT-Live-1 elabora l'audio in ingresso e in uscita in modo continuo e sincrono all'interno di un unico modello, invece di concatenare riconoscimento vocale, modello linguistico e sintesi vocale. Questo elimina la perdita di informazioni tra le fasi e produce il comportamento che le persone notano davvero: puoi interromperlo a metà risposta e si adatta; non scambia una pausa o un rumore di fondo per la fine del tuo turno; resta in silenzio finché non viene interpellato.
La scommessa basata sui turni fatta da Gemini 3.8 Live è che la conversazione sia un'impalcatura per il lavoro. Le sue funzionalità puntano a mantenere la sessione produttiva anziché a mantenere naturale il ritmo: elaborazione dell'input visivo quasi in tempo reale, transizione automatica tra 97 lingue supportate nel corso della conversazione ed esecuzione in background di strumenti e API che dà conferma di aver ricevuto una richiesta e continua a parlare mentre la chiamata si completa.
Entrambi i modelli si rifiutano di riagganciarti mentre pensano. Solo che si rifiutano in modi diversi. GPT-Live-1 lo fa non interrompendo mai il flusso audio. Google lo fa parlando sopra il lavoro.

Quello che l'indice dice davvero
Artificial Analysis mantiene uno Speech to Speech Index — un composito ponderato di ragionamento vocale, prestazioni agentiche, preferenza dell'arena e tasso di successo nei compiti. Leggi attentamente la classifica catturata il 16 settembre 2026, perché il titolo nasconde la struttura:
• Gemini 3.8 Live Extended Thinking — 82,6 (primo)
• GPT-Live-1 (backend Astra, impegno medio) — 81.5
• Grok Voice Think Fast 2.0 High — 81.3
• GPT-Live-1 (backend Sol, sforzo basso) — 80.1
• Gemini 3.8 Live — 76,0
• GPT-Realtime-2.1 High — 73.9
• Gemini 3.1 Flash Live High — 71,5
Da quell'ordinamento emergono tre cose. In primo luogo, Google occupa la prima posizione, ma la occupa con la variante costosa, non con quella che la maggior parte delle persone implementerà. In secondo luogo, GPT-Live-1 compare due volte, perché Artificial Analysis valuta l'intero sistema anziché il front-end vocale — e il divario di 1,4 punti tra le sue due configurazioni è sette volte più ampio del divario di 0,2 punti tra il primo e il secondo posto. In terzo luogo, il modello nel titolo di questo confronto, Gemini 3.8 Live, si colloca al quinto posto, sotto entrambe le configurazioni di GPT-Live-1.
Se stai confrontando a parità di condizioni — il livello standard contro il livello standard — GPT-Live-1 vince questo confronto sull'indice composito, e non c'è partita. Il punteggio di 82,6 appartiene a Gemini 3.8 Live Extended Thinking, che è un prodotto diverso, a un prezzo diverso e con un rollout diverso.

Dove GPT-Live-1 è ancora in vantaggio
Full-duplex non è una distinzione di marketing, e la suddivisione del benchmark mostra dove si traduce in un vantaggio reale:
• Prestazioni agentiche — GPT-Live-1 è nettamente in testa su τ-Voice con il 67,9% contro il 56,5% di Grok. Google non ha pubblicato un dato τ-Voice comparabile per Gemini 3.8 Live, solo il 68,6% per la variante Extended Thinking.
• Dinamica conversazionale — l'alternanza dei turni full-duplex rimane il parametro di riferimento per la naturalezza, e i modelli basati sui turni sono storicamente rimasti indietro su questo.
• Profondità di delega — GPT-Live-1 passa le query complesse a un modello testuale di frontiera, con GPT-5.5 e GPT-6 Astra entrambi documentati come backend, ed espone selettori dell'effort di ragionamento.
• Sourcing — le trascrizioni vocali di ChatGPT contengono link di citazione, il che resta poco comune nelle interazioni vocali in generale.
Il contrappeso è che GPT-Live-1 resta indietro sul ragionamento vocale grezzo: 90,1% su Big Bench Audio contro il 97,2% di Grok. E il suo dato di latenza di punta di 0,798 secondi su Full Duplex Bench è una misurazione diversa dal tempo al primo audio dell'API, che va da 1,24 a 1,34 secondi.
Dove Gemini 3.8 Live è in vantaggio
I vantaggi di Google riguardano meno la conversazione e più ciò che la sessione può fare:
• Visione, oggi — Gemini supporta l'input dalla fotocamera e la condivisione dello schermo già da un po'. GPT-Live-1 è stato lanciato senza video né condivisione dello schermo, con OpenAI che ha dichiarato che arriveranno e ha indicato la più datata Advanced Voice Mode come soluzione temporanea. Gemini 3.8 Live aggiunge in più l'elaborazione dell'input visivo quasi in tempo reale.
• Copertura linguistica — 97 lingue supportate con passaggio automatico da una lingua all'altra nel corso della conversazione, a fronte di un'offerta molto più limitata sul fronte OpenAI.
• Costo — la tariffa annunciata è di 0,005 $ al minuto di input audio e 0,018 $ al minuto di output audio. GPT-Live-1 viene fatturato a 0,05 $ per minuto vocale per il solo front-end, con un costo complessivo misurato di circa 4,47–5,83 $ all'ora una volta conteggiati i token del backend.
• Un secondo livello che ragiona ad alta voce — Gemini 3.8 Live Extended Thinking narra i progressi con segnali come «Fammi controllare…», che è una risposta diversa al problema del silenzio rispetto a quella del full-duplex.
Il confronto dei costi che conta
Le tariffe front-end sembrano una disfatta — 0,018 $ contro 0,05 $ al minuto — e le cifre orarie sono ancora più marcate. Il grafico di Artificial Analysis sul costo per ora dell'audio in input colloca Gemini 3.8 Live a 1,50 $ all'ora, contro 4,14 $ per GPT-Realtime-2 High e 10,75 $ per GPT-Realtime-2.1 High. Grok Voice Think Fast 2.0 si attesta a 4,80 $.
Il problema è che nessuno dei due numeri è la bolletta reale. I $0,05 al minuto di GPT-Live-1 coprono solo il front-end vocale; il modello testuale di backend che svolge il ragionamento vero e proprio viene fatturato separatamente, ed è così che un prezzo di facciata di $0,05 diventa $4,47–$5,83 all'ora tutto compreso. Gemini 3.8 Live ha la stessa struttura — l'esecuzione degli strumenti in background è lavoro da modello testuale — e Google non ha pubblicato quanto costi.
Quindi la lettura onesta è che Gemini 3.8 Live è più economico all'ingresso, e di gran lunga, mentre il confronto complessivo è sconosciuto per entrambi finché non misuri il tuo carico di lavoro. Non è una scusa; è l'effettivo stato delle informazioni.
Il livello a cui entrambi delegano
Ecco il fatto strutturale che rende questo confronto meno una decisione di lock-in di quanto appaia. Entrambi i modelli delegano. GPT-Live-1, per scelta progettuale, passa le query difficili a un modello testuale di backend, e l'esecuzione in background degli strumenti sul lato Gemini si traduce in normali chiamate al modello. In entrambi i casi il front-end vocale è uno strato sottile sopra un modello testuale che svolge il ragionamento — e quello strato testuale è dove risiede la varianza dei tuoi costi e dove cambiare costa poco.
OrcaRouter mette a disposizione 190 modelli dietro un'unica chiave al prezzo di listino del provider, senza alcun ricarico, così un taglio di prezzo a monte arriva dalla nostra parte lo stesso giorno invece che al rinnovo contrattuale successivo. Per uno stack vocale le due proprietà che contano sono che il target di delega può essere sostituito su traffico in tempo reale senza toccare l'integrazione vocale, e che il failover automatico mantiene viva una chiamata quando un backend genera un errore o va in timeout. Un chiarimento, perché è facile lasciar intendere il contrario: non ospitiamo gli endpoint vocali Gemini 3.8 Live o GPT-Live-1 — quelli provengono dalle API dei fornitori stessi. I modelli testuali a cui generalmente affidano il lavoro sono sul router.

Come scegliere
Scegli GPT-Live-1se la qualità della conversazione è il prodotto — la gestione naturale delle interruzioni, i backchannel e la sensazione di parlare con qualcosa invece di azionarlo — e se puoi assorbire il costo complessivo, che è sostanzialmente più alto di quanto suggerisca la tariffa pubblicizzata. Tieni presente che la sua API è diventata disponibile solo a settembre 2026, quindi gli strumenti di terze parti che vi ruotano attorno sono ancora acerbi.
Scegli Gemini 3.8 Live se ti serve la visione adesso, se ti servono più di un paio di dozzine di lingue, o se l'economia al minuto domina il tuo modello. Accetta che stai acquistando il livello standard, che si colloca al quinto posto sull'indice composito anziché al primo, e che l'82,6 che tutti citeranno appartiene alla variante Extended Thinking.
Scegli Gemini 3.8 Live Extended Thinking se il punto è il ragionamento e vuoi l'attuale leader dell'indice — ma controlla prima il suo rollout, perché il suo percorso di distribuzione attraverso Gemini Live, Docs, Gmail e Keep è più ampio di quello del modello standard e la sua disponibilità enterprise è ancora in anteprima privata.
La cosa da tenere d'occhio nel prossimo trimestre è se il full-duplex resta un fossato competitivo. I modelli turn-based stanno colmando il divario conversazionale attraverso una strada diversa — tenendo l'audio occupato con la narrazione mentre il lavoro procede — e se questo regge sotto traffico reale, la distinzione architetturale che ha definito questa categoria per un anno smetterà di essere ciò su cui gli acquirenti chiedono informazioni.
Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
