
GPT-Live-1 vs Gemini 3.5 Live Translate: un generalista già rilasciato contro uno specialista in anteprima
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 per 1M di token
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
Questi due modelli vengono confrontati perché entrambi mettono il parlato in tempo reale in un'API, e il confronto crolla nel momento in cui leggi le schede tecniche dei modelli. GPT-Live-1 è un modello vocale full-duplex di uso generale che OpenAI ha spostato nell'API per sviluppatori il 10 settembre 2026, tre mesi dopo il suo rilascio all'interno di ChatGPT l'8 luglio. Gemini 3.5 Live Translate è un modello di traduzione audio-audio a scopo unico che Google DeepMind ha rilasciato il 9 giugno 2026, e il suo ID modello contiene ancora la parola preview. Uno di questi puoi metterlo davanti a clienti paganti oggi, a una tariffa pubblicata. L'altro, Google può cambiartelo sotto senza un avviso di deprecazione. È quell'asimmetria, non la tabella dei benchmark, a dover decidere la scelta.
Due macchine diverse che indossano la stessa etichetta
Vale la pena essere schietti su quanto poco queste si sovrappongano. Gemini 3.5 Live Translate traduce. Prende audio in streaming in una lingua e restituisce audio in streaming in un'altra, preservando la voce e il tono di chi parla, in oltre 70 lingue e più di 2.000 coppie linguistiche, con rilevamento automatico della lingua e funzionamento bidirezionale. Non sostiene una conversazione, non chiama una funzione, né risponde a una domanda. È un motore di interpretazione simultanea.
GPT-Live-1 ha la forma opposta. È un modello conversazionale: ascolta e parla contemporaneamente, decide molte volte al secondo se continuare ad ascoltare, mettersi in pausa, interrompere o chiamare uno strumento, e affida il lavoro pesante — ricerca web, ragionamento più approfondito, attività agentiche — a un modello di ragionamento separato tramite l'API Responses mentre la conversazione continua. L'esempio WebRTC pubblicato da OpenAI stesso collega quella delega a GPT-5.6 Terra. La traduzione è una delle cose che può fare; non è una funzionalità di cui il modello di Google abbia un equivalente nella direzione opposta.
Quindi la questione pratica è più ristretta di quanto suggerisca il confronto da prima pagina: se quello che stai costruendo è interpretariato, il modello di Google è progettato ad hoc e quello di OpenAI è generalista. Se quello che stai costruendo è un agente vocale che traduce occasionalmente, GPT-Live-1 è l'unico dei due che rientri persino nella categoria di prodotto giusta.
Quanto costa ciascuno per minuto di audio
È qui che lo specialista si guadagna da vivere, e i conti sono davvero scomodi per OpenAI.
• GPT-Live-1 — $0,05 al minuto per la voce, fatturato al secondo anziché arrotondato al minuto intero successivo. Il ragionamento e le chiamate agli strumenti effettuati dal backend delegato vengono fatturati separatamente alle tariffe normali di quel modello.
• Gemini 3.5 Live Translate — 3,50 $ per milione di token audio di input e 21,00 $ per milione di token audio di output, con fatturazione calcolata a 25 token al secondo di audio. Nel complesso, si arriva a circa 0,037 $ al minuto di audio tradotto.
Sui minuti di sola traduzione, Google costa circa un quarto in meno. Non è una differenza di arrotondamento su larga scala: 10.000 minuti interpretati al mese costano circa $500 sul livello vocale di GPT-Live-1 contro circa $368 su Gemini 3.5 Live Translate. E il divario è reale, non un artefatto del cambiamento di misurazione, perché i due modelli fatturano su unità davvero diverse.
C'è un inghippo nella direzione opposta. Il prezzo di $0,05 pubblicizzato per GPT-Live-1 è solo il prezzo del livello vocale. Se il tuo agente traduce e allo stesso tempo cerca qualcosa, oppure inoltra una frase difficile a un modello di ragionamento, paghi quella delega in aggiunta — e il modello delegato viene fatturato per token come qualsiasi altro modello di frontiera. Un carico di lavoro di sola traduzione non attiva mai questo meccanismo. Un carico di lavoro che combina traduzione e qualsiasi altra cosa sì, e il vincitore del confronto al minuto smette di essere ovvio.

L'etichetta di anteprima è il rischio che nessuno prezza
L'ID del modello di Gemini 3.5 Live Translate è gemini-3.5-live-translate-preview. È stato distribuito all'API Gemini Live e a Google AI Studio come anteprima pubblica, e contemporaneamente nell'app Google Translate su Android e iOS e come anteprima privata in Google Meet per clienti Workspace selezionati. Anteprima significa ciò che ha sempre significato presso Google: nessuna garanzia di stabilità, nessuna finestra di deprecazione pubblicata, nessun impegno che la tariffa che stai pagando sopravviva al prossimo rilascio.
Per un'app consumer va bene. Per i carichi di lavoro a cui questo modello è in realtà destinato — interpretazione dal vivo in un call center, un prodotto per riunioni, un prodotto per viaggi — è il più grande rischio di integrazione nello stack. Stai creando una dipendenza di produzione da un modello per il quale Google non ha assunto alcun impegno esplicito.
GPT-Live-1 ha il problema inverso, ed è più piccolo ma non nullo. È generalmente disponibile, a una tariffa pubblicata, con un endpoint documentato, e non sparirà. Ma la sua superficie API è ristretta in un modo che sorprende i team che presumono che si inserisca in un'integrazione OpenAI esistente: c'è esattamente un ID modello, un endpoint, e nessun percorso attraverso Chat Completions, Responses, Realtime, Batch, Assistants o fine-tuning. L'unico modo per entrare è l'endpoint Live Sessions su v1/live/sessions tramite WebRTC, con gestione degli eventi su un canale dati. Questa è una nuova integrazione, non un cambio di parametro.

Lingue, e dove il generalista è onestamente più debole
Il numero di Google è di oltre 70 lingue, con preservazione di voce e tono. La documentazione di OpenAI stessa è decisamente meno sicura riguardo alla propria copertura: il materiale di lancio osserva che per determinate lingue il modello può presentare un accento non nativo o mostrare lacune nella fluidità, e non pubblica un conteggio delle lingue che competa con quello di Google.
Non è un fornitore che fa il misterioso — è ciò che appare un modello conversazionale generalista accanto a uno specialista addestrato sul problema. Se la proposta di valore del tuo prodotto è "interpretiamo bene 40 lingue", lo specialista è la scelta onesta e il generalista ti metterà in imbarazzo nella coda lunga. Se il tuo prodotto è un agente vocale per un mercato di lingua inglese con una funzione di traduzione appiccicata, le lacune linguistiche del generalista non verranno mai fuori.
Entrambi i modelli applicano un watermark all'audio generato con SynthID, il che conta se ti trovi in una giurisdizione o in un contratto con un cliente che richiede la provenienza del parlato sintetico. Su questo punto sono pari.

Dove l'architettura di delegazione cambia la build
La differenza strutturale tra questi due è che GPT-Live-1 è in realtà due modelli con una giuntura nel mezzo. Il livello vocale tiene viva la conversazione; un modello di ragionamento separato fa il lavoro di pensiero. Quella giuntura è dove va il tuo sforzo di ingegneria, ed è anche il punto in cui il modello dei costi si complica.
Vale la pena sapere che la metà delegata è un normale modello testuale che puoi instradare come qualsiasi altro. GPT-5.6 Terra, il backend nell'esempio di OpenAI stesso, viene servito tramite OrcaRouter a 2,00 $ per milione di token in input e 12,00 $ per milione in output, con una finestra di contesto da 1M di token ed entrambi gli endpoint /v1/chat/completions e /v1/responses esposti. Se vuoi cambiare il cervello di ragionamento dietro un agente vocale — per un modello più economico sulle chiamate semplici, o uno più potente in caso di escalation — quella metà dello stack ha delle opzioni, perché è una normale chiamata API che si affianca a circa altri 190 modelli su un'unica chiave.
La metà vocale no. GPT-Live-1 non è su OrcaRouter, e non lo è nemmeno Gemini 3.5 Live Translate; entrambi sono disponibili solo presso il fornitore che li ha creati. È tutto ciò che sta a valle dell'audio il punto in cui un router si guadagna il suo posto in un'architettura come questa: i modelli testuali che si occupano del recupero delle informazioni, della summarizzazione, della scrittura di ritorno sul CRM e dell'escalation, vale a dire la metà della spesa che puoi davvero consolidare su una sola chiave e un'unica fattura.
Cosa scegliere davvero
• Scegli Gemini 3.5 Live Translate se la traduzione è il prodotto, il prezzo al minuto conta più della stabilità contrattuale e puoi assorbire il fatto che un modello in anteprima cambi sotto di te. Prevedi un budget di circa 0,037 $ al minuto e mantieni un livello di astrazione sulla chiamata, così che un modello GA possa sostituirlo senza una riscrittura.
• Scegli GPT-Live-1 se ti serve un agente conversazionale che, incidentalmente, traduce; se ti serve il function calling e l'uso di strumenti all'interno del ciclo vocale; o se un team di acquisti ti chiederà cosa succede quando il modello viene dismesso e ti serve una risposta migliore di "niente, probabilmente".
• Non scegliere l'uno o l'altro solo perché ha vinto un benchmark. I benchmark delle due parti non sono comparabili — i numeri full-duplex di OpenAI sono i suoi, non riprodotti da nessuna terza parte, e le dichiarazioni linguistiche di Google non sono state verificate rispetto a un generalista sullo stesso set audio.
Una nota lungimirante: le due superfici stanno convergendo anziché scontrarsi. Il modello di traduzione di Google vive già dentro Gemini Live, e il layer vocale di GPT-Live-1 è progettato esplicitamente per avere nuovi modelli di frontiera inseriti dietro di esso. L'aspettativa ragionevole è che nell'arco di un paio di cicli di rilascio la traduzione del generalista migliori e la storia d'integrazione dello specialista diventi meno un azzardo. Se stai costruendo oggi e la decisione è vicina, questo è un argomento a favore dell'opzione più economica e più sostituibile, e per mantenere il percorso audio isolato dietro un'interfaccia in ogni caso.
