Una card di titolo hero che recita 'GPT-Live-1 vs Gemini 3.5 Live Translate' con il sottotitolo 'Un generalista rilasciato contro uno specialista in anteprima' e la riga 'GA a $0,05 al minuto vs anteprima a circa $0,037 al minuto', sopra due pannelli: quello a sinistra mostra una forma d'onda audio full-duplex con frecce che curvano in entrambe le direzioni e un badge 'GA' pieno, quello a destra mostra un globo con due fumetti e un badge 'PREVIEW' delineato, con il logo OrcaRouter composto nell'angolo.
Guides & Insights

GPT-Live-1 vs Gemini 3.5 Live Translate: un generalista già rilasciato contro uno specialista in anteprima

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Questi due modelli vengono confrontati perché entrambi mettono il parlato in tempo reale in un'API, e il confronto crolla nel momento in cui leggi le schede tecniche dei modelli. GPT-Live-1 è un modello vocale full-duplex di uso generale che OpenAI ha spostato nell'API per sviluppatori il 10 settembre 2026, tre mesi dopo il suo rilascio all'interno di ChatGPT l'8 luglio. Gemini 3.5 Live Translate è un modello di traduzione audio-audio a scopo unico che Google DeepMind ha rilasciato il 9 giugno 2026, e il suo ID modello contiene ancora la parola preview. Uno di questi puoi metterlo davanti a clienti paganti oggi, a una tariffa pubblicata. L'altro, Google può cambiartelo sotto senza un avviso di deprecazione. È quell'asimmetria, non la tabella dei benchmark, a dover decidere la scelta.

Due macchine diverse che indossano la stessa etichetta

Vale la pena essere schietti su quanto poco queste si sovrappongano. Gem​ini 3.5 Live Translate traduce. Prende audio in streaming in una lingua e restituisce audio in streaming in un'altra, preservando la voce e il tono di chi parla, in oltre 70 lingue e più di 2.000 coppie linguistiche, con rilevamento automatico della lingua e funzionamento bidirezionale. Non sostiene una conversazione, non chiama una funzione, né risponde a una domanda. È un motore di interpretazione simultanea.

GPT-Live-1 ha la forma opposta. È un modello conversazionale: ascolta e parla contemporaneamente, decide molte volte al secondo se continuare ad ascoltare, mettersi in pausa, interrompere o chiamare uno strumento, e affida il lavoro pesante — ricerca web, ragionamento più approfondito, attività agentiche — a un modello di ragionamento separato tramite l'API Responses mentre la conversazione continua. L'esempio WebRTC pubblicato da Ope​nAI stesso collega quella delega a GPT-5.6 Terra. La traduzione è una delle cose che può fare; non è una funzionalità di cui il modello di Goo​gle abbia un equivalente nella direzione opposta.

Quindi la questione pratica è più ristretta di quanto suggerisca il confronto da prima pagina: se quello che stai costruendo è interpretariato, il modello di Goo​gle è progettato ad hoc e quello di Ope​nAI è generalista. Se quello che stai costruendo è un agente vocale che traduce occasionalmente, GPT-Live-1 è l'unico dei due che rientri persino nella categoria di prodotto giusta.

Quanto costa ciascuno per minuto di audio

È qui che lo specialista si guadagna da vivere, e i conti sono davvero scomodi per Ope​nAI.

• GPT-Live-1 — $0,05 al minuto per la voce, fatturato al secondo anziché arrotondato al minuto intero successivo. Il ragionamento e le chiamate agli strumenti effettuati dal backend delegato vengono fatturati separatamente alle tariffe normali di quel modello.

• Gem​ini 3.5 Live Translate — 3,50 $ per milione di token audio di input e 21,00 $ per milione di token audio di output, con fatturazione calcolata a 25 token al secondo di audio. Nel complesso, si arriva a circa 0,037 $ al minuto di audio tradotto.

Sui minuti di sola traduzione, Goo​gle costa circa un quarto in meno. Non è una differenza di arrotondamento su larga scala: 10.000 minuti interpretati al mese costano circa $500 sul livello vocale di GPT-Live-1 contro circa $368 su Gem​ini 3.5 Live Translate. E il divario è reale, non un artefatto del cambiamento di misurazione, perché i due modelli fatturano su unità davvero diverse.

C'è un inghippo nella direzione opposta. Il prezzo di $0,05 pubblicizzato per GPT-Live-1 è solo il prezzo del livello vocale. Se il tuo agente traduce e allo stesso tempo cerca qualcosa, oppure inoltra una frase difficile a un modello di ragionamento, paghi quella delega in aggiunta — e il modello delegato viene fatturato per token come qualsiasi altro modello di frontiera. Un carico di lavoro di sola traduzione non attiva mai questo meccanismo. Un carico di lavoro che combina traduzione e qualsiasi altra cosa sì, e il vincitore del confronto al minuto smette di essere ovvio.

A two-column comparison scoreboard titled 'GPT-Live-1 vs Gemini 3.5 Live Translate - the scoreboard'. The GPT-Live-1 column lists Status GA, Sept 10; Price $0.05 / minute; Scope conversational agent; Languages limited, vendor-flagged gaps; Tool calling yes, delegated; Tone preservation no. The Gemini 3.5 Live Translate column lists Status preview; Price about $0.037 / minute; Scope translation only; Languages 70+; Tool calling no; Tone preservation yes. A footer reads 'GPT-Live-1 figures per OpenAI; Gemini figures per Google. Different models, different jobs.'

L'etichetta di anteprima è il rischio che nessuno prezza

L'ID del modello di Gem​ini 3.5 Live Translate è gemini-3.5-live-translate-preview. È stato distribuito all'API Gem​ini Live e a Goo​gle AI Studio come anteprima pubblica, e contemporaneamente nell'app Goo​gle Translate su Android e iOS e come anteprima privata in Goo​gle Meet per clienti Workspace selezionati. Anteprima significa ciò che ha sempre significato presso Goo​gle: nessuna garanzia di stabilità, nessuna finestra di deprecazione pubblicata, nessun impegno che la tariffa che stai pagando sopravviva al prossimo rilascio.

Per un'app consumer va bene. Per i carichi di lavoro a cui questo modello è in realtà destinato — interpretazione dal vivo in un call center, un prodotto per riunioni, un prodotto per viaggi — è il più grande rischio di integrazione nello stack. Stai creando una dipendenza di produzione da un modello per il quale Google non ha assunto alcun impegno esplicito.

GPT-Live-1 ha il problema inverso, ed è più piccolo ma non nullo. È generalmente disponibile, a una tariffa pubblicata, con un endpoint documentato, e non sparirà. Ma la sua superficie API è ristretta in un modo che sorprende i team che presumono che si inserisca in un'integrazione OpenAI esistente: c'è esattamente un ID modello, un endpoint, e nessun percorso attraverso Chat Completions, Responses, Realtime, Batch, Assistants o fine-tuning. L'unico modo per entrare è l'endpoint Live Sessions su v1/live/sessions tramite WebRTC, con gestione degli eventi su un canale dati. Questa è una nuova integrazione, non un cambio di parametro.

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

Lingue, e dove il generalista è onestamente più debole

Il numero di Goo​gle è di oltre 70 lingue, con preservazione di voce e tono. La documentazione di Ope​nAI stessa è decisamente meno sicura riguardo alla propria copertura: il materiale di lancio osserva che per determinate lingue il modello può presentare un accento non nativo o mostrare lacune nella fluidità, e non pubblica un conteggio delle lingue che competa con quello di Goo​gle.

Non è un fornitore che fa il misterioso — è ciò che appare un modello conversazionale generalista accanto a uno specialista addestrato sul problema. Se la proposta di valore del tuo prodotto è "interpretiamo bene 40 lingue", lo specialista è la scelta onesta e il generalista ti metterà in imbarazzo nella coda lunga. Se il tuo prodotto è un agente vocale per un mercato di lingua inglese con una funzione di traduzione appiccicata, le lacune linguistiche del generalista non verranno mai fuori.

Entrambi i modelli applicano un watermark all'audio generato con SynthID, il che conta se ti trovi in una giurisdizione o in un contratto con un cliente che richiede la provenienza del parlato sintetico. Su questo punto sono pari.

A screenshot of Google's Gemini Live API overview documentation page, showing the banner 'Preview: The Live API is in Preview', the description that the Live API enables low-latency real-time voice and vision interactions by processing continuous streams of audio, images and text, an architecture diagram in which an app exchanges text, audio and video with the Live API over a WebSocket, and a left navigation listing Live translate under Live.

Dove l'architettura di delegazione cambia la build

La differenza strutturale tra questi due è che GPT-Live-1 è in realtà due modelli con una giuntura nel mezzo. Il livello vocale tiene viva la conversazione; un modello di ragionamento separato fa il lavoro di pensiero. Quella giuntura è dove va il tuo sforzo di ingegneria, ed è anche il punto in cui il modello dei costi si complica.

Vale la pena sapere che la metà delegata è un normale modello testuale che puoi instradare come qualsiasi altro. GPT-5.6 Terra, il backend nell'esempio di Ope​nAI stesso, viene servito tramite OrcaRouter a 2,00 $ per milione di token in input e 12,00 $ per milione in output, con una finestra di contesto da 1M di token ed entrambi gli endpoint /v1/chat/completions e /v1/responses esposti. Se vuoi cambiare il cervello di ragionamento dietro un agente vocale — per un modello più economico sulle chiamate semplici, o uno più potente in caso di escalation — quella metà dello stack ha delle opzioni, perché è una normale chiamata API che si affianca a circa altri 190 modelli su un'unica chiave.

La metà vocale no. GPT-Live-1 non è su OrcaRouter, e non lo è nemmeno Gem​ini 3.5 Live Translate; entrambi sono disponibili solo presso il fornitore che li ha creati. È tutto ciò che sta a valle dell'audio il punto in cui un router si guadagna il suo posto in un'architettura come questa: i modelli testuali che si occupano del recupero delle informazioni, della summarizzazione, della scrittura di ritorno sul CRM e dell'escalation, vale a dire la metà della spesa che puoi davvero consolidare su una sola chiave e un'unica fattura.

Cosa scegliere davvero

• Scegli Gemini 3.5 Live Translate se la traduzione è il prodotto, il prezzo al minuto conta più della stabilità contrattuale e puoi assorbire il fatto che un modello in anteprima cambi sotto di te. Prevedi un budget di circa 0,037 $ al minuto e mantieni un livello di astrazione sulla chiamata, così che un modello GA possa sostituirlo senza una riscrittura.

• Scegli GPT-Live-1 se ti serve un agente conversazionale che, incidentalmente, traduce; se ti serve il function calling e l'uso di strumenti all'interno del ciclo vocale; o se un team di acquisti ti chiederà cosa succede quando il modello viene dismesso e ti serve una risposta migliore di "niente, probabilmente".

• Non scegliere l'uno o l'altro solo perché ha vinto un benchmark. I benchmark delle due parti non sono comparabili — i numeri full-duplex di Ope​nAI sono i suoi, non riprodotti da nessuna terza parte, e le dichiarazioni linguistiche di Goo​gle non sono state verificate rispetto a un generalista sullo stesso set audio.

Una nota lungimirante: le due superfici stanno convergendo anziché scontrarsi. Il modello di traduzione di Goo​gle vive già dentro Gem​ini Live, e il layer vocale di GPT-Live-1 è progettato esplicitamente per avere nuovi modelli di frontiera inseriti dietro di esso. L'aspettativa ragionevole è che nell'arco di un paio di cicli di rilascio la traduzione del generalista migliori e la storia d'integrazione dello specialista diventi meno un azzardo. Se stai costruendo oggi e la decisione è vicina, questo è un argomento a favore dell'opzione più economica e più sostituibile, e per mantenere il percorso audio isolato dietro un'interfaccia in ogni caso.