Titolo che recita 'Qwen3.8-LiveTranslate vs Gemini 3.5 Live Translate' con il sottotitolo 'Uno fornisce un numero, l'altro fornisce una mappa'.
Guides & Insights

Qwen3.8-LiveTranslate vs Gemini 3.5 Live Translate: uno fornisce un numero, l'altro fornisce una mappa

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

I due principali modelli di traduzione vocale in tempo reale non concordano su ciò su cui sono disposti a farsi misurare, e tale disaccordo è più utile di qualsiasi confronto di specifiche. Qwen3.8-LiveTranslate, rilasciato il 19 settembre 2026, punta su un unico dato concreto: un ritardo medio di 2,3 secondi, in calo rispetto ai 2,8 della generazione precedente. Gemini 3.5 Live Translate, il modello speech-to-speech del fornitore annunciato a giugno 2026 e ancora contraddistinto da un ID di modello in anteprima, punta invece sulla portata: oltre 70 lingue, rilevamento automatico, cambio di lingua a metà conversazione e integrazione nelle app Translate e Meet del fornitore. Un'azienda ha pubblicato un numero di latenza su cui può essere chiamata a rispondere. L'altra ha pubblicato un conteggio di lingue. Se devi scegliere tra i due, capire perché si tratta di tipi diversi di promesse conta più di quale elenco sia più lungo.

Due architetture che concordano sull'obiettivo e su nient'altro

Entrambi i modelli esistono per eliminare lo stesso comportamento: il traduttore a turni che aspetta che tu finisca una frase prima di dire qualcosa. È quella pausa a far sembrare l'interpretazione automatica un'interpretazione automatica.

Qwen3.8-LiveTranslate ci arriva con un'architettura Interleave su un backbone Hybrid MoE, suddivisa in un modulo Thinker che fonde audio, video, testo sorgente e traduzione in un'unica sequenza causale, e un modulo Talker che risintetizza la traduzione nel timbro del parlante originale. L'affermazione è che unire riconoscimento, traduzione e sintesi in un'unica sequenza elimina la latenza e la perdita semantica che una pipeline a tre stadi paga a ogni confine tra moduli.

Gemini 3.5 Live Translate assume la stessa posizione end-to-end dalla direzione opposta: è basato su Gemini 3 Pro come modello nativo audio-to-audio, in streaming continuo tramite Gemini Live API invece di eseguire una cascata discreta ASR → MT → TTS. In pratica si mantiene un WebSocket bidirezionale persistente, si inviano blocchi audio da 100 ms verso l'alto e si ricevono blocchi audio tradotti verso il basso. Nessuno dei due modelli fa la vecchia cosa. Entrambi ora fanno la cosa nuova. Le differenze sono tutte nei dettagli di secondo ordine.

Il confronto sulla latenza non è il pareggio che sembra

Google descrive Gemini 3.5 Live Translate come un sistema che resta "qualche secondo indietro" rispetto a chi parla. Non ha pubblicato un valore LAAL, né alcun'altra metrica di latenza denominata e riproducibile, per il modello. Qwen ha pubblicato 2,3 secondi e ha definito cosa significa.

Questa asimmetria viene regolarmente appiattita in "entrambi sono intorno ai due o tre secondi". Questa lettura non è supportata da nulla di ciò che nessuna delle due aziende ha dichiarato. La formulazione di Google è compatibile con 2 secondi e compatibile con 4; l'azienda si è semplicemente rifiutata di essere inchiodata a una cifra. Il confronto che si può effettivamente fare oggi è:

Metrica di latenza pubblicata — Qwen3.8-LiveTranslate: LAAL 2,3 s, dichiarata dal fornitore. Gemini 3.5 Live Translate: nessuna pubblicata.

Misurazione indipendente della latenza — nessuna, per nessuno dei due modelli. Nessuna terza parte ha pubblicato un confronto diretto.

La conclusione onesta è che sulla latenza Qwen ha formulato un'affermazione falsificabile e Google ne ha formulata una vaga. Questo è un punto a favore di Qwen sulla trasparenza ed esattamente zero punti a suo favore sulle prestazioni finché qualcuno non misura entrambe. Se la latenza è il fattore decisivo per la tua messa in produzione, lo stato attuale delle prove non supporta una decisione di acquisto in nessuna delle due direzioni.

Two-column comparison scoreboard. Qwen3.8-LiveTranslate column: latency LAAL 2.3s, languages 60 source and 29 spoken, speaker ID real-time diarization, input audio plus image, status generally available, watermark none stated. Gemini 3.5 Live Translate column: latency not published, languages 70-plus supported, speaker ID weak turn-taking, input audio only, status preview, watermark SynthID on all audio. Footer reads 'Qwen figures vendor-reported; Gemini per Google docs. No independent head-to-head.'

60 lingue contro più di 70 è il tabellone sbagliato

I conteggi delle lingue vengono citati costantemente e traggono in inganno in entrambe le direzioni.

Qwen3.8-LiveTranslate riconosce 60 lingue di partenza e produce output vocale in 29 di esse. Gemini 3.5 Live Translate supporta oltre 70 lingue con rilevamento automatico e, in Google Meet, questo si espande a oltre 2.000 combinazioni linguistiche, laddove il limite precedente era la traduzione basata sull'inglese in cinque lingue.

Leggi attentamente il secondo numero prima di considerarlo una vittoria tripla. Il dato di Google, oltre 2.000, conta coppie ordinate — ogni lingua di partenza incrociata con ogni lingua di arrivo — che è una misura di copertura legittima e genuinamente utile, ma non comparabile a un conteggio per singola lingua. E l'elenco di Google, sebbene più ampio, è fortemente sbilanciato verso le lingue con grandi popolazioni di parlanti: afrikaans, arabo, bengalese, olandese, inglese, francese, tedesco, hindi, indonesiano, italiano, giapponese, coreano, malese, persiano, polacco, portoghese, russo, spagnolo, swahili, tamil, telugu, thai, turco, ucraino, urdu, vietnamita, zulu. Le 29 lingue con output vocale di Qwen sono ancora più limitate, e nessuno dei due elenchi dei fornitori è una risposta seria alla coda lunga — i dialetti regionali e le lingue a basse risorse in cui gli strumenti di interpretazione hanno storicamente fallito di più. Entrambe le aziende dicono di starci lavorando. Nessuna delle due l'ha ancora rilasciato.

Dove i due divergono davvero: la stanza piena di persone

L'unico punto in cui i modelli offrono promesse davvero diverse è la gestione di più parlanti, ed è la differenza che più probabilmente deciderà un deployment reale.

Qwen3.8-LiveTranslate offre la diarizzazione dei parlanti in tempo reale: ogni frase viene attribuita a un parlante nel momento in cui arriva, e la replica vocale è descritta come stabile nei cambi di turno. Qwen dichiara autonomamente un tasso di errore di diarizzazione del 9,7% sul proprio set di test lungo con più parlanti, contro il 30,6% di Seed LiveInterpret 2.0 — un confronto tra fornitori su una valutazione condotta dal fornitore stesso, quindi va considerato un'affermazione con un numero allegato più che un risultato. Il modello emette anche il testo di origine e la traduzione sulla stessa timeline, ed è ciò che rende possibili sottotitoli bilingui sincronizzati senza una passata di allineamento separata.

Gemini 3.5 Live Translate pone l'accento sull'aspetto opposto. La sua forza documentata è la conservazione della prosodia — mantenere il tono, il ritmo, l'intonazione e il registro emotivo dell'oratore, così che la voce tradotta trasmetta la sensazione dell'originale. Le sue debolezze documentate sono esattamente dove la diarizzazione sarebbe d'aiuto: una clonazione vocale incoerente che può andare alla deriva dopo lunghe pause o ricadere sul genere sbagliato, una debole gestione dell'alternanza dei turni senza un chiaro segnale di fine frase, difficoltà con accenti marcati e con coppie linguistiche strettamente correlate come spagnolo e portoghese, e una gestione imperfetta del rumore di fondo. Inoltre, Google limita le sessioni puramente audio a 15 minuti, salvo estensione, e contrassegna ogni flusso audio generato con una filigrana SynthID che al momento non può essere rimossa.

Attribuzione multi-interlocutore — Qwen: diarizzazione in tempo reale, dichiarato 9,7% di DER. Gemini: turn-taking debole documentato, nessuna dichiarazione di diarizzazione.

Fedeltà della voce — Qwen: riproduzione del timbro della sorgente tramite il modulo Talker. Gemini: conservazione di prosodia, intonazione e ritmo; deriva di clonazione documentata.

Output bilingue — Qwen: sorgente e traduzione emesse sulla stessa timeline. Gemini: trascrizione opzionale di input e output, configurata per sessione.

Filigrana — Qwen: nessuno dichiarato. Gemini: SynthID su tutto l'audio generato, nessun percorso di rimozione.

Durata della sessione — Qwen: non specificato. Gemini: limite di 15 minuti per le sessioni puramente audio.

Tipi di input — Qwen: audio e immagine. Gemini: solo audio, nessun input di testo.

Screenshot of Google's own Gemini Live API documentation for live translation, showing the speech-to-speech streaming setup, the supported-language list, and the documented session constraints for the preview model.

Quanto costa effettivamente far funzionare ciascuno

Qwen3.8-LiveTranslate ha un prezzo per milione di token tramite l'API Realtime WebSocket. Nella regione di Singapore: 7,50 $ per input audio, 0,55 $ per input immagine, 20,00 $ per output di testo, 30,00 $ per output audio. A Pechino: ¥40 / ¥3,3 / ¥100 / ¥160 per milione — all'incirca 5,65 $ / 0,47 $ / 14,13 $ / 22,61 $. Il suo contesto è di 53.248 token, e il limite di frequenza è di 10 richieste al minuto e 100.000 token al minuto in entrambe le regioni.

Quel tetto di 10 RPM è il numero più significativo del tariffario. Le condizioni commerciali di Gemini 3.5 Live Translate non sono pubblicate allo stesso modo, il che è di per sé un segnale di maturità: Google la sta distribuendo tramite Live API e AI Studio in anteprima pubblica, Google Meet in anteprima privata per clienti Workspace selezionati, e l'app Translate su Android e iOS. I prezzi e i limiti di frequenza dell'anteprima possono cambiare senza preavviso, e Google non si è impegnata a una data di GA.

Quindi al momento il confronto dei costi è tra un modello con un prezzo pubblicato e un tetto rigido di concorrenza, e un modello senza prezzo pubblicato e con un tetto non specificato. Se devi modellare l'economia unitaria in questo trimestre, solo uno dei due è preventivabile.

Screenshot of Alibaba Cloud Model Studio documentation for the qwen3.8-livetranslate-flash-realtime model, showing the WebSocket Realtime API endpoint and the published per-million-token pricing for audio input, image input, text output and audio output.

Cosa dovrebbe dimostrare un test indipendente

Tutto quanto sopra si basa sugli annunci dei due fornitori stessi, perché nessuno ha messo questi modelli a confronto. Un risultato che possa davvero risolvere questo confronto richiede quattro cose, e nessuna di esse esiste ancora:

• LAAL misurato allo stesso modo su entrambi i modelli, sullo stesso audio, nelle stesse coppie linguistiche — il dato di 2,3 s di Qwen non può essere confrontato con alcun dato, poiché Google ha rifiutato di dichiararlo.

• Tasso di errore di diarizzazione su un corpus multi-parlante condiviso, non sul set Omnilingua-MSpeaker di Qwen stesso.

• Stabilità della clonazione vocale nelle sessioni lunghe, che è il punto in cui la documentazione di Gemini stessa segnala deriva e Qwen avanza la sua affermazione più forte.

• Comportamento ai limiti di concorrenza — se i 10 RPM di Qwen reggono sotto il carico reale di una riunione e se le quote di anteprima di Gemini sopravvivono al contatto con la produzione.

Finché quel test non esiste, la posizione difendibile è ristretta: Qwen ha pubblicato di più e promesso cose più specifiche; Google ha una copertura linguistica più ampia e una presenza distributiva che nessun modello disponibile solo via API può eguagliare.

Quale scegliere?

Concentrati sulla forma del tuo problema, non sul tabellone, perché il tabellone non è ancora affidabile.

Se il tuo carico di lavoro coinvolge più parti e l'attribuzione conta — trascrizione di riunioni, un panel, un'aula di tribunale, qualunque situazione in cui sapere chi ha pronunciato una frase tradotta faccia parte del valore — Qwen3.8-LiveTranslate è l'unico dei due a rivendicare questa capacità, e la documentata debolezza di Gemini nella gestione dei turni di parola punta nella stessa direzione. Se il tuo carico di lavoro è su un'ampia gamma di lingue, rivolto ai consumatori e già all'interno dell'ecosistema Google, le oltre 70 lingue di Gemini 3.5 Live Translate e la sua presenza nell'app Translate e in Meet sono vantaggi che nessun concorrente disponibile solo tramite API può eguagliare sul piano della distribuzione.

Se stai costruendo un prodotto invece di acquistare una demo, tieni presente che entrambi sono specialisti in un ambito molto ristretto. Nessuno dei due esegue un loop agentico, nessuno dei due riassume, e Qwen3.8-LiveTranslate dichiara esplicitamente di non supportare il function calling, l'output strutturato, la cache del contesto né il fine-tuning. L'interprete è la parte iniziale della tua pipeline, non la sua totalità. OrcaRouter oggi non è il luogo in cui chiamare uno dei due modelli di traduzione: nessuno dei due è nel nostro catalogo, e preferiamo dirlo piuttosto che lasciarlo intendere. Quello che offriamo è la metà dello stack che consuma la trascrizione: una sola chiave per oltre 200 modelli al prezzo di listino del provider, senza alcun ricarico applicato, così il riassuntore, il validatore del glossario o l'agente a valle che legge quella trascrizione possono essere sostituiti o messi in failover senza dover gestire un secondo contratto con un fornitore.

La parte inferiore di esso

Qwen3.8-LiveTranslate e Gemini 3.5 Live Translate sono sufficientemente vicini sui fondamentali che il marketing è diventato l'elemento distintivo: uno ha pubblicato un numero di latenza e un listino prezzi, l'altro ha pubblicato una mappa delle lingue e un ecosistema. Nessuno dei due si è sottoposto a un test indipendente. La versione di questo confronto che vale la pena leggere è quella che verrà scritta dopo che qualcuno avrà eseguito entrambi sullo stesso audio — e, dato quanto rapidamente si muove questa categoria, potrebbe non mancare molto.

Confrontati in questo articolo3

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno