
Gemini 3.5 Transcribe Live vs Gemini 3.5 Transcribe: quale endpoint la tua app dovrebbe chiamare
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaNUOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123Intelligenza49Codice
Quando Google ha lanciato la famiglia Gemini 3.5 Transcribe il 26 agosto 2026, ha rilasciato due modelli che condividono nome e missione, ma sono costruiti per fasi diverse di una conversazione: Gemini 3.5 Transcribe Live, l'endpoint streaming offerto tramite la Live API, e Gemini 3.5 Transcribe, l'endpoint per file pre-registrati offerto tramite la Interactions API. L'errore che la maggior parte dei team commette nella prima settimana è trattarli come un unico modello con due pulsanti. In realtà sono due SKU: API diverse, prezzi diversi, limiti rigidi diversi, e il confronto sulla precisione tra i due non è una sfida equa, perché vengono misurati secondo regole diverse. Questo articolo li mette fianco a fianco, così che la decisione dipenda dal tuo carico di lavoro e non da una classifica.
I due a colpo d'occhio
• API — Gemini 3.5 Transcribe Live funziona sulla Live API (WebSocket, streaming bidirezionale) rispetto a Gemini 3.5 Transcribe sulla Interactions API (file in ingresso, trascrizione in uscita).
• Job — conversazione dal vivo, sottotitolazione, agenti vocali vs riunioni, log delle chiamate, audio d'archivio.
• Accuratezza — 4.0% WER in streaming vs 2.6% WER non in streaming, secondo Artificial Analysis, citato da Google; regimi di misura diversi, non direttamente confrontabili.
• Latenza — una trascrizione finale 0,40s dopo la fine del parlato rispetto all'elaborazione batch di un file completo.
• Sessione — limite di 10 minuti per sessione live rispetto a file fino a 60 minuti (30 minuti con diarizzazione e timestamp attivati).
• Relatori — nessuno sul lato streaming rispetto a un massimo di tre relatori con timestamp a livello di parola sul lato preregistrato.
• Prezzo — circa $0,009 al minuto misto rispetto a circa $0,005 al minuto misto.

La decisione architetturale: Interactions API o Live API
Entrambi i modelli rientrano nella famiglia Gemini Audio di Google e sono entrambi in anteprima pubblica. La differenza inizia dal trasporto. gemini-3-5-transcribe-live apre un WebSocket e lo mantiene aperto: l'audio grezzo arriva in streaming continuo — il framing più comune prevede chunk PCM a 16 kHz o 24 kHz a 16 bit — e il modello restituisce trascrizioni parziali mentre parli, poi una trascrizione finale per ogni enunciato quando il discorso termina. gemini-3-5-transcribe accetta un file completo, lo elabora e restituisce la trascrizione finale con attribuzione del parlante e timestamp parola per parola.
La decisione sul trasporto determina tutto il resto. Se il tuo prodotto mostra le parole mentre vengono pronunciate — una didascalia in tempo reale, un agente vocale che legge l'intenzione a metà frase, un assistente di chiamata che agisce mentre la chiamata è in corso — sei sul percorso Live. Se il tuo prodotto produce una registrazione — una nota di riunione, un registro di chiamata, un archivio — sei sul percorso Interactions. La confusione nasce dal fatto che entrambi producono testo; la differenza sta nel fatto che il testo sia uno stato in tempo reale o un artefatto finale.
Precisione: la tassa sullo streaming è reale.
Artificial Analysis, la società indipendente di benchmarking di cui {{1}}Google{{/1}} cita i numeri nel suo post di lancio, misura un tasso medio di errore sulle parole del 4,0% per l'endpoint in streaming e del 2,6% per quello non in streaming. Sul benchmark multilingue FLEURS, {{2}}Google{{/2}} riporta il 5,50% in streaming contro il 5,04% non in streaming. Il dato del 2,6% colloca {{3}}Gemini{{/3}} 3.5 Transcribe al 5° posto nella classifica WER di AA al lancio, dietro a ElevenLabs Scribe v2 al 2,2% e a Microsoft MAI-Transcribe-1.5 al 2,4% — queste sono misurazioni di AA, non dichiarazioni di {{4}}Google{{/4}}.
Il valore dello streaming {{1}}non è una versione peggiore dello stesso test{{/1}}. È un regime diverso: il modello si vincola alle parole prima di aver sentito la fine della frase, e ne paga il prezzo. Non scegliere tra i due in base alla sola accuratezza, perché su qualsiasi carico di lavoro il divario potrebbe invertirsi. Scegli sulla base dei vincoli: {{2}}l'endpoint in streaming ha un limite di sessione di 10 minuti, nessuna diarizzazione dei parlanti e nessun timestamp{{/2}}; {{3}}l'endpoint preregistrato gestisce file di un'ora, attribuisce fino a tre parlanti e restituisce timestamp a livello di parola{{/3}}. Se la tua app ha bisogno di etichette dei parlanti, il modello in streaming semplicemente non può fare il lavoro, {{4}}qualunque sia il suo WER{{/4}}.

Cosa condividono
I due endpoint condividono il motore di "trascrizione intelligente", e sulle funzionalità condivise la scelta tra di essi è neutra:
• 85+ lingue con rilevamento automatico, incluso il cambio di lingua a metà flusso sul percorso Live.
• Pulizia delle disfluenze — riempitivi eliminati, autocorrezioni risolte ("Martedì — no, mercoledì" diventa il giorno corretto).
• Formattazione automatica — punteggiatura, uso di maiuscole/minuscole e struttura dei paragrafi applicate all'output.
• Vocabolario personalizzato — fino a 1.000 termini per gergo e nomi di prodotto, con la documentazione di Google che consiglia circa 100 per risultati ottimali.
Un'avvertenza che vale per entrambi: la pulizia "intelligente" che rende leggibile l'output è una scelta progettuale che sacrifica la fedeltà letterale. Le formulazioni goffe vengono appianate; il testo è la lettura dell'intento da parte del modello, non un verbale giudiziario. Per trascrizioni esatte vorrai un'opzione verbatim laddove disponibile, e in ogni caso vorrai verificare il comportamento sul tuo audio.
Costo al minuto: il live premium
Google addebita l'audio in token a 25 token audio al secondo, con un output di circa 175 token di testo per minuto di trascrizione. Ai prezzi di listino, il costo misto per minuto di audio è di circa $0,005 per gemini-3-5-transcribe e di circa $0,009 per gemini-3-5-transcribe-live — input a $2 contro $3,50 per milione di token, output a $12 contro $21 per milione di token. Entrambi hanno oggi un livello gratuito.
Il premium compra il percorso in tempo reale, non più accuratezza: paghi circa l'80% in più al minuto per l'endpoint di streaming, e trascrive con un WER più alto. Questo è il quadro onesto. Il modello pre-registrato è sia più economico che più accurato; il modello di streaming esiste perché alcuni prodotti non possono aspettare che il file finisca.
Su quale endpoint dovresti costruire
• Didascalie e sottotitoli in tempo reale — Gemini 3.5 Transcribe Live, e controlla il limite senza timestamp se hai bisogno di un output allineato al tempo.
• Agenti vocali — Gemini 3.5 Transcribe Live per l'intento a metà frase; pianifica in base al limite di 10 minuti per le sessioni lunghe.
• Riunioni, interviste, archiviazione — Gemini 3.5 Transcribe, per il 2,6% di WER, attribuzione del parlante e timestamp a livello di parola.
• Analisi post-chiamata — Gemini 3.5 Transcribe per la registrazione finale; Gemini 3.5 Transcribe Live solo se l'analisi deve essere eseguita durante la chiamata.
• Audio continuo di lunga durata — Gemini 3.5 Transcribe, perché un file di 60 minuti batte il ricucire a mano sessioni live di dieci minuti.

Il livello sopra la trascrizione
Nessuno dei due modelli è qualcosa che OrcaRouter ospita — oggi non instradiamo il riconoscimento vocale e chiamerai direttamente l'API di Google per entrambi gli endpoint. Ciò che un livello di instradamento fa per una pipeline vocale è collocarsi al di sopra della trascrizione: il modello di riepilogo, il modello di estrazione delle entità, il modello degli action item che trasforma un flusso in una decisione. È in questo livello che OrcaRouter dimostra il proprio valore — un'unica API su oltre 200 modelli al prezzo di listino del provider senza ricarichi, failover automatico tra i provider e un DSL di routing che compone più modelli in una singola chiamata. Scegli l'endpoint di trascrizione in base al carico di lavoro, poi esegui il modello che legge la trascrizione con un'unica chiave.
Il risultato finale
Gemini 3.5 Transcribe Live e Gemini 3.5 Transcribe appartengono alla stessa famiglia ma sono prodotti diversi. Scegli Live quando la trascrizione deve esistere prima che la conversazione finisca e puoi accettare una sessione di 10 minuti, senza etichette dei parlanti e senza timestamp. Scegli Transcribe quando l'output è un documento di registrazione e accuratezza e attribuzione contano più della velocità: è più economico, più accurato e molto meno vincolato. L'unica risposta sbagliata è presumere che un singolo endpoint faccia entrambe le cose.
