
Trascrizione intelligente con Gemini 3.5 Transcribe
- 智谱NUOVOZ.ai: GLM 5.3 Flash2026-08-26$0.07 / $0.25 per 1M di token
- DeepSeekNUOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianNUOVOQwen3.8 27B2026-08-1552Intelligenza68Codice
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenza77Codice
Gemini 3.5 Transcribe è entrato in anteprima pubblica il 26 agosto 2026, ed è il primo modello speech-to-text di Google genuinamente venduto come modello Gemini: lo si invoca tramite l'API Gemini con un ID del modello, l'audio è prezzato in token, e Google riporta il costo al minuto di audio nella sua pagina dei prezzi. Quest'ultimo dettaglio è ciò che la copertura consumer sorvola. Le storie del giorno del lancio riguardano la rimozione delle parole di riempimento e l'editing vocale in Gboard, ma ciò che è realmente cambiato per gli sviluppatori è che la trascrizione ora si trova sulla stessa superficie API del resto della linea Gemini, con attribuzione del parlante e timestamp a livello di parola nel modello base invece che in un componente aggiuntivo separato. Questo articolo si legge come un riferimento API, perché è questa la lacuna che la prima ondata di copertura lascia aperta.
Due precisazioni preliminari, affinché i numeri riportati di seguito non traggano in inganno. Google non definisce Gemini 3.5 Transcribe "il modello di riconoscimento vocale più accurato che abbiamo" — l'affermazione è che è il modello più preciso per le interazioni vocali intelligenti, che è un'affermazione diversa, e la differenza è importante quando si leggono i valori WER. E tutto ciò che è descritto qui riguarda un'anteprima pubblica: i due ID dei modelli, i prezzi e i numeri di benchmark sono quelli che Google offre oggi, e tutto può cambiare prima della GA.
I due percorsi API — e gli ID dei modelli da ricordare
Gemini 3.5 Transcribe viene distribuito come due endpoint, e scegliere quello giusto è la prima decisione architetturale che un team prende:
• gemini-3-5-transcribe — il percorso pre-registrato tramite l'API Interactions. Invia un file, ricevi la trascrizione con attribuzione dei parlanti (fino a tre parlanti; tre o più è sperimentale) e timestamp a livello di parola. Questo è il cavallo di battaglia per l'elaborazione batch e asincrona.
gemini-3-5-transcribe-live — il percorso in tempo reale tramite la Live API. Streaming bidirezionale con latenza sub-secondaria, progettato per conversazioni dal vivo, sottotitolazione e interfacce vocali.
La suddivisione rispecchia come è organizzato il resto della famiglia Gemini Audio, ed è importante perché "live" è uno SKU distinto con un proprio prezzo. Diverse prime letture di questo lancio presumono che un unico modello faccia entrambe le cose; non è così.

Cosa significa realmente "trascrizione intelligente"
Il post di lancio di Google inquadra questo come un andare oltre la precisione fonetica verso la comprensione. Le funzionalità che seguono da questa inquadratura sono quelle da valutare, piuttosto che l'inquadratura stessa:
• Gestione delle disfluenze — i "um" e gli "ah" vengono eliminati, e le autocorrezioni vengono risolte. "Incontriamoci martedì — no, mercoledì" viene trascritto come il giorno corretto, non come trascrizione di un falso inizio. È una decisione che prende il modello, ed è in questo senso che Google lo definisce intelligente.
• Formattazione automatica — l'output viene restituito come testo rifinito: punteggiatura, maiuscole/minuscole e struttura dei paragrafi applicate, non un flusso di token grezzo.
• Identificazione multi-parlante — fino a tre parlanti attribuiti nell'audio preregistrato con timestamp a livello di parola; tre o più parlanti è sperimentale. Questa funzionalità è integrata nel modello base anziché in un servizio di diarizzazione separato.
• Vocabolario personalizzato — puoi orientare il riconoscimento verso termini tecnici, nomi di prodotti e grafie insolite fornendo un vocabolario, che è il meccanismo per i domini verticali.
• 85+ lingue — rilevamento automatico, con accenti regionali e dialetti indicati esplicitamente.
• Chiamata di funzioni — il modello può delegare attività come la generazione di immagini o l'analisi di file ad altri modelli Gemini, il che trasforma la trascrizione in un componente di un agente più ampio piuttosto che in un passaggio terminale.
• Acquisizione delle entità — Google afferma di avere ottime prestazioni su audio reali e rumorosi e su entità alfanumeriche quali codici postali e ID ordine.
La copertura stampa ha anche riportato una finestra di contesto di 96.000 token (circa un'ora di audio di riunione senza suddivisione) e il rilevamento delle emozioni. Entrambi sono in linea con la presentazione del lancio, ma la scheda del modello pubblicata da Google non li mette in evidenza, quindi trattateli come riportati piuttosto che confermati finché non verrà pubblicata una scheda tecnica GA.

I numeri di accuratezza, etichettati
I dati WER citati da Google provengono da Artificial Analysis: un tasso medio di errore sulle parole del 4,0% per la trascrizione in streaming e del 2,6% per quella non in streaming. Sul benchmark multilingue FLEURS, Google riporta un WER del 5,50% per lo streaming e del 5,04% per il non in streaming. Google afferma inoltre un miglioramento del 70% nel tempo di trascrizione finale rispetto al suo predecessore, Chirp 3.
La lettura onesta: queste sono misurazioni indipendenti nel senso che Artificial Analysis non è Google, ma sono misurazioni selezionate da Google, pubblicate all'interno dell'annuncio di Google stesso, di un modello che è chiamabile da un giorno. Nessuno al di fuori di Google ha ancora eseguito un confronto testa a testa avversario contro i modelli open-weight con cui la maggior parte dei team lo confronta, e i materiali di lancio non contengono alcun confronto diretto con la famiglia Whisper o con la linea Parakeet di NVIDIA. Il dato del 70% più veloce rispetto a Chirp-3 è un'affermazione del fornitore, punto. Trattate il 2,6% e il 4,0% come forti segnali iniziali, non come fatti accertati.
Quanto costa
La pagina dei prezzi di Google riporta per ogni modello sia i token sia i minuti stimati di audio. Per gemini-3-5-transcribe, la stima media è di circa $0,005 al minuto di audio ai prezzi di listino — input circa $0,003/min, output circa $0,002/min. Per gemini-3-5-transcribe-live, la stima media è di circa $0,009 al minuto. Entrambi prevedono oggi un livello gratuito.
Quelle cifre al minuto sono stime derivate da un tasso di token assunto (25 token audio al secondo in ingresso, 175 token di testo al minuto in uscita), quindi cambiano se Google modifica la contabilizzazione dei token. Ciò che è solido è il principio: il prezzo di listino è il prezzo. È esattamente il principio su cui opera un router pass-through come OrcaRouter — margine 0%, prezzo di listino del fornitore applicato direttamente — quindi se Google riduce i prezzi di trascrizione durante la finestra tra anteprima e disponibilità generale, il taglio è attivo dal nostro lato lo stesso giorno, non dopo che un rivenditore aggiorna un tariffario.
Dove viene distribuito
Per gli sviluppatori, l'anteprima pubblica oggi significa due superfici: l'API Gemini in Google AI Studio e la Gemini Enterprise Agent Platform per i carichi di lavoro aziendali. Sul lato consumer, Gemini 3.5 Transcribe alimenta già la funzione di dettatura Rambler in Gboard su Android e l'app Gemini su macOS. Chrome è il prossimo — scrivi parlando in qualsiasi campo web — seguito da Search Live, Gemini Live, Docs, Keep e Gmail. Per un team che la sta valutando, la risposta pratica è più semplice: oggi è richiamabile dal codice, in inglese, nelle regioni in cui l'API Gemini è disponibile.

Cosa significa questo per la tua pipeline
La vera novità non è un numero di WER. È che Google ora vende la trascrizione con le due funzionalità che i team in precedenza assemblavano da soli — etichette dei parlanti e timestamp a livello di parola — nel modello base, su una superficie API Gemini che supporta il function calling. Se stavi costruendo una pipeline di note di riunione diarizzate a partire da un semplice trascrittore più un diarizzatore separato più una fase di formattazione, questo è il primo modello Google che comprime questi passaggi. La domanda aperta è come il 2,6% di WER non streaming regga sul tuo audio, e finché non appare una riproduzione indipendente, la mossa responsabile per un team di produzione è eseguire un campione reale attraverso l'API piuttosto che basare il budget sui benchmark scelti da Google. Per il lavoro LLM che gira sopra la trascrizione — riassunto, estrazione strutturata, elementi d'azione — quello è il livello in cui il routing guadagna la sua importanza, ed è il livello che OrcaRouter copre: un'API su oltre 200 modelli, failover automatico tra provider e un DSL di routing che compone più modelli in una singola chiamata. Il passaggio di trascrizione in sé dovresti testarlo con il tuo audio prima di fidarti del numero pubblicizzato da chiunque.
