Hero card del titolo per 'Trascrizione intelligente con Gemini 3.5 Transcribe' che mostra una forma d'onda sonora che si trasforma in testo formattato, un globo con 85+ lingue, chip con le etichette dei parlanti, i numeri in evidenza 2,6% WER non-streaming e ~$0,005/min combinato, e il logo OrcaRouter nell'angolo in basso a destra.
Engineering & Research

Trascrizione intelligente con Gemini 3.5 Transcribe

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Gemini 3.​5 Transcribe è entrato in anteprima pubblica il 26 agosto 2026, ed è il primo modello speech-to-text di Go​ogle genuinamente venduto come modello G​emini: lo si invoca tramite l'API G​emini con un ID del modello, l'audio è prezzato in token, e Go​ogle riporta il costo al minuto di audio nella sua pagina dei prezzi. Quest'ultimo dettaglio è ciò che la copertura consumer sorvola. Le storie del giorno del lancio riguardano la rimozione delle parole di riempimento e l'editing vocale in Gboard, ma ciò che è realmente cambiato per gli sviluppatori è che la trascrizione ora si trova sulla stessa superficie API del resto della linea G​emini, con attribuzione del parlante e timestamp a livello di parola nel modello base invece che in un componente aggiuntivo separato. Questo articolo si legge come un riferimento API, perché è questa la lacuna che la prima ondata di copertura lascia aperta.

Due precisazioni preliminari, affinché i numeri riportati di seguito non traggano in inganno. Go​ogle non definisce Gemini 3.​5 Transcribe "il modello di riconoscimento vocale più accurato che abbiamo" — l'affermazione è che è il modello più preciso per le interazioni vocali intelligenti, che è un'affermazione diversa, e la differenza è importante quando si leggono i valori WER. E tutto ciò che è descritto qui riguarda un'anteprima pubblica: i due ID dei modelli, i prezzi e i numeri di benchmark sono quelli che Go​ogle offre oggi, e tutto può cambiare prima della GA.

I due percorsi API — e gli ID dei modelli da ricordare

Gemini 3.​5 Transcribe viene distribuito come due endpoint, e scegliere quello giusto è la prima decisione architetturale che un team prende:

• gemini-3-5-transcribe — il percorso pre-registrato tramite l'API Interactions. Invia un file, ricevi la trascrizione con attribuzione dei parlanti (fino a tre parlanti; tre o più è sperimentale) e timestamp a livello di parola. Questo è il cavallo di battaglia per l'elaborazione batch e asincrona.

gemini-3-5-transcribe-live — il percorso in tempo reale tramite la Live API. Streaming bidirezionale con latenza sub-secondaria, progettato per conversazioni dal vivo, sottotitolazione e interfacce vocali.

La suddivisione rispecchia come è organizzato il resto della famiglia G​emini Audio, ed è importante perché "live" è uno SKU distinto con un proprio prezzo. Diverse prime letture di questo lancio presumono che un unico modello faccia entrambe le cose; non è così.

A generated two-card infographic titled 'Gemini 3.5 Transcribe - two API paths' showing the pre-recorded Interactions API path on the left labeled gemini-3-5-transcribe with a file-in transcript-out flow and speaker attribution, and the streaming Live API path on the right labeled gemini-3-5-transcribe-live with bidirectional streaming and sub-second latency, a footer reading 'Public preview, August 2026', and the OrcaRouter logo in the bottom-right corner.

Cosa significa realmente "trascrizione intelligente"

Il post di lancio di Go​ogle inquadra questo come un andare oltre la precisione fonetica verso la comprensione. Le funzionalità che seguono da questa inquadratura sono quelle da valutare, piuttosto che l'inquadratura stessa:

• Gestione delle disfluenze — i "um" e gli "ah" vengono eliminati, e le autocorrezioni vengono risolte. "Incontriamoci martedì — no, mercoledì" viene trascritto come il giorno corretto, non come trascrizione di un falso inizio. È una decisione che prende il modello, ed è in questo senso che Go​ogle lo definisce intelligente.

• Formattazione automatica — l'output viene restituito come testo rifinito: punteggiatura, maiuscole/minuscole e struttura dei paragrafi applicate, non un flusso di token grezzo.

• Identificazione multi-parlante — fino a tre parlanti attribuiti nell'audio preregistrato con timestamp a livello di parola; tre o più parlanti è sperimentale. Questa funzionalità è integrata nel modello base anziché in un servizio di diarizzazione separato.

• Vocabolario personalizzato — puoi orientare il riconoscimento verso termini tecnici, nomi di prodotti e grafie insolite fornendo un vocabolario, che è il meccanismo per i domini verticali.

• 85+ lingue — rilevamento automatico, con accenti regionali e dialetti indicati esplicitamente.

• Chiamata di funzioni — il modello può delegare attività come la generazione di immagini o l'analisi di file ad altri modelli G​emini, il che trasforma la trascrizione in un componente di un agente più ampio piuttosto che in un passaggio terminale.

• Acquisizione delle entità — Go​ogle afferma di avere ottime prestazioni su audio reali e rumorosi e su entità alfanumeriche quali codici postali e ID ordine.

La copertura stampa ha anche riportato una finestra di contesto di 96.000 token (circa un'ora di audio di riunione senza suddivisione) e il rilevamento delle emozioni. Entrambi sono in linea con la presentazione del lancio, ma la scheda del modello pubblicata da Google non li mette in evidenza, quindi trattateli come riportati piuttosto che confermati finché non verrà pubblicata una scheda tecnica GA.

A generated single-column scoreboard titled 'Gemini 3.5 Transcribe - the scoreboard' with rows Release Aug 26 2026 public preview, Languages 85+ auto-detect, WER 2.6% non-streaming / 4.0% streaming, Price ~$0.005 per minute blended, APIs transcribe plus transcribe-live, and Context ~96K tokens reported, a footer reading 'WER per Artificial Analysis, cited by Google; context window press-reported', and the OrcaRouter logo in the bottom-right corner.

I numeri di accuratezza, etichettati

I dati WER citati da Go​ogle provengono da Artificial Analysis: un tasso medio di errore sulle parole del 4,0% per la trascrizione in streaming e del 2,6% per quella non in streaming. Sul benchmark multilingue FLEURS, Go​ogle riporta un WER del 5,50% per lo streaming e del 5,04% per il non in streaming. Go​ogle afferma inoltre un miglioramento del 70% nel tempo di trascrizione finale rispetto al suo predecessore, Chirp 3.

La lettura onesta: queste sono misurazioni indipendenti nel senso che Artificial Analysis non è Google, ma sono misurazioni selezionate da Google, pubblicate all'interno dell'annuncio di Google stesso, di un modello che è chiamabile da un giorno. Nessuno al di fuori di Google ha ancora eseguito un confronto testa a testa avversario contro i modelli open-weight con cui la maggior parte dei team lo confronta, e i materiali di lancio non contengono alcun confronto diretto con la famiglia Whisper o con la linea Parakeet di NVIDIA. Il dato del 70% più veloce rispetto a Chirp-3 è un'affermazione del fornitore, punto. Trattate il 2,6% e il 4,0% come forti segnali iniziali, non come fatti accertati.

Quanto costa

La pagina dei prezzi di Google riporta per ogni modello sia i token sia i minuti stimati di audio. Per gemini-3-5-transcribe, la stima media è di circa $0,005 al minuto di audio ai prezzi di listino — input circa $0,003/min, output circa $0,002/min. Per gemini-3-5-transcribe-live, la stima media è di circa $0,009 al minuto. Entrambi prevedono oggi un livello gratuito.

Quelle cifre al minuto sono stime derivate da un tasso di token assunto (25 token audio al secondo in ingresso, 175 token di testo al minuto in uscita), quindi cambiano se Go​ogle modifica la contabilizzazione dei token. Ciò che è solido è il principio: il prezzo di listino è il prezzo. È esattamente il principio su cui opera un router pass-through come OrcaRouter — margine 0%, prezzo di listino del fornitore applicato direttamente — quindi se Go​ogle riduce i prezzi di trascrizione durante la finestra tra anteprima e disponibilità generale, il taglio è attivo dal nostro lato lo stesso giorno, non dopo che un rivenditore aggiorna un tariffario.

Dove viene distribuito

Per gli sviluppatori, l'anteprima pubblica oggi significa due superfici: l'API G​emini in Go​ogle AI Studio e la G​emini Enterprise Agent Platform per i carichi di lavoro aziendali. Sul lato consumer, Gemini 3.​5 Transcribe alimenta già la funzione di dettatura Rambler in Gboard su Android e l'app G​emini su macOS. Chrome è il prossimo — scrivi parlando in qualsiasi campo web — seguito da Search Live, G​emini Live, Docs, Keep e Gmail. Per un team che la sta valutando, la risposta pratica è più semplice: oggi è richiamabile dal codice, in inglese, nelle regioni in cui l'API G​emini è disponibile.

A screenshot of the Google blog announcement page for Gemini 3.5 Transcribe, titled 'Intelligent transcription with Gemini 3.5 Transcribe', showing the August 26 2026 date and the authors Diego Melendo Casado and Luke Leonhard, captured August 27 2026.

Cosa significa questo per la tua pipeline

La vera novità non è un numero di WER. È che Go​ogle ora vende la trascrizione con le due funzionalità che i team in precedenza assemblavano da soli — etichette dei parlanti e timestamp a livello di parola — nel modello base, su una superficie API G​emini che supporta il function calling. Se stavi costruendo una pipeline di note di riunione diarizzate a partire da un semplice trascrittore più un diarizzatore separato più una fase di formattazione, questo è il primo modello Go​ogle che comprime questi passaggi. La domanda aperta è come il 2,6% di WER non streaming regga sul tuo audio, e finché non appare una riproduzione indipendente, la mossa responsabile per un team di produzione è eseguire un campione reale attraverso l'API piuttosto che basare il budget sui benchmark scelti da Go​ogle. Per il lavoro LLM che gira sopra la trascrizione — riassunto, estrazione strutturata, elementi d'azione — quello è il livello in cui il routing guadagna la sua importanza, ed è il livello che OrcaRouter copre: un'API su oltre 200 modelli, failover automatico tra provider e un DSL di routing che compone più modelli in una singola chiamata. Il passaggio di trascrizione in sé dovresti testarlo con il tuo audio prima di fidarti del numero pubblicizzato da chiunque.

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube