Scheda del titolo hero per 'Gemini 3.5 Transcribe vs Whisper Large v3 Turbo' con sottotitolo 'la baseline va sostituita?', che mostra una scheda API gestita a sinistra etichettata Gemini 3.5 Transcribe al 2,6% WER non in streaming e una scheda open-weight a destra etichettata Whisper Large v3 Turbo al 2,1% LibriSpeech clean con badge MIT e tag 809M, e il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

Gemini 3.5 Transcribe vs Whisper Large v3 Turbo: il baseline va sostituito?

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Whisper Large v3 Turbo è il modello a cui l'espressione «speech-to-text» rimanda di default per gran parte dell'industria, e Gemini 3.​5 Transcribe è il primo modello di trascrizione di Go​ogle esplicitamente venduto come sfidante di quel punto di riferimento piuttosto che come una generica API di riconoscimento vocale. Gemini 3.​5 Transcribe, in anteprima pubblica dal 26 agosto 2026, ridefinisce la trascrizione come un compito di ragionamento: risolve le autocorrezioni, formatta l'output, attribuisce i parlanti e chiama autonomamente altri modelli G​emini. Whisper Large v3 Turbo è la versione distillata da 809 milioni di parametri di Whisper Large-v3 di Ope​nAI, con licenza MIT, auto-ospitabile, in 99 lingue, e all'incirca da quattro a otto volte più veloce del modello da cui è stata derivata, a seconda dell'hardware. Il primo è uno strato di intelligenza gestito che agisce sull'audio; il secondo è un componente libero e ben compreso che puoi eseguire dove vuoi. La domanda a cui questa pagina serve a rispondere è più ristretta e più utile di «quale sia meglio»: quando il punto di riferimento smette di essere abbastanza buono?

La baseline, nel caso avessi dimenticato quanto è buona.

Whisper Large v3 Turbo merita il suo stato predefinito, quindi il caso a suo favore viene per primo:

• Funziona ovunque — licenza MIT, pesi aperti, installabile su un laptop, una singola GPU o una funzione serverless. Nessun fornitore, nessun contatore, nessun dato che lascia la tua rete.

• È veloce — il decoder distillato (32 layer encoder, 4 layer decoder, rispetto ai 32 originali) lo rende circa quattro volte più veloce di Whisper Large-v3 su hardware tipico, e ancora di più su alcuni, mantenendo gran parte della sua accuratezza. La stessa OpenAI riporta circa otto volte su un A100.

• Copre 99 lingue per la trascrizione, un elenco più ampio rispetto agli 85+ di Gemini 3.5 Transcribe.

La sua accuratezza è ben documentata: 2,1% WER su LibriSpeech test-clean, 4,2% su test-other, 9,1% su Common Voice English — numeri che sono stati replicati in tutta la comunità per anni.

• L'ecosistema è enorme — faster-whisper, whisper.cpp, esportazioni ONNX e ogni framework di inferenza che già usi. Se riesci a eseguire un modello, puoi eseguire anche questo.

A screenshot of the Hugging Face model page for openai/whisper-large-v3-turbo, showing the MIT license tag, the automatic-speech-recognition pipeline tag, the Transformers and Safetensors tags, the 99-languages tag, and the model card for the 809 million parameter distilled version of Whisper Large-v3, captured August 27 2026.

Per la trascrizione batch in inglese e quasi-inglese su larga scala, Whisper Large v3 Turbo è il punto di riferimento per ragioni strutturali che nessun divario nei benchmark può facilmente ribaltare: è gratuito, è tuo, ed è ovunque.

A generated two-column scoreboard titled 'Gemini 3.5 Transcribe vs Whisper Large v3 Turbo - the scoreboard'. Left column Gemini 3.5 Transcribe: Deployment managed API, Languages 85+, WER 2.6% non-streaming, Speaker ID built in, Formatting intelligent, Price ~$0.005/min. Right column Whisper Large v3 Turbo: Deployment anywhere self-host, Languages 99, WER 2.1% LibriSpeech clean, Speaker ID none, Formatting plain, Price free to run. Footer reads 'Gemini WER per Artificial Analysis, cited by Google; Whisper WER on LibriSpeech - a different set, see text.'

Cosa aggiunge in più Gemini 3.5 Transcribe

Il valore del challenger gestito non è che supera il baseline sull'inglese pulito — è una battaglia che i numeri non possono ancora risolvere chiaramente. Il suo valore è il lavoro che avviene al di sopra delle parole, che Whisper esplicitamente non fa:

• Attribuzione del parlante — fino a tre parlanti con timestamp a livello di parola, nel modello base. Whisper trascrive un unico flusso vocale; non ha alcun concetto di chi abbia detto cosa.

• Formattazione intelligente — disfluenze rimosse, autocorrezioni risolte, punteggiatura e maiuscole applicate. Whisper restituisce le parole così come pronunciate, compresi gli "ehm".

• Vocabolario personalizzato — tendenza verso gergo e grafie insolite. Whisper non ha un meccanismo simile; si deve ricorrere a post-processing o fine-tuning.

• Chiamata di funzioni — la trascrizione può essere passata ad altri modelli G​emini, rendendo la trascrizione un passaggio in una pipeline di agenti piuttosto che l'output finale.

• Sessioni lunghe — circa un'ora di audio in un'unica passata (contesto da 96K riportato dalla stampa) contro la necessità pratica di Whisper di dividere in blocchi e ricucire file lunghi.

Questo è un prodotto diverso. È ciò che Go​ogle intende per "trascrizione intelligente", ed è la parte del confronto che non dipende dall'aritmetica dei benchmark.

La questione dell'accuratezza a cui nessuno può ancora rispondere chiaramente.

I numeri di punta dei due modelli in realtà non si affrontano. Il WER non-streaming del 2,6% di {{1}}Gemini 3.​5 Transcribe{{/1}} è una misurazione di Artificial Analysis citata da {{2}}Go​ogle{{/2}}, calcolata su oltre 85 lingue. Il 2,1% di {{3}}Whisper Large v3 Turbo{{/3}} su LibriSpeech test-clean è un benchmark inglese tratto dal paper sulla distillazione di {{4}}Ope​nAI{{/4}} stessa, ampiamente replicato. Corpora diversi, copertura linguistica diversa, fornitori diversi. Quello che si può dire con onestà: sull'inglese pulito, la baseline open e il modello contendente gestito si collocano plausibilmente sullo stesso livello, e il vantaggio del modello gestito risiede nelle sue caratteristiche multilingue e strutturali, non in una vittoria dimostrata sul WER inglese. I materiali di lancio di {{5}}Go​ogle{{/5}} non contengono alcun confronto testa a testa con i modelli della famiglia Whisper, e non esiste ancora un confronto avversariale indipendente perché {{6}}Gemini 3.​5 Transcribe{{/6}} è pubblico solo da un giorno. Finché non ne appare uno, la corona dell'accuratezza rimane non rivendicata, e qualsiasi articolo — incluso questo — che dichiara un vincitore del WER sulla base di queste due cifre sta esagerando.

A screenshot of the Google blog announcement page for Gemini 3.5 Transcribe, titled 'Intelligent transcription with Gemini 3.5 Transcribe', showing the August 26 2026 date and the authors Diego Melendo Casado and Luke Leonhard, captured August 27 2026.

Costo: gratuito da eseguire rispetto a $0,005 al minuto

Whisper Large v3 Turbo ha un costo hardware e nessun contatore. Se lo esegui su una GPU che già possiedi, il costo marginale per minuto trascritto è quasi zero; se noleggi una GPU, il costo è quello dell'istanza mentre è in funzione. Gemini 3.5 Transcribe addebita circa $0,005 per minuto di audio in tariffa mista, con la SKU live a circa $0,009 al minuto e una fascia gratuita. Con mille ore di audio, si parla di circa $300 sul contatore di Gemini contro pochi dollari di tempo GPU sulla baseline aperta. Questo divario è la vera storia dei costi di questo confronto, ed è il motivo per cui la baseline manterrà il suo status predefinito per il lavoro batch in inglese ad alto volume per molto tempo. L'economia del modello gestito si allinea solo quando le funzionalità incluse — diarizzazione, formattazione, controllo del vocabolario — ti costerebbero tempo di ingegneria per assemblarle sopra Whisper.

Lingue e streaming

Whisper Large v3 Turbo elenca 99 lingue contro le 85+ di G​emini, ma la storia pratica del multilingue è diversa: Whisper trascrive tutte le 99 in un'unica passata senza rilevamento automatico, e la sua accuratezza degrada maggiormente sulle lingue a basse risorse e su quelle rumorose — il compromesso di un modello distillato. G​emini rileva automaticamente tra le sue 85+ e Go​ogle evidenzia accenti e dialetti regionali. Per lo streaming, Whisper non ha un modello nativo in tempo reale; le implementazioni in tempo reale usano faster-whisper e framework simili sulla propria infrastruttura, mentre Gemini 3.​5 Transcribe ha un endpoint live appositamente progettato con una latenza dichiarata sub-secondo e un prezzo all'altezza. Se il tuo carico di lavoro è live e multilingue, l'endpoint gestito è più semplice da operare; se è batch e in inglese, la baseline aperta è più economica.

Il verdetto, per quello che è

Whisper Large v3 Turbo rimane la scelta predefinita giusta per la trascrizione batch in inglese su larga scala, per qualsiasi cosa che debba girare sulla propria infrastruttura e per i team che vogliono un artefatto immutabile e verificabile. Gemini 3.​5 Transcribe è la scelta giusta quando la trascrizione deve essere più di semplici parole — etichette dei parlanti, formattazione pulita, vocabolario di dominio, copertura multilingue o un gancio per agenti — e quando si è disposti a pagare a consumo per queste funzionalità. I due coesistono, e il pattern che rende economica questa coesistenza è un confine di routing: il trascrittore adatto all'audio, poi il layer LLM che decide che fine fa il testo. Questo layer è ciò che OrcaRouter gestisce — una sola API su 200+ modelli, failover automatico tra provider e un DSL di routing per comporre più modelli in un'unica chiamata. Nessuno dei due modelli vocali è ospitato dalla nostra parte; la scelta della trascrizione è tra la tua GPU e il contatore di Go​ogle, ed entrambi ci saranno ancora per molto tempo.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube