
Gemini 3.5 Transcribe vs Whisper Large v3 Turbo: il baseline va sostituito?
- AlibabaNUOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.3 Flash2026-08-2658Intelligenza72Codice
- DeepSeekNUOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianNUOVOQwen3.8 27B2026-08-1552Intelligenza68Codice
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
Whisper Large v3 Turbo è il modello a cui l'espressione «speech-to-text» rimanda di default per gran parte dell'industria, e Gemini 3.5 Transcribe è il primo modello di trascrizione di Google esplicitamente venduto come sfidante di quel punto di riferimento piuttosto che come una generica API di riconoscimento vocale. Gemini 3.5 Transcribe, in anteprima pubblica dal 26 agosto 2026, ridefinisce la trascrizione come un compito di ragionamento: risolve le autocorrezioni, formatta l'output, attribuisce i parlanti e chiama autonomamente altri modelli Gemini. Whisper Large v3 Turbo è la versione distillata da 809 milioni di parametri di Whisper Large-v3 di OpenAI, con licenza MIT, auto-ospitabile, in 99 lingue, e all'incirca da quattro a otto volte più veloce del modello da cui è stata derivata, a seconda dell'hardware. Il primo è uno strato di intelligenza gestito che agisce sull'audio; il secondo è un componente libero e ben compreso che puoi eseguire dove vuoi. La domanda a cui questa pagina serve a rispondere è più ristretta e più utile di «quale sia meglio»: quando il punto di riferimento smette di essere abbastanza buono?
La baseline, nel caso avessi dimenticato quanto è buona.
Whisper Large v3 Turbo merita il suo stato predefinito, quindi il caso a suo favore viene per primo:
• Funziona ovunque — licenza MIT, pesi aperti, installabile su un laptop, una singola GPU o una funzione serverless. Nessun fornitore, nessun contatore, nessun dato che lascia la tua rete.
• È veloce — il decoder distillato (32 layer encoder, 4 layer decoder, rispetto ai 32 originali) lo rende circa quattro volte più veloce di Whisper Large-v3 su hardware tipico, e ancora di più su alcuni, mantenendo gran parte della sua accuratezza. La stessa OpenAI riporta circa otto volte su un A100.
• Copre 99 lingue per la trascrizione, un elenco più ampio rispetto agli 85+ di Gemini 3.5 Transcribe.
La sua accuratezza è ben documentata: 2,1% WER su LibriSpeech test-clean, 4,2% su test-other, 9,1% su Common Voice English — numeri che sono stati replicati in tutta la comunità per anni.
• L'ecosistema è enorme — faster-whisper, whisper.cpp, esportazioni ONNX e ogni framework di inferenza che già usi. Se riesci a eseguire un modello, puoi eseguire anche questo.

Per la trascrizione batch in inglese e quasi-inglese su larga scala, Whisper Large v3 Turbo è il punto di riferimento per ragioni strutturali che nessun divario nei benchmark può facilmente ribaltare: è gratuito, è tuo, ed è ovunque.

Cosa aggiunge in più Gemini 3.5 Transcribe
Il valore del challenger gestito non è che supera il baseline sull'inglese pulito — è una battaglia che i numeri non possono ancora risolvere chiaramente. Il suo valore è il lavoro che avviene al di sopra delle parole, che Whisper esplicitamente non fa:
• Attribuzione del parlante — fino a tre parlanti con timestamp a livello di parola, nel modello base. Whisper trascrive un unico flusso vocale; non ha alcun concetto di chi abbia detto cosa.
• Formattazione intelligente — disfluenze rimosse, autocorrezioni risolte, punteggiatura e maiuscole applicate. Whisper restituisce le parole così come pronunciate, compresi gli "ehm".
• Vocabolario personalizzato — tendenza verso gergo e grafie insolite. Whisper non ha un meccanismo simile; si deve ricorrere a post-processing o fine-tuning.
• Chiamata di funzioni — la trascrizione può essere passata ad altri modelli Gemini, rendendo la trascrizione un passaggio in una pipeline di agenti piuttosto che l'output finale.
• Sessioni lunghe — circa un'ora di audio in un'unica passata (contesto da 96K riportato dalla stampa) contro la necessità pratica di Whisper di dividere in blocchi e ricucire file lunghi.
Questo è un prodotto diverso. È ciò che Google intende per "trascrizione intelligente", ed è la parte del confronto che non dipende dall'aritmetica dei benchmark.
La questione dell'accuratezza a cui nessuno può ancora rispondere chiaramente.
I numeri di punta dei due modelli in realtà non si affrontano. Il WER non-streaming del 2,6% di {{1}}Gemini 3.5 Transcribe{{/1}} è una misurazione di Artificial Analysis citata da {{2}}Google{{/2}}, calcolata su oltre 85 lingue. Il 2,1% di {{3}}Whisper Large v3 Turbo{{/3}} su LibriSpeech test-clean è un benchmark inglese tratto dal paper sulla distillazione di {{4}}OpenAI{{/4}} stessa, ampiamente replicato. Corpora diversi, copertura linguistica diversa, fornitori diversi. Quello che si può dire con onestà: sull'inglese pulito, la baseline open e il modello contendente gestito si collocano plausibilmente sullo stesso livello, e il vantaggio del modello gestito risiede nelle sue caratteristiche multilingue e strutturali, non in una vittoria dimostrata sul WER inglese. I materiali di lancio di {{5}}Google{{/5}} non contengono alcun confronto testa a testa con i modelli della famiglia Whisper, e non esiste ancora un confronto avversariale indipendente perché {{6}}Gemini 3.5 Transcribe{{/6}} è pubblico solo da un giorno. Finché non ne appare uno, la corona dell'accuratezza rimane non rivendicata, e qualsiasi articolo — incluso questo — che dichiara un vincitore del WER sulla base di queste due cifre sta esagerando.

Costo: gratuito da eseguire rispetto a $0,005 al minuto
Whisper Large v3 Turbo ha un costo hardware e nessun contatore. Se lo esegui su una GPU che già possiedi, il costo marginale per minuto trascritto è quasi zero; se noleggi una GPU, il costo è quello dell'istanza mentre è in funzione. Gemini 3.5 Transcribe addebita circa $0,005 per minuto di audio in tariffa mista, con la SKU live a circa $0,009 al minuto e una fascia gratuita. Con mille ore di audio, si parla di circa $300 sul contatore di Gemini contro pochi dollari di tempo GPU sulla baseline aperta. Questo divario è la vera storia dei costi di questo confronto, ed è il motivo per cui la baseline manterrà il suo status predefinito per il lavoro batch in inglese ad alto volume per molto tempo. L'economia del modello gestito si allinea solo quando le funzionalità incluse — diarizzazione, formattazione, controllo del vocabolario — ti costerebbero tempo di ingegneria per assemblarle sopra Whisper.
Lingue e streaming
Whisper Large v3 Turbo elenca 99 lingue contro le 85+ di Gemini, ma la storia pratica del multilingue è diversa: Whisper trascrive tutte le 99 in un'unica passata senza rilevamento automatico, e la sua accuratezza degrada maggiormente sulle lingue a basse risorse e su quelle rumorose — il compromesso di un modello distillato. Gemini rileva automaticamente tra le sue 85+ e Google evidenzia accenti e dialetti regionali. Per lo streaming, Whisper non ha un modello nativo in tempo reale; le implementazioni in tempo reale usano faster-whisper e framework simili sulla propria infrastruttura, mentre Gemini 3.5 Transcribe ha un endpoint live appositamente progettato con una latenza dichiarata sub-secondo e un prezzo all'altezza. Se il tuo carico di lavoro è live e multilingue, l'endpoint gestito è più semplice da operare; se è batch e in inglese, la baseline aperta è più economica.
Il verdetto, per quello che è
Whisper Large v3 Turbo rimane la scelta predefinita giusta per la trascrizione batch in inglese su larga scala, per qualsiasi cosa che debba girare sulla propria infrastruttura e per i team che vogliono un artefatto immutabile e verificabile. Gemini 3.5 Transcribe è la scelta giusta quando la trascrizione deve essere più di semplici parole — etichette dei parlanti, formattazione pulita, vocabolario di dominio, copertura multilingue o un gancio per agenti — e quando si è disposti a pagare a consumo per queste funzionalità. I due coesistono, e il pattern che rende economica questa coesistenza è un confine di routing: il trascrittore adatto all'audio, poi il layer LLM che decide che fine fa il testo. Questo layer è ciò che OrcaRouter gestisce — una sola API su 200+ modelli, failover automatico tra provider e un DSL di routing per comporre più modelli in un'unica chiamata. Nessuno dei due modelli vocali è ospitato dalla nostra parte; la scelta della trascrizione è tra la tua GPU e il contatore di Google, ed entrambi ci saranno ancora per molto tempo.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
