
MAI-Transcribe-2-Streaming vs Gemini 3.5 Transcribe Live: stessi 9 $, compromesso diverso
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 221 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
MAI-Transcribe-2-Streaming e Gemini 3.5 Transcribe Live costano la stessa cifra e si basano su teorie opposte su a cosa serva un trascrittore in streaming. Entrambi si attestano su circa 9,00 $ ogni 1.000 minuti di audio in streaming. Il modello di Microsoft, rilasciato il 1° ottobre 2026, è uno strumento di precisione: un dichiarato tasso di errore sulle parole in streaming del 2,5% a 0,13 secondi dalla trascrizione finale, primo per accuratezza sia sulle trascrizioni finali sia su quelle parziali secondo quanto afferma Microsoft stessa, misurato con la metodologia di streaming di Artificial Analysis ma non ancora tracciato come riga su quella classifica. L'altro modello, in anteprima pubblica dal 26 agosto 2026 e servito tramite la Live API, è uno strumento di copertura: oltre 85 lingue con cambio di lingua a metà stream, un livello gratuito e un tasso di errore sulle parole in streaming del 4,00% a 0,40 secondi, il valore che Artificial Analysis misura per esso. Nessuno dei due è la scelta ovvia, e il motivo è che non competono davvero per lo stesso carico di lavoro.
Ecco il confronto diretto per come si leggono davvero i numeri — cifre dichiarate dal fornitore etichettate come tali, cifre del tracker attribuite, e le parti in cui un modello vince su una dimensione che l'altro non contesta affatto.
La versione su una riga
• Accuratezza e latenza — MAI-Transcribe-2-Streaming, sui numeri pubblicati. Microsoft dichiara un WER in streaming del 2,5% a 0,13 secondi per la trascrizione finale, primo per accuratezza sia sulle trascrizioni finali sia su quelle parziali, e del 2,5% sulla prima trascrizione parziale a 0,12 secondi. Di contro, Artificial Analysis ha Gemini 3.5 Transcribe Live al 4,00% a 0,40 secondi. Il vantaggio dichiarato da Microsoft è di 1,5 punti, con una stabilizzazione circa tre volte più rapida. Il caveat è che il tracker non ha ancora inserito nei propri grafici MAI-Transcribe-2-Streaming stesso — l'attuale leader della classifica è Grok Voice Transcribe 2.0 al 2,73% e 0,49 secondi, con Muse Voice Transcribe al 3,06% e 0,16 secondi — quindi il 2,5% è un dato del fornitore confrontato con un campo che il tracker misura effettivamente. Non è una differenza risicata sull'asse che entrambi i modelli pubblicano, ma solo un lato di esso è pubblicato in modo indipendente.
• Ampiezza linguistica — Gemini 3.5 Transcribe Live. Oltre 85 lingue con rilevamento automatico e la capacità di cambiare lingua a metà flusso senza riavviare la sessione, che è l'affermazione di punta di Google per la Live API. MAI-Transcribe-2-Streaming copre 60 lingue con rilevamento automatico e continuo della lingua. La base di Microsoft è più alta; il tetto di Google è più ampio, e il divario di 25 lingue riguarda principalmente lingue in cui un modello di streaming monolingua non è affatto utilizzabile.
• Forma della sessione — Gemini 3.5 Transcribe Live, e questo aspetto ha due facce. La Live API è una sessione WebSocket limitata a 10 minuti, il che va bene per un turno di un agente vocale ma è scomodo per una riunione di un'ora; Microsoft non pubblica alcun limite di sessione equivalente per il suo modello di streaming, il che conta se la tua unità di lavoro è una chiamata, non un turno conversazionale.
• Costo di ingresso — Gemini 3.5 Transcribe Live. Esiste un piano gratuito, e la tariffa combinata di Google equivale a circa 0,009 $ al minuto con il modello di prezzo basato su token. I 0,54 $ per ora audio di Microsoft sono una tariffa introduttiva che, secondo Microsoft, durerà fino alla fine dell'anno, senza che sia stato comunicato un prezzo standard — la stessa struttura del suo lancio batch di settembre.

Perché il divario di accuratezza è più grande di quanto sembri
Un divario di 1,5 punti nel tasso di errore sulle parole sembra una differenza di arrotondamento, finché non lo si quantifica in termini di costo. Con un WER in streaming del 4,00%, Gemini 3.5 Transcribe Live sbaglia circa 40 parole ogni 1.000; con il 2,5% dichiarato da Microsoft, MAI-Transcribe-2-Streaming ne sbaglia 25. Sui volumi che produce una pipeline in tempo reale — un'organizzazione di assistenza che gestisce 5.000 ore di chiamate al mese significa 300.000 minuti, più di 45 milioni di parole a un ritmo conversazionale — quella forbice si traduce in milioni di parole errate ogni anno, concentrate proprio nelle entità da cui dipendono i sistemi a valle: nomi di account, numeri di ticket, dosaggi, indirizzi.
La differenza di latenza è quella più difficile da vendere. 0,13 secondi contro 0,40 secondi dopo la fine del parlato è percepibile in un flusso di sottotitoli in tempo reale — sotto circa 0,2 secondi appare come simultaneo, e un terzo di secondo appare come la trascrizione che insegue chi parla — ma non è percepibile in un pannello di assistenza per agenti che si aggiorna su una scala temporale umana. Se il tuo consumatore è una persona che legge seguendo, il vantaggio di Microsoft sulla latenza è il prodotto. Se il tuo consumatore è un modello che riceve la trascrizione finale quando il turno termina, è un numero.
Entrambi i valori presentano lo stesso avvertimento, e vale la pena dirlo una volta: sono numeri di una singola esecuzione provenienti da una classifica di monitoraggio che comprende 37 modelli, e il divario tra il primo e il terzo posto in quella classifica è inferiore a un punto. Una nuova esecuzione può rimescolare le prime posizioni della classifica dello streaming in un modo che un divario di due punti nella classifica batch non può. Né tantomeno il 2,5% di Microsoft compare ancora nella classifica — è un dato dichiarato dal fornitore e misurato secondo la metodologia del tracker, che è cosa diversa da una riga pubblicata dal tracker.
I limiti sono dove risiede davvero la decisione.
I limiti delle funzionalità separano questi due più velocemente di quanto facciano i benchmark, e vanno in direzioni opposte.
Gemini 3.5 Transcribe Live presenta tre limiti documentati: un tetto di 10 minuti per sessione sull'API Live, nessuna diarizzazione degli speaker e nessun timestamp a livello di parola. Il primo è architetturale — lo streaming su una sessione WebSocket ha un limite per progettazione — e comporta che la trascrizione live di contenuti lunghi debba essere ricucita tra più sessioni, con la gestione delle giunture lasciata a te. Gli altri due sono assoluti: se il tuo prodotto deve attribuire il parlato a un interlocutore, oppure collocare una parola a un timestamp per la ricerca o la sincronizzazione dei sottotitoli, Gemini 3.5 Transcribe Live non lo fa a nessun prezzo.
I vincoli di MAI-Transcribe-2-Streaming sono meno documentati, il che è di per sé un'informazione. Microsoft non avanza alcuna affermazione sulla diarizzazione per il modello streaming né alcuna affermazione sui timestamp a livello di parola; il MAI-Transcribe-2 batch include la diarizzazione e restituisce timestamp a livello di parola, ma quello è il prodotto batch, e presumere che lo SKU streaming li erediti è esattamente il tipo di inferenza che il materiale di lancio serve a prevenire. Ciò che Microsoft afferma è 60 lingue con rilevamento continuo della lingua e posizionamento sulla frontiera di Pareto per accuratezza rispetto alla latenza — entrambe affermazioni del fornitore rispetto alle quali i dati del tracker sono coerenti.
Quindi la lettura onesta delle funzionalità è questa: nessuno dei due modelli di streaming pubblica la diarizzazione o i timestamp a livello di parola. Gemini 3.5 Transcribe Live ha un limite di sessione pubblicato e un livello gratuito; MAI-Transcribe-2-Streaming ha un numero di lingue pubblicato e nessun limite pubblicato. Se i tuoi requisiti includono la diarizzazione, nessuno dei due è la risposta e stai guardando a una trascrizione batch con uno strato di streaming avvitato davanti.
Cosa ti sta davvero dicendo la parità di prezzo
Che due fornitori arrivino allo stesso prezzo di 9 $ per 1.000 minuti partendo da direzioni opposte è il fatto più interessante di questo confronto. Google ci è arrivata tramite una tariffazione basata su token su una sessione Live API: audio in ingresso a 3,50 $ per milione di token, testo in uscita a 21 $ per milione, e un consumo approssimativo di 175 token di testo al minuto, che si traduce in circa 0,009 $ al minuto. Microsoft ci è arrivata indicando una tariffa fissa di 0,54 $ per ora di audio per un modello di una famiglia il cui modello gemello in batch viene offerto a 0,10 $. Il primo è una sessione in tempo reale a consumo; l'altro è una tariffa fissa al minuto con uno sconto introduttivo.
Queste strutture si comportano diversamente man mano che si scala. Una tariffa fissa è prevedibile e facile da preventivare; una sessione a consumo di token varia in base a quanto il modello risponde e a quanto a lungo la sessione resta aperta inattiva. Per una pipeline ad alto volume, la tariffa fissa è la fattura più favorevole; per un prototipo o una funzionalità a basso volume, il livello gratuito e la fatturazione per token sono l'ingresso più favorevole.

Ciò che nessuna delle due strutture cambia è lo strato sopra la trascrizione. Qualunque modello la produca, una trascrizione in tempo reale è input per riepilogo, classificazione, redazione e instradamento, e questi passaggi hanno le proprie curve di costo e qualità — di solito eseguiti su diversi modelli anziché su uno solo. È lo strato che OrcaRouter copre: un'unica API su oltre 200 modelli, prezzi di listino dei fornitori passati con markup dello 0%, failover automatico e un DSL di instradamento che può inviare una trascrizione verso modelli diversi in base al carico di lavoro. Né MAI-Transcribe-2-Streaming né Gemini 3.5 Transcribe Live figurano in quell'elenco — sono serviti rispettivamente attraverso gli stack vocali di Microsoft e Google — e il punto non è instradarli, ma mantenere portatile tutto ciò che sta a valle di essi.

Quale scegliere?
Scegli MAI-Transcribe-2-Streaming quando accuratezza e tempo di stabilizzazione sono il prodotto: sottotitoli dal vivo che una persona legge, punteggi di conformità o qualità in tempo reale in cui un'entità fraintesa ha un costo, o sessioni lunghe che il limite di 10 minuti di Gemini costringerebbe a cucire insieme. Scegli Gemini 3.5 Transcribe Live quando la copertura è il prodotto: un deployment globale su lingue che non puoi enumerare in anticipo, cambio di lingua a metà stream, o un prototipo in cui il livello gratuito e la fatturazione per token eliminano l'impegno. I team che hanno bisogno di entrambi non sono bloccati — le due sono API diverse con modelli di sessione diversi, e l'architettura onesta è instradare in base al carico di lavoro anziché standardizzare su una sola.
La conclusione da trarre da questo confronto non è che Microsoft abbia vinto. È che la trascrizione in streaming ha ora due credibili opzioni all'avanguardia con lo stesso prezzo, il che significa che la decisione si è spostata da "ciò che è disponibile" a "ciò di cui ha bisogno questo specifico carico di lavoro". È un problema migliore da avere.
Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
