Scheda hero dell'articolo con scritto 'MAI-Transcribe-2-Streaming vs Gemini 3.5 Transcribe Live', con il badge 'TESTA A TESTA · TRASCRIZIONE VOCALE IN STREAMING' e il sottotitolo 'Stesso $9, compromesso diverso', con chip che mostrano 2,5% dichiarato contro 4,00% verificato, 0,13 s contro 0,40 s al finale, 60 lingue contro 85+ e nessuna diarizzazione pubblicata su entrambi, su un gradiente dal bianco al blu con il logo OrcaRouter in basso a destra.
Guides & Insights

MAI-Transcribe-2-Streaming vs Gemini 3.5 Transcribe Live: stessi 9 $, compromesso diverso

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

MAI-Transcribe-2-Streaming e Gemini 3.5 Transcribe Live costano la stessa cifra e si basano su teorie opposte su a cosa serva un trascrittore in streaming. Entrambi si attestano su circa 9,00 $ ogni 1.000 minuti di audio in streaming. Il modello di Microsoft, rilasciato il 1° ottobre 2026, è uno strumento di precisione: un dichiarato tasso di errore sulle parole in streaming del 2,5% a 0,13 secondi dalla trascrizione finale, primo per accuratezza sia sulle trascrizioni finali sia su quelle parziali secondo quanto afferma Microsoft stessa, misurato con la metodologia di streaming di Artificial Analysis ma non ancora tracciato come riga su quella classifica. L'altro modello, in anteprima pubblica dal 26 agosto 2026 e servito tramite la Live API, è uno strumento di copertura: oltre 85 lingue con cambio di lingua a metà stream, un livello gratuito e un tasso di errore sulle parole in streaming del 4,00% a 0,40 secondi, il valore che Artificial Analysis misura per esso. Nessuno dei due è la scelta ovvia, e il motivo è che non competono davvero per lo stesso carico di lavoro.

Ecco il confronto diretto per come si leggono davvero i numeri — cifre dichiarate dal fornitore etichettate come tali, cifre del tracker attribuite, e le parti in cui un modello vince su una dimensione che l'altro non contesta affatto.

La versione su una riga

• Accuratezza e latenza — MAI-Transcribe-2-Streaming, sui numeri pubblicati. Microsoft dichiara un WER in streaming del 2,5% a 0,13 secondi per la trascrizione finale, primo per accuratezza sia sulle trascrizioni finali sia su quelle parziali, e del 2,5% sulla prima trascrizione parziale a 0,12 secondi. Di contro, Artificial Analysis ha Gemini 3.5 Transcribe Live al 4,00% a 0,40 secondi. Il vantaggio dichiarato da Microsoft è di 1,5 punti, con una stabilizzazione circa tre volte più rapida. Il caveat è che il tracker non ha ancora inserito nei propri grafici MAI-Transcribe-2-Streaming stesso — l'attuale leader della classifica è Grok Voice Transcribe 2.0 al 2,73% e 0,49 secondi, con Muse Voice Transcribe al 3,06% e 0,16 secondi — quindi il 2,5% è un dato del fornitore confrontato con un campo che il tracker misura effettivamente. Non è una differenza risicata sull'asse che entrambi i modelli pubblicano, ma solo un lato di esso è pubblicato in modo indipendente.

• Ampiezza linguistica — Gemini 3.5 Transcribe Live. Oltre 85 lingue con rilevamento automatico e la capacità di cambiare lingua a metà flusso senza riavviare la sessione, che è l'affermazione di punta di Google per la Live API. MAI-Transcribe-2-Streaming copre 60 lingue con rilevamento automatico e continuo della lingua. La base di Microsoft è più alta; il tetto di Google è più ampio, e il divario di 25 lingue riguarda principalmente lingue in cui un modello di streaming monolingua non è affatto utilizzabile.

• Forma della sessione — Gemini 3.5 Transcribe Live, e questo aspetto ha due facce. La Live API è una sessione WebSocket limitata a 10 minuti, il che va bene per un turno di un agente vocale ma è scomodo per una riunione di un'ora; Microsoft non pubblica alcun limite di sessione equivalente per il suo modello di streaming, il che conta se la tua unità di lavoro è una chiamata, non un turno conversazionale.

• Costo di ingresso — Gemini 3.5 Transcribe Live. Esiste un piano gratuito, e la tariffa combinata di Google equivale a circa 0,009 $ al minuto con il modello di prezzo basato su token. I 0,54 $ per ora audio di Microsoft sono una tariffa introduttiva che, secondo Microsoft, durerà fino alla fine dell'anno, senza che sia stato comunicato un prezzo standard — la stessa struttura del suo lancio batch di settembre.

Screenshot of the Artificial Analysis Speech-to-Text leaderboard page showing the AA-WER Streaming Index chart, which plots final-transcript word error rate against time to final transcription after end of speech across the streaming field; MAI-Transcribe-2-Streaming does not appear on the chart.

Perché il divario di accuratezza è più grande di quanto sembri

Un divario di 1,5 punti nel tasso di errore sulle parole sembra una differenza di arrotondamento, finché non lo si quantifica in termini di costo. Con un WER in streaming del 4,00%, Gemini 3.5 Transcribe Live sbaglia circa 40 parole ogni 1.000; con il 2,5% dichiarato da Microsoft, MAI-Transcribe-2-Streaming ne sbaglia 25. Sui volumi che produce una pipeline in tempo reale — un'organizzazione di assistenza che gestisce 5.000 ore di chiamate al mese significa 300.000 minuti, più di 45 milioni di parole a un ritmo conversazionale — quella forbice si traduce in milioni di parole errate ogni anno, concentrate proprio nelle entità da cui dipendono i sistemi a valle: nomi di account, numeri di ticket, dosaggi, indirizzi.

La differenza di latenza è quella più difficile da vendere. 0,13 secondi contro 0,40 secondi dopo la fine del parlato è percepibile in un flusso di sottotitoli in tempo reale — sotto circa 0,2 secondi appare come simultaneo, e un terzo di secondo appare come la trascrizione che insegue chi parla — ma non è percepibile in un pannello di assistenza per agenti che si aggiorna su una scala temporale umana. Se il tuo consumatore è una persona che legge seguendo, il vantaggio di Microsoft sulla latenza è il prodotto. Se il tuo consumatore è un modello che riceve la trascrizione finale quando il turno termina, è un numero.

Entrambi i valori presentano lo stesso avvertimento, e vale la pena dirlo una volta: sono numeri di una singola esecuzione provenienti da una classifica di monitoraggio che comprende 37 modelli, e il divario tra il primo e il terzo posto in quella classifica è inferiore a un punto. Una nuova esecuzione può rimescolare le prime posizioni della classifica dello streaming in un modo che un divario di due punti nella classifica batch non può. Né tantomeno il 2,5% di Microsoft compare ancora nella classifica — è un dato dichiarato dal fornitore e misurato secondo la metodologia del tracker, che è cosa diversa da una riga pubblicata dal tracker.

I limiti sono dove risiede davvero la decisione.

I limiti delle funzionalità separano questi due più velocemente di quanto facciano i benchmark, e vanno in direzioni opposte.

Gemini 3.5 Transcribe Live presenta tre limiti documentati: un tetto di 10 minuti per sessione sull'API Live, nessuna diarizzazione degli speaker e nessun timestamp a livello di parola. Il primo è architetturale — lo streaming su una sessione WebSocket ha un limite per progettazione — e comporta che la trascrizione live di contenuti lunghi debba essere ricucita tra più sessioni, con la gestione delle giunture lasciata a te. Gli altri due sono assoluti: se il tuo prodotto deve attribuire il parlato a un interlocutore, oppure collocare una parola a un timestamp per la ricerca o la sincronizzazione dei sottotitoli, Gemini 3.5 Transcribe Live non lo fa a nessun prezzo.

I vincoli di MAI-Transcribe-2-Streaming sono meno documentati, il che è di per sé un'informazione. Microsoft non avanza alcuna affermazione sulla diarizzazione per il modello streaming né alcuna affermazione sui timestamp a livello di parola; il MAI-Transcribe-2 batch include la diarizzazione e restituisce timestamp a livello di parola, ma quello è il prodotto batch, e presumere che lo SKU streaming li erediti è esattamente il tipo di inferenza che il materiale di lancio serve a prevenire. Ciò che Microsoft afferma è 60 lingue con rilevamento continuo della lingua e posizionamento sulla frontiera di Pareto per accuratezza rispetto alla latenza — entrambe affermazioni del fornitore rispetto alle quali i dati del tracker sono coerenti.

Quindi la lettura onesta delle funzionalità è questa: nessuno dei due modelli di streaming pubblica la diarizzazione o i timestamp a livello di parola. Gemini 3.5 Transcribe Live ha un limite di sessione pubblicato e un livello gratuito; MAI-Transcribe-2-Streaming ha un numero di lingue pubblicato e nessun limite pubblicato. Se i tuoi requisiti includono la diarizzazione, nessuno dei due è la risposta e stai guardando a una trascrizione batch con uno strato di streaming avvitato davanti.

Cosa ti sta davvero dicendo la parità di prezzo

Che due fornitori arrivino allo stesso prezzo di 9 $ per 1.000 minuti partendo da direzioni opposte è il fatto più interessante di questo confronto. Google ci è arrivata tramite una tariffazione basata su token su una sessione Live API: audio in ingresso a 3,50 $ per milione di token, testo in uscita a 21 $ per milione, e un consumo approssimativo di 175 token di testo al minuto, che si traduce in circa 0,009 $ al minuto. Microsoft ci è arrivata indicando una tariffa fissa di 0,54 $ per ora di audio per un modello di una famiglia il cui modello gemello in batch viene offerto a 0,10 $. Il primo è una sessione in tempo reale a consumo; l'altro è una tariffa fissa al minuto con uno sconto introduttivo.

Queste strutture si comportano diversamente man mano che si scala. Una tariffa fissa è prevedibile e facile da preventivare; una sessione a consumo di token varia in base a quanto il modello risponde e a quanto a lungo la sessione resta aperta inattiva. Per una pipeline ad alto volume, la tariffa fissa è la fattura più favorevole; per un prototipo o una funzionalità a basso volume, il livello gratuito e la fatturazione per token sono l'ingresso più favorevole.

A generated bar-comparison card titled 'Two routes to $9.00 per 1,000 minutes' showing MAI-Transcribe-2-Streaming at a flat $0.54 per audio-hour introductory rate and Gemini 3.5 Transcribe Live at roughly $0.009 per minute blended from token pricing, both at $9.00, with MAI-Transcribe-2 (batch sibling) at $1.67, and a note that neither streaming rate has an announced post-promotional successor and that Gemini's blended figure uses $3.50 per million audio-in and $21 per million text-out at about 175 text tokens per minute, with the OrcaRouter logo bottom right.

Ciò che nessuna delle due strutture cambia è lo strato sopra la trascrizione. Qualunque modello la produca, una trascrizione in tempo reale è input per riepilogo, classificazione, redazione e instradamento, e questi passaggi hanno le proprie curve di costo e qualità — di solito eseguiti su diversi modelli anziché su uno solo. È lo strato che OrcaRouter copre: un'unica API su oltre 200 modelli, prezzi di listino dei fornitori passati con markup dello 0%, failover automatico e un DSL di instradamento che può inviare una trascrizione verso modelli diversi in base al carico di lavoro. Né MAI-Transcribe-2-Streaming né Gemini 3.5 Transcribe Live figurano in quell'elenco — sono serviti rispettivamente attraverso gli stack vocali di Microsoft e Google — e il punto non è instradarli, ma mantenere portatile tutto ciò che sta a valle di essi.

A generated three-axis comparison card titled 'Streaming speech-to-text, on three axes' contrasting MAI-Transcribe-2-Streaming (2.5% streaming WER as a claim, 0.13s to final, 60 languages with automatic detection, no published session cap, diarization not published, word timestamps not published, $9.00 per 1,000 minutes introductory) with Gemini 3.5 Transcribe Live (4.00% streaming WER per Artificial Analysis, 0.40s to final, 85+ languages with mid-stream switching, a 10-minute session cap on the Live API, no diarization, no word timestamps, no session cap published), with the OrcaRouter logo bottom right.

Quale scegliere?

Scegli MAI-Transcribe-2-Streaming quando accuratezza e tempo di stabilizzazione sono il prodotto: sottotitoli dal vivo che una persona legge, punteggi di conformità o qualità in tempo reale in cui un'entità fraintesa ha un costo, o sessioni lunghe che il limite di 10 minuti di Gemini costringerebbe a cucire insieme. Scegli Gemini 3.5 Transcribe Live quando la copertura è il prodotto: un deployment globale su lingue che non puoi enumerare in anticipo, cambio di lingua a metà stream, o un prototipo in cui il livello gratuito e la fatturazione per token eliminano l'impegno. I team che hanno bisogno di entrambi non sono bloccati — le due sono API diverse con modelli di sessione diversi, e l'architettura onesta è instradare in base al carico di lavoro anziché standardizzare su una sola.

La conclusione da trarre da questo confronto non è che Microsoft abbia vinto. È che la trascrizione in streaming ha ora due credibili opzioni all'avanguardia con lo stesso prezzo, il che significa che la decisione si è spostata da "ciò che è disponibile" a "ciò di cui ha bisogno questo specifico carico di lavoro". È un problema migliore da avere.

Confrontati in questo articolo2

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno