Card hero dell'articolo con il testo «MAI-Transcribe-2-Streaming vs MAI-Transcribe-2», il badge «STESSA FAMIGLIA · DUE LIVELLI DI PREZZO» e il sottotitolo «Paghi 5,4 volte tanto per il timing a livello di parola», realizzata come due card con il nome del modello separate da un badge VS, con una striscia di chip che mostra 9,00 $ contro 1,67 $ per 1.000 minuti, un tasso di errore sulle parole dichiarato del 2,5% contro un 2,0% verificato, 0,13 s per la trascrizione finale contro circa 411 volte il tempo reale, e timestamp e diarizzazione solo sul livello batch, su un gradiente da bianco a blu con il logo OrcaRouter in basso a destra.
Guides & Insights

MAI-Transcribe-2-Streaming vs MAI-Transcribe-2: paghi 5,4× per la temporizzazione a livello di parola

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

MAI-Transcribe-2-Streaming e MAI-Transcribe-2 sono la stessa famiglia di modelli divisa in due fasce di prezzo, e la suddivisione è abbastanza netta da poter pianificare di conseguenza. MAI-Transcribe-2 è stato rilasciato il 3 settembre 2026 come modello batch: tasso di errore sulle parole del 2,0% nella classifica non-streaming di Artificial Analysis, circa 411× la velocità in tempo reale e 0,10 $ per ora audio — circa 1,67 $ per 1.000 minuti. MAI-Transcribe-2-Streaming è stato rilasciato il 1º ottobre 2026 come variante in tempo reale: un tasso di errore sulle parole in streaming dichiarato del 2,5% con 0,13 secondi per la trascrizione finale, che Microsoft descrive come primo per accuratezza sia sulle trascrizioni finali sia su quelle parziali, misurato secondo la metodologia di streaming di Artificial Analysis piuttosto che già tracciato come riga nella classifica del tracker. 0,54 $ per ora audio — circa 9,00 $ per 1.000 minuti. Stesse 60 lingue, stessa distribuzione solo tramite API, nessun peso pubblicato. Lo streaming costa 5,4× la tariffa batch e, secondo i dati di Microsoft, 0,5 punti di accuratezza. Se questo sia un affare o una tassa dipende interamente da una sola domanda: c'è qualcosa nella vostra pipeline che ha bisogno della trascrizione prima che la frase sia finita?

Poiché i due modelli provengono da un unico fornitore e da un'unica superficie di documentazione, il confronto è insolitamente pulito — niente congetture sulla parità di funzionalità, nessun disallineamento tra versioni dei benchmark, nessun "i loro numeri contro i nostri". È un unico fornitore che applica prezzi a due velocità della stessa capacità, e il lavoro interessante consiste nel capire quali carichi di lavoro copre effettivamente il livello economico.

La famiglia, su due file

• MAI-Transcribe-2 — batch, audio preregistrato, rilasciato il 3 settembre. 2,0% AA-WER, secondo nella classifica non-streaming di Artificial Analysis. Circa 214× in tempo reale, inoltre. 0,10 $ per ora di audio, circa 1,67 $ per 1.000 minuti, come offerta a tempo limitato fino alla fine dell'anno senza alcun prezzo standard pubblicato. Include la diarizzazione degli speaker e i timestamp a livello di parola. 60 con identificazione automatica della lingua.

• MAI-Transcribe-2-Streaming — trascrizione continua in tempo reale, in stile WebSocket, rilasciata il 1º ottobre 2026. Microsoft riporta un WER del 2,5% sulla trascrizione finale a 0,13 secondi dalla fine del parlato, e lo stesso 2,5% sul primo parziale a 0,12 secondi, che descrive come primo per accuratezza su entrambi — un'affermazione del fornitore misurata sulla metodologia di streaming di Artificial Analysis, sebbene al momento della stesura la board del tracker stesso (37 modelli) non abbia ancora inserito il modello, e il suo attuale leader è Grok Voice Transcribe 2.0 con 2,73% e 0,49 secondi. 0,54 $ per ora audio, circa 9,00 $ per 1.000 minuti, prezzo introduttivo fino a fine anno. 60 lingue con rilevamento automatico e continuo della lingua. Nessuna dichiarazione pubblicata sulla diarizzazione, nessuna dichiarazione pubblicata sui timestamp delle parole.

L'unica asimmetria che non riguarda la velocità o il prezzo è la capacità: la diarizzazione e i timestamp a livello di parola del modello batch sono funzionalità documentate, mentre quelle del modello streaming non lo sono. Questo conta più del divario di accuratezza di 0,5 punti, ed è il motivo per cui molti team finiranno per eseguirli entrambi.

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2-Streaming dated October 1, 2026, headlined 'Our first streaming transcription model debuts at no. 1 on Artificial Analysis' and introducing the MAI-Transcribe and MAI-Voice models, with the companion MAI-Voice-2.1 and MAI-Voice-2.1-Flash announcements from the same release.

Cosa ti dà davvero 5,4×

A 1,67 $ per 1.000 minuti, la trascrizione batch a questo livello di accuratezza è quasi gratuita al margine. A 9,00 $ per 1.000 minuti, lo streaming è una vera voce di costo — all'incirca il costo dello stesso audio trascritto cinque volte, più mezzo punto di accuratezza. Quindi la domanda non è se il tempo reale valga di più; è quali minuti specifici ne hanno bisogno.

I carichi di lavoro in cui è chiaramente così: i sottotitoli in tempo reale che una persona legge mentre l'oratore parla, dove 0,13 secondi rispetto alla fine del file rappresentano l'intero prodotto; l'assistenza in tempo reale agli agenti e il punteggio di conformità, dove un intervento che arriva dopo la fine della chiamata è inutile; e le applicazioni vocali interattive, dove un turno non può concludersi finché non si conclude la trascrizione. In tutti e tre, il modello batch non è un'opzione più economica, è una non-opzione — non esiste un prezzo al quale la trascrizione post-hoc diventi in tempo reale.

I carichi di lavoro in cui chiaramente non lo è: registrazioni di riunioni e chiamate elaborate a posteriori, archivi multimediali, controllo qualità in batch dei contact center, revisione di conformità delle chiamate completate, sottotitolazione di podcast e video. Sono esattamente le pipeline per cui il 411× rispetto al tempo reale e la tariffa di 1,67 $ del modello batch sono stati pensati per vincere, e pagare 5,4× per ridurre di qualche centinaio di millisecondi una trascrizione che nessuno leggerà fino a domani è uno spreco bello e buono. Aggiungi le funzionalità di diarizzazione e timestamp a livello di parola — il modello batch le ha documentate, il modello streaming no — e la tesi post-hoc si rafforza, non si indebolisce.

La via di mezzo interessante è dove i due sono davvero complementari: usare lo streaming per la superficie live e il batch per la registrazione. Una chiamata di supporto trascritta in tempo reale per alimentare un pannello di assistenza all'agente, poi ritrascritta in batch durante la notte per produrre la trascrizione archivistica con diarizzazione e timestamp, costa un piccolo sovrapprezzo rispetto al solo batch e offre entrambi i comportamenti. Questo modello è diventato possibile solo a settembre, e il rilascio di ottobre è ciò che lo completa.

Dove emerge la struttura a due divisioni

Due cose di questa famiglia meritano di essere notate, perché sono strutturali e non incidentali.

Innanzitutto, la gerarchia dell'accuratezza è invertita rispetto al solito schema. I modelli di streaming di norma pagano un sostanziale prezzo in accuratezza per l'output in tempo reale; qui il prezzo è di 0,5 punti, dal 2,0% sulla classifica batch a un dichiarato 2,5% su quella streaming. Microsoft ha ottenuto un modello in tempo reale entro mezzo punto dal suo modello di punta batch secondo i suoi stessi numeri, il che è il vero risultato ingegneristico del rilascio di ottobre se regge — non il posizionamento in cima alla classifica, che una buona ripetizione dei test potrebbe spostare e che il tracker non ha ancora confermato.

In secondo luogo, anche la struttura dei prezzi è invertita rispetto allo schema abituale. I fornitori in genere scontano la fascia a volume più elevato; Microsoft ha fissato il prezzo dello streaming a 5,4 volte quello del batch e ha lasciato entrambi su tariffe introduttive che scadono contemporaneamente. Questo appare meno come un sovrapprezzo intenzionale per lo streaming e più come due lanci separati, ciascuno con uno sconto di lancio, senza una tariffa standard pubblicata per nessuno dei due. I team che pianificano un budget per il 2027 dovrebbero considerare entrambi i numeri come provvisori: sia 1,67 $ sia 9,00 $ sono etichettati come a tempo limitato, e per nessuno dei due è stato annunciato un prezzo successivo.

A generated two-column scoreboard card titled 'One family, two divisions' contrasting MAI-Transcribe-2 (batch) — non-streaming, 2.0% AA-WER at #2, roughly 411x real time at #2, $1.67 per 1,000 minutes ($0.10 per audio-hour), bundled diarization, returned word timestamps, 60 languages with automatic ID, released September 3, 2026 — with MAI-Transcribe-2-Streaming — streaming, 2.5% claimed word error rate, 0.13s to final transcript, $9.00 per 1,000 minutes ($0.54 per audio-hour), diarization not published, word timestamps not published, 60 languages with continuous detection, released October 1, 2026, with the OrcaRouter logo bottom right.

Cosa non è ancora stato dimostrato?

Le questioni aperte del modello batch risalenti a settembre restano aperte: nessun tasso di errore di diarizzazione pubblicato, nessuna ripartizione per lingua a sostegno dell'affermazione sulle 60 lingue e un prezzo promozionale senza un successore nominato. Il modello streaming ne aggiunge un'altra, specifica del lavoro in tempo reale: il WER in streaming viene misurato su audio pulito, e la qualità della trascrizione parziale in uno stream far-field rumoroso è la modalità di fallimento che conta di più in fase di deployment e che è meno coperta dal materiale di lancio. Eredita anche la vicinanza della classifica dello streaming: i primi tre nella classifica di 37 modelli del tracker sono entro una frazione di punto, quindi "primo" è uno stato che una nuova esecuzione può cambiare — e il primo posto di Microsoft è un'affermazione più che una riga.

La questione a livello di famiglia è però quella da tenere d'occhio. Microsoft ora vende la stessa funzionalità a due prezzi che distano cinque volte l'uno dall'altro, con il livello costoso privo di due funzionalità che quello economico documenta. Se la diarizzazione e i timestamp delle parole arrivano sullo SKU in streaming, il divario si riduce a un puro compromesso tra latenza e prezzo, che è una decisione molto più semplice. Se non arrivano, la struttura a due divisioni è permanente e le architetture dovrebbero essere costruite attorno ad essa.

Dove questo lascia uno stack di trascrizione

A generated routing card titled 'Which minutes go on which tier' splitting workloads into a streaming column (live captions a person reads while the speaker talks, real-time agent assist, compliance or quality scoring that must land before the call ends, interactive voice turns) and a batch column (meeting and call recordings processed after the fact, media archives, contact-centre batch QA, podcast and video captioning, anything needing bundled diarization or word-level timestamps), with a note that a stream-and-reprocess pattern covers both and a footer stating that neither tier is on OrcaRouter and both are served through Microsoft's own speech stack, with the OrcaRouter logo bottom right.

Il risultato pratico è che a settembre la trascrizione ha smesso di essere una singola voce e a ottobre è diventata una decisione di instradamento. Una pipeline che prima si uniformava su una sola API ora vuole lo streaming per la superficie live, il batch per la registrazione e una regola per stabilire quale audio segua quale percorso — e quella regola è essa stessa un problema di instradamento, una quantità di complessità davvero strana da far ricadere nel ciclo di rilascio di un solo fornitore.

È su ciò che sta sopra la trascrizione che l'impatto è più pesante. Qualunque livello produca il testo, quel testo viene poi riassunto, classificato, oscurato e instradato, e queste fasi girano su modelli linguistici con profili di latenza e costo propri: una trascrizione dal vivo vuole un modello veloce ed economico, una archivistica può permettersi uno più potente. OrcaRouter copre esattamente quello strato: un'unica API su oltre 200 modelli, prezzi di listino dei provider passati con 0% di ricarico, failover automatico e un DSL di routing che seleziona un modello per carico di lavoro anziché per pipeline. Né MAI-Transcribe-2-Streaming né MAI-Transcribe-2 figurano in quell'elenco — entrambi sono serviti tramite lo stack vocale di Microsoft — ma uno strato di trascrizione a due divisioni è l'argomento più forte finora per mantenere portabile tutto ciò che sta a valle di esso.

Il riassunto onesto: lo streaming non è un MAI-Transcribe-2 migliore, è un secondo prodotto a un secondo prezzo. Acquistalo per i minuti che richiedono davvero il tempo reale, lascia il resto sulla fascia economica e prevedi nel budget che entrambe le tariffe verranno riprezzate quando termina il periodo introduttivo.