
MAI-Transcribe-2-Streaming vs MAI-Transcribe-2: paghi 5,4× per la temporizzazione a livello di parola
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 221 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
MAI-Transcribe-2-Streaming e MAI-Transcribe-2 sono la stessa famiglia di modelli divisa in due fasce di prezzo, e la suddivisione è abbastanza netta da poter pianificare di conseguenza. MAI-Transcribe-2 è stato rilasciato il 3 settembre 2026 come modello batch: tasso di errore sulle parole del 2,0% nella classifica non-streaming di Artificial Analysis, circa 411× la velocità in tempo reale e 0,10 $ per ora audio — circa 1,67 $ per 1.000 minuti. MAI-Transcribe-2-Streaming è stato rilasciato il 1º ottobre 2026 come variante in tempo reale: un tasso di errore sulle parole in streaming dichiarato del 2,5% con 0,13 secondi per la trascrizione finale, che Microsoft descrive come primo per accuratezza sia sulle trascrizioni finali sia su quelle parziali, misurato secondo la metodologia di streaming di Artificial Analysis piuttosto che già tracciato come riga nella classifica del tracker. 0,54 $ per ora audio — circa 9,00 $ per 1.000 minuti. Stesse 60 lingue, stessa distribuzione solo tramite API, nessun peso pubblicato. Lo streaming costa 5,4× la tariffa batch e, secondo i dati di Microsoft, 0,5 punti di accuratezza. Se questo sia un affare o una tassa dipende interamente da una sola domanda: c'è qualcosa nella vostra pipeline che ha bisogno della trascrizione prima che la frase sia finita?
Poiché i due modelli provengono da un unico fornitore e da un'unica superficie di documentazione, il confronto è insolitamente pulito — niente congetture sulla parità di funzionalità, nessun disallineamento tra versioni dei benchmark, nessun "i loro numeri contro i nostri". È un unico fornitore che applica prezzi a due velocità della stessa capacità, e il lavoro interessante consiste nel capire quali carichi di lavoro copre effettivamente il livello economico.
La famiglia, su due file
• MAI-Transcribe-2 — batch, audio preregistrato, rilasciato il 3 settembre. 2,0% AA-WER, secondo nella classifica non-streaming di Artificial Analysis. Circa 214× in tempo reale, inoltre. 0,10 $ per ora di audio, circa 1,67 $ per 1.000 minuti, come offerta a tempo limitato fino alla fine dell'anno senza alcun prezzo standard pubblicato. Include la diarizzazione degli speaker e i timestamp a livello di parola. 60 con identificazione automatica della lingua.
• MAI-Transcribe-2-Streaming — trascrizione continua in tempo reale, in stile WebSocket, rilasciata il 1º ottobre 2026. Microsoft riporta un WER del 2,5% sulla trascrizione finale a 0,13 secondi dalla fine del parlato, e lo stesso 2,5% sul primo parziale a 0,12 secondi, che descrive come primo per accuratezza su entrambi — un'affermazione del fornitore misurata sulla metodologia di streaming di Artificial Analysis, sebbene al momento della stesura la board del tracker stesso (37 modelli) non abbia ancora inserito il modello, e il suo attuale leader è Grok Voice Transcribe 2.0 con 2,73% e 0,49 secondi. 0,54 $ per ora audio, circa 9,00 $ per 1.000 minuti, prezzo introduttivo fino a fine anno. 60 lingue con rilevamento automatico e continuo della lingua. Nessuna dichiarazione pubblicata sulla diarizzazione, nessuna dichiarazione pubblicata sui timestamp delle parole.
L'unica asimmetria che non riguarda la velocità o il prezzo è la capacità: la diarizzazione e i timestamp a livello di parola del modello batch sono funzionalità documentate, mentre quelle del modello streaming non lo sono. Questo conta più del divario di accuratezza di 0,5 punti, ed è il motivo per cui molti team finiranno per eseguirli entrambi.

Cosa ti dà davvero 5,4×
A 1,67 $ per 1.000 minuti, la trascrizione batch a questo livello di accuratezza è quasi gratuita al margine. A 9,00 $ per 1.000 minuti, lo streaming è una vera voce di costo — all'incirca il costo dello stesso audio trascritto cinque volte, più mezzo punto di accuratezza. Quindi la domanda non è se il tempo reale valga di più; è quali minuti specifici ne hanno bisogno.
I carichi di lavoro in cui è chiaramente così: i sottotitoli in tempo reale che una persona legge mentre l'oratore parla, dove 0,13 secondi rispetto alla fine del file rappresentano l'intero prodotto; l'assistenza in tempo reale agli agenti e il punteggio di conformità, dove un intervento che arriva dopo la fine della chiamata è inutile; e le applicazioni vocali interattive, dove un turno non può concludersi finché non si conclude la trascrizione. In tutti e tre, il modello batch non è un'opzione più economica, è una non-opzione — non esiste un prezzo al quale la trascrizione post-hoc diventi in tempo reale.
I carichi di lavoro in cui chiaramente non lo è: registrazioni di riunioni e chiamate elaborate a posteriori, archivi multimediali, controllo qualità in batch dei contact center, revisione di conformità delle chiamate completate, sottotitolazione di podcast e video. Sono esattamente le pipeline per cui il 411× rispetto al tempo reale e la tariffa di 1,67 $ del modello batch sono stati pensati per vincere, e pagare 5,4× per ridurre di qualche centinaio di millisecondi una trascrizione che nessuno leggerà fino a domani è uno spreco bello e buono. Aggiungi le funzionalità di diarizzazione e timestamp a livello di parola — il modello batch le ha documentate, il modello streaming no — e la tesi post-hoc si rafforza, non si indebolisce.
La via di mezzo interessante è dove i due sono davvero complementari: usare lo streaming per la superficie live e il batch per la registrazione. Una chiamata di supporto trascritta in tempo reale per alimentare un pannello di assistenza all'agente, poi ritrascritta in batch durante la notte per produrre la trascrizione archivistica con diarizzazione e timestamp, costa un piccolo sovrapprezzo rispetto al solo batch e offre entrambi i comportamenti. Questo modello è diventato possibile solo a settembre, e il rilascio di ottobre è ciò che lo completa.
Dove emerge la struttura a due divisioni
Due cose di questa famiglia meritano di essere notate, perché sono strutturali e non incidentali.
Innanzitutto, la gerarchia dell'accuratezza è invertita rispetto al solito schema. I modelli di streaming di norma pagano un sostanziale prezzo in accuratezza per l'output in tempo reale; qui il prezzo è di 0,5 punti, dal 2,0% sulla classifica batch a un dichiarato 2,5% su quella streaming. Microsoft ha ottenuto un modello in tempo reale entro mezzo punto dal suo modello di punta batch secondo i suoi stessi numeri, il che è il vero risultato ingegneristico del rilascio di ottobre se regge — non il posizionamento in cima alla classifica, che una buona ripetizione dei test potrebbe spostare e che il tracker non ha ancora confermato.
In secondo luogo, anche la struttura dei prezzi è invertita rispetto allo schema abituale. I fornitori in genere scontano la fascia a volume più elevato; Microsoft ha fissato il prezzo dello streaming a 5,4 volte quello del batch e ha lasciato entrambi su tariffe introduttive che scadono contemporaneamente. Questo appare meno come un sovrapprezzo intenzionale per lo streaming e più come due lanci separati, ciascuno con uno sconto di lancio, senza una tariffa standard pubblicata per nessuno dei due. I team che pianificano un budget per il 2027 dovrebbero considerare entrambi i numeri come provvisori: sia 1,67 $ sia 9,00 $ sono etichettati come a tempo limitato, e per nessuno dei due è stato annunciato un prezzo successivo.

Cosa non è ancora stato dimostrato?
Le questioni aperte del modello batch risalenti a settembre restano aperte: nessun tasso di errore di diarizzazione pubblicato, nessuna ripartizione per lingua a sostegno dell'affermazione sulle 60 lingue e un prezzo promozionale senza un successore nominato. Il modello streaming ne aggiunge un'altra, specifica del lavoro in tempo reale: il WER in streaming viene misurato su audio pulito, e la qualità della trascrizione parziale in uno stream far-field rumoroso è la modalità di fallimento che conta di più in fase di deployment e che è meno coperta dal materiale di lancio. Eredita anche la vicinanza della classifica dello streaming: i primi tre nella classifica di 37 modelli del tracker sono entro una frazione di punto, quindi "primo" è uno stato che una nuova esecuzione può cambiare — e il primo posto di Microsoft è un'affermazione più che una riga.
La questione a livello di famiglia è però quella da tenere d'occhio. Microsoft ora vende la stessa funzionalità a due prezzi che distano cinque volte l'uno dall'altro, con il livello costoso privo di due funzionalità che quello economico documenta. Se la diarizzazione e i timestamp delle parole arrivano sullo SKU in streaming, il divario si riduce a un puro compromesso tra latenza e prezzo, che è una decisione molto più semplice. Se non arrivano, la struttura a due divisioni è permanente e le architetture dovrebbero essere costruite attorno ad essa.
Dove questo lascia uno stack di trascrizione

Il risultato pratico è che a settembre la trascrizione ha smesso di essere una singola voce e a ottobre è diventata una decisione di instradamento. Una pipeline che prima si uniformava su una sola API ora vuole lo streaming per la superficie live, il batch per la registrazione e una regola per stabilire quale audio segua quale percorso — e quella regola è essa stessa un problema di instradamento, una quantità di complessità davvero strana da far ricadere nel ciclo di rilascio di un solo fornitore.
È su ciò che sta sopra la trascrizione che l'impatto è più pesante. Qualunque livello produca il testo, quel testo viene poi riassunto, classificato, oscurato e instradato, e queste fasi girano su modelli linguistici con profili di latenza e costo propri: una trascrizione dal vivo vuole un modello veloce ed economico, una archivistica può permettersi uno più potente. OrcaRouter copre esattamente quello strato: un'unica API su oltre 200 modelli, prezzi di listino dei provider passati con 0% di ricarico, failover automatico e un DSL di routing che seleziona un modello per carico di lavoro anziché per pipeline. Né MAI-Transcribe-2-Streaming né MAI-Transcribe-2 figurano in quell'elenco — entrambi sono serviti tramite lo stack vocale di Microsoft — ma uno strato di trascrizione a due divisioni è l'argomento più forte finora per mantenere portabile tutto ciò che sta a valle di esso.
Il riassunto onesto: lo streaming non è un MAI-Transcribe-2 migliore, è un secondo prodotto a un secondo prezzo. Acquistalo per i minuti che richiedono davvero il tempo reale, lascia il resto sulla fascia economica e prevedi nel budget che entrambe le tariffe verranno riprezzate quando termina il periodo introduttivo.
