
MAI-Transcribe-2-Streaming è live: Microsoft conquista la corona della trascrizione in streaming con un WER del 2,5%
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 221 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
MAI-Transcribe-2-Streaming è la risposta di Microsoft AI all'unica domanda lasciata aperta dal suo rilascio di settembre, e vi ha risposto in 28 giorni. Rilasciato il 1° ottobre 2026, MAI-Transcribe-2-Streaming è un modello di trascrizione vocale in tempo reale che trascrive man mano che le parole arrivano, anziché dopo che il file è terminato. Microsoft afferma che si classifica primo per accuratezza sia sulle trascrizioni finali sia su quelle parziali nella valutazione AA-WER Streaming di Artificial Analysis, con un tasso di errore sulle parole del 2,5% e la trascrizione finale pronta 0,13 secondi dopo la fine del parlato. Si tratta di un'affermazione del fornitore basata sulla metodologia di un tracker, non di una riga pubblicata dal tracker — al momento della stesura, i 37 modelli della classifica non lo includono, e il modello che scalzerebbe è Grok Voice Transcribe 2.0 (Streaming) con 2,73% e 0,49 secondi. Il modello su cui è basato, MAI-Transcribe-2, è stato distribuito il 3 settembre come modello batch con WER del 2,0% e nessuna SKU in tempo reale; la variante streaming colma quel divario senza rinunciare a gran parte dell'accuratezza che ha reso notevole la versione batch. Ciò a cui rinuncia è il prezzo: lo streaming è 5,4× la tariffa batch al lancio.
L'inquadramento che Microsoft vuole è un dominio totale della classifica dello streaming. L'inquadramento che i numeri supportano è più ristretto e più interessante: un modello che dichiara di primeggiare al tempo stesso in accuratezza e latenza, su una frontiera in cui la voce più accurata della classifica impiega quattro volte più tempo a stabilizzarsi rispetto a quelle più veloci, e nessuna di quelle veloci è sotto il 3% di word error, con un prezzo alla pari con l'incumbent anziché inferiore. Ecco il lancio così com'è avvenuto, con le dichiarazioni dei fornitori etichettate.
Cosa ha rilasciato Microsoft il 1° ottobre
MAI-Transcribe-2-Streaming è erogato attraverso lo stack vocale di Microsoft nel servizio Azure AI Speech, con documentazione sotto il nome del modello stesso e lo stesso modello di distribuzione solo-API, senza pesi, della versione batch. Trascrive 60 lingue con rilevamento automatico e continuo della lingua, così una sessione che cambia lingua a metà flusso non deve essere dichiarata in anticipo. Microsoft lo posiziona sulla frontiera di Pareto tra accuratezza e latenza del grafico in streaming di Artificial Analysis — la lettura del fornitore stesso dei dati del tracker, nonché la lettura che il grafico del tracker stesso supporta.
Il modello di streaming non era l'intero rilascio. Microsoft ha rilasciato insieme a esso due modelli vocali: MAI-Voice-2.1, che copre 23 lingue in 24 locale, e MAI-Voice-2.1-Flash, che gestisce fino a 45 secondi di audio con una latenza di circa 150 ms. Considerato nel suo insieme, il rilascio del 1° ottobre è uno stack conversazionale in tempo reale completo — ascoltare, comprendere, parlare — anziché il lancio di un singolo modello.

Lettura della classifica dello streaming
AA-WER Streaming misura due cose per modello: quanto è sbagliata la trascrizione finita e quanto tempo passa dopo che chi parla si ferma prima che sia completata. L'affermazione di Microsoft è che MAI-Transcribe-2-Streaming è in testa su entrambe: tasso di errore sulle parole del 2,5% sulla trascrizione finale a 0,13 secondi dalla fine del parlato, e lo stesso 2,5% sulla prima trascrizione parziale a 0,12 secondi, che secondo Microsoft è un primato di accuratezza su entrambi. Prendetelo come dato del fornitore: al momento della stesura, la board streaming del tracker stesso non ha ancora inserito il modello, quindi non c'è una riga indipendente di MAI-Transcribe-2-Streaming da leggere. Quello che la board mostra, però, è il campo che dichiara di battere, e il campo è più vicino di quanto suggerisca un'impostazione da "corona":
• Grok Voice Transcribe 2.0 — WER del transcript finale del 2,73% a 0,49 secondi dalla fine del parlato, secondo Artificial Analysis, e attuale leader della classifica. È 0,23 punti dietro il 2,5% dichiarato da Microsoft, e circa quattro volte più lento a stabilizzarsi — la differenza tra un sottotitolo che tiene il passo e uno che resta indietro.
• Muse Voice Transcribe — 3,06% a 0,16 secondi, secondo Artificial Analysis. Il concorrente più vicino sulla latenza: circa 30 millisecondi dietro, e 0,5 punti peggiore in accuratezza rispetto a quanto dichiarato da Microsoft.
• ElevenLabs Scribe v2 Realtime — 3,59% a 0,14 secondi, secondo Artificial Analysis. Di fatto appaiato sulla velocità, più di un punto indietro sull'accuratezza.
• Gemini 3.5 Transcribe Live — 4,00% di WER in streaming a 0,40 secondi, il dato che Artificial Analysis ha pubblicato e che Google cita per il proprio modello Live API. Si tratta di un divario di 1,5 punti, ed è il confronto a cui punta questa release.
La colonna dei primi parziali è dove l'affermazione è meno simile al resto del tabellone. Sullo stesso tracker, i primi parziali di Grok Voice Transcribe 2.0 si attestano al 3,36% e quelli di Gemini 3.5 Transcribe Live al 5,77% — i parziali dovrebbero essere peggiori della trascrizione finale, spesso di un punto o più, perché il modello prende posizione prima che la frase termini. Un primo parziale che corrisponde al numero finale è la parte davvero insolita del lancio di Microsoft, ed è la parte che i dati stessi del tracker non possono ancora confermare. Citala come un'affermazione finché non esiste una riga.
L'avvertenza onesta è che 0,13 secondi e 0,16 secondi sono la stessa esperienza di prodotto per una persona che legge i sottotitoli, e il 2,5% contro il 2,73% che attualmente guida la classifica corrisponde a circa 2 errori ogni 1.000 parole. Un vantaggio di quelle dimensioni è reale ma piccolo, e se sia un vantaggio che chiunque possa percepire dipende dal carico di lavoro. Dove si fa sentire davvero è nella coda: un flusso di contact center attivo otto ore al giorno al 2,73% rispetto al 2,5% significa decine di migliaia di parole sbagliate in più all'anno, e gli errori di parola in una trascrizione non sono distribuiti in modo uniforme — si concentrano proprio sui nomi propri e sui numeri che rendono utile una trascrizione.

Cosa si può acquistare con 9,00 $ per 1.000 minuti
Lo streaming costa più del batch, e Microsoft lo ha posizionato al vertice del tier in tempo reale anziché al di sotto. MAI-Transcribe-2-Streaming è listato a $0,54 per ora audio, che corrispondono a $9,00 per 1.000 minuti di audio in streaming, descritto come tariffa introduttiva valida fino alla fine dell'anno. Per confronto, il batch MAI-Transcribe-2 è $0,10 per ora audio — $1,67 per 1.000 minuti — quindi la trascrizione in tempo reale costa circa 5,4× la tariffa basata su file per la stessa famiglia di base e 0,5 punti in più di errore di parola. Non è un rincaro che Microsoft sta nascondendo; è il prezzo onesto di una connessione persistente e di una trascrizione parziale che deve essere corretta prima che la frase sia finita.
Rispetto al resto della fascia streaming, il quadro è misto. MAI-Transcribe-2-Streaming pareggia Gemini 3.5 Transcribe Live a circa 9 $ per 1.000 minuti — più preciso, stesso prezzo. Si posiziona sopra ElevenLabs Scribe v2 Realtime e Deepgram Flux a circa 6,50 $ per 1.000 minuti, sopra Cartesia Ink-2 a circa 4 $, e circa il triplo di Muse Voice Transcribe, a circa 3 $. Quindi il lancio è una mossa su accuratezza e latenza a prezzi in parità, non una guerra sui prezzi; i team che usano già un modello streaming più economico baratteranno dollari in cambio di punti di WER.
Vale la pena definire con precisione quel compromesso, perché è lo stesso compromesso che il lancio batch ha invertito. A settembre Microsoft ha reso economica l'accuratezza. A ottobre ha reso l'accuratezza in tempo reale allo stesso costo di quella di tutti gli altri. Se la tua pipeline ha bisogno delle trascrizioni solo alla fine, niente del 1° ottobre cambia la tua fattura. Se ne ha bisogno mentre la chiamata è ancora in corso, il calcolo si è appena spostato sulla qualità.

Costruire su una trascrizione è l’altra metà di quella decisione, ed è lì che uno strato multi-modello si guadagna il suo posto. Una trascrizione in tempo reale è raramente la fine della pipeline: viene riassunta, valutata, cercata, instradata ed escalata, e questi passaggi richiedono modelli diversi a costi diversi. OrcaRouter esiste per quello strato: una sola API su oltre 200 modelli, prezzi di listino dei provider passati senza alcun ricarico, failover automatico e un DSL di routing che può inviare una trascrizione dal vivo a un modello per lo screening di conformità e a un altro per le note di riunione senza una seconda integrazione. MAI-Transcribe-2-Streaming stesso non è in quell’elenco — è erogato tramite lo stack vocale di Microsoft — ma la trascrizione in streaming che produce è esattamente il tipo di input ad alto volume e sensibile alla latenza che suggerisce di mantenere lo strato sovrastante agnostico rispetto al modello.
Cosa non è ancora stato dimostrato?
Tre cose sono davvero aperte. In primo luogo, la diarizzazione: il modello batch include l'attribuzione del parlante senza alcun tasso di errore di diarizzazione pubblicato, e il materiale sullo streaming di Microsoft non avanza alcuna pretesa in materia di diarizzazione — per un modello in tempo reale che alimenta l'assistenza agli agenti dal vivo o i sottotitoli, chi ha detto cosa è spesso la funzionalità che conta più del WER grezzo. In secondo luogo, la ripartizione multilingue: 60 lingue con rilevamento automatico e continuo della lingua è un'affermazione ampia, e la latenza per lingua di un modello in streaming può variare molto più di quella della sua controparte batch, perché la qualità della trascrizione parziale dipende da quanto rapidamente il modello si decide per una lingua. Microsoft non ha pubblicato alcuna tabella di streaming per lingua. In terzo luogo, il WER in streaming viene misurato su audio di benchmark pulito; la modalità di errore che danneggia le distribuzioni reali è un flusso far-field rumoroso, e il giorno del lancio non esisteva alcun confronto indipendente dello streaming in far-field.
Dove lascia il tuo stack
La cosa interessante di questo lancio non è che Microsoft abbia la trascrizione in streaming più accurata. È la cadenza: batch a settembre, streaming a ottobre, nella stessa famiglia, sulla stessa superficie documentale, con una struttura di prezzo che ora va da $1,67 a $9,00 per 1.000 minuti per la stessa capacità sottostante. Per la prima volta, questo offre ai team una vera scelta — pagare il tempo reale solo dove il tempo reale conta, ed elaborare in batch tutto il resto — ma significa anche che il livello di trascrizione è ora qualcosa che si ottimizza per carico di lavoro anziché da standardizzare una volta per tutte.
Leggi l'affermazione del titolo alla lettera e regge come dichiarazione di un fornitore: Microsoft afferma che MAI-Transcribe-2-Streaming è primo sia per l'accuratezza della trascrizione finale sia per quella della prima trascrizione parziale, e che si trova sulla frontiera di Pareto. Gli asterischi sono che la classifica del tracker non ha ancora posizionato il modello, il vantaggio che rivendica sul leader attuale è abbastanza piccolo da sparire in una nuova esecuzione, il vantaggio di prezzo è zero, e la storia della diarizzazione non è stata raccontata. Queste sono le cose da tenere d'occhio, non la corona.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
