Card hero dell'articolo che recita 'MAI-Transcribe-2-Streaming è live' con il badge 'NUOVO MODELLO · MICROSOFT AI' e il sottotitolo 'Microsoft si aggiudica il primato della trascrizione in streaming con un WER del 2,5%', con una striscia di statistiche che mostra un tasso di errore di parola in streaming del 2,5% a 0,13 s dopo la fine del parlato, etichettato sulla card come dichiarazione di Microsoft e primo sia per le trascrizioni finali che per quelle parziali; 60 lingue con rilevamento automatico e continuo della lingua; e 9,00 $ per 1.000 minuti, descritto come 0,54 $ per ora audio, prezzo introduttivo fino al 2026; su un gradiente dal bianco al blu con il logo OrcaRouter in basso a destra.
Guides & Insights

MAI-Transcribe-2-Streaming è live: Microsoft conquista la corona della trascrizione in streaming con un WER del 2,5%

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

MAI-Transcribe-2-Streaming è la risposta di Microsoft AI all'unica domanda lasciata aperta dal suo rilascio di settembre, e vi ha risposto in 28 giorni. Rilasciato il 1° ottobre 2026, MAI-Transcribe-2-Streaming è un modello di trascrizione vocale in tempo reale che trascrive man mano che le parole arrivano, anziché dopo che il file è terminato. Microsoft afferma che si classifica primo per accuratezza sia sulle trascrizioni finali sia su quelle parziali nella valutazione AA-WER Streaming di Artificial Analysis, con un tasso di errore sulle parole del 2,5% e la trascrizione finale pronta 0,13 secondi dopo la fine del parlato. Si tratta di un'affermazione del fornitore basata sulla metodologia di un tracker, non di una riga pubblicata dal tracker — al momento della stesura, i 37 modelli della classifica non lo includono, e il modello che scalzerebbe è Gro​k Voice Transcribe 2.0 (Streaming) con 2,73% e 0,49 secondi. Il modello su cui è basato, MAI-Transcribe-2, è stato distribuito il 3 settembre come modello batch con WER del 2,0% e nessuna SKU in tempo reale; la variante streaming colma quel divario senza rinunciare a gran parte dell'accuratezza che ha reso notevole la versione batch. Ciò a cui rinuncia è il prezzo: lo streaming è 5,4× la tariffa batch al lancio.

L'inquadramento che Microsoft vuole è un dominio totale della classifica dello streaming. L'inquadramento che i numeri supportano è più ristretto e più interessante: un modello che dichiara di primeggiare al tempo stesso in accuratezza e latenza, su una frontiera in cui la voce più accurata della classifica impiega quattro volte più tempo a stabilizzarsi rispetto a quelle più veloci, e nessuna di quelle veloci è sotto il 3% di word error, con un prezzo alla pari con l'incumbent anziché inferiore. Ecco il lancio così com'è avvenuto, con le dichiarazioni dei fornitori etichettate.

Cosa ha rilasciato Microsoft il 1° ottobre

MAI-Transcribe-2-Streaming è erogato attraverso lo stack vocale di Microsoft nel servizio Azure AI Speech, con documentazione sotto il nome del modello stesso e lo stesso modello di distribuzione solo-API, senza pesi, della versione batch. Trascrive 60 lingue con rilevamento automatico e continuo della lingua, così una sessione che cambia lingua a metà flusso non deve essere dichiarata in anticipo. Microsoft lo posiziona sulla frontiera di Pareto tra accuratezza e latenza del grafico in streaming di Artificial Analysis — la lettura del fornitore stesso dei dati del tracker, nonché la lettura che il grafico del tracker stesso supporta.

Il modello di streaming non era l'intero rilascio. Microsoft ha rilasciato insieme a esso due modelli vocali: MAI-Voice-2.1, che copre 23 lingue in 24 locale, e MAI-Voice-2.1-Flash, che gestisce fino a 45 secondi di audio con una latenza di circa 150 ms. Considerato nel suo insieme, il rilascio del 1° ottobre è uno stack conversazionale in tempo reale completo — ascoltare, comprendere, parlare — anziché il lancio di un singolo modello.

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2-Streaming dated October 1, 2026, headlined 'Our first streaming transcription model debuts at no. 1 on Artificial Analysis' and introducing the MAI-Transcribe and MAI-Voice models as accurate, fast and low cost, with the companion MAI-Voice-2.1 and MAI-Voice-2.1-Flash announcements from the same release.

Lettura della classifica dello streaming

AA-WER Streaming misura due cose per modello: quanto è sbagliata la trascrizione finita e quanto tempo passa dopo che chi parla si ferma prima che sia completata. L'affermazione di Microsoft è che MAI-Transcribe-2-Streaming è in testa su entrambe: tasso di errore sulle parole del 2,5% sulla trascrizione finale a 0,13 secondi dalla fine del parlato, e lo stesso 2,5% sulla prima trascrizione parziale a 0,12 secondi, che secondo Microsoft è un primato di accuratezza su entrambi. Prendetelo come dato del fornitore: al momento della stesura, la board streaming del tracker stesso non ha ancora inserito il modello, quindi non c'è una riga indipendente di MAI-Transcribe-2-Streaming da leggere. Quello che la board mostra, però, è il campo che dichiara di battere, e il campo è più vicino di quanto suggerisca un'impostazione da "corona":

• Grok Voice Transcribe 2.0 — WER del transcript finale del 2,73% a 0,49 secondi dalla fine del parlato, secondo Artificial Analysis, e attuale leader della classifica. È 0,23 punti dietro il 2,5% dichiarato da Microsoft, e circa quattro volte più lento a stabilizzarsi — la differenza tra un sottotitolo che tiene il passo e uno che resta indietro.

• Muse Voice Transcribe — 3,06% a 0,16 secondi, secondo Artificial Analysis. Il concorrente più vicino sulla latenza: circa 30 millisecondi dietro, e 0,5 punti peggiore in accuratezza rispetto a quanto dichiarato da Microsoft.

• ElevenLabs Scribe v2 Realtime — 3,59% a 0,14 secondi, secondo Artificial Analysis. Di fatto appaiato sulla velocità, più di un punto indietro sull'accuratezza.

• Gemini 3.5 Transcribe Live — 4,00% di WER in streaming a 0,40 secondi, il dato che Artificial Analysis ha pubblicato e che Google cita per il proprio modello Live API. Si tratta di un divario di 1,5 punti, ed è il confronto a cui punta questa release.

La colonna dei primi parziali è dove l'affermazione è meno simile al resto del tabellone. Sullo stesso tracker, i primi parziali di Grok Voice Transcribe 2.0 si attestano al 3,36% e quelli di Gemini 3.5 Transcribe Live al 5,77% — i parziali dovrebbero essere peggiori della trascrizione finale, spesso di un punto o più, perché il modello prende posizione prima che la frase termini. Un primo parziale che corrisponde al numero finale è la parte davvero insolita del lancio di Microsoft, ed è la parte che i dati stessi del tracker non possono ancora confermare. Citala come un'affermazione finché non esiste una riga.

L'avvertenza onesta è che 0,13 secondi e 0,16 secondi sono la stessa esperienza di prodotto per una persona che legge i sottotitoli, e il 2,5% contro il 2,73% che attualmente guida la classifica corrisponde a circa 2 errori ogni 1.000 parole. Un vantaggio di quelle dimensioni è reale ma piccolo, e se sia un vantaggio che chiunque possa percepire dipende dal carico di lavoro. Dove si fa sentire davvero è nella coda: un flusso di contact center attivo otto ore al giorno al 2,73% rispetto al 2,5% significa decine di migliaia di parole sbagliate in più all'anno, e gli errori di parola in una trascrizione non sono distribuiti in modo uniforme — si concentrano proprio sui nomi propri e sui numeri che rendono utile una trascrizione.

A generated comparison card titled 'The streaming field, by the numbers' with a left column for MAI-Transcribe-2-Streaming (final-transcript word error rate 2.5% flagged as Microsoft's claim, time to final transcript 0.13s after speech end, first-partial word error rate 2.5% at 0.12s flagged as claimed, $9.00 per 1,000 minutes introductory, 60 languages with automatic detection, and 'not yet plotted' for the tracker's board) and a right column headed 'The field it claims to beat' listing Grok Voice Transcribe 2.0 at 2.73% and 0.49s, Muse Voice Transcribe at 3.06% and 0.16s, ElevenLabs Scribe v2 Realtime at 3.59% and 0.14s, Qwen3 ASR Flash Realtime at 3.73% and 0.48s, Gemini 3.5 Transcribe Live at 4.00% and 0.40s, and a board size of 37 models, with a footer noting that Microsoft's figures are the vendor's own claim measured on Artificial Analysis's streaming methodology while the right-hand column is what Artificial Analysis currently publishes, all times being after detected end of speech, and the OrcaRouter logo bottom right.

Cosa si può acquistare con 9,00 $ per 1.000 minuti

Lo streaming costa più del batch, e Microsoft lo ha posizionato al vertice del tier in tempo reale anziché al di sotto. MAI-Transcribe-2-Streaming è listato a $0,54 per ora audio, che corrispondono a $9,00 per 1.000 minuti di audio in streaming, descritto come tariffa introduttiva valida fino alla fine dell'anno. Per confronto, il batch MAI-Transcribe-2 è $0,10 per ora audio — $1,67 per 1.000 minuti — quindi la trascrizione in tempo reale costa circa 5,4× la tariffa basata su file per la stessa famiglia di base e 0,5 punti in più di errore di parola. Non è un rincaro che Microsoft sta nascondendo; è il prezzo onesto di una connessione persistente e di una trascrizione parziale che deve essere corretta prima che la frase sia finita.

Rispetto al resto della fascia streaming, il quadro è misto. MAI-Transcribe-2-Streaming pareggia Gemini 3.5 Transcribe Live a circa 9 $ per 1.000 minuti — più preciso, stesso prezzo. Si posiziona sopra ElevenLabs Scribe v2 Realtime e Deepgram Flux a circa 6,50 $ per 1.000 minuti, sopra Cartesia Ink-2 a circa 4 $, e circa il triplo di Muse Voice Transcribe, a circa 3 $. Quindi il lancio è una mossa su accuratezza e latenza a prezzi in parità, non una guerra sui prezzi; i team che usano già un modello streaming più economico baratteranno dollari in cambio di punti di WER.

Vale la pena definire con precisione quel compromesso, perché è lo stesso compromesso che il lancio batch ha invertito. A settembre Microsoft ha reso economica l'accuratezza. A ottobre ha reso l'accuratezza in tempo reale allo stesso costo di quella di tutti gli altri. Se la tua pipeline ha bisogno delle trascrizioni solo alla fine, niente del 1° ottobre cambia la tua fattura. Se ne ha bisogno mentre la chiamata è ancora in corso, il calcolo si è appena spostato sulla qualità.

A single-column scoreboard card titled 'MAI-Transcribe-2-Streaming — the launch scoreboard' listing 2.5% final-transcript WER at 0.13s, 2.5% first-partial WER at 0.12s, an accuracy rank claimed at #1 for final and partial transcripts, tracker status 'not yet plotted on the 37-model board', $9.00 per 1,000 minutes ($0.54 per audio-hour) introductory through 2026, 60 languages with automatic continuous detection, no published diarization or word-level timestamp claim for the streaming SKU, and the batch sibling MAI-Transcribe-2 at 2.0% AA-WER, roughly 411x real time and $1.67 per 1,000 minutes, with the OrcaRouter logo bottom right.

Costruire su una trascrizione è l’altra metà di quella decisione, ed è lì che uno strato multi-modello si guadagna il suo posto. Una trascrizione in tempo reale è raramente la fine della pipeline: viene riassunta, valutata, cercata, instradata ed escalata, e questi passaggi richiedono modelli diversi a costi diversi. OrcaRouter esiste per quello strato: una sola API su oltre 200 modelli, prezzi di listino dei provider passati senza alcun ricarico, failover automatico e un DSL di routing che può inviare una trascrizione dal vivo a un modello per lo screening di conformità e a un altro per le note di riunione senza una seconda integrazione. MAI-Transcribe-2-Streaming stesso non è in quell’elenco — è erogato tramite lo stack vocale di Microsoft — ma la trascrizione in streaming che produce è esattamente il tipo di input ad alto volume e sensibile alla latenza che suggerisce di mantenere lo strato sovrastante agnostico rispetto al modello.

Cosa non è ancora stato dimostrato?

Tre cose sono davvero aperte. In primo luogo, la diarizzazione: il modello batch include l'attribuzione del parlante senza alcun tasso di errore di diarizzazione pubblicato, e il materiale sullo streaming di Microsoft non avanza alcuna pretesa in materia di diarizzazione — per un modello in tempo reale che alimenta l'assistenza agli agenti dal vivo o i sottotitoli, chi ha detto cosa è spesso la funzionalità che conta più del WER grezzo. In secondo luogo, la ripartizione multilingue: 60 lingue con rilevamento automatico e continuo della lingua è un'affermazione ampia, e la latenza per lingua di un modello in streaming può variare molto più di quella della sua controparte batch, perché la qualità della trascrizione parziale dipende da quanto rapidamente il modello si decide per una lingua. Microsoft non ha pubblicato alcuna tabella di streaming per lingua. In terzo luogo, il WER in streaming viene misurato su audio di benchmark pulito; la modalità di errore che danneggia le distribuzioni reali è un flusso far-field rumoroso, e il giorno del lancio non esisteva alcun confronto indipendente dello streaming in far-field.

Dove lascia il tuo stack

La cosa interessante di questo lancio non è che Microsoft abbia la trascrizione in streaming più accurata. È la cadenza: batch a settembre, streaming a ottobre, nella stessa famiglia, sulla stessa superficie documentale, con una struttura di prezzo che ora va da $1,67 a $9,00 per 1.000 minuti per la stessa capacità sottostante. Per la prima volta, questo offre ai team una vera scelta — pagare il tempo reale solo dove il tempo reale conta, ed elaborare in batch tutto il resto — ma significa anche che il livello di trascrizione è ora qualcosa che si ottimizza per carico di lavoro anziché da standardizzare una volta per tutte.

Leggi l'affermazione del titolo alla lettera e regge come dichiarazione di un fornitore: Microsoft afferma che MAI-Transcribe-2-Streaming è primo sia per l'accuratezza della trascrizione finale sia per quella della prima trascrizione parziale, e che si trova sulla frontiera di Pareto. Gli asterischi sono che la classifica del tracker non ha ancora posizionato il modello, il vantaggio che rivendica sul leader attuale è abbastanza piccolo da sparire in una nuova esecuzione, il vantaggio di prezzo è zero, e la storia della diarizzazione non è stata raccontata. Queste sono le cose da tenere d'occhio, non la corona.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno