Card del titolo principale generata per un confronto tra Voxtral Mini 4B Realtime Arabic e MAI-Transcribe-2-Streaming, con il sottotitolo "due arrivi di ottobre, due problemi di evidenza", il badge "Ottobre 2026, entrambi dichiarati dai fornitori", tre chip statistiche che riportano 8,82% di tasso di errore sui caratteri arabi a 480 ms contro 2,5% di tasso di errore sulle parole a 0,13 s, 16 dialetti contro 60 lingue, e pesi Apache 2.0 contro Azure preview a 0,54 $ per ora audio, e il logo OrcaRouter composto in una striscia bianca in basso a destra.
Guides & Insights

Voxtral Mini 4B Realtime Arabic vs MAI-Transcribe-2-Streaming: due arrivi di ottobre, due problemi di evidenza

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Sette giorni separano questi due modelli vocali in tempo reale, e sono arrivati in modi opposti. MAI-Transcribe-2-Streaming è il primo modello di trascrizione in streaming di Microsoft AI, annunciato il 1° ottobre 2026 con un post di lancio, una scheda di anteprima su Azure, un prezzo di 0,54 $ per ora audio, introduttivo fino alla fine dell'anno, e la rivendicazione di essere primo nella classifica streaming di Artificial Analysis sia per l'accuratezza delle trascrizioni finali sia per quella delle parziali, con un tasso di errore di parole del 2,5% e il testo finale pronto 0,13 secondi dopo la fine del parlato. Voxtral Mini 4B Realtime Arabic è il modello di streaming per dialetti arabi di Mistral AI, pubblicato su Hugging Face l'8 ottobre 2026 senza alcun annuncio — nessun post sul blog, nessun prezzo, nessun servizio, solo pesi Apache 2.0 e una scheda del modello che riporta un tasso medio di errore dei caratteri dell'8,82% su sette benchmark arabi con un ritardo di 480 millisecondi. Il modello Microsoft è un prodotto finito con un titolo non verificabile. Il modello Mistral è un artefatto verificabile senza alcun prodotto attorno. Entrambi meritano di essere compresi proprio perché entrambi lasciano la domanda centrale — quanto bene gestisca l'arabo — con risposta solo dal fornitore.

Vale comunque la pena fare il confronto, perché i due modelli inquadrano la stessa decisione ingegneristica da estremi opposti. Microsoft vende ampiezza e un servizio gestito: 60 lingue con rilevamento automatico e continuo della lingua, in esecuzione all'interno di Azure AI Speech, con prezzo a ore, in anteprima. Mistral offre gratuitamente profondità: sedici varietà arabe denominate, abbastanza piccole da girare su un singolo acceleratore, con uno script di normalizzazione così puoi verificare tu stesso il punteggio. Se questo mese stai mettendo in piedi una pipeline di trascrizione in arabo, stai scegliendo tra queste due posizioni, e la scelta dipende da prove che in nessuno dei due casi possiedi ancora.

Quello che ogni fornitore ha effettivamente detto, e quello che dicono le classifiche

Il divario probatorio è l'aspetto più importante di questo confronto, perciò viene per primo.

• MAI-Transcribe-2-Streaming — tasso di errore di parola della trascrizione finale del 2,5% a 0,13 secondi dopo la fine del parlato, e lo stesso 2,5% sui primi risultati parziali a 0,12 secondi, entrambi presentati come primo posto per accuratezza secondo la metodologia AA-WER Streaming di Artificial Analysis. È la caratterizzazione di Microsoft stessa. Al momento della stesura di questo articolo, la board streaming del tracker non ha tracciato una riga per il modello, quindi l'affermazione poggia sulla metodologia del tracker senza un numero pubblicato dal tracker a sostenerla.

• Voxtral Mini 4B Realtime Arabic — 8,82% di tasso medio di errore sui caratteri su sette benchmark arabi con un ritardo configurato di 480 millisecondi. La scheda di Mistral stessa, con il codice di valutazione fornito. Nessuna terza parte ha riprodotto il risultato, e il modello ha due giorni.

Quindi i due numeri principali di questo articolo sono, rispettivamente, una dichiarazione di un fornitore basata sul righello di qualcun altro e una dichiarazione di un fornitore con il proprio righello allegato. Nessuno dei due è una misurazione indipendente. Ciò che cambia è che il numero di Mistral arriva con lo script di normalizzazione necessario per ricalcolarlo, mentre quello di Microsoft arriva con una board che non l'ha ancora inserito nel grafico. Se stai prendendo una decisione di acquisto, questa distinzione conta più del divario tra 2,5 e 8,82, che comunque non significa nulla — il tasso di errore per parola e il tasso di errore per carattere non sono convertibili, e l'ortografia araba amplia notevolmente il divario tra i due.

L'unico confronto all'interno della scheda di Mistral che converte davvero è quello con il suo gemello offline: Voxtral Transcribe Arabic a 7,91% CER sugli stessi sette benchmark con la stessa normalizzazione, quindi lo streaming costa a questo modello 0,91 punti percentuali. Microsoft ha pubblicato una cifra equivalente per la propria famiglia quando ha rilasciato il modello batch MAI-Transcribe-2 il 3 settembre 2026 con un tasso di errore per parola del 2,0% — la variante streaming rinuncia a mezzo punto rispetto al modello batch pur aggiungendo la consegna in tempo reale. Leggi quei due delta interni ai fornitori fianco a fianco e ottieni l'unica affermazione davvero comparabile in questo articolo: sui rispettivi benchmark, lo SKU streaming di ciascun laboratorio è dietro al proprio gemello batch, di circa un punto in un caso e di mezzo punto nell'altro, ed entrambi misurano lingue diverse.

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

Copertura linguistica: 60 contro 16, e lo stesso divario senza nome da entrambe le parti

• MAI-Transcribe-2-Streaming — 60 lingue con rilevamento automatico e continuo della lingua, così una sessione che cambia lingua durante lo streaming non ha bisogno che la lingua venga dichiarata in anticipo. Il materiale di lancio di Microsoft fornisce il conteggio ma non l'elenco; la documentazione di supporto linguistico di Azure per la famiglia MAI-Transcribe è il luogo in cui la copertura è dettagliata voce per voce, e documenta l'arabo tra le lingue supportate per la famiglia.

• Voxtral Mini 4B Realtime Arabic — sedici varietà di arabo, denominate singolarmente: arabo standard moderno, arabo marocchino, libico, tunisino, algerino e hassaniya, arabo del Golfo, najdi, omanita e sanaani, arabo egiziano e sudanese, arabo mesopotamico e sia l'arabo levantino meridionale sia quello settentrionale, e arabo ciadiano. Al di fuori di tale insieme, il modello è documentato come fuori ambito, con un rimando al Voxtral Mini 4B Realtime generale.

Nessuno dei due numeri ti dice ciò di cui hai bisogno. Il 60 di Microsoft è un conteggio di ampiezza che include l'arabo senza descrivere le prestazioni sull'arabo; il post di lancio indica il totale delle lingue una volta sola e passa oltre. Il 16 di Mistral è un'enumerazione di target di addestramento con un unico tasso di errore aggregato su sette set di benchmark, il che significa che la ripartizione a livello di dialetto — la cosa che determina davvero se il tuo audio di chiamata marocchino viene trascritto — non è pubblicata neanche. Due modelli, due fornitori, e in entrambi i casi la risposta onesta a "quanto è bravo nello specifico nell'arabo del Golfo" è: non dichiarato.

Quello che l'enumerazione ti dà è un prior. Un modello con l'arabo ciadiano e l'arabo hassaniya come target denominati è stato tarato su una distribuzione nordafricana; Mistral lo ha co-sviluppato con il Ministère de la Transition Numérique et de la Réforme Administrative del Marocco e ha costruito due dei sette benchmark con quel ministero — ISMA e Darija in the Wild — proprio per misurare i casi difficili. Un modello generale da 60 lingue migliora innanzitutto sull'arabo standard moderno, perché è lì che si concentra il volume del segnale di addestramento. Se il tuo audio è in Darija o in arabo del Golfo, quelli sono problemi diversi, e solo uno di questi due fornitori ha dato un numero per l'uno o per l'altro.

Latenza e la forma del ritardo

• MAI-Transcribe-2-Streaming — 0,13 secondi dalla fine del parlato alla trascrizione finale, e primi parziali a 0,12 secondi, il che è abbastanza veloce da far sì che il parziale e il finale abbiano effettivamente la stessa latenza. L'affermazione di Microsoft, misurata secondo la metodologia del tracker.

• Voxtral Mini 4B Realtime Arabic — 480 millisecondi di ritardo configurato al punto di accuratezza pubblicato, con il ritardo regolabile. È all'incirca tre volte e mezzo il valore di Microsoft, ed è il parametro che l'operatore sceglie anziché una proprietà fissa.

Tre decimi di secondo sono una differenza reale per un agente vocale che deve rispondere nel bel mezzo di un enunciato e quasi invisibile per una persona che legge i sottotitoli. È anche la differenza tra una manopola e un numero. Il parametro di ritardo di Mistral significa che puoi operare con una configurazione più stretta e accettare più errori, oppure più allentata e recuperare l'accuratezza — il modello base da cui è stato fine-tuned questo checkpoint dichiara un intervallo da 240 millisecondi fino a 2,4 secondi — mentre il punto operativo di Microsoft è quello che distribuisce Azure. Questo rende il valore di Microsoft più facile da interpretare e quello di Mistral più facile da regolare, e significa che qualsiasi confronto tra i due numeri di accuratezza è in realtà un confronto tra due punti scelti su una curva e un punto fisso su un'altra.

La superficie delle funzionalità differisce altrettanto nettamente, e vale la pena verificarla rispetto ai requisiti della tua pipeline prima che la discussione sull'accuratezza diventi interessante.

• MAI-Transcribe-2-Streaming — fornito tramite Azure AI Speech con il set di funzionalità documentate della famiglia: diarizzazione, timestamp a livello di parola, biasing di parole chiave e frasi, stili di output verbatim e pulito, e identificazione automatica della lingua. La documentazione specifica dello SKU streaming per diarizzazione e timestamp è più scarna di quella del modello batch, quindi verifica questi aspetti per ogni endpoint anziché presumere la parità.

Screenshot of the Microsoft Learn documentation page 'Use a MAI-Transcribe model' in Azure AI Speech, captured 10 October 2026, showing the public preview notice that the feature is provided without a service-level agreement and is not recommended for production workloads, alongside the statement that MAI-Transcribe is a next-generation speech-to-text model built in-house by the Microsoft AI team covering 60 languages.

• Voxtral Mini 4B Realtime Arabic — la scheda documenta la trascrizione con un encoder audio causale, il serving vLLM su un WebSocket a /v1/realtime, il supporto nativo di Transformers dalla versione 5.2.0 e un modulo di normalizzazione. Non documenta la diarizzazione né i timestamp a livello di parola per questo checkpoint.

Modello di distribuzione: un servizio di anteprima anziché pesi scaricabili

• MAI-Transcribe-2-Streaming — Anteprima Azure, il che significa nessun SLA e una raccomandazione del fornitore contro la dipendenza dalla produzione. Prezzo di $0,54 per ora audio come tariffa introduttiva valida fino alla fine del 2026, con la tariffa standard non pubblicata; il batch MAI-Transcribe-2 è stato lanciato a $0,10 per ora audio sulla stessa base a tempo limitato. Lo streaming costa 5,4 volte la tariffa batch.

• Voxtral Mini 4B Realtime Arabic — Apache 2.0, circa 4,4 miliardi di parametri in BF16, scaricabile, sottoponibile a fine-tuning e servibile su un singolo acceleratore. Nessun prezzo, nessun SLA e nessun impegno di supporto, perché non c'è alcun servizio dietro.

Quelle due frasi contengono la decisione. Un servizio in anteprima con una tariffa introduttiva e un prezzo standard non divulgato è un impegno che scade; il premio di streaming di 5,4× e la finestra fino al 2026 sono entrambi elementi che Microsoft può cambiare, e il rapporto batch-streaming è il numero da tenere d'occhio quando arriverà la tariffa standard. I pesi Apache 2.0 senza alcun annuncio sono l'opposto: un artefatto che nessuno può ritirare, legato a un rapporto con il fornitore che nessuno ha descritto. Se il checkpoint verrà mantenuto è impossibile saperlo, ma il file che hai oggi continua a funzionare comunque.

Il vincolo specifico del settore è quello che di solito decide queste questioni nella pratica. Un deployment di call center in arabo all'interno di un'istituzione regolamentata potrebbe non essere in grado di inviare affatto audio a un endpoint cloud in anteprima; un team che si è già standardizzato su Azure AI Speech potrebbe non volere un secondo stack on-premises per una sola famiglia linguistica. Entrambi i vincoli sono legittimi, e nessuno dei due ha nulla a che fare con le cifre del 2,5% e dell'8,82% che fanno da titolo ai due lanci.

Al di sopra dello strato di trascrizione, lo stesso discorso vale per entrambi. OrcaRouter non instrada nessuno di questi due modelli vocali — questo è un confronto tra due sistemi che non serviamo — ma il riassuntore, il classificatore o l'agente che consuma la trascrizione è instradabile: più di 200 modelli su un'unica chiave API al prezzo di listino del provider con 0% di markup, così un cambiamento di prezzo di un fornitore arriva dalla nostra parte lo stesso giorno, e failover automatico se un provider si degrada. Il punto in cui questo aiuta specificamente qui è la fase di prova: indirizzare entrambi i candidati di trascrizione verso un'unica pipeline a valle, dietro un'unica chiave, è il modo in cui esegui il confronto testa a testa senza predisporre due integrazioni.

Il test che risolverebbe la questione

Nessuno dei due fornitori ha pubblicato prestazioni specifiche per l'arabo, e nessuno dei due è stato valutato in modo indipendente su audio dialettale. Il confronto si riduce quindi a tre fatti e una raccomandazione.

I fatti: il modello streaming di Microsoft è più veloce a 0,13 secondi e dichiara una migliore accuratezza aggregata su una classifica che non l'ha ancora tracciato; il modello di Mistral pubblica un elenco di dialetti, un tasso di errore per l'arabo e il codice di normalizzazione per ricalcolarlo, a 480 millisecondi; e le due cifre di accuratezza non possono essere confrontate perché una è il tasso di errore sulle parole e l'altra è il tasso di errore sui caratteri su un corpus diverso.

La raccomandazione: chiunque stia prendendo questa decisione dovrebbe provare entrambi sul proprio audio, perché è l'unica misurazione che entrambi i fornitori hanno lasciato aperta. Costruisci il set di valutazione da registrazioni reali — il mix di dialetti che ricevi effettivamente, il codec che usi effettivamente, il vocabolario di dominio che ti serve effettivamente — e valuta entrambi con la normalizzazione di Mistral rispetto a un riferimento di cui ti fidi. Un test di due ore sulle tue registrazioni ti dirà più di entrambi i post di lancio messi insieme, ed è l'unico modo per scoprire se il vantaggio di 0,13 secondi vale una dipendenza da una preview e un sovrapprezzo di 5,4× per lo streaming, o se un modello scaricabile da 4,4B a 480 millisecondi sia già abbastanza buono per il compito.

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and MAI-Transcribe-2-Streaming across six shared rows: price none published and self-host only against $0.54 per audio-hour introductory through the end of 2026; accuracy 8.82% Arabic character error rate at 480ms against a claimed 2.5% final word error rate at 0.13s; board status none because the model is days old against claimed first but not yet plotted; languages 16 named Arabic varieties against 60 with the list unpublished; delivery Apache 2.0 self-hosted weights against Azure preview with no SLA; and diarization and timestamps not documented against family documentation that requires per-SKU confirmation. A footer reads that both accuracy figures are vendor-reported and that no independent Arabic evaluation of either model exists. The OrcaRouter logo sits in a white strip at the bottom right.

OrcaRouter non serve nessuno di questi due modelli vocali, e questo articolo non suggerisce il contrario: ciò di cui si occupa è il livello linguistico che legge la trascrizione: più di 200 modelli dietro una sola chiave al prezzo di listino del fornitore con 0% di ricarico, così una variazione di prezzo del fornitore sul modello a valle ti raggiunge il giorno stesso in cui viene annunciata.

Failover automaticoconsente a entrambi i candidati di trascrizione di alimentare un'unica pipeline a valle invece di due integrazioni, che è anche il modo più economico per eseguire il confronto testa a testa.