Card del titolo hero generata per un confronto tra Voxtral Mini 4B Realtime Arabic e Grok Voice Transcribe 2.0, con sottotitolo "un leader della classifica label incontra uno specialista dell'arabo con 16 dialetti", badge "repository Mistral, 8 ottobre 2026", con tre chip statistiche che riportano 8,82% di tasso di errore sui caratteri arabi a 480 ms contro 2,7% di tasso di errore sulle parole a 0,49 s, 16 dialetti denominati contro 38+ lingue non documentate, e pesi Apache 2.0 contro $0,20 per ora audio, e il logo OrcaRouter compositato in una striscia bianca in basso a destra.
Guides & Insights

Voxtral Mini 4B Realtime Arabic vs Grok Voice Transcribe 2.0: un leader della classifica incontra uno specialista dei dialetti

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il punto di partenza onesto per questo confronto è che Voxtral Mini 4B Realtime Arabic e Grok Voice Transcribe 2.0 non competono per lo stesso compito, e il modo più rapido per rendersene conto è guardare a ciò che ciascun fornitore era disposto a pubblicare. Mistral AI ha pubblicato Voxtral Mini 4B Realtime Arabic su Hugging Face l'8 ottobre 2026 senza alcun annuncio: pesi Apache 2.0, una scheda del modello che cita sedici varietà di arabo e un singolo dato di accuratezza, un tasso medio di errore sui caratteri dell'8,82% su sette benchmark arabi con un ritardo di 480 millisecondi. Grok Voice Transcribe 2.0 di xAI è uscito il 18 settembre 2026 con un post di lancio, un prezzo e un risultato su una classifica di terze parti: un tasso di errore sulle parole del 2,7% sulle trascrizioni finali, con il testo che si assesta 0,49 secondi dopo che l'oratore si ferma, primo nella classifica di speech-to-text in streaming di Artificial Analysis quando è arrivato. Un modello ti dice esattamente quali dialetti gestisce e si rifiuta di indovinare al di fuori di essi. L'altro ti dice che copre più di 38 lingue e non ne elenca nemmeno una.

Quell'asimmetria è tutto il confronto. Se acquisti capacità di trascrizione in grandi volumi per audio in più lingue, il modello xAI è il prodotto più completo, e con un ampio margine. Se invece il tuo audio è in arabo — e in particolare se è arabo dialettale, non l'arabo standard moderno dei notiziari — il checkpoint Mistral è pensato per un problema che la classifica in cima alla quale si trova il modello xAI non misura, e il fatto che sia secondo in quella classifica anziché primo sarebbe un errore interpretarlo come un verdetto.

L'aritmetica dei prezzi, perché qui è insolitamente pulita

xAI pubblica una tariffa. Mistral pubblica un download. Questa differenza determina tutto ciò che sta a valle, quindi parti dal numero che esiste.

• Grok Voice Transcribe 2.0 — $0,10 per ora audio tramite REST per i file registrati, $0,20 per ora audio tramite WebSocket in streaming. Si tratta di circa $1,67 ogni mille minuti per l'elaborazione batch e $3,33 ogni mille minuti in streaming, invariati rispetto a Grok Voice Transcribe 1.0 agli stessi livelli di prezzo.

• Voxtral Mini 4B Realtime Arabic — nessun prezzo pubblicato, perché non esiste un servizio pubblicato. I pesi sono Apache 2.0 e circa 4,4 miliardi di parametri in BF16, il che significa che il costo è la GPU a cui lo si collega e l'utilizzo che se ne ricava. A volume sostenuto è economico; a volume zero è l'opzione più costosa in questo articolo, perché si paga per hardware inattivo.

Il punto di pareggio non è una questione sottile. Una tariffa di streaming di 0,20 $ all'ora equivale a circa un terzo di centesimo al minuto. Qualsiasi acceleratore su cui faresti girare un modello da 4,4B costa più di così all'ora, a meno che tu non ci faccia passare traffico sostenuto, il che significa che la via dei pesi aperti vince sul costo solo dopo che hai abbastanza volume in arabo da tenere occupata una macchina — e perde su ogni altro asse mentre ci arrivi, perché l'API non ha capex, non richiede pianificazione della capacità e non comporta oneri operativi.

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

L'unico punto in cui il calcolo si ribalta presto è la conformità. Il checkpoint Mistral elabora l'audio su hardware che controlli tu, quindi nulla lascia la tua rete, e la scheda include un modulo di normalizzazione, così la pipeline di scoring in arabo è tua da verificare. Grok Voice Transcribe 2.0 viene eseguito nelle regioni di xAI e, secondo la sua documentazione, elabora l'audio in tempo reale senza conservarlo né utilizzarlo per l'addestramento, con il supporto di SOC 2 Type II e dell'idoneità HIPAA. Entrambe le narrazioni sono difendibili; solo una di esse consente a un'autorità di regolamentazione di ispezionare il percorso del codice.

Cosa si può davvero comprare con 0,20 $ all'ora, e il modello Mistral non viene distribuito

Il divario di funzionalità qui è più ampio del divario di accuratezza e se ne discute molto meno. Grok Voice Transcribe 2.0 è un prodotto con un'interfaccia; Voxtral Mini 4B Realtime Arabic è un checkpoint che emette testo.

• Diarizzazione dei parlanti — inclusa in Grok Voice Transcribe 2.0, più la trascrizione multicanale fino a otto canali indipendenti. La scheda Mistral non elenca alcuna funzionalità di diarizzazione; il modello produce una trascrizione, non una con attribuzione dei parlanti.

• Timestamp a livello di parola — Grok li fornisce corredati di punteggi di confidenza, così puoi applicare una soglia agli intervalli a bassa confidenza invece di fidarti in modo uniforme di un'intera trascrizione. La scheda di Mistral non dichiara timestamp per questo checkpoint.

• Bias sui termini chiave — fino a 100 termini di dominio per richiesta sull'endpoint Grok, ed è così che si fa in modo che un modello riporti correttamente nomi di prodotto, codici account e nomi di località senza fine-tuning. La via Mistral per ottenere lo stesso risultato è il fine-tuning sui propri dati, che Apache 2.0 consente e l'endpoint ospitato no.

• Normalizzazione inversa del testo — Grok formatta numeri, date, valute, numeri di telefono e indirizzi email in forma scritta in 25 lingue. La scheda Mistral include uno script di normalizzazione, ma il suo scopo dichiarato è valutare benchmark arabi, non formattare l'output per la visualizzazione.

• Superficie dell'interfaccia — REST per file fino a 500 MB, streaming WebSocket su wss://api.x.ai/v1/stt con risultati intermedi circa ogni 500 ms, 10 richieste al secondo documentate e 100 sessioni di streaming simultanee, e un'unica regione per ora. Sul lato Mistral, serving vLLM con un WebSocket su /v1/realtime, oppure Transformers nativo dalla versione 5.2.0, senza altri limiti di frequenza che non siano il tuo hardware.

Se hai bisogno di diarizzazione e timestamp, il confronto è già finito prima ancora che entri in gioco l'accuratezza. Questo non è una critica al modello Mistral — uno specialista arabo da 4B addestrato a produrre testo dialettale accurato è un obiettivo ingegneristico diverso da un servizio di trascrizione generico — ma significa che i due diventano intercambiabili solo se la tua pipeline tratta la trascrizione come materia prima per la tua post-elaborazione.

Il problema dell'elenco delle lingue

Entrambi i fornitori descrivono il supporto linguistico in un modo che lascia senza risposta la stessa domanda, partendo da direzioni opposte.

• Grok Voice Transcribe 2.0 — oltre 38 lingue, rilevamento automatico della lingua con cambio di lingua durante la registrazione in un'unica passata, su 12 formati audio da 8 kHz a 48 kHz. La documentazione riporta il numero e non l'elenco. L'arabo non viene menzionato singolarmente da nessuna parte nel materiale, il che significa che il supporto per l'arabo è implicito nel conteggio e non confermato dal fornitore.

• Voxtral Mini 4B Realtime Arabic — sedici varietà arabe nominate esplicitamente: arabo standard moderno; marocchino, libico, tunisino, algerino e hassaniya dal Maghreb; del Golfo, najdi, omanita e sanaani dal Golfo; egiziano e sudanese dalla Valle del Nilo; mesopotamico e levantino sia meridionale sia settentrionale; e arabo ciadiano. Tutto ciò che è al di fuori di questo insieme è fuori ambito, e la scheda dice di usare invece il modello realtime generale.

Quindi la domanda «quale di questi gestisce meglio l'arabo» ha una struttura strana. Il modello Mistral è un documentato specialista dell'arabo, con un tasso di errore in arabo pubblicato e nessuna verifica indipendente. Il modello xAI è un documentato leader nelle classifiche, il cui fornitore non ha confermato che l'arabo rientri affatto nell'ambito. Un conteggio di 38 lingue che include l'arabo e un elenco di sedici dialetti che include solo l'arabo rispondono entrambi alla domanda «gestisce l'arabo?» — ma solo uno dei due risponde a «gestisce la Darija?».

Screenshot of the xAI documentation page for the grok-voice-transcribe-2.0 model, captured 10 October 2026, showing the Speech to Text entry in the Voice documentation navigation, the model page slug grok-voice-transcribe-2.0, its audio-to-text modality, and the us-east-1 region listing with rate-limit sections.

La classifica non aiuta in questo caso. La valutazione speech-to-text di Artificial Analysis è un mix fisso ponderato verso il parlato inglese degli agenti, che è il design giusto per classificare la trascrizione generica e quello sbagliato per far emergere una vittoria sull’arabo dialettale. Un modello potrebbe essere davvero migliore sull’arabo del Golfo e sull’arabo marocchino e risultare solo buono in quella classifica. Questa non è una critica alla classifica; è un motivo per non usarla come unico input per un deployment regionale.

Accuratezza, in unità che non si convertono

• Grok Voice Transcribe 2.0 — tasso di errore per parola della trascrizione finale del 2,7%, con 0,49 secondi per arrivare al risultato finale, e 3,4% sui primi parziali, entrambi misurati sull'indice AA-WER v2 di Artificial Analysis, che combina un set privato di conversazioni tra agenti con VoxPopuli ed Earnings22. Il dato sui primi parziali è quello degno di nota: è sceso dal 18,3% di Grok Voice Transcribe 1.0, ovvero la differenza tra una trascrizione parziale su cui puoi basare l'instradamento e una che puoi solo visualizzare.

• Voxtral Mini 4B Realtime Arabic — 8,82% di tasso medio di errore sui caratteri su sette benchmark arabi con 480 millisecondi di ritardo, sulla valutazione dello stesso fornitore con uno script di normalizzazione fornito insieme ad essa. Mistral riferisce che questo rientra entro 0,91 punti percentuali da Voxtral Transcribe Arabic al 7,91% di CER, che è il modello arabo offline dello stesso laboratorio — un confronto che vale più di uno tra fornitori diversi perché i benchmark, la normalizzazione e la misurazione sono identici da entrambe le parti.

Mettere 2,7% accanto a 8,82% non è un confronto; è un errore di categoria. Il tasso di errore sulle parole conta le parole sbagliate rispetto a un riferimento, il tasso di errore sui caratteri conta i caratteri sbagliati, e l’ortografia araba — la stessa parola tollera più grafie legittime e i clitici si legano liberamente — allarga il divario tra le due metriche ben oltre quanto mostrano le lingue a scrittura latina. I corpora sono diversi, la normalizzazione è diversa, e solo uno dei due valori proviene da una terza parte. Ciò che i due numeri possono legittimamente dirti è che il modello x è un trascrittore generico misurato e ben classificato, mentre il modello Mistral è un trascrittore specifico per l’arabo solo dichiarato. Non possono dirti quale dei due trascrive meglio il tuo audio.

Il confronto che converte è quello all'interno della scheda di Mistral stessa: 8,82% in streaming contro 7,91% offline, gli stessi sette benchmark, la stessa normalizzazione, lo stesso laboratorio. Lo streaming costa circa un punto di accuratezza sull'arabo rispetto a un modello batch. Se sia un buono scambio decidi tu, e ora è una decisione informata.

Dove il modello piccolo vince, e non è sul tabellone dei punteggi

Tre cose riguardo al checkpoint di Mistral valgono più di quanto i numeri suggeriscano, e nessuna di esse compare su alcuna leaderboard.

Il primo è la tassonomia dei dialetti stessa. Denominare sedici varietà come obiettivi di addestramento distinti, tra cui l'hassaniya e l'arabo ciadiano, è una dichiarazione su dove sono stati misurati gli errori del modello. Un modello multilingue generale che include l'arabo come una delle 38 lingue migliora prima sull'arabo standard moderno, perché è lì che si trova la maggior parte del segnale di addestramento e del peso del benchmark. Un modello costruito per il partenariato con il Marocco insieme a un ministero nordafricano è ottimizzato per una distribuzione diversa, ed è stato sviluppato congiuntamente con due benchmark — ISMA e Darija in the Wild — creati appositamente per misurarla.

Il secondo è il ritardo configurabile. Il valore dell'8,82% è indicato a 480 millisecondi, e il ritardo è regolabile anziché fisso, il che trasforma il numero di accuratezza in un punto su una curva scelta dall'operatore. Per un'attività di sottotitolazione dal vivo puoi accorciarlo e accettare più errori; per una pipeline di registrazione delle chiamate puoi allungarlo e recuperare l'accuratezza. Grok Voice Transcribe 2.0 presenta un punto operativo fisso, e il percorso di aggiornamento dello stesso fornitore mostra perché ciò abbia conseguenze — passare da 1.0 a 2.0 è costato circa un terzo di secondo sia nella latenza del primo risultato parziale sia in quella finale, e la soluzione disponibile è bloccare il vecchio modello, non regolare una manopola.

Il terzo punto è che la concessione Apache 2.0 è incondizionata per i pesi che possiedi. Qualunque cosa accada al checkpoint a monte — che venga annunciato, che gli venga assegnato un prezzo, che venga deprecato o che non venga mai più menzionato — l'artefatto resta scaricabile, sottoponibile a fine-tuning e distribuibile all'interno del tuo stesso prodotto. Sia il listino prezzi di un endpoint ospitato sia il suo calendario di dismissione del modello sono modificabili a discrezione del fornitore, e xAI ha già segnalato l'intenzione di rendere Grok Voice Transcribe 2.0 il default e deprecare la 1.0, il che sposterà in un colpo solo sul nuovo profilo di latenza ogni integrazione che non ha mai passato un parametro di modello.

Sul livello di routing sopra la trascrizione, una nota pratica: nessuno dei due modelli è speech-to-text che ospitiamo noi, e questo articolo non sostiene il contrario. Ciò che OrcaRouter copre è il livello del modello linguistico che consuma lo stream — il summariser, il classificatore, l'agente — dietro un'unica API key su più di 200 modelli al prezzo di listino del provider con 0% di ricarico, così un cambio di prezzo di un fornitore arriva qui lo stesso giorno. I team che gestiscono due fornitori di speech per la copertura linguistica stanno già sostenendo due contratti e due percorsi di autenticazione; far convergere la metà a valle su un'unica key è il guadagno a basso costo.

Cosa fare con questo

Basati su Grok Voice Transcribe 2.0 se il tuo audio è multilingue, se hai bisogno di diarizzazione, timestamp o bias dei termini chiave fin da subito, oppure se desideri un servizio con una tariffa pubblicata e un percorso di supporto già oggi. È il prodotto più completo, è misurato da una terza parte, e la tariffa di streaming di $0,20 per ora di audio è abbastanza bassa che l'argomento dei costi dei modelli open-weights non regge finché non gestisci volumi davvero seri.

Basati su Voxtral Mini 4B Realtime Arabic se il tuo audio è in arabo e specificamente dialettale, se hai bisogno del modello all'interno della tua rete per motivi di conformità, oppure se intendi fare fine-tuning — perché solo uno di questi lo consente. Accetta prima tre cose: nessuna diarizzazione, nessun timestamp e nessuna valutazione indipendente pubblicata da nessuno. Due giorni dopo la comparsa dei pesi, quest'ultima non è un segnale d'allarme; è semplicemente lo stato delle prove.

Ciò che cambierebbe più rapidamente questo confronto è una valutazione specifica per l'arabo su audio dialettali reali, eseguita al di fuori di entrambi i fornitori, con la stessa normalizzazione applicata a entrambi i sistemi. Finché non esisterà, la decisione si basa sulla lista di dialetti dichiarata da un fornitore contrapposta a quella non dichiarata di un altro fornitore, e l'unico test affidabile sono le tue registrazioni.

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and Grok Voice Transcribe 2.0 across six shared rows: price none published and self-host only against $0.10 per audio-hour over REST and $0.20 streaming; accuracy 8.82% Arabic character error rate vendor-reported against 2.7% final word error rate per Artificial Analysis; delay configurable with 480ms quoted against 0.49s to final and 0.49s to first partial; languages 16 named Arabic varieties against 38+ with none itemised by the vendor; diarization and timestamps not documented against included with confidence scores; and distribution Apache 2.0 weights on Hugging Face against API only. A footer reads that Mistral figures are vendor-reported and unverified while Grok figures are per Artificial Analysis, and that character error rate and word error rate are not comparable. The OrcaRouter logo sits in a white strip at the bottom right.

Nessuno dei due endpoint è erogato da noi — questo è un confronto tra due sistemi al di fuori del nostro catalogo — ma i modelli che utilizzano la trascrizione sono instradabili: oltre 200 modelli con un'unica chiave API al prezzo di listino del provider con markup pari allo 0%, perciò una variazione tariffaria sul modulo di riepilogo o sul classificatore diventa effettiva lo stesso giorno in cui viene annunciata.

Failover automatico è ciò che impedisce a una configurazione vocale a due fornitori di trascinare due single point of failure nel livello linguistico che ne dipende.