Card hero dell'articolo con la scritta "Voxtral Mini 4B Realtime Arabic vs Gemini 3.5 Transcribe Live", con il sottotitolo "15 dialetti arabi su pesi aperti contro oltre 85 localizzazioni su un'API chiusa", un badge che segnala il modello Mistral come rilascio non annunciato del repository datato 8 ottobre 2026, e tre chip statistiche: 16 varianti arabe contro oltre 85 localizzazioni; 8,82% di tasso di errore sui caratteri a 480 ms contro 4,0% di tasso di errore sulle parole in streaming a 0,40 s; pesi aperti Apache 2.0 contro solo API. Il logo OrcaRouter si trova in una striscia bianca in basso a destra.
Guides & Insights

Voxtral Mini 4B Realtime Arabic vs Gemini 3.5 Transcribe Live: dialetti vs ampiezza

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Due modelli di riconoscimento vocale in streaming, due scommesse completamente diverse su quale sia la parte difficile della trascrizione. Voxtral Mini 4B Realtime Arabic è un fine-tune da 4,4 miliardi di parametri che Mistral AI ha pubblicato su un repository pubblico l'8 ottobre 2026 senza un post di lancio, un articolo sul blog o una riga nell'indice delle notizie aziendali, addestrato specificamente sull'arabo standard moderno e su quindici dialetti denominati, rilasciato sotto Apache 2.0 con pesi BF16 scaricabili. Gemini 3.5 Transcribe Live è l'endpoint in streaming di Gemini 3.5 Transcribe di Google, annunciato in agosto 2026 con l'apparato completo di un rilascio di piattaforma, che copre oltre 85 localizzazioni, ed è chiuso: un'API in anteprima senza pesi e con un limite di sessione di dieci minuti. Un modello è andato in profondità su una singola famiglia linguistica e lo ha dichiarato nella propria sezione dei limiti; l'altro è andato in ampiezza e ha lasciato non dichiarate le garanzie a livello di accento. Quale dei due si desidera dipende da un asse che il marketing di nessuno dei due fornitori mette al primo posto: come suona realmente il tuo audio.

Questo non è un confronto simmetrico, e vale la pena dirlo subito invece di nasconderlo. Il modello Mistral ha 48 ore al momento in cui scrivo, non ha alcun annuncio del fornitore, nessuna valutazione indipendente e nessun prezzo pubblicato. Il modello Google è in anteprima pubblica da fine agosto ed è misurato su un tracker di terze parti. Considerate il lato Mistral come un insieme di affermazioni tratte da una model card e il lato Google come un insieme di misurazioni più un insieme di affermazioni, e il confronto resta onesto.

Che cosa è ciascun modello, prima dei numeri

• Voxtral Mini 4B Realtime Arabic — un modello ASR in streaming fine-tuned da Voxtral-Mini-4B-Realtime-2602, con circa 4,4 miliardi di parametri in BF16, che riceve audio a 16 kHz attraverso un encoder audio causale e un decoder linguistico. Emette testo man mano che l'audio arriva, con un ritardo di trascrizione configurabile, ed è Apache 2.0 con i pesi su Hugging Face. Mistral lo ha co-sviluppato con il Ministère de la Transition Numérique et de la Réforme Administrative del Marocco nell'ambito di una partnership firmata a gennaio 2026, e descrive il modello come un asset di IA sovrana.

• Gemini 3.5 Transcribe Live — la metà in streaming di un rilascio con due modelli. L'endpoint dell'API Live trasporta audio continuo del microfono tramite WebSocket, restituisce trascrizioni parziali mentre l'oratore sta ancora parlando e si assesta su una trascrizione finale poco dopo la fine di ogni enunciato. Il gemello batch, gemini-3.5-transcribe, elabora file preregistrati fino a un'ora. Entrambi sono in anteprima pubblica, entrambi sono disponibili solo tramite API e nessuno dei due ha pesi pubblicati.

La prima differenza strutturale non è l'accuratezza. È che uno di questi è un file che puoi scaricare stasera e l'altro è un servizio in cui devi essere accettato per poterlo usare.

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

Copertura linguistica: 16 contro oltre 85, e il divario non è il punto

Contare le lingue fa sembrare il modello Mistral limitato e il modello Google enorme. I conteggi misurano cose diverse, e leggerli fianco a fianco senza questa avvertenza è l'errore più comune che questo confronto invita a commettere.

• Voxtral Mini 4B Realtime Arabic — 16 varietà di arabo, denominate singolarmente sulla scheda del modello per famiglia dialettale: arabo standard moderno, più arabo marocchino, libico, tunisino, algerino e hassaniya del Maghreb; arabo del Golfo, najdi, omanita e sanaani del Golfo; egiziano e sudanese della Valle del Nilo; mesopotamico e sia il levantino meridionale sia quello settentrionale; e arabo ciadiano. L'impostazione della scheda stessa è che il modello ha come obiettivo la trascrizione dell'arabo, e che il code-switching — parlanti che alternano le lingue nel bel mezzo della conversazione — è la capacità che è stato progettato per gestire correttamente, piuttosto che un effetto collaterale.

• Gemini 3.5 Transcribe Live — rilevamento automatico della lingua su oltre 85 locale, con commutazione di codice all'interno della frase e tra frasi. La documentazione di Google elenca l'arabo in tale insieme; la tabella dei locale riporta Arabic (Egypt) come voce araba, e la copertura più ampia dei locale arabi non è dettagliata nella documentazione del modello stesso.

Leggilo onestamente e appare la forma del compromesso. L'85 e più di Google è un'affermazione di ampiezza: se il tuo audio è in una lingua diversa dall'arabo, l'endpoint Google lo copre e il modello Mistral lo rifiuterà — la scheda dice apertamente che per le altre lingue dovresti usare l'originale Voxtral Mini 4B Realtime, non questo checkpoint. Il 16 di Mistral è un'affermazione di profondità. Non sostiene di trascrivere l'arabo; sostiene di trascrivere darija marocchino, arabo del Golfo, arabo egiziano e arabo ciadiano come obiettivi distinti, che è un problema materialmente più difficile che trascrivere l'arabo standard moderno e sperare che il dialetto ne emerga. Un benchmark breadth-first ponderato sull'inglese non ti mostrerà mai quella differenza, perché i set dialettali non vi sono inclusi.

Per un call center marocchino o una linea di assistenza clienti del Golfo, un modello che gestisce 16 dialetti e nient'altro può battere un modello che gestisce 85 localizzazioni con un'accuratezza per dialetto non dichiarata. Per un'azienda europea che trascrive riunioni in cinque lingue, l'equazione si inverte istantaneamente. Nessuno dei due fornitori sbaglia; hanno scelto clienti diversi.

Screenshot of Google's Gemini API model documentation for Gemini 3.5 Transcribe, captured 10 October 2026, showing the model code gemini-3.5-transcribe, audio input up to one hour per request dropping to 30 minutes when speaker diarization or word-level timestamps are enabled, and the supported capability list including speaker diarization, word-level timestamps, Smart transcription and custom vocabulary.

I numeri che puoi confrontare, e quelli che non puoi

È qui che l'asimmetria si fa sentire. I due modelli riportano unità diverse, su corpora diversi, con prove diverse alle spalle, e nessuna terza parte li ha messi a confronto diretto.

• Voxtral Mini 4B Realtime Arabic — 8,82% di tasso medio di errore sui caratteri su sette benchmark arabi, con un ritardo di trascrizione configurato di 480 millisecondi. Secondo la scheda di Mistral stessa, e non riprodotto in modo indipendente.

• Il modello che sta inseguendo — Voxtral Transcribe Arabic a 7,91% CER sugli stessi sette benchmark con la stessa misurazione, quindi il modello realtime si colloca 0,91 punti percentuali dietro un modello arabo offline dello stesso fornitore. Quel divario è il confronto stesso di Mistral, il che lo rende insolitamente informativo: il fornitore ti sta dicendo quanto costa lo streaming in termini di accuratezza su questa famiglia linguistica.

• Gemini 3.5 Transcribe Live — tasso di errore per parola in streaming del 4,0%, misurato da Artificial Analysis e citato da Google, con una trascrizione finale che arriva 0,40 secondi dopo la fine del parlato. Misurato anche: 2,6% nella classifica non-streaming dello stesso tracker, e 5,50% in streaming su FLEURS secondo quanto riportato da Google stessa.

Non accostare 8,82% CER a 4,0% WER e trarre conclusioni. Il tasso di errore per carattere e il tasso di errore per parola hanno denominatori diversi — l’ortografia araba rende il divario tra loro più ampio di quanto non sia per le lingue a scrittura latina — e i corpora non sono gli stessi, la normalizzazione non è la stessa, e un numero è corredato da uno script riproducibile mentre l’altro proviene da un mix fisso di un tracker ponderato a favore del parlato degli agenti in inglese.

Il confronto più utile è quello all'interno della scheda di Mistral stessa: 8,82% in streaming contro 7,91% offline, su benchmark identici con identica normalizzazione. Questa è una misurazione netta di ciò che la bassa latenza dà e costa, specificamente sull'arabo, e vale più di qualsiasi percentuale tra fornitori diversi. Ciò che nessuno ha pubblicato è un'esecuzione in arabo, a parità di condizioni, dei modelli Google e Mistral sullo stesso audio. Finché qualcuno non lo farà, «quale sia più accurato in arabo» resta una questione aperta, e l'unica risposta difendibile è: provateli entrambi sulle vostre registrazioni.

Un dettaglio nella scheda di Mistral merita una menzione perché va contro l'interesse dello stesso fornitore. La scheda osserva che i filtri di sicurezza di Gemini bloccano la trascrizione di alcuni campioni audio FLEURS. Si tratta di un'osservazione reale e verificabile sulla pipeline di un concorrente, ed è anche esattamente il tipo di cosa che non compare mai in una classifica: un modello che rifiuta di trascrivere un campione viene valutato come un fallimento o come assente, e nessuna delle due letture è equa. Se il tuo audio include materiale che un filtro di contenuti potrebbe intercettare, si tratta di un rischio di deployment che nessun valore WER farà emergere.

Latenza: un quadrante rispetto a un numero fisso

I modelli in streaming vengono solitamente confrontati in base a un singolo dato di latenza. Questi due non ne hanno uno in comune.

• Voxtral Mini 4B Realtime Arabic — ritardo di trascrizione configurabile. La cifra CER dell'8,82% è indicata a 480 millisecondi, e il ritardo è regolabile, il che significa che il numero di accuratezza è un punto su una curva scelta dall'operatore anziché una proprietà del modello. Il suo modello base dichiara un intervallo da 240 millisecondi fino a 2,4 secondi.

• Gemini 3.5 Transcribe Live — 0,40 secondi dalla fine del parlato a una trascrizione finale, misurati da Artificial Analysis, con risultati parziali che arrivano continuamente durante il parlato. Google sostiene separatamente un miglioramento del 70% nel tempo necessario alla trascrizione finale rispetto a Chirp 3, che è un dato del fornitore e non replicato.

Entrambi si collocano nella stessa fascia — all'incirca mezzo secondo — ma il significato ingegneristico differisce. Il modello Mistral ti consegna il compromesso latenza-precisione come parametro, così puoi operare a 240 ms quando le didascalie sotto il secondo contano più degli ultimi punti di precisione e allungare il ritardo quando non è così. L'endpoint di Google presenta un punto operativo fisso con annesso il comportamento di filtro dei contenuti proprio di Google. Per un agente vocale, una manopola vale più di un numero fisso leggermente migliore, perché l'impostazione giusta dipende dal tuo audio e dai tuoi utenti e nessuno dei due fornitori può sceglierla per te.

Il vero spartiacque: pesi aperti contro un endpoint di anteprima

La differenza di licenza e distribuzione è più ampia di qualsiasi divario nei benchmark in questo confronto, e decide la maggior parte delle implementazioni reali prima ancora che si parli di accuratezza.

• Voxtral Mini 4B Realtime Arabic — Apache 2.0, pesi BF16 su Hugging Face, servibile con vLLM tramite WebSocket su /v1/realtime e supportato nativamente in Transformers dalla versione 5.2.0. La scheda include un esempio Python e un modulo di normalizzazione, così puoi riprodurre da solo il calcolo del CER arabo. Nulla della pipeline richiede i server di Mistral, e il modello è abbastanza piccolo che la domanda operativa è quale GPU, non se puoi permettertene una.

• Gemini 3.5 Transcribe Live — solo API, anteprima pubblica, nessun impegno di prezzo pubblicato oltre le tariffe di listino, e un limite di sessione di dieci minuti che significa che qualsiasi cosa più lunga deve essere suddivisa in blocchi, riconnessa e ricucita dal vostro codice. Tre vincoli segnalati insieme al lancio sono rilevanti specificamente per le distribuzioni in arabo: l'endpoint di streaming non restituisce né la diarizzazione dei parlanti né i timestamp a livello di parola, entrambi presenti nell'endpoint batch ma non in questo. Se la vostra trascrizione in arabo deve sapere chi ha detto cosa, o deve essere allineata temporalmente all'audio, l'endpoint Live non può produrla indipendentemente dalla lingua.

Quei due vincoli sono l'argomento più forte a favore del piccolo modello aperto in un deployment reale per l'arabo, e non hanno nulla a che fare con l'accuratezza. Una pipeline di call center vuole l'attribuzione del parlante, una pipeline di conformità vuole i timestamp, e un modello arabo offline con uno script di normalizzazione che controlli ti offre entrambe le cose senza discutere con un contratto di endpoint. La model card di Mistral elenca anche questo come una limitazione anziché una funzionalità — punta alla trascrizione, è un fine-tuning di un modello generale in tempo reale, ed è onesto nel dire che a monte esiste un modello più ampio se ne hai bisogno.

Quanto costa ciascuno e ciò che è sconosciuto

• Gemini 3.5 Transcribe Live — circa 0,009 $ al minuto di audio in media, calcolati dai prezzi di listino di 3,50 $ per milione di token di input e 21 $ per milione di token di output, con l'audio valutato a 25 token al secondo e la trascrizione a circa 175 token al minuto. L'endpoint batch costa circa 0,005 $ al minuto. Entrambe le cifre sono stime basate sulla tokenizzazione presunta di Google, quindi variano se cambia il computo. Oggi è disponibile un livello gratuito.

• Voxtral Mini 4B Realtime Arabic — nessun prezzo pubblicato, perché non esiste un servizio pubblicato. Il costo è quello che costa il tuo hardware. Un modello BF16 da 4,4 miliardi di parametri entra su un singolo acceleratore moderno, quindi il costo marginale per ora di audio è elettricità e utilizzo, e il costo fisso è la macchina. È più economico di qualsiasi API a consumo su volumi elevati e più costoso di qualsiasi API a consumo a volume zero, che è la normale conformazione del compromesso open-weights.

L'incognita che conta di più sul fronte Mistral non è il prezzo. È se questo repository sia l'inizio di una linea di prodotti o un deliverable una tantum nell'ambito della partnership con il Marocco. Un modello che viene rilasciato in sordina, senza annuncio, senza prezzo e senza servizio, è un modello senza alcun impegno di supporto alle spalle. Apache 2.0 significa che la licenza non può essere revocata per i pesi che già possiedi, ma non dice nulla sul fatto che il checkpoint venga mantenuto, e il puntatore al modello base presente nella scheda stessa suggerisce che il modello general realtime sia ancora la linea supportata.

Per lo strato al di sopra della trascrizione, un livello di routing si ripaga in un modo che non ha nulla a che fare con la trascrizione. Nessuno di questi modelli è un servizio di trascrizione vocale che ospitiamo — OrcaRouter non instrada nessuno dei due endpoint — ma il summarizer, il classificatore di intenti o l'agente che consuma il flusso è un modello che puoi instradare: un'unica chiave API per oltre 200 modelli al prezzo di listino del provider con 0% di ricarico, così un taglio di prezzo del fornitore arriva anche a noi lo stesso giorno, più failover automatico se un provider si degrada. Se stai già combinando due fornitori di servizi vocali per la copertura dei dialetti, mettere i modelli linguistici a valle dietro un'unica chiave anziché due contratti è la metà economica dell'integrazione.

Su quale basarsi

Se il tuo audio è in arabo — un solo dialetto, diversi, o con commutazione di codice tra l'arabo e qualcos'altro — il modello Mistral è il candidato più serio, e il motivo è strutturale, non numerico. Dichiara i dialetti per cui è stato creato, è abbastanza piccolo da girare sul tuo hardware, restituisce testo grezzo che puoi post-elaborare con la tua normalizzazione, e non si trova dietro un limite di sessione di dieci minuti o un filtro contenuti che non puoi ispezionare. Il costo è che gestisce una sola famiglia linguistica e rifiuta le altre, e che nessuno ha ancora pubblicato una valutazione indipendente su di esso.

Se il tuo audio comprende più lingue, o se hai bisogno oggi di un servizio con un percorso di assistenza e un listino prezzi pubblicato, Gemini 3.5 Transcribe Live è disponibile da subito, misurato su un tracker di terze parti, e copre le lingue che il checkpoint Mistral rifiuterà. I costi sono il limite di sessione, la mancanza di diarizzazione e timestamp sull'endpoint in streaming, e il fatto che l'accuratezza specifica per l'arabo è un'affermazione che dovrai verificare tu stesso — l'elenco delle lingue cita l'Egitto, e le prestazioni dialettali non sono dettagliate.

La cosa da tenere d'occhio non è un benchmark. È se Mistral annuncerà o meno questo modello e, in tal caso, con quale prezzo e quale roadmap linguistica. Un repository silenzioso con una licenza Apache 2.0 è un artefatto utile e un impegno debole. Se segue una roadmap dei dialetti arabi — levantino, del Golfo, egiziano come checkpoint separati — la via dei modelli piccoli diventa una risposta davvero completa per la regione, e l'argomentazione sull'ampiezza diventa molto più difficile da sostenere.

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and Gemini 3.5 Transcribe Live across six shared rows: coverage 16 named Arabic varieties against 85+ locales that list Arabic as Egypt only; reported accuracy 8.82% Arabic character error rate at 480ms against 4.0% streaming word error rate at 0.40s; evidence vendor card unreproduced against Artificial Analysis cited by Google; delay configurable with 480ms quoted against 0.40s fixed to final transcript; weights Apache 2.0 and downloadable against API only in public preview; and diarization and timestamps not documented against absent on the Live endpoint. A footer reads that Mistral figures are vendor-reported while Gemini figures are per Artificial Analysis, and that character error rate and word error rate are not comparable. The OrcaRouter logo sits in a white strip at the bottom right.

Nessuno di questi è un modello vocale che ospitiamo noi, ma il livello sopra la trascrizione è instradabile - più di 200 modelli dietro una sola chiave API al prezzo di listino del fornitore con 0% di ricarico, quindi un taglio di prezzo del fornitore sul modello di ragionamento a valle della tua trascrizione è attivo lo stesso giorno.

Failover automatico significa che una pipeline vocale assemblata ha un dominio di guasto in meno, perché il riepilogatore o il classificatore di intenti che consuma la trascrizione può essere reindirizzato invece di cadere insieme a un provider.