Card del titolo hero generata per un confronto tra Voxtral Mini 4B Realtime Arabic e Voxtral 4B TTS, con sottotitolo «due estremi dello stesso ciclo vocale arabo, due licenze diverse», badge «voce in ingresso contro voce in uscita», con tre chip statistiche che riportano un tasso di errore sui caratteri arabi dell'8,82% a 480ms contro 70ms di tempo al primo audio, 16 dialetti arabi contro 9 lingue tra cui l'arabo, e pesi Apache 2.0 contro pesi CC BY-NC 4.0, e il logo OrcaRouter composto in una striscia bianca in basso a destra.
Engineering & Research

Voxtral Mini 4B Realtime Arabic vs Voxtral 4B TTS: I due estremi della stessa conversazione

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Questi due modelli condividono un nome, un numero di parametri e un file di licenza che si comporta diversamente, ed è qui che finisce la somiglianza. Voxtral Mini 4B Realtime Arabic, pubblicato su Hugging Face l'8 ottobre 2026 senza alcun annuncio di accompagnamento, riceve audio in ingresso e produce testo arabo — un fine-tune in streaming di Voxtral-Mini-4B-Realtime-2602 realizzato per l'arabo standard moderno e quindici dialetti denominati, Apache 2.0, tasso medio di errore sui caratteri dell'8,82% con un ritardo di 480 millisecondi. Voxtral 4B TTS, annunciato da Mistral AI a marzo 2026, fa l'opposto: testo in ingresso, parlato in uscita, venti voci preimpostate più l'adattamento da una breve clip di riferimento, nove lingue tra cui l'arabo, e una licenza — CC BY-NC 4.0 — che vieta l'uso commerciale dei pesi stessi. Non sono alternative e non sono varianti. Sono le due metà di un ciclo vocale, e il motivo per guardarli insieme è che le decisioni che prendi su uno di essi vincolano l'altro più di quanto la maggior parte dei team si aspetti.

La maggior parte delle pagine di confronto ti dirà che questi modelli non sono correlati perché uno è ASR e uno è TTS, per poi fermarsi. Questo è vero e non utile. Ciò che vale davvero la pena sapere è dove si incontrano: un agente vocale ha bisogno di entrambi, le due licenze puntano in direzioni opposte, le due impronte hardware sono simili mentre le caratteristiche di throughput non lo sono, e le dichiarazioni sulla copertura dell'arabo sono di forme completamente diverse. Tutto ciò che segue riguarda questi quattro punti d'incontro.

Che cos'è ciascun modello, nei termini che contano per una pipeline

• Voxtral Mini 4B Realtime Arabic — riconoscimento automatico del parlato in streaming. Audio a 16 kHz in ingresso, testo in uscita, circa 4,4 miliardi di parametri in BF16, servito tramite vLLM con un WebSocket su /v1/realtime o nativamente in Transformers dalla versione 5.2.0. Un encoder audio causale e un decoder linguistico, un ritardo di trascrizione configurabile indicato in 480 millisecondi per il valore di accuratezza pubblicato, e un modulo di normalizzazione fornito insieme, così da poter ricalcolare il tasso di errore sui caratteri dell'arabo. Apache 2.0.

• Voxtral 4B TTS — sintesi vocale in streaming e batch. Testo in ingresso, audio a 24 kHz in uscita in WAV, PCM, FLAC, MP3, AAC o Opus, circa 4 miliardi di parametri, con una rosa di 20 voci predefinite e adattamento vocale da una clip di riferimento lunga appena tre secondi. Il benchmark interno di Mistral su una singola H200 che esegue vLLM-Omni 0.18.0 con un input di 500 caratteri e un riferimento di dieci secondi riporta 70 millisecondi di latenza e un fattore di tempo reale di 0,103 con concorrenza 1, che sale a 331 millisecondi e 0,237 con concorrenza 16, e a 552 millisecondi con concorrenza 32. Consultabile come API a 0,016 $ per mille caratteri.

La prima osservazione che emerge da quei due paragrafi è che la coppia è piccola. Entrambi i modelli sono nell'intervallo dei 4 miliardi di parametri e entrambi stanno su un singolo acceleratore in BF16, il che significa che un agente vocale arabo costruito interamente su pesi aperti è al massimo un deployment su due GPU, e plausibilmente un deployment su una singola GPU con quantizzazione su entrambi i lati. Questa è la ragione pratica per considerarli come un insieme anziché come due decisioni di prodotto separate.

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

L'asimmetria delle licenze è il risultato, non una nota a piè di pagina.

Ecco la cosa che sorprende chi presume che modelli dello stesso laboratorio con la stessa convenzione di denominazione portino gli stessi termini.

• Voxtral Mini 4B Realtime Arabic — Apache 2.0. Uso commerciale, modifica, ridistribuzione e fine-tuning sono tutti consentiti, fatte salve le restrizioni standard relative alla violazione dei diritti di terzi.

• Voxtral 4B TTS — CC BY-NC 4.0, ereditata dai dataset di voci di riferimento che ne sono alla base. Non commerciale. La scheda di Mistral è esplicita sul fatto che il modello eredita la licenza delle sue voci di riferimento, tratte da fonti tra cui EARS, CML-TTS, IndicVoices-R e un set di audio naturale in arabo. I pesi sono scaricabili e la licenza non è di tipo commerciale.

Questo è un vincolo rigido sull'esatta architettura a cui tutti ricorrono per prima. Se costruisci un agente vocale arabo il cui ramo speech-to-text è Voxtral Mini 4B Realtime Arabic e il cui ramo text-to-speech è Voxtral 4B TTS, hai una pipeline in cui metà dei componenti è liberamente utilizzabile a fini commerciali e metà no, e la metà restrittiva governa il prodotto. Il fatto che il modello ASR sia Apache 2.0 non salva il ramo TTS. Eseguire la coppia localmente non cambia la licenza, e nemmeno il non distribuire i pesi — il vincolo si applica all'uso, non alla distribuzione.

Screenshot of the Hugging Face model card for mistralai/Voxtral-4B-TTS-2603, captured 10 October 2026, showing the model name, the mistralai organisation, the Text-to-Speech pipeline tag, 922 likes, a language badge, and the CC BY-NC 4.0 licence inherited from the reference-voice datasets.

La via commerciale che Mistral offre per il lato vocale è l'API ospitata a 0,016 $ per mille caratteri, ovvero un accordo di servizio anziché una concessione di licenza. Per un team di prodotto, la conseguenza pratica è che la metà liberamente commercializzabile del ciclo è quella che ascolta, mentre la metà che parla è o una dipendenza da API o una conversazione sulla licenza. Questo capovolge ciò che la maggior parte dei team dà per scontato quando si accinge a costruire uno stack vocale aperto, e vale la pena scoprirlo prima di aver scritto l'integrazione, anziché dopo.

Le affermazioni arabe non coincidono, e solo una di esse è una promessa di copertura.

Entrambi i modelli elencano l'arabo. Gli elenchi significano cose diverse.

• Voxtral Mini 4B Realtime Arabic — L'arabo è l'intero ambito. Sedici varietà elencate come obiettivi di addestramento: arabo standard moderno, marocchino, libico, tunisino, algerino e hassaniya, del Golfo, najdi, omanita e sanaani, egiziano e sudanese, mesopotamico e sia levantino meridionale sia settentrionale, e ciadiano. Qualsiasi cosa al di fuori di questo insieme è documentata come fuori ambito. Un'unica cifra di accuratezza aggregata, 8,82% CER, calcolata come media su sette benchmark arabi.

• Voxtral 4B TTS — L'arabo è una delle nove lingue supportate, insieme a inglese, francese, spagnolo, tedesco, italiano, portoghese, olandese e hindi. La scheda descrive "dialetti diversi" all'interno di tale supporto, senza elencarli, e non è pubblicato alcun dato sulla qualità per singola lingua né per l'arabo né per nessuna delle altre otto.

Letti insieme, i due elementi forniscono un'indicazione dettagliata su quanto bene il tuo sistema sentirà l'arabo e quasi nessuna indicazione su quanto bene lo parlerà. Questa asimmetria ha una conseguenza concreta per un agente vocale in darija o in arabo del Golfo: il lato input ha un benchmark pubblicato e un elenco di dialetti su cui puoi valutare, mentre il lato output ha un badge linguistico e un elenco di voci. Nessuno ha pubblicato una misura di intelligibilità dell'arabo dialettale per Voxtral 4B TTS, e la funzione di adattamento della voce non risolve la questione — adattare una voce cambia a chi somiglia il parlato, non quale dialetto produce.

C'è un secondo punto, più sottile, riguardo al valore di accuratezza del modello ASR stesso che si ripercuote anche sul lato TTS. Mistral riporta 8,82% di CER in streaming contro 7,91% per Voxtral Transcribe Arabic offline sugli stessi sette benchmark con la stessa normalizzazione, quindi lo streaming costa circa un punto. Il compromesso equivalente sul lato TTS — quanto costa l'inferenza in streaming in termini di qualità dell'output rispetto al batch — non è quantificato affatto nel materiale. I numeri sulla latenza esistono; il delta di qualità no.

Throughput: un modello è costruito per essere spinto, l'altro no.

Mistral ha pubblicato i dati di throughput per esattamente uno di questi modelli, e i numeri spiegano il perché.

• Voxtral 4B TTS — misurato su un H200 con vLLM-Omni, un input di 500 caratteri e un riferimento audio di dieci secondi, il throughput va da circa 119 caratteri al secondo di tempo GPU con concorrenza 1 a circa 879 con concorrenza 16 e circa 1.431 con concorrenza 32, con la latenza che sale da 70 millisecondi a 331 e poi 552. Questa è una curva di throughput sulla quale si può pianificare la capacità, ed è la forma che ci si aspetterebbe da un modello progettato come servizio vocale di produzione.

• Voxtral Mini 4B Realtime Arabic — la scheda non riporta alcun dato di throughput, alcun comportamento in concorrenza e alcun benchmark hardware. Ciò che invece dichiara è l'architettura: un encoder causale e uno schema di attenzione a finestra scorrevole sia sull'encoder sia sul decoder, descritti sul modello base come in grado di supportare uno streaming effettivamente illimitato. Il punto di accuratezza è dichiarato a 480 millisecondi di ritardo, il che implica che il modello tiene il passo con l'audio in tempo reale su hardware adeguato, e questo è l'ambito dell'inviluppo di prestazioni pubblicato.

Il divario non è tanto una critica a nessuno dei due modelli quanto un'affermazione sulla loro maturità. Il modello TTS ha una tabella di SLO pubblicata perché è stato rilasciato come prodotto con un post sul blog, una demo, un'API e un prezzo. Il modello ASR arabo non ha un profilo prestazionale pubblicato perché è arrivato come repository con una scheda. Se oggi stai dimensionando una flotta di trascrizione in arabo, il numero di throughput di cui hai bisogno non esiste ancora, e l'unico modo per ottenerlo è eseguire il percorso di serving di vLLM sul tuo hardware con il tuo audio.

È anche il punto in cui un livello di routing cambia la forma del deployment, non solo la fatturazione. OrcaRouter non instrada nessuno di questi modelli — non ospitiamo alcun endpoint vocale Mistral, e questo articolo non sostiene il contrario — ma il livello di modello linguistico tra di essi è esattamente il livello che trae beneficio dall'essere instradato: una sola chiave API per oltre 200 modelli al prezzo di listino del provider con 0% di markup, così un cambiamento di prezzo di un fornitore arriva dalla nostra parte lo stesso giorno in cui viene annunciato, e failover automatico, così un pomeriggio storto di un singolo provider upstream è un reroute anziché un'interruzione nel tuo loop vocale. Un agente vocale assemblato da due modelli Mistral self-hosted più un modello di ragionamento ospitato ha tre domini di guasto; il livello di routing è ciò che rende noioso quello centrale.

Costo, fianco a fianco, con l'avvertenza che un lato non ha un prezzo

• Voxtral 4B TTS — 0,016 $ per mille caratteri tramite l'API di Mistral, oppure il costo della GPU se lo ospiti in proprio, alle condizioni che consentono il tuo caso d'uso. Per avere un'idea approssimativa della scala, mille caratteri sono un paio di centinaia di parole, quindi un minuto di parlato generato si colloca nelle frazioni basse di un centesimo al prezzo di listino, prima di qualsiasi vantaggio di concorrenza derivante dall'eseguirlo in proprio.

• Voxtral Mini 4B Realtime Arabic — nessun prezzo pubblicato, nessun servizio hosted, nessun listino. Il costo è l'hardware e l'utilizzo. Un modello BF16 da 4.4B su un moderno acceleratore è un costo mensile fisso che si ammortizza su tutta l'audio che la macchina è in grado di elaborare: economico a volumi sostenuti e puro spreco a volumi occasionali.

Il confronto che probabilmente conta di più è quello con le alternative a cui ricorreresti invece. Sul fronte dell'ascolto, il checkpoint arabo compete con API di streaming a tariffazione oraria i cui prezzi sono pubblicati e bassi — MAI-Transcribe-2-Streaming di Microsoft a 0,54 $ per ora audio in offerta introduttiva, Grok Voice Transcribe 2.0 di xAI a 0,20 $ per ora audio in streaming — il che significa che un servizio di trascrizione in arabo può essere acquistato per pochi decimi di centesimo al minuto e la tesi dell'open-weights va sostenuta sull'accuratezza dialettale, sulla residenza dei dati o sul fine-tuning più che sul costo unitario. Sul fronte del parlato, un modello TTS self-hosted a costo marginale zero è un vero vantaggio rispetto alle API a tariffazione per carattere quando i volumi sono elevati, ed è per questo che la licenza CC BY-NC è il fattore limitante, più che il prezzo.

Una nota strutturale per chi deve preventivare un passaggio basato sul prezzo: un router che trasferisce il prezzo di listino del provider con un ricarico dello 0% è la superficie in cui una variazione delle tariffe del fornitore compare lo stesso giorno in cui viene annunciata, anziché al successivo ciclo di riprezzamento. Questo conta più sul lato dell'ascolto che sul lato del parlato, perché la trascrizione è prezzata per ora di audio, e quello è un numero che i fornitori modificano.

Come ragionare sulla scelta tra loro

Non stai scegliendo tra loro. La domanda è quale metà del ciclo puoi costruire su pesi aperti, e la licenza risponde.

Se la tua esigenza è un agente vocale arabo autonomo in cui l'audio non lascia mai la tua infrastruttura, il ramo di ascolto è disponibile per te senza condizioni: Apache 2.0, scaricabile, ottimizzabile con fine-tuning, con un elenco di dialetti su cui puoi fare test e un tasso di errore pubblicato per l'arabo. Il ramo di sintesi vocale è quello in cui si concretizza il vincolo, e hai due opzioni oneste — spostare la sintesi vocale su un servizio ospitato con un accordo commerciale, oppure rimuovere Voxtral 4B TTS dall'architettura e trovare un modello di sintesi con licenza permissiva per l'arabo.

Se il tuo requisito è un servizio di trascrizione di produzione e la lingua è l'arabo, la decisione è tra un checkpoint scaricabile da 4,4B con una tassonomia dei dialetti pubblicata e un tasso di errore aggregato, e un'API di streaming ospitata con una tariffa pubblicata, una latenza pubblicata e una classifica di terze parti. Il modello aperto vince su controllo, residenza e fine-tuning; le opzioni ospitate vincono su evidenza, supporto e semplicità operativa. Due giorni dopo la comparsa dei pesi, nessuno al di fuori di Mistral li ha misurati, e questo è un motivo per eseguire il proprio benchmark piuttosto che un motivo per scartare il checkpoint.

Ciò che cambierebbe di più questo quadro è un rilascio di sintesi in arabo a condizioni che ne consentano l'uso commerciale — lo stesso schema che il versante dell'ascolto già segue. Finché non esisterà, il ciclo resta semiaperto, e il lavoro pratico consiste nel decidere quale metà sei disposto ad affittare.

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and Voxtral 4B TTS across six shared rows: task speech to text against text to speech with 24 kHz audio output; Arabic claim 16 named dialects at 8.82% character error rate against 1 of 9 languages with no quality figure; licence Apache 2.0 permitting commercial use against CC BY-NC 4.0 non-commercial weights; service price none published against $0.016 per 1,000 characters; published throughput none against 119 to 1,431 characters per second per GPU; and hardware roughly 4.4B in BF16 on a single accelerator against roughly 4B in BF16 on a single accelerator. A footer reads that all figures are Mistral's own and unreproduced, and that the two models are complementary rather than competing. The OrcaRouter logo sits in a white strip at the bottom right.

Non ospitiamo nessuno di questi due modelli vocali Mistral e questo articolo non afferma il contrario; ciò che il ciclo vocale richiede al di sopra di essi è il livello linguistico, e questo è instradabile - un'unica chiave API per più di 200 modelli al prezzo di listino del fornitore con 0% di ricarico, così una variazione delle tariffe del fornitore ricade su di noi lo stesso giorno in cui viene annunciata.

Failover automatico impedisce che la parte centrale di un agente vocale a tre componenti - un modello di ragionamento a monte tra due modelli Mistral self-hosted - sia quella che manda in tilt il prodotto.