Hero-titelkaart gegenereerd voor een vergelijking van Voxtral Mini 4B Realtime Arabic en Voxtral 4B TTS, met als ondertitel 'twee uiteinden van dezelfde Arabische spraaklus, twee verschillende licenties', voorzien van het label 'spraak in versus spraak uit', met drie statistiekchips die 8,82% Arabische tekenfoutratio bij 480 ms tegenover 70 ms tot de eerste audio lezen, 16 Arabische dialecten tegenover 9 talen waaronder Arabisch, en Apache 2.0-gewichten tegenover CC BY-NC 4.0-gewichten, en het OrcaRouter-logo samengesteld in een witte strook rechtsonder.
Engineering & Research

Voxtral Mini 4B Realtime Arabic vs Voxtral 4B TTS: Twee uiteinden van hetzelfde gesprek

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Deze twee modellen delen een naam, een aantal parameters en een licentiebestand dat zich anders gedraagt, en daar houdt de gelijkenis op. Voxtral Mini 4B Realtime Arabic, op 8 oktober 2026 naar Hugging Face gepusht zonder begeleidende aankondiging, neemt audio als invoer en produceert Arabische tekst — een streaming fine-tune van Voxtral-Mini-4B-Realtime-2602, gebouwd voor Modern Standard Arabic en vijftien met naam genoemde dialecten, Apache 2.0, 8,82% gemiddelde Character Error Rate bij een vertraging van 480 milliseconden. Voxtral 4B TTS, in maart 2026 aangekondigd door Mistral AI, doet het omgekeerde: tekst in, spraak uit, twintig vooraf ingestelde stemmen plus aanpassing op basis van een korte referentieclip, negen talen waaronder Arabisch, en een licentie — CC BY-NC 4.0 — die commercieel gebruik van de gewichten zelf verbiedt. Het zijn geen alternatieven en het zijn geen varianten. Het zijn de twee helften van een stemlus, en de reden om ze samen te bekijken is dat de beslissingen die je over een van beide neemt, de andere meer beperken dan de meeste teams verwachten.

De meeste vergelijkingspagina's zullen je vertellen dat deze modellen niets met elkaar te maken hebben omdat de een ASR is en de ander TTS, en daar dan stoppen. Dat is waar en niet nuttig. Wat werkelijk de moeite waard is om te weten, is waar ze elkaar raken: een voice-agent heeft beide nodig, de twee licenties wijzen in tegengestelde richtingen, de twee hardwarevoetafdrukken lijken op elkaar terwijl de doorvoerkarakteristieken dat niet doen, en de claims over Arabische dekking zijn totaal anders van vorm. Alles hieronder gaat over die vier raakvlakken.

Wat elk model is, in de termen die ertoe doen voor een pipeline

• Voxtral Mini 4B Realtime Arabic — streaming automatische spraakherkenning. 16 kHz audio in, tekst uit, ongeveer 4,4 miljard parameters in BF16, geserveerd via vLLM met een WebSocket op /v1/realtime of native in Transformers vanaf versie 5.2.0. Een causale audio-encoder en een taaldecoder, een configureerbare transcriptievertraging die wordt opgegeven als 480 milliseconden voor het gepubliceerde nauwkeurigheidscijfer, en een normalisatiemodule die erbij wordt geleverd zodat de Arabische karakterfoutratio opnieuw kan worden afgeleid. Apache 2.0.

• Voxtral 4B TTS — streaming en batch tekst-naar-spraak. Tekst in, 24 kHz audio uit in WAV, WAV, FLAC, MP3, AAC of Opus, ongeveer 4 miljard parameters, met een presetlijst van 20 stemmen en stemadaptatie op basis van een referentieclip van slechts drie. Mistrals eigen benchmark op een enkele H1 met vLLM-Omni 0.18 met een invoer van 500 tekens en een referentie van tien seconden rapporteert 70 milliseconden latentie en een real-timefactor van 0,103 bij gelijktijdigheid 1, oplopend tot 331 milliseconden en 0,237 bij gelijktijdigheid 16, en 552 milliseconden bij gelijktijdigheid 32. Geraadpleegd als API voor $0,016 per duizend tekens.

De eerste observatie uit die twee alinea's is dat het paar klein is. Beide modellen zitten in het bereik van 4 miljard parameters en beide passen op één accelerator in BF16, wat betekent dat een Arabische spraakagent die volledig op open gewichten is gebouwd, hooguit een implementatie op twee GPU's is, en aannemelijk een implementatie op één GPU met kwantisatie aan beide kanten. Dat is de praktische reden om ze als een geheel te bekijken in plaats van als twee afzonderlijke productbeslissingen.

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

De licentie-asymmetrie is de bevinding, niet een voetnoot.

Dit is het punt dat mensen verrast die aannemen dat modellen van hetzelfde lab met dezelfde naamgevingsconventie dezelfde voorwaarden hebben.

• Voxtral Mini 4B Realtime Arabic — Apache 2.0. Commercieel gebruik, wijziging, herdistributie en fine-tuning zijn allemaal toegestaan, met inachtneming van de standaardbeperking tegen inbreuk op de rechten van derden.

• Voxtral 4B TTS — CC BY-NC 4.0, overgenomen van de referentiestemdatasets erachter. Niet-commercieel. De kaart van Mistral vermeldt expliciet dat het model de licentie van zijn stemreferenties erft, afkomstig uit bronnen waaronder EARS, CML-TTS, IndicVoices-R en een Arabische set met natuurlijke audio. De gewichten zijn downloadbaar en de licentie is niet commercieel.

Dit is een harde beperking op de exacte architectuur waar iedereen als eerste naar grijpt. Als je een Arabische spraakagent bouwt waarvan het spraak-naar-tekst-deel Voxtral Mini 4B Realtime Arabic is en het tekst-naar-spraak-deel Voxtral 4B TTS, heb je een pijplijn waarin de helft van de componenten vrijelijk commercieel is en de helft niet, en het beperkende deel bepaalt het product. Dat het ASR-model Apache 2.0 is, redt de TTS-tak niet. De combinatie lokaal draaien verandert de licentie niet, en het niet meeleveren van de gewichten evenmin — de beperking kleeft aan het gebruik, niet aan de distributie.

Screenshot of the Hugging Face model card for mistralai/Voxtral-4B-TTS-2603, captured 10 October 2026, showing the model name, the mistralai organisation, the Text-to-Speech pipeline tag, 922 likes, a language badge, and the CC BY-NC 4.0 licence inherited from the reference-voice datasets.

De commerciële route die Mistral voor de spraakkant biedt, is de gehoste API tegen $0,016 per duizend tekens, wat een serviceovereenkomst is en geen licentieverlening. Voor een productteam is de praktische consequentie dat de vrij commercieel te exploiteren helft van de lus de helft is die luistert, en de helft die spreekt is ofwel een API-afhankelijkheid ofwel een licentiegesprek. Dat keert om wat de meeste teams aannemen wanneer ze beginnen met het bouwen van een open spraakstack, en het is de moeite waard om dat te ontdekken voordat je de integratie hebt geschreven in plaats van erna.

De Arabische beweringen komen niet overeen, en slechts één ervan is een dekkingsbelofte.

Beide modellen vermelden Arabisch. De vermeldingen betekenen verschillende dingen.

• Voxtral Mini 4B Realtime Arabic — Arabisch is de volledige scope. Zestien variëteiten worden opgesomd als trainingsdoelen: Modern Standaardarabisch, Marokkaans, Libisch, Tunesisch, Algerijns en Hassaniya-Arabisch, Golf-, Najdi-, Omaans- en Sanaaans-Arabisch, Egyptisch en Soedanees, Mesopotamisch en zowel Zuid- als Noord-Levantijns, en Tsjadisch. Alles buiten die set wordt gedocumenteerd als buiten scope. Eén geaggregeerd nauwkeurigheidscijfer, 8,82% CER, gemiddeld over zeven Arabische benchmarks.

• Voxtral 4B TTS — Arabisch is een van de negen ondersteunde talen, naast Engels, Frans, Spaans, Duits, Italiaans, Portugees, Nederlands en Hindi. De kaart beschrijft "diverse dialecten" binnen die ondersteuning, zonder ze op te sommen, en er is geen kwaliteitscijfer per taal gepubliceerd voor Arabisch of voor een van de andere acht.

Samen gelezen geeft het paar je een gedetailleerde uitspraak over hoe goed je systeem Arabisch zal horen en vrijwel geen enkele uitspraak over hoe goed het het zal spreken. Die asymmetrie heeft echte gevolgen voor een Darija- of Golf-Arabische voice-agent: de invoerzijde heeft een gepubliceerde benchmark en een dialectenlijst waartegen je kunt evalueren, en de uitvoerzijde heeft een taalbadge en een stemmenlijst. Niemand heeft voor Voxtral 4B TTS een verstaanbaarheidsmeting voor dialectisch Arabisch gepubliceerd, en de functie voor stemadaptatie lost dat niet op — het aanpassen van een stem verandert op wie de spraak lijkt, niet welk dialect die voortbrengt.

Er is een tweede, subtieler punt over het eigen nauwkeurigheidscijfer van het ASR-model dat ook geldt voor de TTS-kant. Mistral rapporteert 8,82% CER voor streaming tegenover 7,91% voor de offline Voxtral Transcribe Arabic op dezelfde zeven benchmarks met dezelfde normalisatie, dus streaming kost ongeveer een punt. De equivalente afweging aan de TTS-kant — wat streaming-inferentie aan uitvoerkwaliteit kost in vergelijking met batch — wordt in het materiaal helemaal niet gekwantificeerd. De latentiecijfers bestaan; het kwaliteitsverschil niet.

Doorvoer: het ene model is gebouwd om tot het uiterste te worden gedreven, het andere niet.

Mistral publiceerde doorvoergegevens voor precies één van deze modellen, en de cijfers verklaren waarom.

• Voxtral 4B TTS — gemeten op één H200 met vLLM-Omni, bij een invoer van 500 tekens en een audioreferentie van tien seconden, varieert de doorvoer van ongeveer 119 tekens per seconde aan GPU-tijd bij een gelijktijdigheid van 1 tot ruwweg 879 bij een gelijktijdigheid van 16 en ongeveer 1.431 bij een gelijktijdigheid van 32, terwijl de latentie stijgt van 70 milliseconden naar 331 en vervolgens 552. Dat is een doorvoercurve waarmee u capaciteitsplanning kunt doen, en het is de vorm die u zou verwachten van een model dat is ontworpen als een productie-spraakservice.

• Voxtral Mini 4B Realtime Arabic — de kaart vermeldt geen doorvoercijfer, geen gedrag bij gelijktijdigheid en geen hardwarebenchmark. Wat er wel in staat, is de architectuur: een causale encoder en een sliding-window-aandachtsschema op zowel de encoder als de decoder, op het basismodel beschreven als ondersteuning voor vrijwel onbeperkte streaming. Het nauwkeurigheidspunt wordt opgegeven bij een vertraging van 480 milliseconden, wat impliceert dat het model realtime audio bijhoudt op geschikte hardware, en dat is de reikwijdte van de gepubliceerde prestatie-envelop.

De kloof is niet zozeer een kritiek op een van beide modellen als wel een uitspraak over volwassenheid. Het TTS-model heeft een gepubliceerde SLO-tabel omdat het als product is uitgebracht met een blogpost, een demo, een API en een prijs. Het Arabische ASR-model heeft geen gepubliceerde prestatie-envelop omdat het verscheen als een repository met een modelkaart. Als je vandaag de grootte bepaalt van een vloot voor Arabische transcriptie, bestaat het doorvoercijfer dat je nodig hebt nog niet, en de enige manier om eraan te komen is het vLLM-servingpad op je eigen hardware te draaien met je eigen audio.

Dat is ook waar een routeringslaag de vorm van de implementatie verandert, in plaats van alleen de facturering. OrcaRouter routeert geen van deze modellen — we hosten geen van beide Mistral-spraakeindpunten, en dit artikel beweert niet anders — maar de taalmodellaag ertussen is precies de laag die baat heeft bij routering: één API-sleutel voor meer dan 200 modellen tegen de listprijs van de provider met 0% opslag, zodat een prijswijziging van een leverancier op dezelfde dag dat die wordt aangekondigd bij ons terechtkomt, en automatische failover zodat een slechte middag van één upstreamprovider een omleiding is in plaats van een storing in je spraaklus. Een spraakagent die is samengesteld uit twee zelfgehoste Mistral-modellen plus één gehost redeneermodel heeft drie storingsdomeinen; de routeringslaag is wat de middelste saai maakt.

Kosten, naast elkaar, met de kanttekening dat de ene kant geen prijs heeft

• Voxtral 4B TTS — $ 0,016 per duizend tekens via de API van Mistral, of de kosten van de GPU als je het zelf host onder voorwaarden die jouw gebruiksscenario toestaan. Voor een ruwe indicatie van de schaal: duizend tekens zijn een paar honderd woorden, dus een minuut gesproken output komt tegen de lijstprijs uit op enkele kleine fracties van een cent, nog vóór enig voordeel qua gelijktijdigheid dat het zelf draaien oplevert.

• Voxtral Mini 4B Realtime Arabic — geen gepubliceerde prijs, geen gehoste dienst, geen tarievenkaart. De kosten bestaan uit hardware en benutting. Een 4,4B BF16-model op één moderne accelerator is een vaste maandelijkse kostenpost die je afschrijft over zoveel audio als de machine kan verwerken; dat is goedkoop bij aanhoudend volume en pure verspilling bij incidenteel volume.

De vergelijking die waarschijnlijk zwaarder weegt, is met de alternatieven waarnaar je anders zou grijpen. Aan de luisterkant concurreert het Arabische checkpoint met streaming-API's per uur waarvan de tarieven gepubliceerd en laag zijn — Microsofts MAI-Transcribe-2-Streaming tegen $0,54 per audio-uur als introductietarief, xAI's Grok Voice Transcribe 2.0 tegen $0,20 per audio-uur streaming — wat betekent dat een Arabische transcriptieservice kan worden gekocht voor een paar tienden van een cent per minuut, en dat de argumentatie voor open weights moet worden gebaseerd op dialectnauwkeurigheid, dataresidentie of fine-tuning in plaats van op kosten per eenheid. Aan de spreekkant is een zelfgehost TTS-model met nul marginale kosten een echt voordeel ten opzichte van API's per teken bij grote volumes, en daarom is de CC BY-NC-licentie de beperkende factor in plaats van de prijs.

Eén structurele opmerking voor wie een op prijs gebaseerde overstap budgetteert: een router die de lijstprijs van de provider tegen 0% opslag doorgeeft, is het oppervlak waarop een tariefwijziging van een leverancier dezelfde dag dat die wordt aangekondigd zichtbaar wordt in plaats van bij de volgende herprijzingscyclus. Dat is belangrijker aan de luisterkant dan aan de spreekkant, omdat transcriptie per uur audio wordt geprijsd en dat is een getal dat leveranciers nog weleens aanpassen.

Hoe je moet nadenken over het kiezen tussen beide

Je kiest niet tussen hen. De vraag is welke helft van de lus je op open gewichten kunt bouwen, en de licentie geeft daarop het antwoord.

Als uw vereiste een op zichzelf staande Arabische spraakagent is waarbij audio uw infrastructuur nooit verlaat, dan is het luistergedeelte onvoorwaardelijk voor u beschikbaar: Apache 2.0, downloadbaar, fijn af te stemmen, met een dialectlijst waartegen u kunt testen en een gepubliceerd Arabisch foutenpercentage. Het sprekende gedeelte is waar de beperking toeslaat, en u hebt twee eerlijke opties — verplaats de spraaksynthese naar een gehoste dienst onder een commerciële overeenkomst, of verwijder Voxtral 4B TTS uit de architectuur en zoek een spraaksynthesemodel voor het Arabisch met een permissieve licentie.

Als uw vereiste een productietranscriptiedienst is en de taal Arabisch is, dan gaat de keuze tussen een downloadbaar checkpoint van 4,4B met een gepubliceerde dialecttaxonomie en één samengevoegd foutpercentage, en een gehoste streaming-API met een gepubliceerd tarief, een gepubliceerde latentie en een leaderboard van derden. Het open model wint op controle, gegevensresidentie en fine-tuning; de gehoste opties winnen op bewijs, ondersteuning en operationele eenvoud. Twee dagen nadat de gewichten verschenen, heeft niemand buiten Mistral ze gemeten, en dat is een reden om uw eigen benchmark te draaien in plaats van een reden om het checkpoint terzijde te schuiven.

Wat dit beeld het meest zou veranderen, is een Arabische synthese-release onder voorwaarden die commercieel gebruik toestaan — hetzelfde patroon dat de luisterkant al volgt. Zolang dat niet bestaat, blijft de lus halfopen, en het praktische werk is beslissen welke helft je bereid bent te huren.

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and Voxtral 4B TTS across six shared rows: task speech to text against text to speech with 24 kHz audio output; Arabic claim 16 named dialects at 8.82% character error rate against 1 of 9 languages with no quality figure; licence Apache 2.0 permitting commercial use against CC BY-NC 4.0 non-commercial weights; service price none published against $0.016 per 1,000 characters; published throughput none against 119 to 1,431 characters per second per GPU; and hardware roughly 4.4B in BF16 on a single accelerator against roughly 4B in BF16 on a single accelerator. A footer reads that all figures are Mistral's own and unreproduced, and that the two models are complementary rather than competing. The OrcaRouter logo sits in a white strip at the bottom right.

We hosten geen van deze twee Mistral-spraakmodellen en dit artikel beweert dat ook niet; wat de spraaklus daarbovenop nodig heeft, is de taallaag, en die is routeerbaar - één API-sleutel voor meer dan 200 modellen tegen de lijstprijs van de provider met 0% opslag, zodat een tariefwijziging van een leverancier dezelfde dag dat ze wordt aangekondigd aan onze kant landt.

Automatische failover zorgt ervoor dat het middelste deel van een uit drie componenten bestaande voice-agent – één upstream reasoning-model tussen twee zelfgehoste Mistral-modellen – niet het onderdeel is dat het product platlegt.