
Voxtral-Mini-4B-Realtime-Arabic: Mistral bracht een ASR-model voor Arabische dialecten uit en zei niets
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 118 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Negenenvijftig seconden is de volledige publieke aankondiging voor Voxtral-Mini-4B-Realtime-Arabic. Op 8 oktober 2026 om 11:36:06 UTC verscheen een repository met de naam mistralai/Voxtral-Mini-4B-Realtime-Arabic op Hugging Face. Op 11:37:05 — negenenvijftig seconden later — verscheen daarnaast een tweede repository, mistralai/LIDstral-Arabic. Beide hebben dezelfde tijdstempel voor de laatste wijziging, beide stonden op nul downloads en drie likes toen dit op 10 oktober werd geschreven, en geen van beide heeft een launchpost, een prijzenpagina, een blogbericht of een regel in de nieuwsindex van Mistral achter zich. Voxtral-Mini-4B-Realtime-Arabic is een streaming spraak-naar-tekstmodel voor het Arabisch — Modern Standaardarabisch plus vijftien met naam genoemde dialecten — dat is gefinetuned op basis van Voxtral-Mini-4B-Realtime-2602 en gepubliceerd onder Apache 2.0 met downloadbare BF16-gewichten. Dat bewijst de repository in elk geval. Of Mistral van plan is om het te ondersteunen, er een prijs voor te vragen of er überhaupt iets over te zeggen, valt nog niet te weten, en dit stuk houdt die twee categorieën bewust gescheiden.
De korte versie: een bekend-goede realtime ASR-architectuur werd gericht op één taalfamilie en zijn dialecten, de gewichten en beide servingpaden zijn vandaag openbaar en uitvoerbaar, en het bedrijf erachter heeft zich niet uitgelaten. Wat volgt is een interpretatie van wat er feitelijk bestaat — de tijdstempels in de repository, de configuratiebestanden, de eigen cijfers op de modelkaart — plus een duidelijke grens rond wat dat allemaal niet zegt.
Wat staat er op de hub, en hoe is het daar gekomen?
Het primaire artefact is één enkele Hugging Face-repository, mistralai/Voxtral-Mini-4B-Realtime-Arabic, met een modelkaart, safetensors-gewichten in BF16 en de processor- en configuratiebestanden die nodig zijn om deze te laden. Het aanmaaktijdstip is 2026-10-08T11:36:06Z. De laatste wijziging is 2026-10-09T17:11:35Z — de repository werd nog bewerkt op de dag nadat deze verscheen.
Het moment waarop de zusterrepo verscheen, is het detail dat van één stille upload iets lezenswaardigs maakt. mistralai/LIDstral-Arabic is aangemaakt op 2026-10-08T11:37:05Z, minder dan een minuut later, met een identieke wijzigingstijdstempel en identieke engagementcijfers, en een pipeline-tag van text-classification in plaats van spraakherkenning. Twee repositories, twee verschillende taken, zestig seconden na elkaar. Zo wordt een eenmalig experiment niet gepubliceerd; zo wordt een batch gepusht.
De grotere afstand is wat de combinatie vreemd maakt. Vóór 8 oktober was de meest recente Mistral-modelrepository van welke aard dan ook Shieldstral-1.0-3B op 2026-07-16 — ongeveer twaalf weken van een lege hub, doorbroken door twee uploads binnen een minuut. Een ASR-checkpoint voor Arabische dialecten en een classifier voor Arabische taalidentificatie die samen arriveren, naamloos en onverklaard, vormen het kenmerk van een release die intern wordt gecoördineerd en extern niet wordt aangekondigd. Het is niet het kenmerk van een lek, en het is de moeite waard om precies te zijn over waarom: een lek is gewichten zonder licentie, zonder config, zonder een servingpad. Dit heeft alle drie.

De modelkaart is geschreven om te worden uitgeleverd. Ze documenteert gebruik, benchmarks, beperkingen en licentie in het gebruikelijke formaat, en noemt de medeontwikkelaar: Marokko's Ministère de la Transition Numérique et de la Réforme Administrative, in het kader van het strategische partnerschap dat in januari 2026 tussen Mistral en Marokko is ondertekend, waarbij het model wordt beschreven als een soevereine AI-asset. Die framing is consistent met een deliverable die bestaat omdat een contract vereist dat die bestaat, wat een plausibele reden is waarom gewichten openbaar kunnen zijn terwijl een lanceringsbericht ontbreekt. Het is een plausibele reden. Het is geen bevestigde reden, en de kaart zegt dat niet.
De dialectenlijst is de werkelijke productbeslissing
De kaart bevat zestien taaltags. Slechts één ervan is een taal in de gewone zin.
• Modern Standaardarabisch — de ar-tag, de variant die elk Arabisch ASR-systeem al aankan.
• Maghreb — Marokkaans (ary), Libisch (ayl), Tunesisch (aeb), Algerijns (arq) en Hassaniya, de Mauritaanse variant (mey).
• Golf — Golf-Arabisch in Bahrein, Koeweit, Qatar en de VAE (afb), Najdi (ars), Omanitisch (acx) en Sanaani, de Jemenitische variant (ayn).
• Nijlvallei — Egyptisch (arz) en Sudanees (apd).
• Levantijns en Irak — Mesopotamisch (acm), Zuid-Levantijns voor Jordanië en Palestina (ajp) en Noord-Levantijns voor Libanon en Syrië (apc).
• Anders — Tsjadisch Arabisch (shu).
Lees dat als een specificatie, en het punt is niet "het doet Arabisch". Tal van modellen doen Arabisch. Het punt is dat Marokkaans Darija, Golf-Arabisch, Egyptisch-Arabisch en Tsjadisch-Arabisch als afzonderlijke trainingsdoelen staan vermeld in plaats van als accenten die één Modern Standaardarabisch model wordt geacht op te vangen. Dat is een wezenlijk moeilijker probleem, en het is het probleem dat Arabische spraaksystemen in productie daadwerkelijk laat stuklopen — een Marokkaans callcenter en een supportlijn in de Golfregio zijn niet dezelfde audio, en een model dat op fusḥā is afgestemd, faalt doorgaans op beide. De kaart vermeldt ook dat code-switching, waarbij een spreker midden in een gesprek van taal wisselt, een trainingsfocus was in plaats van een neveneffect.
De beperking wordt net zo duidelijk vermeld, en het is de moeite waard de kern te citeren in plaats van die af te zwakken: het model is gericht op Arabische transcriptie, en voor andere talen verwijst de kaart je naar het originele Voxtral-Mini-4B-Realtime-2602. Dit is een gespecialiseerd checkpoint, geen algemeen checkpoint. Er is geen enkele ambiguïteit en geen enkele aanwijzing dat er een meertalige versie aankomt.
De architectuur, gelezen uit de config in plaats van uit de prozatekst
De tekst op een modelkaart heeft een marketingachtige vorm; de configuratiebestanden zijn mechanisch, en daarin zitten de operationele beperkingen. Het volgende is rechtstreeks gelezen uit de config.json, params.json en processor_config.json van de repository.
• Twee stacks, niet één — een causale audio-encoder van 32 lagen met een verborgen breedte van 1280 en 32 attention-heads, die een taaldecoder van 26 lagen met een verborgen breedte van 3072 voedt, met 32 query-heads tegenover 8 key-value-heads. Het "ongeveer 4,4 miljard parameters" van de kaart is de som; de encoder is daarvan de kleinere helft.
• Audio-front-end — 16 kHz invoer, 128 mel-bins, een FFT van 400 samples met een hop van 160 samples, wat een encoder-framerate van 12,5 per seconde oplevert, oftewel één frame per 80 milliseconden. De architectuur is geregistreerd als voxtral_realtime met een VoxtralRealtimeForConditionalGeneration-head.
• De vertraging is een tokenaantal, geen veld in milliseconden — default_num_delay_tokens is 6. Zes encoderframes van elk 80 milliseconden zijn 480 milliseconden, precies de vertraging waarbij de kaart zijn nauwkeurigheidscijfer vermeldt. Het latentiecijfer in de marketing is dus een configuratiewaarde die je kunt wijzigen, en het kopcijfer van de kaart is één punt op een curve in plaats van een eigenschap van het model.
• Encoderaandacht is beperkt tot een venster van 750 frames — ongeveer zestig seconden audio — terwijl de decoder met een schuivend venster van 8.192 tokens werkt tegen een maximale positie-embedding van 131.072. Het encodervenster is het eerste getal dat je met je eigen workload moet vergelijken: een streamingsessie die langer dan een minuut duurt, werkt op een rollend venster, niet op onbeperkte context, en hoe het model zich gedraagt wanneer een lange opname voorbij die grens schuift, is iets waar de kaart niet op ingaat.
• Quantisatie wordt niet meegeleverd — de gepubliceerde dtype is overal bfloat16. Wie een int8- of fp8-deployment wil, bouwt die zelf.
Het cijfer van 8,82%, en wie erachter staat
Elk nauwkeurigheidscijfer dat aan dit model is gekoppeld, is afkomstig van de modelkaart. Niets hiervan is door een derde partij gereproduceerd, en de onderstaande cijfers moeten worden gelezen als de eigen claims van de leverancier, niet als metingen.
• Gemiddeld karakterfoutpercentage — 8,82% over zeven Arabische benchmarks, bij de standaard transcriptievertraging van 480 milliseconden, temperatuur 0,0.
• Vergeleken met zijn eigen offline tegenhanger — Voxtral Transcribe Arabic staat op 7,91% op dezelfde zeven benchmarks, dus het realtime-model blijft 0,91 procentpunt achter bij een niet-streamend Arabisch model van dezelfde leverancier. Die vergelijking is van Mistral zelf, en dat is wat haar nuttig maakt: het is een zuivere meting van wat subsecondelatentie kost in deze taalfamilie, op identieke data met identieke scoring.
• Nieuwe benchmarks in de mix — de zeven omvatten ISMA en Darija in the Wild, die volgens de kaart samen met Marokko's MTNRA zijn ontwikkeld. Dat een leverancier zijn eigen evaluatiesets naast een model introduceert, is normaal, en het betekent ook dat een deel van de benchmarksuite geen externe geschiedenis heeft om tegen te vergelijken.
• Normalisatie is het cruciale voorbehoud — de CER-cijfers worden berekend met een normalisatieschema dat ook samen met MTNRA is ontwikkeld, en dat dialectspecifieke spelling, clitics, leenwoorden en gesproken getallen dekt, en de kaart stelt ronduit dat scores kunnen verschillen onder andere normalisatiemethoden. De code wordt meegeleverd in de repository als normalization.py. Lees dat als een uitnodiging om het te controleren, en ook als een waarschuwing: twee teams kunnen dit model op dezelfde audio draaien en verschillende CER-cijfers publiceren zonder dat een van beide ongelijk heeft.
• Eén voetnoot is nadelig voor een concurrent — de kaart merkt op dat Gemini's veiligheidsfilters de transcriptie van sommige FLEURS-audiosamples blokkeren. Dat is een specifieke, controleerbare observatie over een concurrerende pijplijn, en het is het soort gedrag dat een ranglijst platvlakt: een sample dat een model weigert te transcriberen, wordt opgevat als een fout of als ontbrekende data, en geen van beide interpretaties is een eerlijke score.

Twee dingen ontbreken in de bewijsbasis en beide doen ertoe. Er is geen onafhankelijke evaluatie, dus geen enkel cijfer hier heeft contact met een derde partij overleefd. En er is geen prijs, want er is geen dienst — er wordt niets verkocht, dus er valt niets te beprijzen. Een model dat wordt geleverd met geclaimde cijfers en geen commercieel aanbod, is een model waarvan niemand buiten het lab een reden heeft gehad om de cijfers te testen.
Vandaag draaien we het.
Dit is het onderdeel dat een echte checkpoint onderscheidt van een placeholder, en de repository is ongewoon compleet voor iets onaangekondigds. Twee ondersteunde paden worden op de kaart meegeleverd.
• vLLM — installeer vLLM met de audio-extra's uit mistral-common, serveer vervolgens het checkpoint op naam en stream audio via een WebSocket naar het /v1/realtime-endpoint. De kaart verwijst naar het realtime spraak-naar-tekst-voorbeeld van vLLM als het ding dat je moet aanpassen, wat betekent dat het streamingcontract een gedocumenteerde, onderhouden interface is in plaats van iets dat voor de demo in elkaar is geflanst.
• Transformers — native ondersteuning vanaf versie 5.2.0, geladen via AutoProcessor en VoxtralRealtimeForConditionalGeneration in bfloat16, met een volledig Python-voorbeeld op de kaart. De voorbeeldaudio die het gebruikt is een Arabisch bankgesprek, assets/bank-take-2.wav, wat op zijn minst een eerlijke keuze van democlip voor dit model is.
Beide paden zijn self-hosted. Er is geen gehost endpoint voor dit checkpoint dat we ergens kunnen verifiëren, geen leveranciers-API en geen gepubliceerd tarief. Ondersteuning in het bredere ecosysteem is bewust echt dun: native Transformers-ondersteuning op 5.2.0 is het nieuwste hier, en het vLLM-pad is afhankelijk van de audio-extra's. Een operator die dit in productie wil, levert de GPU, het servingproces en de WebSocket-client, en erft een checkpoint waaraan geen enkele ondersteuningsverplichting is verbonden.
![A screenshot of the vLLM documentation page for realtime speech-to-text (captured October 10, 2026), showing the heading 'Realtime Speech-to-Text with Voxtral Realtime', the install commands 'pip install --upgrade vllm mistral-common[audio]' and 'vllm serve mistralai/Voxtral-Mini-4B-Realtime-Arabic', the instruction to stream audio over WebSocket to the /v1/realtime endpoint, and a following section on the OpenAI Realtime Client.](https://cms.orcarouter.ai/api/media/file/4-1756.png)
Die kloof is waar een routeringslaag echt nuttig is, en het is de moeite waard om precies te zijn over de grens. OrcaRouter bedient Voxtral-Mini-4B-Realtime-Arabic niet — het checkpoint staat niet in onze catalogus, en we zullen niet anders suggereren. Wat een router in deze implementatie wel bereikt, is alles downstream van het transcript: de samenvatter, de intentieclassificator, de agent die de stream verbruikt. Dat zijn modellen die je via één API-sleutel kunt aanroepen, verspreid over meer dan 200 modellen tegen de lijstprijs van de provider met 0% opslag, met automatische failover wanneer een provider verslechtert en een routing-DSL om meerdere modellen in één aanroep samen te stellen. Als je een zelfgehoste Arabische ASR-dienst opzet, is het spraakgedeelte van die stack aan jou om te draaien; het taalgedeelte heeft geen tweede contract, tweede SDK of tweede facturatieverhouding nodig om daarmee samen te gaan.
Wat zou hier een verhaal van maken?
Dit is een echt artefact en een onvolledige release, en het onvolledige is het interessante deel. Apache 2.0 kan niet worden ingetrokken voor de al gedownloade gewichten, dus het licentierisico is opgelost. Wat niet is opgelost, is alles wat de licentie niet dekt.
Drie dingen zouden het beeld veranderen, en geen ervan bestaat al. Een aankondiging: een blogpost, een prijsklasse of een regel in Mistral's nieuwsindex zou verklaren of dit een product of een contractdeliverable is, en ze zou vrijwel zeker het detail bevatten dat de kaart weglaat. Een onafhankelijke run: het cijfer van 8,82% en de kloof van 0,91 punt met Voxtral Transcribe Arabic zijn de beweringen die het meest de moeite waard zijn om te reproduceren, en de meegeleverde normalisatiecode maakt dat ongewoon gemakkelijk voor iedereen die het wil proberen. En een tweede checkpoint: een afzonderlijk verschijnend Levantijns, Golf- of Egyptisch model zou van een enkele dialectspecialist een familie maken, wat het verschil is tussen een veelbelovend onderzoeksartefact en iets waarop een regionale implementatie daadwerkelijk kan standaardiseren.
Totdat ten minste één daarvan opduikt, is de nauwkeurige samenvatting van Voxtral-Mini-4B-Realtime-Arabic deze: een compleet, uitvoerbaar Apache-2.0 ASR-checkpoint voor Arabische dialecten, gepubliceerd met een volledige modelkaart en twee ondersteunde servingpaden, dat verschijnt zonder aankondiging van het bedrijf dat het heeft gemaakt, zonder onafhankelijke evaluatie, zonder prijs en zonder toezegging voor ondersteuning — samen met een model voor Arabische taalidentificatie dat negenenvijftig seconden later verscheen en erop wijst dat er meer van dit komt, niet minder.
