
Voxtral-Mini-4B-Realtime-Arabic: Mistral släppte en ASR-modell för arabiska dialekter och sa ingenting
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 118 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Femtionio sekunder är hela det offentliga tillkännagivandet av Voxtral-Mini-4B-Realtime-Arabic. Klockan 11:36:06 UTC den 8 oktober 2026 dök ett förråd med namnet mistralai/Voxtral-Mini-4B-Realtime-Arabic upp på Hugging Face. Klockan 11:37:05 – femtionio sekunder senare – dök ett andra förråd, mistralai/LIDstral-Arabic, upp bredvid det. Båda har samma ändringstidsstämpel, båda stod på noll nedladdningar och tre gillamarkeringar när detta skrevs den 10 oktober, och ingen av dem har ett lanseringsinlägg, en prissättningssida, ett blogginlägg eller en rad i Mistrals nyhetsindex bakom sig. Voxtral-Mini-4B-Realtime-Arabic är en strömmande tal-till-text-modell för arabiska – modern standardarabiska plus femton namngivna dialekter – finjusterad från Voxtral-Mini-4B-Realtime-2602 och publicerad under Apache 2.0 med nedladdningsbara BF16-vikter. Så mycket bevisar förrådet. Huruvida Mistral avser att stödja det, prissätta det eller överhuvudtaget säga något om det går ännu inte att veta, och den här artikeln håller de två kategorierna åtskilda med avsikt.
Den korta versionen: en bevisat fungerande realtids-ASR-arkitektur riktades mot en språkfamilj och dess dialekter, vikterna och båda serveringsvägarna är offentliga och körbara i dag, och företaget bakom har inte uttalat sig. Det som följer är en läsning av vad som faktiskt finns — tidsstämplarna i repositoriet, konfigfilerna, modellkortets egna siffror — plus en tydlig gräns kring vad inget av detta säger dig.
Vad finns på hubben, och hur det hamnade där
Det primära artefaktet är ett enda Hugging Face-repository, mistralai/Voxtral-Mini-4B-Realtime-Arabic, som innehåller ett modellkort, safetensors-vikter i BF16 samt processorn och konfigurationsfilerna som behövs för att läsa in det. Dess skapelsetidsstämpel är 2026-10-08T11:36:06Z. Dess senaste ändring är 2026-10-09T17:11:35Z — repositoryt ändrades fortfarande dagen efter att det dök upp.
Syskonets timing är detaljen som förvandlar en enstaka tyst uppladdning till något värt att läsa. mistralai/LIDstral-Arabic skapades 2026-10-08T11:37:05Z, mindre än en minut senare, med identisk ändringstidsstämpel och identiska engagemangssiffror, och en pipeline-tagg för text-classification snarare än taligenkänning. Två repositorier, två olika uppgifter, sextio sekunder isär. Det är inte så ett engångsexperiment publiceras; det är så en batch pushas.
Det bredare gapet är det som gör kombinationen märklig. Före den 8 oktober var det senaste Mistral-modellarkivet av något slag Shieldstral-1.0-3B den 16 juli 2026 – ungefär tolv veckor av en tom hubb, bruten av två uppladdningar inom en minut. En ASR-checkpoint för arabisk dialekt och en klassificerare för arabisk språkidentifiering som dyker upp tillsammans, namnlösa och oförklarade, är kännetecknet för en utgåva som samordnas internt och inte annonseras externt. Det är inte kännetecknet för en läcka, och det är värt att vara precis om varför: en läcka är vikter utan licens, utan konfiguration, utan serveringsväg. Det här har alla tre.

Modellkortet är skrivet för leverans. Det dokumenterar användning, benchmarks, begränsningar och licens i det vanliga formatet, och det namnger medutvecklaren: Marockos Ministère de la Transition Numérique et de la Réforme Administrative, inom ramen för det strategiska partnerskap som undertecknades mellan Mistral och Marocko i januari 2026, där modellen beskrivs som en suverän AI-tillgång. Den inramningen stämmer överens med en leverabel som finns eftersom ett avtal kräver att den finns, vilket är ett tänkbart skäl till att vikterna kan vara offentliga medan ett lanseringsinlägg saknas. Det är ett tänkbart skäl. Det är inte ett bekräftat sådant, och modellkortet säger det inte.
Dialektlistan är det egentliga produktbeslutet
Kortet har sexton språktaggar. Endast en av dem är ett språk i vanlig bemärkelse.
• Modern standardarabiska – ar-taggen, den variant som alla arabiska ASR-system redan hanterar.
• Maghreb – marockansk (ary), libysk (ayl), tunisisk (aeb), algerisk (arq) och hassaniya, den mauretanska varianten (mey).
• Gulf — gulfarabiska i Bahrain, Kuwait, Qatar och Förenade Arabemiraten (afb), najdi (ars), omanska (acx) och sanaani, den jemenitiska varieteten (ayn).
• Nildalen — egyptiska (arz) och sudanesiska (apd).
• Levantinsk och irakisk – mesopotamisk (acm), sydlevantinsk för Jordanien och Palestina (ajp) och nordlevantinsk för Libanon och Syrien (apc).
• Övrigt — tchadisk arabiska (shu).
Läs det som en specifikation, och poängen är inte "att den klarar arabiska". Massor av modeller klarar arabiska. Poängen är att marockansk darija, gulfarabiska, egyptisk arabiska och tchadisk arabiska listas som separata träningsmål i stället för som accenter som en och samma modell för modern standardarabiska förväntas absorbera. Det är ett avsevärt svårare problem, och det är problemet som faktiskt knäcker system för arabiskt tal i produktion – ett marockanskt callcenter och en supportlinje i Gulfregionen är inte samma ljud, och en modell som tränats på fusḥā tenderar att misslyckas med båda. Kortet anger också att kodväxling, där en talare växlar språk mitt i en konversation, var ett träningsfokus snarare än en bieffekt.
Begränsningen uttrycks lika rakt på sak, och det är värt att citera innebörden snarare än att tona ned den: modellen är inriktad på arabisk transkribering, och för andra språk hänvisar kortet till den ursprungliga Voxtral-Mini-4B-Realtime-2602. Detta är en specialiserad checkpoint, inte en generell. Det finns ingen tvetydighet i det och ingen antydan om att en flerspråkig version är på väg.
Arkitekturen, läst från konfigurationen snarare än från prosan
Prosan på ett modellkort är marknadsföringsformad; konfigurationsfilerna är mekaniska, och det är där de operativa begränsningarna finns. Allt nedan läses direkt från repots config.json, params.json och processor_config.json.
• Två stackar, inte en — en kausal ljudkodare med 32 lager vid 1280 dold bredd och 32 uppmärksamhetshuvuden, som matar en språkavkodare med 26 lager vid 3072 dold bredd med 32 frågehuvuden mot 8 nyckel-värde-huvuden. Kortets "cirka 4,4 miljarder parametrar" är summan; kodaren är den mindre hälften av den.
• Ljudfront-end — 16 kHz-ingång, 128 mel-bin, en FFT på 400 sampel med ett hopp på 160 sampel, vilket ger en ramfrekvens för kodaren på 12,5 per sekund, eller en ram var 80:e millisekund. Arkitekturen är registrerad som voxtral_realtime med ett VoxtralRealtimeForConditionalGeneration-huvud.
• Fördröjningen är ett tokenantal, inte ett fält i millisekunder – default_num_delay_tokens är 6. Sex encoder-ramar på 80 millisekunder vardera är 480 millisekunder, vilket är exakt den fördröjning vid vilken kortet anger sin noggrannhetssiffra. Latenssiffran i marknadsföringen är därför ett konfigurationsvärde som du kan ändra, och kortets rubriksiffra är en punkt på en kurva snarare än en egenskap hos modellen.
• Encoder-attention använder ett fönster på 750 frames – ungefär sextio sekunder ljud – medan decodern kör ett glidande fönster på 8 192 token mot en maximal positionsinbäddning på 131 072. Encoder-fönstret är den första siffran att kontrollera mot din egen arbetsbelastning: en strömmande session som är längre än en minut arbetar med ett rullande fönster, inte med obegränsad kontext, och hur modellen beter sig när en lång inspelning rullar förbi den gränsen är inget som kortet tar upp.
• Kvantisering levereras inte – den publicerade datatypen är bfloat16 genomgående. Den som vill ha en int8- eller fp8-driftsättning bygger den själv.
Siffran 8,82 % – och vem som står bakom den
Varje noggrannhetssiffra som är kopplad till den här modellen kommer från modellkortet. Ingenting här har reproducerats av en tredje part, och siffrorna nedan bör läsas som leverantörens egna påståenden, inte som mätningar.
• Genomsnittlig teckenfelfrekvens — 8,82 % över sju arabiska benchmarkar, vid den förvalda transkriberingsfördröjningen på 480 millisekunder, temperatur 0,0.
• Jämfört med sitt eget offline-syskon — Voxtral Transcribe Arabic ligger på 7,91 % på samma sju benchmarks, så realtidsmodellen hamnar 0,91 procentenheter bakom en icke-strömmande arabisk modell från samma leverantör. Den jämförelsen är Mistrals egen, vilket är vad som gör den användbar: det är en ren mätning av vad subsekundslatens kostar för den här språkfamiljen, på identiska data med identisk poängsättning.
• Nya benchmarks i mixen – de sju inkluderar ISMA och Darija in the Wild, som kortet säger utvecklades i samarbete med Marockos MTNRA. Att en leverantör introducerar egna utvärderingsset tillsammans med en modell är normalt, och det innebär också att en del av benchmark-sviten saknar extern historik att jämföra med.
• Normalisering är det bärande förbehållet – CER-siffrorna beräknas med ett normaliseringsschema som också har tagits fram tillsammans med MTNRA, och som täcker dialektspecifik stavning, klitika, lånord och uttalade siffror, och kortet säger rent ut att resultaten kan skilja sig med andra normaliseringsmetoder. Koden finns i repot som normalization.py. Läs det som en inbjudan att kontrollera, och även som en varning: två team kan köra den här modellen på samma ljud och publicera olika CER-siffror utan att något av dem har fel.
• En fotnot talar emot en konkurrent – kortet noterar att Geminis säkerhetsfilter blockerar transkribering av vissa FLEURS-ljudprover. Det är en specifik, kontrollerbar observation om en konkurrerande pipeline, och det är den typ av beteende som en resultattavla plattar ut: ett ljudprov som en modell vägrar transkribera uppfattas som ett misslyckande eller som saknade data, och ingen av tolkningarna är en rättvis poäng.

Två saker saknas i evidensbasen och båda spelar roll. Det finns ingen oberoende utvärdering, så ingen siffra här har klarat kontakt med en tredje part. Och det finns inget pris, eftersom det inte finns någon tjänst — inget säljs, så det finns inget att prissätta. En modell som levereras med påstådda siffror och inget kommersiellt erbjudande är en modell vars siffror ingen utanför labbet har haft anledning att testa.
Kör det idag
Det här är delen som skiljer en riktig checkpoint från en platshållare, och repositoryt är ovanligt komplett för något oannonserat. Två vägar som stöds levereras på kortet.
• vLLM — installera vLLM med ljudtilläggen från mistral-common, servera sedan checkpunkten vid namn och strömma ljud över en WebSocket till /v1/realtime-slutpunkten. Kortet pekar på vLLM-exemplet för tal-till-text i realtid som det man ska anpassa, vilket innebär att strömningskontraktet är ett dokumenterat, underhållet gränssnitt snarare än något ihopklistrat för demon.
• Transformers — inbyggt stöd från version 5.2.0, laddas via AutoProcessor och VoxtralRealtimeForConditionalGeneration i bfloat16, med ett fullständigt Python-exempel på kortet. Ljudexemplet den använder är ett arabiskt banktelefonsamtal, assets/bank-take-2.wav, vilket åtminstone är ett ärligt val av demoklipp för den här modellen.
Båda vägarna är självhostade. Det finns ingen hostad endpoint för den här checkpunkten någonstans där vi kan verifiera det, inget leverantörs-API och ingen publicerad taxa. Stödet i det bredare ekosystemet är genuint tunt, och det är avsiktligt: inbyggt Transformers-stöd i 5.2.0 är det nyaste här, och vLLM-vägen är beroende av ljudtillägget. En operatör som vill ha detta i produktion tillhandahåller GPU:n, serving-processen och WebSocket-klienten, och ärver en checkpunkt utan något supportåtagande kopplat till sig.
![A screenshot of the vLLM documentation page for realtime speech-to-text (captured October 10, 2026), showing the heading 'Realtime Speech-to-Text with Voxtral Realtime', the install commands 'pip install --upgrade vllm mistral-common[audio]' and 'vllm serve mistralai/Voxtral-Mini-4B-Realtime-Arabic', the instruction to stream audio over WebSocket to the /v1/realtime endpoint, and a following section on the OpenAI Realtime Client.](https://cms.orcarouter.ai/api/media/file/4-1756.png)
Det gapet är där ett routinglager verkligen är användbart, och det är värt att vara exakt om gränsen. OrcaRouter servar inte Voxtral-Mini-4B-Realtime-Arabic – checkpointen finns inte i vår katalog, och vi kommer inte att antyda något annat. Det ett routerlager faktiskt når i den här driftsättningen är allt nedströms om transkriptet: sammanfattaren, avsiktsklassificeraren, agenten som konsumerar strömmen. Det är modeller som du kan anropa via en enda API-nyckel över fler än 200 modeller till leverantörens listpris med 0 % påslag, med automatisk redundansväxling när en leverantör försämras och ett routing-DSL för att sätta samman flera modeller i ett anrop. Om du sätter upp en självhostad arabisk ASR-tjänst är talhalvan av den stacken din att köra; språkhalvan behöver inte ett andra avtal, ett andra SDK eller en andra faktureringsrelation för den delen.
Vad skulle förvandla det här till en berättelse?
Detta är en verklig artefakt och en ofullständig utgåva, och ofullständigheten är det intressanta. Apache 2.0 kan inte dras tillbaka från de vikter som redan har laddats ner, så licensrisken är avgjord. Det som inte är avgjort är allt som licensen inte täcker.
Tre saker skulle ändra bilden, och ingen av dem finns ännu. Ett tillkännagivande: ett blogginlägg, en prisnivå eller en rad i Mistrals nyhetsindex skulle förklara om detta är en produkt eller en kontraktsleverans, och det skulle nästan säkert innehålla den detalj som kortet utelämnar. En oberoende körning: siffran 8,82 % och gapet på 0,91 punkter till Voxtral Transcribe Arabic är de påståenden som är mest värda att reproducera, och den medföljande normaliseringskoden gör det ovanligt enkelt för den som vill försöka. Och en andra kontrollpunkt: en levantinsk, gulf- eller egyptisk modell som kommer separat skulle förvandla en enskild dialektspecialist till en familj, vilket är skillnaden mellan en lovande forskningsartefakt och något som en regional driftsättning faktiskt kan standardisera kring.
Tills åtminstone en av dem har landat är den korrekta sammanfattningen av Voxtral-Mini-4B-Realtime-Arabic följande: en komplett, körbar ASR-checkpoint för arabisk dialekt under Apache-2.0, publicerad med ett fullständigt modellkort och två stödda vägar för serving, som anländer utan något tillkännagivande från företaget som skapade den, utan oberoende utvärdering, utan pris och utan supportåtagande – vid sidan av en modell för arabisk språkidentifiering som dök upp femtinio sekunder senare och antyder att mer av detta är på väg, snarare än mindre.
