Gegenereerde hero-titelkaart voor een vergelijking tussen Voxtral Mini 4B Realtime Arabic en MAI-Transcribe-2-Streaming, met als ondertitel 'twee aankomsten in oktober, twee bewijsproblemen', met badge 'oktober 2026, beide door de leverancier gerapporteerd', met drie statistiekchips met de tekst 8,82% Arabisch karakterfoutpercentage bij 480 ms tegenover 2,5% woordfoutpercentage bij 0,13 s, 16 dialecten tegenover 60 talen, en Apache 2.0-gewichten tegenover Azure preview tegen $0,54 per audio-uur, en het OrcaRouter-logo samengevoegd in een witte strook rechtsonder.
Guides & Insights

Voxtral Mini 4B Realtime Arabic vs MAI-Transcribe-2-Streaming: twee aankomsten in oktober, twee bewijsproblemen

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Zeven dagen scheiden deze twee realtime-spraakmodellen, en ze kwamen op tegenovergestelde manieren aan. MAI-Transcribe-2-Streaming is het eerste streaming-transcriptiemodel van Microsoft AI, aangekondigd op 1 oktober 2026 met een lanceringsbericht, een Azure-previewvermelding, een prijs van $0,54 per audio-uur als introductietarief tot het einde van het jaar, en de claim eerste te zijn op de streaming-ranglijst van Artificial Analysis voor zowel de nauwkeurigheid van definitieve als van gedeeltelijke transcripties bij een woordfoutpercentage van 2,5%, waarbij de definitieve tekst 0,13 seconden na het einde van de spraak klaar is. Voxtral Mini 4B Realtime Arabic is het streamingmodel voor Arabische dialecten van Mistral AI, op 8 oktober 2026 gepubliceerd op Hugging Face zonder enige aankondiging — geen blogpost, geen prijs, geen dienst, alleen Apache 2.0-gewichten en een modelkaart die een gemiddeld karakterfoutpercentage van 8,82% rapporteert over zeven Arabische benchmarks bij een vertraging van 480 milliseconden. Het Microsoft-model is een afgerond product met een niet-verifieerbare kop. Het Mistral-model is een verifieerbaar artefact zonder product eromheen. Beide zijn het begrijpen waard, juist omdat beide de centrale vraag — hoe goed gaat dit om met Arabisch — alleen door de leverancier laten beantwoorden.

De vergelijking is toch de moeite waard, omdat de twee modellen dezelfde technische beslissing vanuit tegengestelde invalshoeken belichten. Microsoft verkoopt breedte en een beheerde service: 60 talen met automatische continue taaldetectie, draaiend binnen Azure AI Speech, geprijsd per uur, in preview. Mistral geeft diepgang weg: zestien met naam genoemde Arabische varianten, klein genoeg om op één accelerator te draaien, met een normalisatiescript zodat je de scoring zelf kunt controleren. Als je deze maand een Arabische transcriptiepijplijn opzet, kies je tussen die twee posities, en de keuze hangt af van bewijs dat je in beide gevallen nog niet hebt.

Wat elke leverancier daadwerkelijk heeft gezegd, en wat de boards zeggen

De bewijskloof is het belangrijkste kenmerk van deze krachtmeting, dus die komt eerst.

• MAI-Transcribe-2-Streaming — 2,5% woordfoutpercentage voor definitieve transcripten 0,13 seconden na het einde van de spraak, en dezelfde 2,5% voor eerste partiële resultaten na 0,12 seconden, beide gepresenteerd als eerste plaats voor nauwkeurigheid volgens de AA-WER Streaming-methodologie van Artificial Analysis. Microsofts eigen framing. Op het moment dat dit stuk werd geschreven, heeft het streamingboard van de tracker nog geen rij voor het model uitgezet, dus de claim berust op de methodologie van de tracker zonder een door de tracker gepubliceerd cijfer erachter.

• Voxtral Mini 4B Realtime Arabic — 8,82% gemiddelde Character Error Rate over zeven Arabische benchmarks bij een geconfigureerde vertraging van 480 milliseconden. Mistrals eigen kaart, met de meegeleverde evaluatiecode. Geen enkele derde partij heeft het gereproduceerd, en het model is twee dagen oud.

Dus de twee belangrijkste cijfers in dit artikel zijn respectievelijk een leveranciersclaim op de meetlat van iemand anders en een leveranciersclaim met een eigen meetlat erbij. Geen van beide is een onafhankelijke meting. Wat verschilt, is dat het cijfer van Mistral wordt geleverd met het normalisatiescript dat je nodig hebt om het opnieuw af te leiden, terwijl dat van Microsoft wordt geleverd met een scorebord dat het nog niet in de grafiek heeft opgenomen. Als je een inkoopbeslissing neemt, is dat onderscheid belangrijker dan de spreiding van 2,5 tegenover 8,82, die toch betekenisloos is — woordfoutpercentage en karakterfoutpercentage laten zich niet omrekenen, en de Arabische orthografie vergroot hun kloof aanzienlijk.

De enige vergelijking op de modelkaart van Mistral die echt overtuigt, is die met zijn eigen offline broertje: Voxtral Transcribe Arabic met 7,91% CER op dezelfde zeven benchmarks met dezelfde normalisatie, dus streaming kost dit model 0,91 procentpunt. Microsoft publiceerde een vergelijkbaar cijfer voor zijn eigen familie toen het op 3 september 2026 de batchversie van MAI-Transcribe-2 uitbracht, met een woordfoutpercentage van 2,0% — de streamingvariant levert een half punt in ten opzichte van het batchmodel, terwijl hij realtimelevering toevoegt. Lees die twee leveranciersinterne delta's naast elkaar en je hebt de enige uitspraak in dit artikel waarbij appels met appels worden vergeleken: op hun eigen benchmarks blijft de streaming-SKU van elk lab achter bij zijn batch-tegenhanger, met ongeveer één punt in het ene geval en een half punt in het andere, en beide meten verschillende talen.

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

Taaldekking: 60 tegen 16, en aan beide kanten dezelfde onbenoemde kloof

• MAI-Transcribe-2-Streaming — 60 talen met automatische continue taaldetectie, zodat bij een sessie die midden in een stream van taal wisselt, de taal niet vooraf hoeft te worden opgegeven. Het lanceringsmateriaal van Microsoft geeft het aantal en niet de lijst; de Azure-documentatie over taalondersteuning voor de MAI-Transcribe-familie is waar de dekking wordt gespecificeerd, en daarin wordt Arabisch vermeld bij de ondersteunde talen van de familie.

• Voxtral Mini 4B Realtime Arabic — zestien Arabische variëteiten, afzonderlijk genoemd: Modern Standaardarabisch, Marokkaans, Libisch, Tunesisch, Algerijns en Hassaniya-Arabisch, Golf-, Najdi-, Omani- en Sanaa-Arabisch, Egyptisch en Soedanees Arabisch, Mesopotamisch en zowel Zuid- als Noord-Levantijns Arabisch, en Tsjadisch Arabisch. Buiten die set wordt het model gedocumenteerd als buiten het bereik, met een verwijzing naar de algemene Voxtral Mini 4B Realtime.

Geen van beide cijfers vertelt je wat je nodig hebt. Microsofts 60 is een breedtetelling die het Arabisch meerekent zonder de prestaties voor het Arabisch te beschrijven; de lanceringspost vermeldt het totale aantal talen één keer en gaat verder. Mistrals 16 is een opsomming van trainingsdoelen met één samengevoegd foutpercentage over zeven benchmarksets, wat betekent dat de uitsplitsing op dialectniveau — hetgeen dat daadwerkelijk bepaalt of je Marokkaanse gespreksaudio wordt getranscribeerd — ook niet is gepubliceerd. Twee modellen, twee leveranciers, en in beide gevallen is het eerlijke antwoord op "hoe goed is het specifiek in Golf-Arabisch": niet vermeld.

Wat de opsomming je wel geeft, is een prior. Een model met Tsjadisch Arabisch en Hassaniya-Arabisch als benoemde doelen was afgestemd op een Noord-Afrikaanse distributie; Mistral heeft het mede ontwikkeld met het Ministère de la Transition Numérique et de la Réforme Administrative van Marokko en heeft twee van de zeven benchmarks met dat ministerie gebouwd — ISMA en Darija in the Wild — specifiek om de moeilijke gevallen te meten. Een algemeen model voor 60 talen verbetert eerst op Modern Standaardarabisch, omdat daar het volume aan trainingssignaal zit. Als je audio Darija of Golf-Arabisch is, zijn dat andere problemen, en slechts één van deze twee leveranciers heeft voor een van beide een cijfer genoemd.

Latentie en de vorm van de vertraging

• MAI-Transcribe-2-Streaming — 0,13 seconden vanaf het einde van de spraak tot het definitieve transcript, en eerste partiële resultaten na 0,12 seconden, wat snel genoeg is dat het partiële en het definitieve resultaat effectief dezelfde latentie hebben. Microsofts claim, gemeten volgens de methodologie van de tracker.

• Voxtral Mini 4B Realtime Arabic — 480 milliseconden geconfigureerde vertraging op het gepubliceerde nauwkeurigheidspunt, waarbij de vertraging aanpasbaar is. Dat is ongeveer drieënhalf keer het cijfer van Microsoft, en het is de parameter die de operator kiest in plaats van een vaste eigenschap.

Drie tienden van een seconde is een echt verschil voor een spraakagent die midden in een uiting moet kunnen reageren, en bijna onzichtbaar voor een mens die ondertitels leest. Het is ook het verschil tussen een draaiknop en een getal. De delay-parameter van Mistral betekent dat je strakker kunt werken en meer fouten kunt accepteren, of losser en de nauwkeurigheid terug kunt winnen — het basismodel waarop deze checkpoint is fine-getuned, adverteert met een bereik van 240 milliseconden tot 2,4 seconden — terwijl het werkpunt van Microsoft is wat Azure levert. Dat maakt het cijfer van Microsoft makkelijker te beredeneren en dat van Mistral makkelijker af te stellen, en het betekent dat elke vergelijking van de twee nauwkeurigheidscijfers in feite een vergelijking is van twee gekozen punten op de ene curve en één vast punt op een andere curve.

Het functieaanbod verschilt net zo sterk, en het is de moeite waard om dit te toetsen aan de vereisten van uw pipeline voordat de nauwkeurigheidsdiscussie interessant wordt.

• MAI-Transcribe-2-Streaming — geleverd via Azure AI Speech met de gedocumenteerde functieset van de familie: diarisatie, tijdstempels op woordniveau, keyword- en phrase-biasing, verbatim versus schone uitvoerstijlen, en automatische taalidentificatie. De eigen documentatie van de streaming-SKU voor diarisatie en tijdstempels is dunner dan die van het batchmodel, dus bevestig die per endpoint in plaats van pariteit aan te nemen.

Screenshot of the Microsoft Learn documentation page 'Use a MAI-Transcribe model' in Azure AI Speech, captured 10 October 2026, showing the public preview notice that the feature is provided without a service-level agreement and is not recommended for production workloads, alongside the statement that MAI-Transcribe is a next-generation speech-to-text model built in-house by the Microsoft AI team covering 60 languages.

• Voxtral Mini 4B Realtime Arabic — de kaart documenteert transcriptie met een causale audio-encoder, vLLM-serving via een WebSocket op /v1/realtime, native Transformers-ondersteuning vanaf versie 5.2.0, en een normalisatiemodule. Het documenteert geen diarisatie of tijdstempels op woordniveau voor dit checkpoint.

Leveringsmodel: een previewservice tegenover downloadbare gewichten

• MAI-Transcribe-2-Streaming, wat betekent dat er geen SLA is en een aanbeveling om er niet in productie van afhankelijk te zijn. Geprijsd op $0,54 per audio-uur als tijdelijke aanbieding die loopt tot eind 2026, met de vaste prijs niet; de batch-MAI-Transcribe-2 werd gelanceerd op $0,10 per audio-uur op dezelfde tijdelijke basis. Streaming kost 5,4 keer het batchtarief.

• Voxtral Mini 4B Realtime Arabic — Apache 2.0, ongeveer 4,4 miljard parameters in BF16, downloadbaar, fine-tunebaar en te serveren op één accelerator. Geen prijs, geen SLA en geen ondersteuningsverplichting, want er zit geen dienst achter.

In die twee zinnen zit de beslissing. Een previewservice met een introductietarief en een niet-bekendgemaakte standaardprijs is een toezegging die afloopt; de streamingpremie van 5,4× en het venster tot en met 2026 kan Microsoft beide wijzigen, en de verhouding tussen batch en streaming is het getal om in de gaten te houden wanneer het standaardtarief ingaat. Apache 2.0-gewichten zonder aankondiging zijn het tegenovergestelde: een artefact dat niemand kan terugdraaien, verbonden aan een leveranciersrelatie die niemand heeft beschreven. Of de checkpoint wordt onderhouden, valt niet te weten, maar het bestand dat je vandaag hebt, blijft hoe dan ook werken.

De branchespecifieke beperking is doorgaans de factor die deze vragen in de praktijk beslist. Een Arabische callcenter-implementatie binnen een gereguleerde instelling is mogelijk helemaal niet in staat om audio naar een preview-cloud-endpoint te sturen; een team dat Azure AI Speech al als standaard heeft gekozen, wil misschien geen tweede on-premises stack voor één taalfamilie. Beide beperkingen zijn legitiem, en geen van beide heeft iets te maken met de cijfers van 2,5% en 8,82% die de twee lanceringen domineren.

Boven de transcriptielaag geldt voor beide hetzelfde punt. OrcaRouter routeert geen van deze spraakmodellen — dit is een vergelijking van twee systemen die wij niet aanbieden — maar de samenvatter, de classifier of de agent die het transcript consumeert, is routeerbaar: meer dan 200 modellen op één API-sleutel tegen de listprijs van de provider met 0% markup, zodat een prijswijziging van een leverancier dezelfde dag nog onze kant bereikt, en automatische failover als een provider verslechtert. Waar dat hier specifiek helpt, is de proeffase: beide transcriptiekandidaten op één downstreampipeline richten, achter één sleutel, is hoe je de rechtstreekse vergelijking uitvoert zonder twee integraties op te zetten.

De test die dit zou beslechten

Geen van beide leveranciers heeft Arabisch-specifieke prestaties gepubliceerd, en geen van beide is onafhankelijk geëvalueerd op dialectale audio. De vergelijking komt daarom neer op drie feiten en één aanbeveling.

De feiten: het streamingmodel van Microsoft is sneller met 0,13 seconde en claimt een betere geaggregeerde nauwkeurigheid op een leaderboard dat het nog niet heeft geplot; het model van Mistral publiceert een dialectenlijst, een Arabisch foutenpercentage en de normalisatiecode om het opnieuw af te leiden, in 480 milliseconden; en de twee nauwkeurigheidscijfers kunnen niet met elkaar worden vergeleken, omdat de ene het woordfoutenpercentage is en de andere het tekenfoutenpercentage op een ander corpus.

De aanbeveling: wie deze beslissing neemt, zou beide op de eigen audio moeten draaien, want dat is de enige maatstaf die beide leveranciers nog open hebben gelaten. Stel de evaluatieset samen uit echte opnamen — de dialectmix die je daadwerkelijk ontvangt, de codec die je daadwerkelijk gebruikt, het domeinvocabulaire dat je daadwerkelijk nodig hebt — en scoor beide met Mistral's normalisatie tegen een referentie die je vertrouwt. Een test van twee uur op je eigen opnamen zegt je meer dan beide launchposts samen, en het is de enige manier om erachter te komen of het voordeel van 0,13 seconde een preview-afhankelijkheid en een streamingtoeslag van 5,4× waard is, of dat een downloadbaar 4,4B-model op 480 milliseconden al goed genoeg is voor de taak.

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and MAI-Transcribe-2-Streaming across six shared rows: price none published and self-host only against $0.54 per audio-hour introductory through the end of 2026; accuracy 8.82% Arabic character error rate at 480ms against a claimed 2.5% final word error rate at 0.13s; board status none because the model is days old against claimed first but not yet plotted; languages 16 named Arabic varieties against 60 with the list unpublished; delivery Apache 2.0 self-hosted weights against Azure preview with no SLA; and diarization and timestamps not documented against family documentation that requires per-SKU confirmation. A footer reads that both accuracy figures are vendor-reported and that no independent Arabic evaluation of either model exists. The OrcaRouter logo sits in a white strip at the bottom right.

OrcaRouter levert geen van deze spraakmodellen, en dit stuk suggereert het tegendeel ook niet - wat het wel behandelt, is de taallaag die het transcript leest: meer dan 200 modellen achter één sleutel tegen de lijstprijs van de provider met 0% opslag, zodat een prijswijziging van de leverancier voor het downstreammodel je bereikt op de dag dat die wordt aangekondigd.

Automatische failover laat beide transcriptiekandidaten één downstream-pijplijn voeden in plaats van twee integraties, wat ook de goedkoopste manier is om de head-to-head te draaien.