Gegenereerde hero-titelkaart voor een vergelijking van Voxtral Mini 4B Realtime Arabic en Grok Voice Transcribe 2.0, met ondertitel 'een koploper op de label-ranglijst ontmoet een Arabische specialist in 16 dialecten', met badge 'Mistral-repository, 8 oktober 2026', met drie statistiekchips met de waarden 8,82% Arabisch tekenfoutpercentage bij 480 ms tegenover 2,7% woordfoutpercentage bij 0,49 s, 16 benoemde dialecten tegenover 38+ niet-gedocumenteerde talen, en Apache 2.0-gewichten tegenover $0,20 per audio-uur, en het OrcaRouter-logo samengevoegd in een witte strook rechtsonder.
Guides & Insights

Voxtral Mini 4B Realtime Arabic vs Grok Voice Transcribe 2.0: Een koploper op de ranglijst ontmoet een dialectenspecialist

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Het eerlijke uitgangspunt voor deze vergelijking is dat Voxtral Mini 4B Realtime Arabic en G​rok Voice Transcribe 2.0 niet om dezelfde klus concurreren, en de snelste manier om dat te zien is te kijken naar wat elke leverancier bereid was te publiceren. Mistral AI zette Voxtral Mini 4B Realtime Arabic op 8 oktober 2026 op Hugging Face zonder enige aankondiging — Apache 2.0-gewichten, een modelkaart die zestien Arabische varianten bij naam noemt, en één enkel nauwkeurigheidscijfer: 8,82% gemiddelde Character Error Rate over zeven Arabische benchmarks bij een vertraging van 480 milliseconden. De G​rok Voice Transcribe 2.0 van x​AI verscheen op 18 september 2026 met een lanceringsbericht, een prijs en een resultaat op een externe ranglijst: 2,7% word error rate op definitieve transcripties, waarbij de tekst 0,49 seconde nadat de spreker stopt vastligt, en een eerste plaats op de streaming speech-to-text-ranglijst van Artificial Analysis toen hij uitkwam. Het ene model vertelt je precies welke dialecten het aankan en weigert te gokken buiten die dialecten. Het andere zegt dat het meer dan 38 talen dekt en somt er geen enkele afzonderlijk op.

Die asymmetrie is de hele vergelijking. Als je transcriptiecapaciteit in bulk inkoopt voor meertalige audio, is het xAI-model met grote afstand het completere product. Als je audio Arabisch is — en dan specifiek als het dialectisch Arabisch is, niet het Modern Standaardarabisch van uitzendingen — dan is het Mistral-checkpoint gericht op een probleem dat de ranglijst waar het xAI-model bovenaan staat niet meet, en het feit dat het op die ranglijst tweede staat in plaats van eerste, zou je ten onrechte als een eindoordeel lezen.

De prijsberekening, omdat die hier ongewoon helder is

xAI publiceert een tarief. Mistral publiceert een download. Dat verschil bepaalt alles wat daarna komt, dus begin met het getal dat bestaat.

• Grok Voice Transcribe 2.0 — $0,10 per audio-uur via REST voor opgenomen bestanden, $0,20 per audio-uur via de streaming WebSocket. Dat is ongeveer $1,67 per duizend minuten voor batch en $3,33 per duizend minuten voor streaming, ongewijzigd ten opzichte van Grok Voice Transcribe 1.0 bij dezelfde prijspunten.

• Voxtral Mini 4B Realtime Arabic — geen gepubliceerde prijs, omdat er geen gepubliceerde dienst is. De gewichten zijn Apache 2.0 en ongeveer 4,4 miljard parameters in BF16, wat betekent dat de kosten de GPU zijn die je eraan koppelt en de benutting die je eruit haalt. Bij aanhoudend volume is dat goedkoop; bij nul volume is het de duurste optie in dit artikel, omdat je betaalt voor inactieve hardware.

Het break-evenpunt is niet subtiel. Een streamingtarief van $0,20 per uur is ongeveer een derde van een cent per minuut. Elke accelerator waarop je een 4.4B-model zou draaien, kost meer dan dat per uur, tenzij je er aanhoudend verkeer doorheen jaagt. Dat betekent dat de open-weights-route alleen op kosten wint nadat je genoeg Arabisch volume hebt om een machine bezig te houden — en op alle andere assen verliest terwijl je daar naartoe werkt, omdat de API geen capex, geen capaciteitsplanning en geen operationele lasten heeft.

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

Het enige punt waar de rekensom vroeg omslaat, is compliance. Het Mistral-checkpoint verwerkt audio op hardware die u zelf beheert, dus er verlaat niets uw netwerk, en de kaart wordt geleverd met een normalisatiemodule, zodat u de Arabische scoringspijplijn zelf kunt auditen. Grok Voice Transcribe 2.0 draait in de regio's van xAI en verwerkt volgens de documentatie audio in realtime zonder deze te bewaren of voor training te gebruiken, ondersteund door SOC 2 Type II en HIPAA-geschiktheid. Beide verhalen zijn verdedigbaar; slechts één ervan laat een toezichthouder het codepad inspecteren.

Wat $0,20 per uur daadwerkelijk koopt, en het Mistral-model dat niet wordt uitgebracht

Het verschil in functionaliteit is hier groter dan het verschil in nauwkeurigheid, en er wordt veel minder over gesproken. Grok Voice Transcribe 2.0 is een product met een interface; Voxtral Mini 4B Realtime Arabic is een checkpoint dat tekst produceert.

• Sprekersdiarisatie — inbegrepen bij Grok Voice Transcribe 2.0, plus multikanaalstranscriptie van maximaal acht onafhankelijke kanalen. De Mistral-kaart vermeldt geen diarisatiemogelijkheid; het model levert een transcript op, geen transcript met sprekerstoewijzing.

• Timestamps op woordniveau — Grok levert ze met bijgevoegde betrouwbaarheidsscores, zodat je een drempel kunt instellen voor segmenten met lage betrouwbaarheid in plaats van een hele transcriptie evenveel te vertrouwen. De modelkaart van Mistral claimt geen timestamps voor deze checkpoint.

• Bias voor sleuteltermen — tot 100 domeintermen per verzoek op het Grok-endpoint; zo zorg je ervoor dat een model productnamen, accountcodes en plaatsnamen correct weergeeft zonder fine-tuning. De Mistral-route naar hetzelfde resultaat is fine-tuning op je eigen data, wat Apache 2.0 wel toestaat en het gehoste endpoint niet.

• Inverse tekstnormalisatie — Grok formatteert getallen, datums, valuta, telefoonnummers en e-mailadressen naar geschreven vorm in 25 talen. De Mistral-kaart bevat een normalisatiescript, maar het opgegeven doel is het scoren van Arabische benchmarks, niet het formatteren van uitvoer voor weergave.

• Interface-oppervlak — REST voor bestanden tot 500 MB, WebSocket-streaming op wss://api.x.ai/v1/stt met tussentijdse resultaten ongeveer elke 500 ms, een gedocumenteerde limiet van 10 verzoeken per seconde en 100 gelijktijdige streamingsessies, en voorlopig één regio. Aan de Mistral-kant: vLLM-serving met een WebSocket op /v1/realtime, of native Transformers vanaf versie 5.2.0, zonder andere snelheidslimiet dan je hardware.

Als je diarisatie en tijdstempels nodig hebt, is de vergelijking al voorbij voordat nauwkeurigheid er nog maar aan te pas komt. Dat is geen diskrediet voor het Mistral-model — een 4B-specialist in Arabisch die is getraind om nauwkeurige dialectische tekst te produceren, is een ander engineeringdoel dan een algemene transcriptieservice — maar het betekent wel dat de twee alleen uitwisselbaar worden als je pipeline het transcript behandelt als ruw materiaal voor je eigen nabewerking.

Het talenlijstprobleem

Beide leveranciers beschrijven taalondersteuning op een manier die dezelfde vraag onbeantwoord laat, vanuit tegengestelde richtingen.

• Grok Voice Transcribe 2.0 — meer dan 38 talen, automatische taalherkenning met taalwisseling tijdens de opname in één enkele doorgang, over 12 audioformaten van 8 kHz tot 48 kHz. De documentatie geeft het aantal en niet de lijst. Arabisch wordt nergens afzonderlijk in het materiaal genoemd, wat betekent dat de ondersteuning voor Arabisch wordt geïmpliceerd door het aantal en niet door de leverancier wordt bevestigd.

• Voxtral Mini 4B Realtime Arabic — zestien Arabische variëteiten die expliciet worden genoemd: Modern Standaard-Arabisch; Marokkaans, Libisch, Tunesisch, Algerijns en Hassaniya uit de Maghreb; Golf, Najdi, Omani en Sanaani uit de Golf; Egyptisch en Sudanese uit de Nijlvallei; Mesopotamisch en zowel Zuid- als Noord-Levantijns; en Tsjadisch Arabisch. Alles buiten die set valt buiten scope, en de kaart zegt dat je in plaats daarvan het algemene realtime model moet gebruiken.

Dus de vraag "welke van deze gaat beter met Arabisch om" heeft een vreemde structuur. Het Mistral-model is een gedocumenteerde Arabisch-specialist met een gepubliceerd Arabisch foutpercentage en geen onafhankelijke verificatie. Het xAI-model is een gedocumenteerde leider op de ranglijst waarvan de leverancier niet heeft bevestigd dat Arabisch überhaupt binnen het bereik valt. Een telling van 38 talen die Arabisch omvat en een lijst van zestien dialecten die alleen Arabisch omvat, beantwoorden allebei de vraag "ondersteunt het Arabisch" — maar slechts één van hen beantwoordt de vraag "ondersteunt het Darija."

Screenshot of the xAI documentation page for the grok-voice-transcribe-2.0 model, captured 10 October 2026, showing the Speech to Text entry in the Voice documentation navigation, the model page slug grok-voice-transcribe-2.0, its audio-to-text modality, and the us-east-1 region listing with rate-limit sections.

De ranglijst helpt hier niet. De spraak-naar-tekst-evaluatie van Artificial Analysis is een vaste mix die zwaar leunt op Engelstalige agentgesprekken, wat het juiste ontwerp is voor het rangschikken van algemene transcriptie en het verkeerde ontwerp om een overwinning voor dialectisch Arabisch naar voren te brengen. Een model zou echt beter kunnen zijn in Golf-Arabisch en Marokkaans-Arabisch en op die ranglijst slechts als goed naar voren komen. Dit is geen kritiek op de ranglijst; het is een reden om die niet als enige input te gebruiken voor een regionale uitrol.

Nauwkeurigheid, in eenheden die niet converteren

• Grok Voice Transcribe 2.0 — 2,7% woordfoutpercentage voor het definitieve transcript, met 0,49 seconden tot het definitieve resultaat, en 3,4% bij de eerste partiële transcripten, beide gemeten op de AA-WER v2-index van Artificial Analysis, die een private agent-talk-set combineert met VoxPopuli en Earnings22. Het cijfer voor de eerste partiële transcripten is het opmerkelijke: het daalde van 18,3% in Grok Voice Transcribe 1.0, wat het verschil is tussen een partieel transcript waarop je kunt routeren en een dat je alleen kunt weergeven.

• Voxtral Mini 4B Realtime Arabic — 8,82% gemiddelde Character Error Rate over zeven Arabische benchmarks bij 480 milliseconden vertraging, op de eigen evaluatie van de leverancier met een bijgeleverd normalisatiescript. Mistral meldt dat dit binnen 0,91 procentpunten van Voxtral Transcribe Arabic met 7,91% CER ligt, het offline Arabische model van hetzelfde lab — een vergelijking die meer waard is dan een vergelijking tussen verschillende leveranciers, omdat de benchmarks, normalisatie en meting aan beide zijden identiek zijn.

2,7% naast 8,82% zetten is geen vergelijking; het is een categoriefout. Het woordfoutpercentage telt foute woorden ten opzichte van een referentie, het tekenfoutpercentage telt foute tekens, en de Arabische orthografie — waarbij hetzelfde woord meerdere legitieme spellingen tolereert en clitica zich vrij kunnen hechten — verbreedt de kloof tussen de twee metrieken veel verder dan wat talen met een Latijns schrift laten zien. De corpora zijn verschillend, de normalisatie is anders, en slechts één cijfer is afkomstig van een derde partij. Wat de twee cijfers je legitiem kunnen vertellen, is dat het xAI-model een gemeten, goed gerangschikte algemene transcriptietool is en het Mistral-model een geclaimde, Arabisch-specifieke transcriptietool. Ze kunnen je niet vertellen welke je audio beter transcribeert.

De vergelijking die wél overtuigt, is die in Mistrals eigen modelkaart: 8,82% streaming tegenover 7,91% offline, dezelfde zeven benchmarks, dezelfde normalisatie, hetzelfde lab. Streaming kost ongeveer een punt nauwkeurigheid op het Arabisch ten opzichte van een batchmodel. Of dat een goede ruil is, is aan jou, en het is nu een geïnformeerde keuze.

Waar het kleine model wint, en dat is niet op het scorebord

Drie dingen aan de Mistral-checkpoint zijn meer waard dan de cijfers doen vermoeden, en geen ervan staat op welk leaderboard dan ook.

Het eerste is de dialecttaxonomie zelf. Door zestien varianten als afzonderlijke trainingsdoelen te benoemen, waaronder Hassaniya en Tsjadisch Arabisch, wordt een uitspraak gedaan over waar de fouten van het model werden gemeten. Een algemeen meertalig model dat Arabisch als een van de 38 talen bevat, verbetert eerst op Modern Standaard Arabisch, want daar ligt het grootste deel van het trainingssignaal en het benchmarkgewicht. Een model dat voor het Marokko-partnerschap samen met een Noord-Afrikaans ministerie is gebouwd, optimaliseert voor een andere distributie, en het is medeontwikkeld met twee benchmarks — ISMA en Darija in the Wild — die specifiek zijn gebouwd om dat te meten.

De tweede is de configureerbare vertraging. Het cijfer van 8,82% wordt genoemd bij 480 milliseconden, en de vertraging is aanpasbaar in plaats van vast, waardoor het nauwkeurigheidscijfer een punt op een curve wordt dat de operator kiest. Voor een live-ondertitelingsklus kun je die verkorten en meer fouten accepteren; voor een pijplijn voor het opnemen van gesprekken kun je die verlengen en de nauwkeurigheid terugwinnen. Grok Voice Transcribe 2.0 presenteert een vast werkpunt, en het eigen upgradepad van de leverancier laat zien waarom dat gevolgen heeft — de overstap van 1.0 naar 2.0 kostte ongeveer een derde van een seconde in zowel de eerste partiële als de definitieve latentie, en de oplossing die voor jou beschikbaar is, is het vastzetten van het oude model, niet het aanpassen van een knop.

Het derde is dat de Apache 2.0-licentie onvoorwaardelijk is voor de gewichten die je hebt. Wat er upstream ook met het checkpoint gebeurt — of het wordt aangekondigd, geprijsd, uitgefaseerd of nooit meer genoemd — het artefact blijft downloadbaar, te fine-tunen en mee te leveren in je eigen product. De tariefkaart van een gehost endpoint en het uitfaseringsschema van het bijbehorende model zijn beide aan de leverancier om te wijzigen, en xAI heeft al laten weten dat het van plan is Grok Voice Transcribe 2.0 de standaard te maken en 1.0 uit te faseren, waardoor elke integratie die nooit een modelparameter heeft doorgegeven, in één keer naar het nieuwe latentieprofiel wordt overgezet.

Op de routeringslaag boven het transcript, één praktische opmerking: geen van beide modellen is spraak-naar-tekst die wij hosten, en dit artikel beweert niet het tegendeel. Wat OrcaRouter dekt, is de taalmodel-laag die de stream verwerkt — de samenvatter, de classifier, de agent — achter één API-sleutel, over meer dan 200 modellen, tegen de lijstprijs van de provider met 0% opslag, zodat een prijswijziging van een leverancier hier dezelfde dag nog doorwerkt. Teams die twee spraakleveranciers draaien voor taaldekking, hebben al twee contracten en twee authenticatiepaden; de downstream-helft op één sleutel onderbrengen is een eenvoudige winst.

Wat te doen met dit

Bouw voort op Grok Voice Transcribe 2.0 als je audio meertalig is, als je diarisering, tijdstempels of key-term-biasing out of the box nodig hebt, of als je vandaag een dienst wilt met een gepubliceerd tarief en een ondersteuningsroute. Het is het completere product, het wordt door een derde partij gemeten, en het streamingtarief van $0,20 per audio-uur is laag genoeg dat het open-weights-kostenargument pas gaat wegen wanneer je serieuze volumes draait.

Bouw voort op Voxtral Mini 4B Realtime Arabic als je audio Arabisch en specifiek dialectisch is, als je het model om compliance-redenen binnen je eigen netwerk nodig hebt, of als je van plan bent te fine-tunen — want slechts één van deze staat dat toe. Accepteer eerst drie dingen: geen diarisatie, geen tijdstempels en geen onafhankelijke evaluatie die door iemand is gepubliceerd. Twee dagen nadat de gewichten verschenen, is dat laatste geen rode vlag; het is simpelweg waar het bewijs staat.

Wat deze vergelijking het snelst zou veranderen, is een Arabisch-specifieke evaluatie op echte dialectaudio, uitgevoerd buiten beide leveranciers, met dezelfde normalisatie toegepast op beide systemen. Totdat die bestaat, berust de beslissing op de eigen dialectlijst van een leverancier tegenover een eigen, niet-vermelde lijst van een leverancier, en de enige betrouwbare test zijn uw opnames.

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and Grok Voice Transcribe 2.0 across six shared rows: price none published and self-host only against $0.10 per audio-hour over REST and $0.20 streaming; accuracy 8.82% Arabic character error rate vendor-reported against 2.7% final word error rate per Artificial Analysis; delay configurable with 480ms quoted against 0.49s to final and 0.49s to first partial; languages 16 named Arabic varieties against 38+ with none itemised by the vendor; diarization and timestamps not documented against included with confidence scores; and distribution Apache 2.0 weights on Hugging Face against API only. A footer reads that Mistral figures are vendor-reported and unverified while Grok figures are per Artificial Analysis, and that character error rate and word error rate are not comparable. The OrcaRouter logo sits in a white strip at the bottom right.

Geen van beide endpoints is er een die wij aanbieden — dit is een vergelijking van twee systemen buiten onze catalogus — maar de modellen die het transcript gebruiken, zijn routeerbaar: meer dan 200 modellen op één API-sleutel tegen de lijstprijs van de provider met 0% opslag, zodat een tariefwijziging voor de samenvatter of de classificator dezelfde dag ingaat als waarop die wordt aangekondigd.

Automatische failover is wat voorkomt dat een spraakopstelling met twee leveranciers twee single points of failure meeneemt naar de taallaag die daarop voortbouwt.