Artikel-herokaart met de tekst 'Voxtral Mini 4B Realtime Arabic vs Gemini 3.5 Transcribe Live', met de ondertitel '15 Arabische dialecten op open weights tegen 85+ locales op een gesloten API', een badge die het Mistral-model markeert als een onaangekondigde repository-drop van 8 oktober 2026, en drie stat-chips: 16 Arabische varianten tegen 85+ locales; 8,82% character error rate bij 480ms tegen 4,0% streaming word error rate bij 0,40s; Apache 2.0 open weights tegen alleen API. Het OrcaRouter-logo staat in een witte strook rechtsonder.
Guides & Insights

Voxtral Mini 4B Realtime Arabic vs Gemini 3.5 Transcribe Live: Dialecten vs Breedte

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Twee streaming spraak-naar-tekstmodellen, twee totaal verschillende gokken op wat het moeilijke deel van transcriptie is. Voxtral Mini 4B Realtime Arabic is een fine-tune met 4,4 miljard parameters die Mistral AI op 8 oktober 2026 naar een openbare repository pushte zonder lanceringspost, blogbericht of een regel in de nieuwsindex van het bedrijf, specifiek getraind op Modern Standaardarabisch en vijftien met naam genoemde dialecten, uitgebracht onder Apache 2.0 met downloadbare BF16-gewichten. Gem​ini 3.5 Transcribe Live is G​ogle's streaming-endpoint van Gem​ini 3.5 Transcribe, aangekondigd in augustus 2026 met de volledige machinerie van een platformrelease, met meer dan 85 locales, en gesloten — een preview-API zonder gewichten en een sessielimiet van tien minuten. Het ene model ging diep op één taalfamilie en zei dat in zijn eigen limitations-sectie; het andere ging breed en liet de garanties op accentniveau onvermeld. Welke van de twee je wilt, hangt af van een as die de marketing van geen van beide leveranciers vooropstelt: hoe je audio daadwerkelijk klinkt.

Dit is geen symmetrische vergelijking, en het is de moeite waard om dat vooraf te zeggen in plaats van het te verbergen. Het Mistral-model is op het moment van schrijven 48 uur oud, heeft geen aankondiging van de leverancier, geen onafhankelijke evaluatie en geen gepubliceerde prijs. Het Google-model is sinds eind augustus openbaar in preview en wordt gemeten op een tracker van een derde partij. Behandel de Mistral-kant als een reeks claims uit een modelkaart en de Google-kant als een reeks metingen plus een reeks claims, en de vergelijking blijft eerlijk.

Wat elk model is, vóór de cijfers

• Voxtral Mini 4B Realtime Arabic — een streaming-ASR-model dat is gefinetuned op Voxtral-Mini-4B-Realtime-2602, met ongeveer 4,4 miljard parameters in BF16, dat 16 kHz-audio verwerkt via een causale audio-encoder en een taaldecoder. Het genereert tekst terwijl de audio binnenkomt, met een configureerbare transcriptievertraging, en het is Apache 2.0 met gewichten op Hugging Face. Mistral ontwikkelde het samen met het Marokkaanse Ministère de la Transition Numérique et de la Réforme Administrative in het kader van een partnerschap dat in januari 2026 werd ondertekend, en omschrijft het model als een soevereine AI-asset.

• Gemini 3.5 Transcribe Live — de streaminghelft van een release met twee modellen. Het Live API-endpoint stuurt doorlopende microfoonaudio via een WebSocket, retourneert gedeeltelijke transcripties terwijl de spreker nog praat, en komt kort nadat elke uiting eindigt uit op een definitieve transcriptie. Het batchbroertje, gemini-3.5-transcribe, bedient vooraf opgenomen bestanden tot een uur. Beide zijn in openbare preview, beide zijn alleen via API beschikbaar, en geen van beide heeft gepubliceerde gewichten.

Het eerste structurele verschil is niet nauwkeurigheid. Het is dat het ene een bestand is dat je vanavond kunt downloaden en het andere een dienst waarvoor je moet worden toegelaten om hem te gebruiken.

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

Taaldekking: 16 tegenover 85-plus, en het gat is niet het verhaal

Het tellen van talen laat het Mistral-model beperkt lijken en het Google-model enorm. De tellingen meten verschillende dingen, en ze naast elkaar lezen zonder dat voorbehoud is de meest voorkomende fout die deze vergelijking uitlokt.

• Voxtral Mini 4B Realtime Arabic — 16 Arabische variëteiten, afzonderlijk genoemd op de modelkaart per dialectfamilie: Modern Standaardarabisch, plus Marokkaans, Libisch, Tunesisch, Algerijns en Hassaniya-Arabisch uit de Maghreb; Golf-, Najdi-, Omani- en Sanaani-Arabisch uit de Golf; Egyptisch en Soedanees uit de Nijlvallei; Mesopotamisch en zowel Zuid- als Noord-Levantijns; en Tsjadisch-Arabisch. De eigen invalshoek van de kaart is dat het model zich richt op Arabische transcriptie, en dat code-switching — sprekers die tijdens een gesprek van taal wisselen — het vermogen is dat het moest beheersen, in plaats van een neveneffect.

• Gemini 3.5 Transcribe Live — automatische taaldetectie in meer dan 85 locales, met codewisseling binnen en tussen zinnen. In de documentatie van Google wordt Arabisch in die set genoemd; de locale-tabel vermeldt Arabisch (Egypte) als de Arabische vermelding, en de bredere dekking van Arabische locales wordt niet uitgesplitst in de eigen documentatie van het model.

Als je dat eerlijk leest, wordt de vorm van de afweging zichtbaar. De 85-plus van Google is een breedteclaim: als je audio in een andere taal dan Arabisch is, dekt het Google-endpoint die en weigert het Mistral-model die — de kaart zegt ronduit dat je voor andere talen de originele Voxtral Mini 4B Realtime moet gebruiken, niet deze checkpoint. De 16 van Mistral is een diepteclaim. Het claimt niet Arabisch te transcriberen; het claimt Marokkaans Darija, Golf-Arabisch, Egyptisch Arabisch en Tsjadisch Arabisch als afzonderlijke doelen te transcriberen, wat een wezenlijk moeilijker probleem is dan Modern Standaardarabisch te transcriberen en te hopen dat het dialect eruit voortkomt. Een op het Engels gewogen, breedte-eerst benchmark zal je dat verschil nooit laten zien, omdat de dialectensets er niet in staan.

Voor een Marokkaans callcenter of een klantenservicelijn in de Golf kan een model dat 16 dialecten aankan en verder niets, een model verslaan dat 85 locales aankan tegen een niet-vermelde nauwkeurigheid per dialect. Voor een Europees bedrijf dat vergaderingen in vijf talen transcribeert, keert de vergelijking onmiddellijk om. Geen van beide leveranciers heeft ongelijk; ze hebben voor verschillende klanten gekozen.

Screenshot of Google's Gemini API model documentation for Gemini 3.5 Transcribe, captured 10 October 2026, showing the model code gemini-3.5-transcribe, audio input up to one hour per request dropping to 30 minutes when speaker diarization or word-level timestamps are enabled, and the supported capability list including speaker diarization, word-level timestamps, Smart transcription and custom vocabulary.

De getallen die je kunt vergelijken, en de getallen die je niet kunt.

Hier slaat de asymmetrie toe. De twee modellen rapporteren verschillende eenheden, op verschillende corpora, met verschillend bewijs erachter, en geen enkele derde partij heeft ze tegen elkaar laten draaien.

• Voxtral Mini 4B Realtime Arabic — gemiddelde Character Error Rate van 8,82% over zeven Arabische benchmarks, bij een geconfigureerde transcriptievertraging van 480 milliseconden. Volgens Mistrals eigen modelkaart, en niet onafhankelijk gereproduceerd.

• Het model dat het nastreeft — Voxtral Transcribe Arabic met 7,91% CER op dezelfde zeven benchmarks volgens dezelfde meting, waardoor het realtime model 0,91 procentpunt achterblijft bij een offline Arabisch model van dezelfde leverancier. Dat verschil is Mistrals eigen vergelijking, wat het ongewoon informatief maakt: de leverancier vertelt je wat streaming aan nauwkeurigheid kost voor deze taalfamilie.

• Gemini 3.5 Transcribe Live — 4,0% streaming-woordfoutpercentage, gemeten door Artificial Analysis en aangehaald door Google, waarbij een definitief transcript 0,40 seconden na het einde van de spraak aankomt. Ook gemeten: 2,6% op de non-streaming-ranglijst van dezelfde tracker, en 5,50% streaming op FLEURS volgens de eigen rapportage van Google.

Zet 8,82% CER niet naast 4,0% WER en concludeer daar niets uit. Karakterfoutpercentage en woordfoutpercentage hebben verschillende noemers — de Arabische orthografie maakt de kloof ertussen groter dan bij talen met Latijns schrift — en de corpora zijn niet hetzelfde, de normalisatie is niet hetzelfde, en het ene getal komt met een reproduceerbaar script terwijl het andere uit een vaste mix van een tracker komt die gewogen is naar Engelstalige agentgesprekken.

De nuttigere vergelijking is die in de eigen modelkaart van Mistral: 8,82% streaming tegen 7,91% offline, op identieke benchmarks met identieke normalisatie. Dat is een zuivere meting van wat lage latentie oplevert en kost, specifiek voor het Arabisch, en die is meer waard dan welk leveranciersoverschrijdend percentage dan ook. Wat niemand heeft gepubliceerd, is een rechtstreeks vergelijkbare Arabische testrun van de Google- en Mistral-modellen op dezelfde audio. Totdat iemand dat doet, is "welke in het Arabisch nauwkeuriger is" een open vraag, en het enige verdedigbare antwoord is: probeer beide op je opnames.

Eén detail op de kaart van Mistral verdient een vermelding, omdat het indruist tegen het eigen belang van de leverancier. Er staat in dat de veiligheidsfilters van Gemini de transcriptie van sommige FLEURS-audiosamples blokkeren. Dat is een echte, controleerbare observatie over de pipeline van een concurrent, en het is ook precies het soort ding dat nooit op een leaderboard verschijnt — een model dat weigert een sample te transcriberen, scoort als een fout of als afwezig, en geen van beide lezingen is eerlijk. Als uw audio materiaal bevat dat een contentfilter zou kunnen oppikken, is dat een deploymentrisico dat geen enkel WER-cijfer aan het licht brengt.

Latentie: een meter tegen een vast getal

Streamingmodellen worden meestal vergeleken op basis van één enkele latentiewaarde. Deze twee hebben die niet gemeen.

• Voxtral Mini 4B Realtime Arabic — configureerbare transcriptievertraging. Het CER-cijfer van 8,82% wordt opgegeven bij 480 milliseconden, en de vertraging is aanpasbaar, wat betekent dat het nauwkeurigheidscijfer één punt op een curve is die de operator kiest in plaats van een eigenschap van het model. Het basismodel geeft een bereik op van 240 milliseconden tot 2,4 seconden.

• Gemini 3.5 Transcribe Live — 0,40 seconden vanaf het einde van de spraak tot een definitief transcript, gemeten door Artificial Analysis, waarbij gedeeltelijke resultaten continu binnenkomen tijdens het spreken. Google claimt daarnaast een verbetering van 70% in de tijd tot definitieve transcriptie ten opzichte van Chirp 3, wat een leverancierscijfer is en niet is gereproduceerd.

Beide komen in dezelfde buurt uit — ongeveer een halve seconde — maar de technische betekenis verschilt. Het Mistral-model geeft de afweging tussen latentie en nauwkeurigheid aan jou als parameter, zodat je op 240 ms kunt draaien wanneer ondertiteling binnen een seconde belangrijker is dan de laatste paar punten nauwkeurigheid, en de vertraging kunt opvoeren wanneer dat niet zo is. Het Google-endpoint biedt een vast werkpunt met het eigen contentfiltergedrag van Google eraan vast. Voor een spraakagent is een draaiknop meer waard dan een iets beter vast getal, omdat de juiste instelling afhangt van je audio en je gebruikers, en geen van beide leveranciers die voor je kan kiezen.

De echte tweedeling: open weights tegenover een preview-endpoint

Het verschil in licentie en distributie is groter dan welke benchmarkkloof dan ook in deze vergelijking, en het bepaalt de meeste echte implementaties voordat nauwkeurigheid ter sprake komt.

• Voxtral Mini 4B Realtime Arabic — Apache 2.0, BF16-gewichten op Hugging Face, serveerbaar met vLLM via een WebSocket op /v1/realtime, en vanaf versie 5.2.0 native ondersteund in Transformers. De modelkaart bevat een Python-voorbeeld en een normalisatiemodule zodat je de Arabische CER-berekening zelf kunt reproduceren. Niets aan de pipeline vereist de servers van Mistral, en het model is klein genoeg dat de operationele vraag is welke GPU, niet of je er een kunt betalen.

• Gemini 3.5 Transcribe Live — alleen API, openbare preview, geen andere gepubliceerde prijstoezegging dan de lijsttarieven, en een limiet van tien minuten per sessie, wat betekent dat alles wat langer is, door je eigen code moet worden opgedeeld, opnieuw verbonden en aan elkaar geregen. Drie beperkingen die bij de lancering zijn gemeld, zijn specifiek van belang voor Arabische implementaties: het streaming-endpoint retourneert geen sprekerdiarisatie en geen tijdstempels op woordniveau; beide bestaan wel op het batch-endpoint, maar niet op dit endpoint. Als het voor je Arabische transcript nodig is om te weten wie wat heeft gezegd, of om tijdsuitgelijnd te worden met de audio, kan het Live-endpoint dit niet leveren, ongeacht de taal.

Die twee beperkingen zijn het sterkste argument voor het kleine open model in een echte Arabische implementatie, en ze hebben niets met nauwkeurigheid te maken. Een callcenterpipeline wil sprekerattributie, een compliancepipeline wil tijdstempels, en een offline Arabisch model met een normalisatiescript dat je beheert, geeft je beide zonder te hoeven discussiëren over een endpointcontract. Mistrals modelkaart noemt dat ook als een beperking in plaats van een functie — het is gericht op transcriptie, het is een fine-tune van een algemeen realtime model, en het is eerlijk dat er upstream een breder model bestaat als je er een nodig hebt.

Wat elk van hen kost, en wat onbekend is

• Gemini 3.5 Transcribe — ongeveer $0,009 per minuut audio, als gewogen gemiddelde op basis van lijstprijzen van $3,50 per miljoen invoertokens en $18 per miljoen uitvoertokens, waarbij audio tegen 25 tokens per seconde en het transcript tegen ongeveer 175 tokens per minuut wordt gerekend. Het batch-endpoint kost ongeveer $0,005 per minuut. Beide cijfers zijn schattingen op basis van de door Google veronderstelde tokenisatie en veranderen als de manier van rekenen verandert. Er is vandaag een gratis tier beschikbaar.

• Voxtral Mini 4B Realtime Arabic — geen gepubliceerde prijs, want er is geen gepubliceerde dienst. De kosten zijn wat je hardware kost. Een BF16-model met 4,4 miljard parameters past op één moderne accelerator, dus de marginale kosten per audio-uur zijn elektriciteit en benutting, en de vaste kosten zijn de machine. Dat is goedkoper dan welke API per minuut dan ook bij volume, en duurder dan welke API per minuut dan ook bij nul volume, wat de gebruikelijke vorm van de open-weightsafweging is.

De onbekende factor die aan de Mistral-kant het meest van belang is, is niet de prijs. Het is de vraag of deze repository het begin is van een productlijn of een eenmalige oplevering in het kader van het Marokko-partnerschap. Een model dat stil wordt uitgebracht, zonder aankondiging, zonder prijsstelling en zonder service, is een model zonder ondersteuningscommitment erachter. Apache 2.0 betekent dat de licentie niet kan worden ingetrokken voor de weights die je al hebt, maar het zegt niets over of het checkpoint wordt onderhouden, en de eigen base-model-verwijzing van de kaart suggereert dat het algemene realtime-model nog steeds de ondersteunde lijn is.

Voor de laag boven het transcript verdient een routeringslaag zijn bestaansrecht op een manier die niets met transcriptie te maken heeft. Geen van deze modellen is een spraak-naar-tekst-dienst die wij hosten — OrcaRouter routeert geen van beide endpoints — maar de samenvatter, de intentieclassifier of de agent die de stream consumeert is een model dat je kunt routeren: één API-sleutel voor meer dan 200 modellen tegen de lijstprijs van de provider met 0% opslag, zodat een prijsverlaging van een leverancier dezelfde dag nog aan onze kant landt, plus automatische failover als een provider verslechtert. Als je al twee spraakleveranciers aan elkaar knoopt voor dialectdekking, is het onderbrengen van de downstream taalmodellen achter één sleutel in plaats van twee contracten de goedkope helft van de integratie.

Op welke bouwen we voort?

Als je audio Arabisch is — één dialect, meerdere dialecten, of code-switching tussen Arabisch en iets anders — dan is het Mistral-model de serieuzere kandidaat, en de reden daarvoor is structureel, niet numeriek. Het noemt de dialecten waarvoor het is gebouwd, het is klein genoeg om op je eigen hardware te draaien, het levert ruwe tekst op die je met je eigen normalisatie kunt nabewerken, en het zit niet achter een sessielimiet van tien minuten of een contentfilter dat je niet kunt inspecteren. De keerzijde is dat het één taalfamilie doet en de rest weigert, en dat niemand er nog een onafhankelijke evaluatie van heeft gepubliceerd.

Als je audio meerdere talen omvat, of als je vandaag een dienst nodig hebt met een ondersteuningsroute en een gepubliceerde tariefkaart, is Gemini 3.5 Transcribe Live nu aanroepbaar, gemeten op een tracker van derden, en dekt het de talen die het Mistral-checkpoint zal weigeren. De kosten zijn de sessielimiet, de ontbrekende diarisering en tijdstempels op het streaming-endpoint, en het feit dat de Arabisch-specifieke nauwkeurigheid een claim is die je zelf zult moeten testen — de locale-lijst noemt Egypte, en dialectprestaties worden niet apart vermeld.

Waar je op moet letten is niet een benchmark. Het gaat erom of Mistral dit model überhaupt aankondigt, en zo ja, tegen welke prijs en met welke taalroadmap. Een stille repository met een Apache 2.0-licentie is een nuttig artefact en een zwakke toezegging. Als daar een roadmap voor Arabische dialecten op volgt — Levantijns, Golf, Egyptisch als afzonderlijke checkpoints — wordt de route met kleine modellen een werkelijk compleet antwoord voor de regio, en wordt het breedteargument veel moeilijker om te maken.

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and Gemini 3.5 Transcribe Live across six shared rows: coverage 16 named Arabic varieties against 85+ locales that list Arabic as Egypt only; reported accuracy 8.82% Arabic character error rate at 480ms against 4.0% streaming word error rate at 0.40s; evidence vendor card unreproduced against Artificial Analysis cited by Google; delay configurable with 480ms quoted against 0.40s fixed to final transcript; weights Apache 2.0 and downloadable against API only in public preview; and diarization and timestamps not documented against absent on the Live endpoint. A footer reads that Mistral figures are vendor-reported while Gemini figures are per Artificial Analysis, and that character error rate and word error rate are not comparable. The OrcaRouter logo sits in a white strip at the bottom right.

Geen van beide is een spraakmodel dat wij hosten, maar de laag boven het transcript is routeerbaar - meer dan 200 modellen achter één API-sleutel tegen de lijstprijs van de provider met 0% opslag, dus een prijsverlaging van een leverancier op het redeneermodel stroomafwaarts van jouw transcript is dezelfde dag live.

Automatische failover betekent dat een samengestelde spraakpijplijn één storingsdomein minder heeft, omdat de samenvatter of intentieclassificator die het transcript verwerkt, kan worden omgeleid in plaats van samen met een provider uit te vallen.