
Voxtral Mini 4B Realtime Arabic vs Grok Voice Transcribe 2.0: En topplisteledare möter en dialektspecialist
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 118 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Den ärliga utgångspunkten för den här jämförelsen är att Voxtral Mini 4B Realtime Arabic och Grok Voice Transcribe 2.0 inte tävlar om samma uppgift, och det snabbaste sättet att se det är att titta på vad respektive leverantör var villig att publicera. Mistral AI lade upp Voxtral Mini 4B Realtime Arabic på Hugging Face den 8 oktober 2026 utan något tillkännagivande – Apache 2.0-vikter, ett modellkort som namnger sexton arabiska varieteter och en enda noggrannhetssiffra på 8,82 % genomsnittlig teckenfelkvot över sju arabiska benchmarkar vid en fördröjning på 480 millisekunder. xAI:s Grok Voice Transcribe 2.0 släpptes den 18 september 2026 med ett lanseringsinlägg, ett pris och ett resultat från en tredjeparts resultattavla: 2,7 % ordfelsfrekvens i slutgiltiga transkriptioner, med texten fastställd 0,49 sekunder efter att talaren slutar, etta på Artificial Analysiss resultattavla för strömmande tal-till-text när den lanserades. Den ena modellen berättar exakt vilka dialekter den hanterar och vägrar gissa utanför dem. Den andra säger att den täcker fler än 38 språk och räknar inte upp ett enda.
Den asymmetrin är hela jämförelsen. Om du köper transkriberingskapacitet i bulk för ljud med blandade språk är xAI-modellen den mer kompletta produkten med bred marginal. Om ditt ljud är arabiska – och särskilt om det är dialektal arabiska, inte modern standardarabiska för sändningar – är Mistral-checkpointen riktad mot ett problem som topplistan som xAI-modellen toppar inte mäter, och att den ligger tvåa på den listan i stället för etta vore ett misstag att läsa som en dom.
Prisaritmetiken, eftersom den är ovanligt ren här
xAI publicerar en taxa. Mistral publicerar en nedladdning. Den skillnaden driver allt nedströms, så börja med siffran som finns.
• Grok Voice Transcribe 2.0 — 0,10 USD per ljudtimme via REST för inspelade filer, 0,20 USD per ljudtimme via den strömmande WebSocket-anslutningen. Det är ungefär 1,67 USD per tusen minuter för batch och 3,33 USD per tusen minuter för strömning, oförändrat jämfört med Grok Voice Transcribe 1.0 vid samma prisnivåer.
• Voxtral Mini 4B Realtime Arabic — inget publicerat pris, eftersom det inte finns någon publicerad tjänst. Vikterna är Apache 2.0 och cirka 4,4 miljarder parametrar i BF16, vilket innebär att kostnaden är den GPU du kopplar till den och den utnyttjandegrad du får ut av den. Vid varaktig volym är det billigt; vid noll volym är det det dyraste alternativet i den här artikeln, eftersom du betalar för inaktiv hårdvara.
Brytpunkten är inte brytpunkten. En streamingkostnad på $0.0 per timme är ungefär en tredjedels cent per minut. Varje accelerator som du skulle köra en 4.4B på kostar mer än så per timme om du inte driver kontinuerlig trafik, vilket innebär att open-weights-vägen bara vinner på kostnad efter att du har tillräckligt med arabisk volym för att hålla en maskin sysselsatt – och förlorar på alla andra plan medan du tar dig dit, eftersom API:et inte har någon capex, ingen kapacitetsplanering och ingen driftbörda.

Det enda stället där kalkylen vänder tidigt är regelefterlevnaden. Mistral-checkpointen bearbetar ljud på hårdvara du kontrollerar, så inget lämnar ditt nätverk, och kortet levereras med en normaliseringsmodul så att den arabiska poängsättningspipelinen är din att granska. Grok Voice Transcribe 2.0 körs i xAI:s regioner och bearbetar enligt sin dokumentation ljud i realtid utan att lagra det eller använda det för träning, med stöd av SOC 2 Type II och HIPAA-berättigande. Båda berättelserna är försvarbara; bara en av dem låter en tillsynsmyndighet inspektera kodvägen.
Vad 0,20 dollar i timmen faktiskt köper, och Mistral-modellen levereras inte
Funktionsgapet här är större än noggrannhetsgapet och diskuteras mycket mindre. Grok Voice Transcribe 2.0 är en produkt med ett gränssnitt; Voxtral Mini 4B Realtime Arabic är en checkpoint som avger text.
• Talaridentifiering – ingår i Grok Voice Transcribe 2.0, plus flerkanalstranskribering av upp till åtta oberoende kanaler. Mistral-kortet anger ingen diariseringsfunktion; modellen producerar en transkription, inte en attribuerad sådan.
• Tidsstämplar på ordnivå – de levereras med tillhörande konfidens, så att du kan sätta ett tröskelvärde för segment med låg konfidens i stället för att lita lika mycket på en hel transkription. Mistrals kort gör inte anspråk på tidsstämplar för denna checkpoint.
• Nyckeltermspåverkan — upp till 100 domäntermer per begäran på Grok-slutpunkten, vilket är så du får en modell att få produktnamn, kontokoder och platsnamn rätt utan finjustering. Mistral-vägen till samma resultat är finjustering på dina egna data, vilket Apache 2.0 tillåter men den värdbaserade slutpunkten inte gör.
• Invers textnormalisering — Grok formaterar tal, datum, valutor, telefonnummer och e-postadresser till skriven form på 25 språk. Mistral-kortet innehåller ett normaliseringsskript, men dess angivna syfte är att poängsätta arabiska benchmarks, inte att formatera utdata för visning.
• Gränssnittsyta — REST för filer upp till 500 MB, WebSocket-streaming på wss://api.x.ai/v1/stt med delresultat ungefär var 500:e ms, en dokumenterad gräns på 10 förfrågningar per sekund och 100 samtidiga streamingsessioner, och en enda region för närvarande. På Mistral-sidan: vLLM-servering med en WebSocket på /v1/realtime, eller inbyggda Transformers från version 5.2.0, utan någon annan hastighetsbegränsning än din hårdvara.
Om du behöver diarisering och tidsstämplar är jämförelsen över innan noggrannheten ens kommer in i bilden. Det är inte en kritik mot Mistral-modellen – en 4B-arabisk specialist tränad för att producera korrekt dialektal text är ett annat ingenjörsmål än en allmän transkriptionstjänst – men det betyder att de två bara blir utbytbara om din pipeline behandlar transkriptionen som råmaterial för din egen efterbearbetning.
Problemet med språklistan
Båda leverantörerna beskriver språkstöd på ett sätt som lämnar samma fråga obesvarad, från motsatta håll.
• Grok Voice Transcribe 2.0 — över 38 språk, automatisk språkidentifiering med språkbyte mitt under inspelning i en enda genomgång, över 12 ljudformat från 8 kHz till 48 kHz. Dokumentationen anger antalet och inte listan. Arabiska nämns inte individuellt någonstans i materialet, vilket innebär att stöd för arabiska antyds av antalet och inte bekräftas av leverantören.
• Voxtral Mini 4B Realtime Arabic — sexton arabiska varieteter som uttryckligen namnges: modern standardarabiska; marockanska, libyska, tunisiska, algeriska och hassaniya från Maghreb; gulfarabiska, najdi, omanska och sanaani från Gulfen; egyptiska och sudanesiska från Nildalen; mesopotamiska samt både syd- och nordlevantinska; och tchadisk arabiska. Allt utanför den uppsättningen ligger utanför omfånget, och kortet säger att man i stället ska använda den allmänna realtidsmodellen.
Frågan ”vilken av dessa hanterar arabiska bättre” har en märklig struktur. Mistral-modellen är en dokumenterad specialist på arabiska med en publicerad felkvot för arabiska och ingen oberoende verifiering. xAI-modellen är en dokumenterad ledare på leaderboarden vars leverantör inte har bekräftat att arabiska ens ingår i omfånget. En uppräkning av 38 språk som inkluderar arabiska och en lista över sexton dialekter som bara inkluderar arabiska svarar båda på frågan ”klarar den arabiska” — men bara en av dem svarar på ”klarar den darija”.

Topplistan hjälper inte här. Artificial Analysis utvärdering av tal-till-text är en fast blandning som är viktad mot engelskt agentprat, vilket är rätt design för att rangordna allmän transkription och fel design för att lyfta fram en dialektal arabisk framgång. En modell skulle kunna vara genuint bättre på golfarabiska och marockansk arabiska och ändå framstå som bara bra på den topplistan. Detta är inte en kritik av topplistan; det är ett skäl att inte använda den som enda indata för en regional driftsättning.
Noggrannhet, i enheter som inte konverteras
• Grok Voice Transcribe 2.0 — 2,7 % ordfelsfrekvens i slutlig transkription, med 0,49 sekunder till slutresultat, och 3,4 % för första partiella resultat, båda uppmätta med AA-WER v2-indexet från Artificial Analysis, som kombinerar ett privat agent-talk-set med VoxPopuli och Earnings22. Siffran för det första partiella resultatet är den som är värd att notera: den sjönk från 18,3 % i Grok Voice Transcribe 1.0, vilket är skillnaden mellan en partiell transkription som du kan routa på och en som du bara kan visa.
• Voxtral Mini 4B Realtime Arabic — 8,82 % genomsnittlig teckenfelfrekvens över sju arabiska benchmarks vid 480 millisekunders fördröjning, i leverantörens egen utvärdering med ett normaliseringsskript som medföljer. Mistral rapporterar att detta ligger inom 0,91 procentenheter från Voxtral Transcribe Arabic vid 7,91 % CER, vilket är offline-modellen för arabiska från samma labb — en jämförelse som är värd mer än en mellan olika leverantörer, eftersom benchmarks, normalisering och mätning är identiska på båda sidor.
Att ställa 2,7 % bredvid 8,82 % är inte en jämförelse; det är ett kategorifel. Ordfelsfrekvens räknar fel ord mot en referens, teckenfelsfrekvens räknar fel tecken, och arabisk ortografi – där samma ord tillåter flera legitima stavningar och klitika fogas fritt – vidgar gapet mellan de två måtten långt bortom vad språk med latinsk skrift uppvisar. Korpusarna är olika, normaliseringen är olika, och bara en av siffrorna kommer från en tredje part. Vad de två siffrorna med fog kan säga dig är att xAI-modellen är en uppmätt, välrankad generell transkriberare och Mistral-modellen är en påstådd, arabiskspecifik sådan. De kan inte säga dig vilken som transkriberar ditt ljud bättre.
Jämförelsen som faktiskt övertygar är den i Mistrals eget kort: 8,82 % streaming mot 7,91 % offline, samma sju benchmarks, samma normalisering, samma labb. Streaming kostar ungefär en procentenhet i noggrannhet för arabiska jämfört med en batchmodell. Huruvida det är en bra avvägning är upp till dig, och nu är det ett informerat beslut.
Där den lilla modellen vinner, och det är inte på resultattavlan
Tre saker med Mistral-checkpointen är värda mer än siffrorna antyder, och ingen av dem syns på någon topplista.
Den första är själva dialekttaxonomin. Att namnge sexton varieteter som distinkta träningsmål, inklusive hassaniya och tchadisk arabiska, är ett uttalande om var modellens fel mättes. En allmän flerspråkig modell som inkluderar arabiska som ett av 38 språk förbättras först på modern standardarabiska, eftersom det är där huvuddelen av träningssignalen och benchmark-vikten ligger. En modell byggd för Marocko-partnerskapet tillsammans med ett nordafrikanskt ministerium optimerar för en annan fördelning, och den samutvecklades med två riktmärken — ISMA och Darija in the Wild — byggda specifikt för att mäta det.
Det andra är den konfigurerbara fördröjningen. Siffran 8,82 % anges vid 480 millisekunder, och fördröjningen är justerbar snarare än fast, vilket gör noggrannhetstalet till en punkt på en kurva som operatören väljer. För en live-textningsuppgift kan du korta den och acceptera fler fel; för en pipeline för samtalsinspelning kan du förlänga den och ta tillbaka noggrannheten. Grok Voice Transcribe 2.0 erbjuder en fast arbetspunkt, och leverantörens egen uppgraderingsväg visar varför det får konsekvenser – att gå från 1.0 till 2.0 kostade omkring en tredjedels sekund i både första partiella och slutlig latens, och den åtgärd du har tillgång till är att låsa den gamla modellen, inte att vrida på en ratt.
Det tredje är att Apache 2.0-licensen är ovillkorlig för de vikter du har. Vad som än händer med checkpointen uppströms – oavsett om den tillkännages, prissätts, avvecklas eller aldrig nämns igen – förblir artefakten nedladdningsbar, finjusterbar och leveransklar i din egen produkt. Prislistan för en hostad slutpunkt och dess schema för modellavveckling är båda något som leverantören kan ändra, och xAI har redan signalerat sin avsikt att göra Grok Voice Transcribe 2.0 till standard och avveckla 1.0, vilket kommer att flytta varje integration som aldrig har skickat en modellparameter till den nya latensprofilen på en gång.
Om routningslagret ovanför transkriptet, en praktisk kommentar: ingen av modellerna är tal-till-text som vi själva driftar, och den här artikeln gör inte anspråk på något annat. Det OrcaRouter täcker är det språkmodellager som konsumerar strömmen – sammanfattaren, klassificeraren, agenten – bakom en enda API-nyckel över fler än 200 modeller till leverantörslistpris med 0 % påslag, så en leverantörsprisändring hamnar här samma dag. Team som kör två taligenkänningsleverantörer för språktäckning bär redan två kontrakt och två autentiseringsvägar; att lägga den nedströms halvan på en enda nyckel är den billiga vinsten.
Vad ska man göra med detta
Bygg vidare på Grok Voice Transcribe 2.0 om ditt ljud är flerspråkigt, om du behöver diarisering, tidsstämplar eller biasering av nyckeltermer direkt ur lådan, eller om du vill ha en tjänst med publicerat pris och en väg till support idag. Det är den mer kompletta produkten, den mäts av en tredje part, och streamingpriset på 0,20 USD per ljudtimme är tillräckligt lågt för att kostnadsargumentet för öppna vikter inte ska bita förrän du kör riktigt stora volymer.
Bygg på Voxtral Mini 4B Realtime Arabic om ditt ljud är arabiskt och särskilt dialektalt, om du behöver modellen i ditt eget nätverk av regelefterlevnadsskäl, eller om du avser att finjustera – eftersom bara en av dessa tillåter det. Acceptera tre saker först: ingen diarisering, inga tidsstämplar och ingen oberoende utvärdering publicerad av någon. Två dagar efter att vikterna dök upp är den sista inte en röd flagga; det är helt enkelt där bevisningen står.
Det som snabbast skulle förändra den här jämförelsen är en utvärdering specifik för arabiska på verkligt dialektalt ljud, genomförd utanför båda leverantörerna, med samma normalisering tillämpad på båda systemen. Tills det finns vilar beslutet på en leverantörs egen dialektlista ställd mot en leverantörs egen outtalade lista, och det enda tillförlitliga testet är dina inspelningar.

Ingen av ändpunkterna är någon som vi tillhandahåller – det här är en jämförelse av två system utanför vår katalog – men de modeller som konsumerar transkriptionen går att dirigera: fler än 200 modeller på en enda API-nyckel till leverantörens listpris med 0 % påslag, så en prisändring på sammanfattaren eller klassificeraren slår igenom samma dag som den tillkännages.
Automatisk redundansväxling är det som hindrar en talmiljö med två leverantörer från att föra med sig två enskilda felpunkter in i språklagret som livnär sig på den.
