Artikelns hero-kort med rubriken ”Voxtral Mini 4B Realtime Arabic vs Gemini 3.5 Transcribe Live”, med underrubriken ”15 arabiska dialekter på öppna vikter mot 85+ lokaler på ett stängt API”, ett märke som markerar Mistral-modellen som ett oannonserat släpp i kodförrådet daterat 8 oktober 2026, och tre statistikchips: 16 arabiska varianter mot 85+ lokaler; 8,82 % teckenfelkvot vid 480 ms mot 4,0 % strömmande ordfelkvot vid 0,40 s; Apache 2.0 öppna vikter mot enbart API. OrcaRouter-logotypen sitter i en vit remsa längst ner till höger.
Guides & Insights

Voxtral Mini 4B Realtime Arabic vs Gemini 3.5 Transcribe Live: Dialekter vs bredd

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Två strömmande tal-till-text-modeller, två helt olika satsningar på vad som är det svåra med transkribering. Voxtral Mini 4B Realtime Arabic är en finjustering med 4,4 miljarder parametrar som Mistral AI lade upp i ett offentligt arkiv den 8 oktober 2026 utan ett lanseringsinlägg, ett blogginlägg eller en rad i företagets nyhetsindex, tränad specifikt på modern standardarabiska och femton namngivna dialekter, släppt under Apache 2.0 med nedladdningsbara BF16-vikter. Gem​ini 3.5 Transcribe Live är G​ogles strömningsslutpunkt för Gem​ini 3.5 Transcribe, tillkännagiven i augusti 2026 med hela maskineriet för en plattformslansering, täcker över 85 språkvarianter, och sluten — ett förhands-API utan vikter och en gräns på tio minuter per session. Den ena modellen gick djupt in i en enda språkfamilj och sade det i sitt eget avsnitt om begränsningar; den andra gick brett och lämnade garantierna på accentnivå outtalade. Vilken du vill ha beror på en axel som ingen av leverantörernas marknadsföring sätter främst: hur ditt ljud faktiskt låter.

Detta är inte en symmetrisk jämförelse, och det är värt att säga det redan här i stället för att begrava det. Mistral-modellen är 48 timmar gammal när detta skrivs, har inget tillkännagivande från leverantören, ingen oberoende utvärdering och inget publicerat pris. Google-modellen har varit i offentlig förhandsvisning sedan slutet av augusti och mäts i en tredjepartsspårare. Behandla Mistral-sidan som en uppsättning påståenden från ett modellkort och Google-sidan som en uppsättning mätningar plus en uppsättning påståenden, så förblir jämförelsen ärlig.

Vad varje modell är, före siffrorna

• Voxtral Mini 4B Realtime Arabic — en strömmande ASR-modell finjusterad från Voxtral-Mini-4B-Realtime-2602, cirka 4,4 miljarder parametrar i BF16, som tar 16 kHz-ljud genom en kausal ljudkodare och en språkavkodare. Den avger text allt eftersom ljudet anländer, med en konfigurerbar transkriberingsfördröjning, och den är Apache 2.0 med vikter på Hugging Face. Mistral samutvecklade den med Marockos Ministère de la Transition Numérique et de la Réforme Administrative inom ramen för ett partnerskap som undertecknades i januari 2026, och beskriver modellen som en suverän AI-tillgång.

• Gemini 3.5 Transcribe Live — den strömmande halvan av en lansering med två modeller. Live-API-slutpunkten överför kontinuerligt mikrofonljud via en WebSocket, returnerar deltranskriptioner medan talaren fortfarande talar och landar i en slutlig transkription strax efter att varje yttrande tar slut. Batch-syskonet, gemini-3.5-transcribe, hanterar förinspelade filer på upp till en timme. Båda är i offentlig förhandsversion, båda är endast via API och ingen av dem har publicerade vikter.

Den första strukturella skillnaden är inte noggrannhet. Det är att en av dessa är en fil du kan ladda ner i kväll, och den andra är en tjänst som du måste bli antagen till för att kunna använda.

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

Språktäckning: 16 mot 85+, och klyftan är inte det viktiga

Att räkna språk får Mistral-modellen att framstå som snäv och Google-modellen som enorm. Siffrorna mäter olika saker, och att läsa dem sida vid sida utan den invändningen är det vanligaste misstaget som den här jämförelsen inbjuder till.

• Voxtral Mini 4B Realtime Arabic — 16 arabiska varieteter, som namnges individuellt på modellkortet efter dialektfamilj: modern standardarabiska, plus marockansk, libysk, tunisisk, algerisk och hassaniya-arabiska från Maghreb; gulf-, najdi-, omansk och sanaaniarabiska från Gulfen; egyptisk och sudanesisk arabiska från Nildalen; mesopotamisk samt både syd- och nordlevantinsk arabiska; och tchadisk arabiska. Modellkortets egen inramning är att modellen riktar in sig på arabisk transkription, och att kodväxling — talare som växlar språk mitt i en konversation — är den förmåga den byggdes för att få rätt, snarare än en bieffekt.

• Gemini 3.5 Transcribe Live – automatisk språkidentifiering över 85+ språk och regioner, med kodväxling inom och mellan meningar. Googles dokumentation listar arabiska i den uppsättningen; språktabellen anger arabiska (Egypten) som den arabiska posten, och den bredare täckningen av arabiska språkvarianter redovisas inte i modellens egen dokumentation.

Läs det ärligt, så framträder avvägningens form. Googles 85-plus är ett anspråk på bredd: om ditt ljud är på ett annat språk än arabiska täcker Googles endpoint det och Mistral-modellen kommer att avvisa det — kortet säger rent ut att för andra språk bör du använda den ursprungliga Voxtral Mini 4B Realtime, inte denna checkpoint. Mistrals 16 är ett anspråk på djup. Det gör inte anspråk på att transkribera arabiska; det gör anspråk på att transkribera marockansk darija, gulfarabiska, egyptisk arabiska och tchadisk arabiska som distinkta mål, vilket är ett väsentligt svårare problem än att transkribera modern standardarabiska och hoppas att dialekten faller ut ur det. Ett engelskviktat, bredd-först-benchmark kommer aldrig att visa dig den skillnaden, eftersom dialektuppsättningarna inte finns med i det.

För ett marockanskt callcenter eller en kundtjänstlinje i Gulfen kan en modell som hanterar 16 dialekter och inget annat slå en modell som hanterar 85 språk- och regionvarianter med en oredovisad noggrannhet per dialekt. För ett europeiskt företag som transkriberar möten på fem språk vänds ekvationen omedelbart. Ingen av leverantörerna har fel; de valde olika kunder.

Screenshot of Google's Gemini API model documentation for Gemini 3.5 Transcribe, captured 10 October 2026, showing the model code gemini-3.5-transcribe, audio input up to one hour per request dropping to 30 minutes when speaker diarization or word-level timestamps are enabled, and the supported capability list including speaker diarization, word-level timestamps, Smart transcription and custom vocabulary.

Siffrorna du kan jämföra, och de du inte kan

Det är här asymmetrin biter. De två modellerna rapporterar olika enheter, på olika korpusar, med olika underlag bakom sig, och ingen tredje part har kört dem mot varandra.

• Voxtral Mini 4B Realtime Arabic — 8,82 % genomsnittlig teckenfelkvot över sju arabiska benchmarkar, vid en konfigurerad transkriptionsfördröjning på 480 millisekunder. Enligt Mistrals eget modellkort, och inte oberoende reproducerat.

• Modellen som den jagar — Voxtral Transcribe Arabic med 7,91 % CER på samma sju benchmarks enligt samma mätmetod, så realtidsmodellen hamnar 0,91 procentenheter bakom en arabisk modell som körs offline från samma leverantör. Den skillnaden är Mistrals egen jämförelse, vilket gör den ovanligt informativ: leverantören berättar för dig vad streaming kostar i noggrannhet för den här språkfamiljen.

• Gemini 3.5 Transcribe Live — 4,0 % ordfelsfrekvens vid strömning, uppmätt av Artificial Analysis och citerat av Google, med en slutlig transkription som anländer 0,40 sekunder efter talets slut. Även uppmätt: 2,6 % på icke-strömningsresultattavlan hos samma tracker, och 5,50 % vid strömning på FLEURS enligt Googles egen rapportering.

Ställ inte 8,82 % CER bredvid 4,0 % WER och dra några slutsatser. Teckenfelsfrekvens och ordfelsfrekvens har olika nämnare – arabisk ortografi gör gapet mellan dem större än det är för språk med latinsk skrift – och korpusarna är inte desamma, normaliseringen är inte densamma, och den ena siffran kommer med ett reproducerbart skript medan den andra kommer från en trackers fasta blandning som är viktad mot engelskt agenttal.

Den mer användbara jämförelsen är den som finns i Mistrals eget modellkort: 8,82 % streaming mot 7,91 % offline, på identiska benchmarks med identisk normalisering. Det är en ren mätning av vad låg latens ger och kostar specifikt för arabiska, och den är värd mer än något procenttal mellan olika leverantörer. Det som ingen har publicerat är en direkt jämförbar arabisk körning av Googles och Mistrals modeller på samma ljud. Tills någon gör det är "vilken som är mer korrekt på arabiska" en öppen fråga, och det enda försvarbara svaret är: testa båda på dina inspelningar.

En detalj i Mistrals modellkort förtjänar att nämnas, eftersom den går emot leverantörens eget intresse. Det noterar att Geminis säkerhetsfilter blockerar transkription av vissa FLEURS-ljudprov. Det är en verklig, verifierbar iakttagelse om en konkurrents pipeline, och det är också precis den typ av sak som aldrig dyker upp på en leaderboard — en modell som vägrar transkribera ett prov poängsätts som ett misslyckande eller som frånvarande, och ingen av tolkningarna är rättvis. Om ditt ljud innehåller material som ett innehållsfilter kan fånga upp, är det en driftsättningsrisk som ingen WER-siffra synliggör.

Latens: en ratt mot ett fast tal

Strömningsmodeller jämförs vanligtvis utifrån en enda latenssiffra. Dessa två har inte en gemensam sådan.

• Voxtral Mini 4B Realtime Arabic — konfigurerbar transkriberingsfördröjning. CER-siffran på 8,82 % anges vid 480 millisekunder, och fördröjningen är justerbar, vilket innebär att noggrannhetssiffran är en punkt på en kurva som operatören väljer snarare än en egenskap hos modellen. Dess basmodell anger ett intervall från 240 millisekunder upp till 2,4 sekunder.

• Gemini 3.5 Transcribe Live — 0,40 sekunder från slutet av talet till en slutlig transkription, mätt av Artificial Analysis, med partiella resultat som anländer kontinuerligt under talet. Google uppger separat en förbättring på 70 % av tiden till slutlig transkription jämfört med Chirp 3, vilket är en leverantörsuppgift och inte har reproducerats.

Båda landar i samma härad – ungefär en halv sekund – men den ingenjörsmässiga betydelsen skiljer sig. Mistral-modellen överlåter avvägningen mellan latens och noggrannhet till dig som en parameter, så du kan köra på 240 ms när undertexter under en sekund är viktigare än de sista få procenten i noggrannhet och skjuta upp fördröjningen när de inte är det. Googles endpoint presenterar en fast arbetspunkt med Googles eget beteende för innehållsfiltrering kopplat till sig. För en röstagent är en ratt värd mer än en något bättre fast siffra, eftersom rätt inställning beror på ditt ljud och dina användare och ingen av leverantörerna kan välja den åt dig.

Den verkliga skiljelinjen: öppna vikter mot en förhandsvisningsslutpunkt

Licens- och distributionsskillnaden är större än något benchmark-gap i den här jämförelsen, och den avgör de flesta verkliga driftsättningar innan noggrannhet diskuteras.

• Voxtral Mini 4B Realtime Arabic — Apache 2.0, BF16-vikter på Hugging Face, kan serveras med vLLM över en WebSocket på /v1/realtime och stöds inbyggt i Transformers från version 5.2.0. Modellkortet innehåller ett Python-exempel och en normaliseringsmodul så att du själv kan återskapa beräkningen av arabisk CER. Inget i pipelinen kräver Mistrals servrar, och modellen är tillräckligt liten för att den operativa frågan ska vara vilken GPU, inte om du har råd med en.

• Gemini 3.5 Transcribe Live – endast API, offentlig förhandsvisning, inget offentliggjort prisåtagande utöver listpriser, och en sessionsgräns på tio minuter som innebär att allt längre måste delas upp, återanslutas och sammanfogas av din egen kod. Tre begränsningar som rapporterades i samband med lanseringen är särskilt viktiga för arabiska driftsättningar: streaming-slutpunkten returnerar ingen talardiarisering och inga tidsstämplar på ordnivå, vilka båda finns på batch-slutpunkten men inte denna. Om din arabiska transkription behöver veta vem som sa vad, eller behöver tidsjusteras mot ljud, kan Live-slutpunkten inte producera det oavsett språk.

De två begränsningarna är det starkaste argumentet för den lilla öppna modellen i en verklig arabisk driftsättning, och de har inget med noggrannhet att göra. En callcenter-pipeline vill ha talarattribution, en efterlevnadspipeline vill ha tidsstämplar, och en offline-arabisk modell med ett normaliseringsskript som du kontrollerar ger dig båda utan att behöva argumentera med ett endpoint-kontrakt. Mistrals modellkort listar också det som en begränsning snarare än en funktion – den är inriktad på transkribering, den är en finjustering av en allmän realtidsmodell, och den är ärlig med att en bredare modell finns uppströms om du behöver en.

Vad var och en kostar, och vad som är okänt

• Gemini 3.5 Transcribe Live — ungefär 0,009 USD per minut ljud, sammanvägt, härlett från listpriser på 3,50 USD per miljon indatatoken och 21 USD per miljon utdatatoken, där ljud bedöms till 25 token per sekund och transkriptionen till cirka 175 token per minut. Batch-slutpunkten kostar cirka 0,005 USD per minut. Båda siffrorna är uppskattningar utifrån Googles antagna tokenisering, så de ändras om redovisningen ändras. Det finns en gratisnivå idag.

• Voxtral Mini 4B Realtime Arabic — inget publicerat pris, eftersom det inte finns någon publicerad tjänst. Kostnaden är vad din hårdvara kostar. En BF16-modell med 4,4 miljarder parametrar får plats på en enda modern accelerator, så marginalkostnaden per ljudtimme är el och utnyttjandegrad, och den fasta kostnaden är maskinen. Det är billigare än något minutprissatt API vid volym och dyrare än något minutprissatt API vid noll volym, vilket är den vanliga formen för avvägningen med öppna vikter.

Det okända som spelar störst roll på Mistral-sidan är inte priset. Det är huruvida detta repo är början på en produktlinje eller en engångsleverans kopplad till Marockopartnerskapet. En modell som släpps tyst utan tillkännagivande, prissättning och tjänst är en modell utan stödåtagande bakom sig. Apache 2.0 innebär att licensen inte kan dras tillbaka för de vikter du redan har, men den säger inget om huruvida checkpointen underhålls, och modellkortets egen hänvisning till basmodell tyder på att den allmänna realtidsmodellen fortfarande är den linje som stöds.

För lagret ovanför transkriptet förtjänar ett routningslager sin plats på ett sätt som inte har något med transkribering att göra. Ingen av dessa modeller är en tal-till-text-tjänst som vi driftar – OrcaRouter routar ingen av slutpunkterna – men sammanfattaren, intent-klassificeraren eller agenten som konsumerar strömmen är en modell du kan routa: en API-nyckel för fler än 200 modeller till leverantörens listpris med 0 % påslag, så att en leverantörs prissänkning slår igenom hos oss samma dag, plus automatisk failover om en leverantör försämras. Om du redan syr ihop två tal-leverantörer för dialekttäckning är att sätta de nedströms språkmodellerna bakom en nyckel i stället för två avtal den billiga halvan av integrationen.

Vilken ska man bygga vidare på?

Om ditt ljud är på arabiska – en dialekt, flera, eller kodväxlar mellan arabiska och något annat – är Mistral-modellen den mer seriösa kandidaten, och anledningen är strukturell snarare än numerisk. Den namnger de dialekter som den byggdes för, den är tillräckligt liten för att köras på din egen hårdvara, den returnerar råtext som du kan efterbearbeta med din egen normalisering, och den ligger inte bakom en tio minuter lång sessionsgräns eller ett innehållsfilter som du inte kan granska. Kostnaden är att den hanterar en enda språkfamilj och vägrar resten, och att ingen ännu har publicerat en oberoende utvärdering av den.

Om ditt ljud spänner över flera språk, eller om du behöver en tjänst med en supportväg och ett publicerat prisblad redan idag, kan Gemini 3.5 Transcribe Live anropas nu, mätt i en tredjeparts-tracker, och täcker de språk som Mistral-checkpointen kommer att avvisa. Kostnaderna är sessionsgränsen, den saknade diariseringen och tidsstämplarna på streamingändpunkten, och det faktum att den arabiskspecifika noggrannheten är ett påstående du själv måste testa — språklistan anger Egypten, och dialektprestanda specificeras inte.

Det man bör hålla ögonen på är inte ett benchmark. Det är huruvida Mistral överhuvudtaget tillkännager den här modellen, och i så fall till vilket pris och med vilken språkroadmap. Ett tystlåtet repo med en Apache 2.0-licens är en användbar artefakt och ett svagt åtagande. Om en färdplan för arabiska dialekter följer – levantinsk, gulfländsk och egyptisk som separata checkpoints – blir småmodellsspåret ett genuint komplett svar för regionen, och breddargumentet blir mycket svårare att framföra.

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and Gemini 3.5 Transcribe Live across six shared rows: coverage 16 named Arabic varieties against 85+ locales that list Arabic as Egypt only; reported accuracy 8.82% Arabic character error rate at 480ms against 4.0% streaming word error rate at 0.40s; evidence vendor card unreproduced against Artificial Analysis cited by Google; delay configurable with 480ms quoted against 0.40s fixed to final transcript; weights Apache 2.0 and downloadable against API only in public preview; and diarization and timestamps not documented against absent on the Live endpoint. A footer reads that Mistral figures are vendor-reported while Gemini figures are per Artificial Analysis, and that character error rate and word error rate are not comparable. The OrcaRouter logo sits in a white strip at the bottom right.

Ingen av dessa är en talmodell som vi driftar, men lagret ovanför transkriptionen är routbart – fler än 200 modeller bakom en enda API-nyckel till leverantörens listpris med 0 % påslag, så en leverantörsprissänkning på resonemangsmodellen nedströms din transkription gäller samma dag.

Automatisk redundansväxling innebär att en sammansatt talpipeline har en färre feldomän, eftersom sammanfattaren eller avsiktsklassificeraren som konsumerar transkriptionen kan omdirigeras i stället för att gå ner tillsammans med en leverantör.