Genererade ett hero-titelkort för en jämförelse av Voxtral Mini 4B Realtime Arabic och MAI-Transcribe-2-Streaming, med underrubriken "två oktoberlanseringar, två bevisproblem", försett med märket "oktober 2026, båda enligt leverantören", med tre statistikchips som anger 8,82 % teckenfelkvot för arabiska vid 480 ms mot 2,5 % ord felkvot vid 0,13 s, 16 dialekter mot 60 språk, och Apache 2.0-vikter mot Azure-förhandsvisning till 0,54 USD per ljudtimme, samt OrcaRouter-logotypen komponerad i en vit remsa längst ner till höger.
Guides & Insights

Voxtral Mini 4B Realtime Arabic vs MAI-Transcribe-2-Streaming: Två ankomster i oktober, två bevisproblem

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Sju dagar skiljer dessa två realtidstalmodeller åt, och de kom på motsatta sätt. MAI-Transcribe-2-Streaming är Microsoft AI:s första strömmande transkriberingsmodell, tillkännagiven den 1 oktober 2026 med ett lanseringsinlägg, en Azure-förhandsvisning, ett introduktionspris på 0,54 USD per ljudtimme till och med slutet av året, och ett påstående om att vara först på streamingtavlan hos Artificial Analysis för både slutlig och partiell transkriptionsnoggrannhet vid 2,5 % ordfelsfrekvens, med den slutliga texten klar 0,13 sekunder efter talets slut. Voxtral Mini 4B Realtime Arabic är Mistral AI:s strömmande modell för arabiska dialekter, publicerad på Hugging Face den 8 oktober 2026 utan något tillkännagivande alls – inget blogginlägg, inget pris, ingen tjänst, bara Apache 2.0-vikter och ett modellkort som rapporterar 8,82 % genomsnittlig teckenfelkvot över sju arabiska benchmarkar vid en fördröjning på 480 millisekunder. Microsoft-modellen är en färdig produkt med en rubrik som inte går att verifiera. Mistral-modellen är en verifierbar artefakt utan någon produkt runt den. Båda är värda att förstå just för att båda lämnar den centrala frågan – hur väl hanterar detta arabiska – besvarad endast av leverantören.

Jämförelsen är värd att göra ändå, eftersom de två modellerna ramar in samma ingenjörsbeslut från motsatta ändar. Microsoft säljer bredd och en hanterad tjänst: 60 språk med automatisk kontinuerlig språkidentifiering, som körs i Azure AI Speech, prissatt per timme, i förhandsversion. Mistral skänker bort djup: sexton namngivna arabiska varieteter, tillräckligt små för att köras på en accelerator, med ett normaliseringsskript så att du själv kan granska poängsättningen. Om du sätter upp en pipeline för arabisk transkription den här månaden väljer du mellan dessa två positioner, och valet hänger på underlag som du ännu inte har i något av fallen.

Vad varje leverantör faktiskt sa, och vad styrelserna säger

Evidensgapet är den viktigaste egenskapen hos den här matchningen, så det kommer först.

• MAI-Transcribe-2-Streaming — 2,5 % ordfelsfrekvens för sluttranskription vid 0,13 sekunder efter att talet avslutats, och samma 2,5 % på de första partiella resultaten vid 0,12 sekunder, båda presenteras som förstaplats för noggrannhet enligt Artificial Analysis metodik AA-WER Streaming. Microsofts egen framställning. När den här artikeln skrevs hade trackerns streamingtavla inte plottat någon rad för modellen, så påståendet vilar på trackerns metodik utan att någon siffra publicerad av trackern ligger bakom det.

• Voxtral Mini 4B Realtime Arabic — 8,82 % genomsnittlig teckenfelkvot över sju arabiska benchmarktester vid en konfigurerad fördröjning på 480 millisekunder. Mistrals eget modellkort, med utvärderingskoden tillhandahållen. Ingen tredje part har reproducerat det, och modellen är två dagar gammal.

Så de två rubriksiffrorna i den här artikeln är, respektive, ett leverantörspåstående mätt med någon annans linjal och ett leverantörspåstående med sin egen linjal bifogad. Ingen av dem är en oberoende mätning. Det som skiljer är att Mistrals siffra kommer med normaliseringsskriptet du behöver för att åter härleda den, medan Microsofts kommer med en nämnd som ännu inte har fört upp den i diagrammet. Om du ska fatta ett upphandlingsbeslut spelar den distinktionen större roll än spridningen mellan 2,5 och 8,82, som ändå är meningslös – ordfelsfrekvens och teckenfelsfrekvens kan inte konverteras, och arabisk ortografi vidgar gapet mellan dem avsevärt.

Den enda jämförelsen i Mistrals kort som faktiskt övertygar är den mot dess eget offline-syskon: Voxtral Transcribe Arabic med 7,91 % CER på samma sju benchmarks med samma normalisering, så streaming kostar denna modell 0,91 procentenheter. Microsoft publicerade en motsvarande siffra för sin egen familj när de lanserade batch-MAI-Transcribe-2 den 3 september 2026 med 2,0 % ordfelsfrekvens — streamingvarianten ger upp en halv punkt mot batchmodellen samtidigt som den tillför realtidsleverans. Läs dessa två leverantörsinterna deltan sida vid sida och du har det enda jämförbara påståendet i den här artikeln: på sina egna benchmarks ligger varje labs streaming-SKU efter sin batch-syskonmodell, med ungefär en punkt i ena fallet och en halv punkt i det andra, och båda mäter olika språk.

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

Språktäckning: 60 mot 16, och samma namnlösa gap på båda sidor

• MAI-Transcribe-2-Streaming — 60 språk med automatisk kontinuerlig språkidentifiering, så en session som byter språk mitt i en ström inte behöver få språket angivet i förväg. Microsofts lanseringsmaterial anger antalet och inte listan; Azure-dokumentationen för språkstöd för MAI-Transcribe-familjen är där täckningen specificeras, och den dokumenterar arabiska bland de språk som stöds för familjen.

• Voxtral Mini 4B Realtime Arabic — sexton arabiska varieteter, namngivna var för sig: modern standardarabiska, marockansk arabiska, libysk arabiska, tunisisk arabiska, algerisk arabiska och hassaniyaarabiska, gulfarabiska, najdiarabiska, omanisk arabiska och sanaaniarabiska, egyptisk arabiska och sudanesisk arabiska, mesopotamisk arabiska samt både syd- och nordlevantinsk arabiska, och tchadisk arabiska. Utanför den uppsättningen dokumenteras modellen som utanför tillämpningsområdet, med en hänvisning till den allmänna Voxtral Mini 4B Realtime.

Ingen av siffrorna säger dig det du behöver. Microsofts 60 är ett täckningsantal som inkluderar arabiska utan att beskriva hur arabiska presterar; lanseringsinlägget anger det totala antalet språk en gång och går vidare. Mistrals 16 är en uppräkning av träningsmål med en enda aggregerad felkvot över sju benchmarkuppsättningar, vilket innebär att nedbrytningen på dialektnivå — det som faktiskt avgör om ditt marockanska samtalsljud transkriberas — inte heller publiceras. Två modeller, två leverantörer, och i båda fallen är det ärliga svaret på ”hur bra är den på just gulvarabiska”: inte angivet.

Det som uppräkningen faktiskt ger dig är en prior. En modell med tchadisk arabiska och hassaniyaarabiska som namngivna mål trimmades mot en nordafrikansk fördelning; Mistral utvecklade den tillsammans med Marockos Ministère de la Transition Numérique et de la Réforme Administrative och byggde två av de sju benchmarkarna med det ministeriet – ISMA och Darija in the Wild – specifikt för att mäta de svåra fallen. En allmän modell för 60 språk blir först bättre på modern standardarabiska, eftersom det är där volymen av träningssignal ligger. Om ditt ljud är darija eller gulfarabiska är det andra problem, och bara en av dessa två leverantörer har satt en siffra på något av dem.

Latens och fördröjningens form

• MAI-Transcribe-2-Streaming — 0,13 sekunder från talets slut till slutlig transkription, och första delresultaten vid 0,12 sekunder, vilket är tillräckligt snabbt för att det partiella resultatet och det slutliga resultatet i praktiken har samma latens. Microsofts påstående, mätt enligt trackerns metodik.

• Voxtral Mini 4B Realtime Arabic — 480 millisekunder av konfigurerad fördröjning vid den publicerade noggrannhetspunkten, med fördröjningen justerbar. Det är ungefär tre och en halv gånger Microsofts siffra, och det är parametern som operatören väljer snarare än en fast egenskap.

Tre tiondels sekund är en verklig skillnad för en röstagent som behöver svara mitt i ett yttrande och nästan osynlig för en människa som läser undertexter. Det är också skillnaden mellan en ratt och ett nummer. Mistrals fördröjningsparameter innebär att du kan köra snävare och acceptera fler fel eller lösare och ta tillbaka noggrannheten — basmodellen som denna checkpoint finjusterades från uppger ett intervall från 240 millisekunder upp till 2,4 sekunder — medan Microsofts arbetspunkt är vad Azure levererar. Det gör Microsofts siffra lättare att resonera kring och Mistrals lättare att justera, och det innebär att varje jämförelse av de två noggrannhetssiffrorna egentligen är en jämförelse av två valda punkter på en kurva och en fast punkt på en annan.

Funktionsytan skiljer sig lika markant, och det är värt att stämma av mot dina pipeline-krav innan noggrannhetsdiskussionen blir intressant.

• MAI-Transcribe-2-Streaming – levereras via Azure AI Speech med familjens dokumenterade funktionsuppsättning: diarisering, tidsstämplar på ordnivå, nyckelords- och frasbias, ordagrann kontra ren utdata och automatisk språkidentifiering. Den strömmande SKU:ns egen dokumentation för diarisering och tidsstämplar är tunnare än batchmodellens, så bekräfta dessa per slutpunkt i stället för att anta att de är likvärdiga.

Screenshot of the Microsoft Learn documentation page 'Use a MAI-Transcribe model' in Azure AI Speech, captured 10 October 2026, showing the public preview notice that the feature is provided without a service-level agreement and is not recommended for production workloads, alongside the statement that MAI-Transcribe is a next-generation speech-to-text model built in-house by the Microsoft AI team covering 60 languages.

• Voxtral Mini 4B Realtime Arabic — kortet dokumenterar transkription med en kausal ljudkodare, vLLM-servering över en WebSocket på /v1/realtime, inbyggt Transformers-stöd från version 5.2.0, och en normaliseringsmodul. Det dokumenterar inte diarisering eller tidsstämplar på ordnivå för denna checkpoint.

Leveransmodell: en förhandsvisningstjänst mot nedladdningsbara vikter

• MAI-Transcribe-2-Streaming – Azure-förhandsversion, vilket innebär att det inte finns något SLA och att leverantören avråder från produktionsberoende. Priset är 0,54 USD per ljudtimme som introduktionspris gällande till slutet av 2026, medan standardpriset inte har publicerats; batchversionen MAI-Transcribe-2 lanserades till 0,10 USD per ljudtimme på samma tidsbegränsade villkor. Streaming kostar 5,4 gånger batchpriset.

• Voxtral Mini 4B Realtime Arabic — Apache 2.0, ungefär 4,4 miljarder parametrar i BF16, nedladdningsbar, finjusterbar och kan köras på en enda accelerator. Inget pris, inget SLA och inget supportåtagande, eftersom det inte finns någon tjänst bakom den.

De två meningarna innehåller beslutet. En förhandsvisningstjänst med ett introduktionspris och ett ej offentliggjort standardpris är ett åtagande som löper ut; streamingpremien på 5,4× och fönstret fram till och med 2026 är båda Microsofts att ändra, och förhållandet mellan batch och streaming är siffran att bevaka när standardpriset landar. Apache 2.0-vikter utan något tillkännagivande är motsatsen: en artefakt som ingen kan ta tillbaka, knuten till en leverantörsrelation som ingen har beskrivit. Huruvida checkpointen underhålls går inte att veta, men filen du har i dag fortsätter att fungera oavsett.

Den branschspecifika begränsningen är den som i praktiken oftast avgör dessa frågor. En arabisk callcenter-driftsättning inom en reglerad institution kanske inte alls kan skicka ljud till en molnslutpunkt i förhandsversion; ett team som redan har standardiserat på Azure AI Speech kanske inte vill ha en andra lokal stack för en språkfamilj. Båda begränsningarna är legitima, och ingen av dem har något att göra med siffrorna 2,5 % och 8,82 % som står i rubriken för de två lanseringarna.

Ovanför transkriptionslagret gäller samma sak för båda. OrcaRouter routar ingen av dessa talmodeller – detta är en jämförelse av två system som vi inte tillhandahåller – men sammanfattaren, klassificeraren eller agenten som konsumerar transkriptionen är routbar: fler än 200 modeller med en och samma API-nyckel till leverantörens listpris med 0 % påslag, så att en leverantörs prisförändring når oss samma dag, och automatisk failover om en leverantör försämras. Där det specifikt hjälper här är i testfasen: att rikta båda transkriptionskandidaterna mot en och samma nedströms pipeline, bakom en och samma nyckel, är så du kör den direkta jämförelsen utan att sätta upp två integrationer.

Testet som skulle avgöra detta

Ingen av leverantörerna har publicerat prestanda specifik för arabiska, och ingen av dem har utvärderats oberoende på dialektalt ljud. Jämförelsen kokar därför ner till tre fakta och en rekommendation.

Fakta: Microsofts strömmande modell är snabbare på 0,13 sekunder och uppger bättre aggregerad noggrannhet på en resultattavla som ännu inte har plottat den; Mistrals modell publicerar en dialektlista, en felfrekvens för arabiska och normaliseringskoden för att åter härleda den, vid 480 millisekunder; och de två noggrannhetssiffrorna kan inte jämföras eftersom den ena är felkvot på ordnivå och den andra är felkvot på teckennivå på en annan korpus.

Rekommendationen: den som fattar det här beslutet bör köra båda på sitt eget ljudmaterial, eftersom det är det enda mått som någon av leverantörerna har lämnat öppet. Bygg utvärderingssetet från riktiga inspelningar – den dialektblandning du faktiskt tar emot, den codec du faktiskt använder, det domänvokabulär du faktiskt behöver – och poängsätt båda med Mistrals normalisering mot en referens du litar på. Ett två timmar långt test på dina egna inspelningar kommer att säga dig mer än båda lanseringsinläggen tillsammans, och det är det enda sättet att ta reda på om fördelen på 0,13 sekunder är värd ett förhandsversionsberoende och en 5,4× streamingpremie, eller om en nedladdningsbar 4,4B-modell vid 480 millisekunder redan är tillräckligt bra för jobbet.

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and MAI-Transcribe-2-Streaming across six shared rows: price none published and self-host only against $0.54 per audio-hour introductory through the end of 2026; accuracy 8.82% Arabic character error rate at 480ms against a claimed 2.5% final word error rate at 0.13s; board status none because the model is days old against claimed first but not yet plotted; languages 16 named Arabic varieties against 60 with the list unpublished; delivery Apache 2.0 self-hosted weights against Azure preview with no SLA; and diarization and timestamps not documented against family documentation that requires per-SKU confirmation. A footer reads that both accuracy figures are vendor-reported and that no independent Arabic evaluation of either model exists. The OrcaRouter logo sits in a white strip at the bottom right.

OrcaRouter tillhandahåller ingen av dessa talmodeller, och den här artikeln antyder inte något annat – det den däremot tar upp är språklagret som läser transkriptet: fler än 200 modeller bakom en enda nyckel till leverantörens listpris med 0 % påslag, så att en leverantörsprisändring på nedströmsmodellen når dig samma dag som den tillkännages.

Automatisk redundansväxling gör att båda transkriptionskandidaterna kan mata en och samma nedströms pipeline i stället för två integrationer, vilket också är det billigaste sättet att genomföra den direkta jämförelsen.