Genererat hero-titelkort för en jämförelse av Voxtral Mini 4B Realtime Arabic och Voxtral 4B TTS, med undertexten ”två ändar av samma arabiska röstslinga, två olika licenser”, försett med märket ”tal in kontra tal ut”, med tre statistikchips som visar 8,82 % arabisk teckenfelkvot vid 480 ms mot 70 ms tid till första ljudet, 16 arabiska dialekter mot 9 språk inklusive arabiska, och Apache 2.0-vikter mot CC BY-NC 4.0-vikter, samt OrcaRouter-logotypen komponerad i en vit remsa nere till höger.
Engineering & Research

Voxtral Mini 4B Realtime Arabic vs Voxtral 4B TTS: Två ändar av samma konversation

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Dessa två modeller delar ett namn, ett parameterantal och en licensfil som beter sig annorlunda, och där slutar likheterna. Voxtral Mini 4B Realtime Arabic, som lades upp på Hugging Face den 8 oktober 2026 utan något åtföljande tillkännagivande, tar in ljud och producerar arabisk text — en strömmande finjustering av Voxtral-Mini-4B-Realtime-2602 byggd för modern standardarabiska och femton namngivna dialekter, Apache 2.0, 8,82 % genomsnittlig teckenfelsfrekvens vid en fördröjning på 480 millisekunder. Voxtral 4B TTS, som tillkännagavs av Mistral AI i mars 2026, gör det motsatta: text in, tal ut, tjugo förinställda röster plus anpassning från ett kort referensklipp, nio språk inklusive arabiska, och en licens — CC BY-NC 4.0 — som förbjuder kommersiell användning av själva vikterna. De är inte alternativ och de är inte varianter. De är de två halvorna av en röstloop, och anledningen till att titta på dem tillsammans är att de beslut du fattar om den ena begränsar den andra mer än vad de flesta team förväntar sig.

De flesta jämförelsesidor säger att dessa modeller inte har något med varandra att göra eftersom den ena är ASR och den andra TTS, och slutar sedan där. Det är sant och inte användbart. Vad som faktiskt är värt att veta är var de möts: en röstagent behöver båda, de två licenserna pekar i motsatta riktningar, de två hårdvarufotavtrycken är likartade medan genomströmningsegenskaperna inte är det, och anspråken på arabisk täckning har helt olika former. Allt nedan handlar om dessa fyra mötespunkter.

Vad varje modell är, i de termer som är viktiga för en pipeline

• Voxtral Mini 4B Realtime Arabic — strömmande automatisk taligenkänning. 16 kHz-ljud in, text ut, ungefär 4,4 miljarder parametrar i BF16, serveras via vLLM med en WebSocket på /v1/realtime eller inbyggt i Transformers från version 5.2.0. En kausal ljudkodare och en språkavkodare, en konfigurerbar transkriptionsfördröjning angiven till 480 millisekunder för den publicerade noggrannhetssiffran, och en normaliseringsmodul som medföljer så att den arabiska teckenfelkvoten kan återberäknas. Apache 2.0.

• Voxtral 4B TTS — strömmande och batchvis text-till-tal. Text in, 24 kHz-ljud ut i WAV, PCM, FLAC, MP3, AAC eller Opus, cirka 4 miljarder parametrar, med en förinställd uppsättning på 20 röster och röstanpassning från ett referensklipp som är så kort som tre sekunder. Mistrals egen benchmark på en enda H200 som kör vLLM-Omni 0.18.0 med en indata på 500 tecken och en referens på tio sekunder rapporterar 70 millisekunders latens och en realtidsfaktor på 0,103 vid samtidighet 1, som stiger till 331 millisekunder och 0,237 vid samtidighet 16, och 552 millisekunder vid samtidighet 32. Används som ett API för 0,016 USD per tusen tecken.

Den första iakttagelsen från de två styckena är att paret är litet. Båda modellerna ligger i intervallet 4 miljarder parametrar och båda ryms på en enda accelerator i BF16, vilket innebär att en arabisk röstagent byggd helt och hållet på öppna vikter som mest är en driftsättning med två GPU:er, och rimligen en driftsättning med en GPU med kvantisering på båda sidor. Det är det praktiska skälet att betrakta dem som en uppsättning snarare än som två separata produktbeslut.

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

Licensasymmetrin är själva fyndet, inte en fotnot

Här är det som förvånar dem som antar att modeller från samma labb med samma namngivningskonvention har samma villkor.

• Voxtral Mini 4B Realtime Arabic — Apache 2.0. Kommersiell användning, modifiering, vidaredistribution och finjustering är alla tillåtna, med förbehåll för den sedvanliga begränsningen mot intrång i tredje parts rättigheter.

• Voxtral 4B TTS — CC BY-NC 4.0, ärvd från de referensröst-datamängder som ligger bakom den. Icke-kommersiell. Mistrals modellkort anger uttryckligen att modellen ärver licensen från sina röstreferenser, som hämtats från källor inklusive EARS, CML-TTS, IndicVoices-R och en arabisk datamängd för naturligt ljud. Vikterna går att ladda ner, och licensen är inte kommersiell.

Detta är en hård begränsning för den exakta arkitektur som alla först griper efter. Om du bygger en arabisk röstagent vars tal-till-text-del är Voxtral Mini 4B Realtime Arabic och vars text-till-tal-del är Voxtral 4B TTS, har du en pipeline där hälften av komponenterna är fritt kommersiellt användbara och hälften inte, och den restriktiva hälften styr produkten. Att ASR-modellen är Apache 2.0 räddar inte TTS-delen. Att köra paret lokalt ändrar inte licensen, och inte heller att inte leverera vikterna – begränsningen fäster vid användningen, inte vid distributionen.

Screenshot of the Hugging Face model card for mistralai/Voxtral-4B-TTS-2603, captured 10 October 2026, showing the model name, the mistralai organisation, the Text-to-Speech pipeline tag, 922 likes, a language badge, and the CC BY-NC 4.0 licence inherited from the reference-voice datasets.

Den kommersiella vägen Mistral erbjuder för talsidan är det hostade API:et till $0,016 per tusen tecken, vilket är ett tjänsteavtal snarare än ett licensbeviljande. För ett produktteam är den praktiska konsekvensen att den fritt kommersialiserbara halvan av loopen är den halva som lyssnar, och den halva som talar är antingen ett API-beroende eller ett licensieringssamtal. Det inverterar vad de flesta team antar när de ger sig i kast med att bygga en öppen röststack, och det är värt att upptäcka innan du har skrivit integrationen snarare än efter.

De arabiska påståendena går inte ihop, och endast ett av dem är ett täckningslöfte.

Båda modellerna listar arabiska. Listningarna betyder olika saker.

• Voxtral Mini 4B Realtime Arabic — Arabiska är hela omfattningen. Sexton varieteter räknas upp som träningsmål: modern standardarabiska, marockansk arabiska, libysk arabiska, tunisisk arabiska, algerisk arabiska och hassaniyaarabiska, gulfarabiska, najdiarabiska, omansk arabiska och sananiarabiska, egyptisk arabiska och sudanesisk arabiska, mesopotamisk arabiska samt både syd- och nordlevantinsk arabiska, och tchadisk arabiska. Allt utanför den uppsättningen dokumenteras som utanför omfånget. Ett sammanvägt noggrannhetstal, 8,82 % CER, i genomsnitt över sju arabiska benchmarks.

• Voxtral 4B TTS – arabiska är ett av nio stödda språk, tillsammans med engelska, franska, spanska, tyska, italienska, portugisiska, nederländska och hindi. Modellkortet beskriver "olika dialekter" inom detta stöd, utan att räkna upp dem, och det finns ingen publicerad kvalitetssiffra per språk för arabiska eller för något av de övriga åtta.

Läser man dem tillsammans ger paret dig ett detaljerat besked om hur väl ditt system kommer att höra arabiska och nästan inget besked alls om hur väl det kommer att tala det. Den asymmetrin har en verklig konsekvens för en darija- eller gulfarabisk röstagent: inputsidan har ett publicerat riktmärke och en dialektlista som du kan utvärdera mot, och outputsidan har en språkbadge och en röstlista. Ingen har publicerat en förståelighetsmätning för dialektal arabiska för Voxtral 4B TTS, och funktionen för röstanpassning löser inte det – att anpassa en röst ändrar vem talet låter som, inte vilken dialekt den producerar.

Det finns en andra, subtilare punkt om ASR-modellens egen noggrannhetssiffra som även gäller TTS-sidan. Mistral rapporterar 8,82 % CER för streaming mot 7,91 % för den offline-versionen av Voxtral Transcribe Arabic på samma sju benchmarks med samma normalisering, så streaming kostar ungefär en procentenhet. Den motsvarande avvägningen på TTS-sidan – vad streaminginferens kostar i utdatakvalitet jämfört med batch – kvantifieras inte alls i materialet. Latenssiffrorna finns; kvalitetsdeltat gör det inte.

Genomströmning: den ena modellen är byggd för att pressas, den andra är det inte

Mistral publicerade data om genomströmning för exakt en av dessa modeller, och siffrorna förklarar varför.

• Voxtral 4B TTS – uppmätt på en H200 med vLLM-Omni, med indata på 500 tecken och en tio sekunder lång ljudreferens, ligger genomströmningen från cirka 119 tecken per sekund GPU-tid vid samtidighet 1 till ungefär 879 vid samtidighet 16 och omkring 1 431 vid samtidighet 32, medan latensen stiger från 70 millisekunder till 331 och därefter 552. Det är en genomströmningskurva som du kan planera kapacitet efter, och det är den form du kan förvänta dig av en modell utformad som en produktionsrösttjänst.

• Voxtral Mini 4B Realtime Arabic — kortet rapporterar ingen genomströmningssiffra, inget samtidighetsbeteende och ingen hårdvarubenchmark. Vad det däremot anger är arkitekturen: en kausal encoder och ett uppmärksamhetsschema med glidande fönster på både encodern och decodern, som på basmodellen beskrivs stödja i praktiken obegränsad strömning. Noggrannhetspunkten anges vid 480 millisekunders fördröjning, vilket antyder att modellen håller jämna steg med realtidsljud på lämplig hårdvara, och det är omfattningen av den publicerade prestandaenveloppen.

Klyftan är inte så mycket en kritik av någon av modellerna som ett uttalande om mognad. TTS-modellen har en publicerad SLO-tabell eftersom den släpptes som en produkt med ett blogginlägg, en demo, ett API och ett pris. Den arabiska ASR-modellen har inget publicerat prestandaomfång eftersom den kom som ett repo med ett kort. Om du dimensionerar en arabisk transkriberingsflotta idag finns ännu inte det genomströmningstal du behöver, och det enda sättet att få det är att köra vLLM-serveringsvägen på din egen hårdvara med ditt eget ljud.

Det är också där ett routningslager förändrar driftsättningens form, inte bara faktureringen. OrcaRouter routar ingendera av dessa modeller – vi hostar heller ingen Mistral-talendpunkt, och den här artikeln påstår inget annat – men språkmodellagret mellan dem är precis det lager som tjänar på att routas: en API-nyckel över fler än 200 modeller till leverantörens listpris med 0 % påslag, så att en leverantörsprisändring hamnar på vår sida samma dag som den tillkännages, och automatisk failover så att en enskild uppströmsleverantörs dåliga eftermiddag blir en omroutning i stället för ett avbrott i din röstloop. En röstagent som är sammansatt av två egenhostade Mistral-modeller plus en hostad resonemangsmodell har tre feldomäner; routningslagret är det som gör den i mitten tråkig.

Kostnad, sida vid sida, med förbehållet att ena sidan saknar pris

• Voxtral 4B TTS — $0.016 per tusen tecken via Mistrals API, eller kostnaden för GPU:n om du hostar den själv under villkor som tillåter ditt användningsfall. För en grov känsla för skalan: tusen tecken är ett par hundra ord, så en minut talad utdata hamnar på låga bråkdelar av en cent till listpris, innan någon samtidighetsfördel med att köra den själv.

• Voxtral Mini 4B Realtime Arabic — inget publicerat pris, ingen hostad tjänst, ingen prislista. Kostnaden är hårdvara och utnyttjandegrad. En 4,4B BF16-modell på en modern accelerator är en fast månadskostnad som du skriver av över så mycket ljud som maskinen kan bearbeta, vilket är billigt vid ihållande volym och rent slöseri vid sporadisk volym.

Jämförelsen som förmodligen spelar större roll är mot de alternativ du annars skulle ta till. På lyssningssidan konkurrerar den arabiska checkpointen med strömnings-API:er med timpris vars priser är offentliggjorda och låga — Microsofts MAI-Transcribe-2-Streaming till ett introduktionspris på 0,54 USD per ljudtimme, xAI:s Grok Voice Transcribe 2.0 till 0,20 USD per ljudtimme vid strömning — vilket innebär att en arabisk transkriptionstjänst kan köpas för några tiondels cent per minut och att argumentet för öppna vikter måste byggas på dialektnoggrannhet, datalokalisering eller finjustering snarare än på enhetskostnad. På talsidan är en självhostad TTS-modell med noll marginalkostnad en verklig fördel jämfört med API:er per tecken vid stora volymer, vilket är varför CC BY-NC-licensen är den begränsande faktorn snarare än priset.

En strukturell notering för den som budgeterar ett prisbaserat byte: en router som förmedlar leverantörens listpris vidare med 0 % påslag är den yta där en leverantörsprisändring syns samma dag som den tillkännages i stället för vid nästa omprissättningscykel. Det spelar större roll på lyssningssidan än på talsidan, eftersom transkribering prissätts per timme ljud och det är en siffra som leverantörer justerar.

Hur man tänker kring att välja mellan dem

Du väljer inte mellan dem. Frågan är vilken halva av loopen du kan bygga på öppna vikter, och licensen besvarar den.

Om ditt krav är en fristående arabisk röstagent där ljud aldrig lämnar din infrastruktur, är lyssnandedelen villkorslöst tillgänglig för dig: Apache 2.0, nedladdningsbar, finjusterbar, med en dialektlista du kan testa mot och en publicerad felfrekvens för arabiska. Den talande delen är där begränsningen ligger, och du har två ärliga alternativ – flytta talsyntesen till en hostad tjänst enligt ett kommersiellt avtal, eller ta bort Voxtral 4B TTS från arkitekturen och hitta en syntesmodell för arabiska med tillåtande licens.

Om ditt krav är en transkriptionstjänst i produktionsmiljö och arabiska är språket, står valet mellan en nedladdningsbar 4,4B-checkpoint med en publicerad dialekttaxonomi och en aggregerad felkvot, och ett hostat streaming-API med en publicerad prissättning, en publicerad latens och en leaderboard från tredje part. Den öppna modellen vinner på kontroll, datahemvist och finjustering; de hostade alternativen vinner på bevis, support och operativ enkelhet. Två dagar efter att vikterna dök upp har ingen utanför Mistral mätt dem, och det är ett skäl att köra ett eget benchmark snarare än ett skäl att avfärda checkpointen.

Det som mest skulle förändra den här bilden är ett släpp av arabisk talsyntes under villkor som tillåter kommersiell användning – samma mönster som lyssningssidan redan följer. Tills det finns förblir loopen halvöppen, och det praktiska arbetet består i att avgöra vilken halva du är villig att hyra.

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and Voxtral 4B TTS across six shared rows: task speech to text against text to speech with 24 kHz audio output; Arabic claim 16 named dialects at 8.82% character error rate against 1 of 9 languages with no quality figure; licence Apache 2.0 permitting commercial use against CC BY-NC 4.0 non-commercial weights; service price none published against $0.016 per 1,000 characters; published throughput none against 119 to 1,431 characters per second per GPU; and hardware roughly 4.4B in BF16 on a single accelerator against roughly 4B in BF16 on a single accelerator. A footer reads that all figures are Mistral's own and unreproduced, and that the two models are complementary rather than competing. The OrcaRouter logo sits in a white strip at the bottom right.

Vi hostar ingen av dessa Mistral-talmodeller och den här artikeln påstår inte något annat; det röstloopen behöver ovanför dem är språklagret, och det är routbart – en API-nyckel för över 200 modellertill leverantörens listpris med 0 % påslag, så en prisändring från leverantören landar hos oss samma dag den tillkännages.

Automatisk redundansväxling ser till att mitten av en röstagent med tre komponenter – en uppströms resonemangsmodell mellan två självhostade Mistral-modeller – inte blir den del som tar ner produkten.