Główna karta tytułowa z napisem „Voxtral Realtime Arabic”, z podtytułem „Mistral opublikował model 8 października 2026 r. i nigdy go nie ogłosił”, trzy chipy statystyk z napisami „16 arabskich odmian”, „480 ms opóźnienia” i „wagi Apache 2.0” oraz płaska ikona liniowa fali dźwiękowej wpływającej do strumienia krótkich linii tekstu. Logo OrcaRouter znajduje się w białym pasie w prawym dolnym rogu.
Engineering & Research

Voxtral-Mini-4B-Realtime-Arabic: Mistral wypuścił model ASR do arabskich dialektów i nic nie powiedział

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Pięćdziesiąt dziewięć sekund to całe publiczne ogłoszenie Voxtral-Mini-4B-Realtime-Arabic. O 11:36:06 UTC 8 października 2026 r. na Hugging Face pojawiło się repozytorium o nazwie mistralai/Voxtral-Mini-4B-Realtime-Arabic. O 11:37:05 — pięćdziesiąt dziewięć sekund później — obok niego pojawiło się drugie repozytorium, mistralai/LIDstral-Arabic. Oba mają ten sam znacznik czasu modyfikacji, oba miały zero pobrań i trzy polubienia, gdy pisano ten tekst 10 października, a żaden z nich nie ma za sobą wpisu o premierze, strony z cennikiem, wpisu na blogu ani wzmianki w indeksie aktualności Mistrala. Voxtral-Mini-4B-Realtime-Arabic to strumieniowy model zamiany mowy na tekst dla języka arabskiego — współczesny standardowy arabski plus piętnaście nazwanych dialektów — dostrojony na podstawie Voxtral-Mini-4B-Realtime-2602 i opublikowany na licencji Apache 2.0 z możliwymi do pobrania wagami BF16. Tyle dowodzi repozytorium. Czy Mistral zamierza je wspierać, ustalić dla niego cenę lub powiedzieć o nim cokolwiek, nie da się jeszcze stwierdzić, a ten tekst celowo rozdziela te dwie kategorie.

Krótka wersja: sprawdzona architektura ASR czasu rzeczywistego została skierowana na jedną rodzinę językową i jej dialekty, wagi oraz obie ścieżki serwowania są publiczne i można je uruchomić już dziś, a firma, która za tym stoi, nie zabrała głosu. To, co następuje, jest odczytem tego, co faktycznie istnieje — znaczników czasu w repozytorium, plików konfiguracyjnych, liczb z samej karty modelu — plus wyraźna granica wokół tego, czego nic z tego nie mówi.

Co znajduje się na hubie i jak się tam znalazło?

Głównym artefaktem jest pojedyncze repozytorium Hugging Face, mistralai/Voxtral-Mini-4B-Realtime-Arabic, zawierające kartę modelu, wagi safetensors w BF16 oraz pliki procesora i konfiguracji potrzebne do jego załadowania. Jego znacznik czasu utworzenia to 2026-10-08T11:36:06Z. Jego ostatnia modyfikacja to 2026-10-09T17:11:35Z — repozytorium było wciąż modyfikowane dzień po tym, jak się pojawiło.

Czas utworzenia siostrzanego repozytorium to szczegół, który zamienia pojedynczy cichy upload w coś wartego przeczytania. mistralai/LIDstral-Arabic utworzono 2026-10-08T11:37:05Z, niecałą minutę później, z identycznym znacznikiem czasu modyfikacji i identycznymi licznikami zaangażowania oraz tagiem potoku text-classification, a nie rozpoznawania mowy. Dwa repozytoria, dwa różne zadania, sześćdziesiąt sekund różnicy. Tak nie publikuje się jednorazowego eksperymentu; tak wypycha się partię.

Większa luka to właśnie to, co czyni tę parę dziwną. Przed 8 października najnowszym repozytorium modelu Mistral jakiegokolwiek rodzaju był Shieldstral-1.0-3B z 2026-07-16 — około dwunastu tygodni pustego huba, przerwanych przez dwa wgrania w ciągu minuty. Checkpoint ASR dialektu arabskiego i klasyfikator identyfikacji języka arabskiego, pojawiające się razem, nienazwane i niewyjaśnione, to sygnatura wydania koordynowanego wewnętrznie i nieogłoszonego na zewnątrz. To nie jest sygnatura przecieku i warto wyjaśnić dokładnie, dlaczego: przeciek to wagi bez licencji, bez konfiguracji, bez ścieżki serwowania. To ma wszystkie trzy.

A generated scoreboard card titled 'Voxtral-Mini-4B-Realtime-Arabic - the scoreboard', listing six rows: Parameters ~4.4B BF16; Languages 16 Arabic varieties; Transcription delay 480 ms, configurable; Average CER 8.82% on 7 benchmarks; Offline sibling 7.91% CER, no delay; Hosted API none found. A footer line reads 'All figures vendor-reported from the model card; no independent run yet.', and the OrcaRouter logo sits in a white strip at the bottom right.

Karta modelu jest przygotowana do wydania. Dokumentuje sposób użycia, benchmarki, ograniczenia i licencję w zwykłym formacie oraz wskazuje współtwórcę: Ministère de la Transition Numérique et de la Réforme Administrative Maroka, w ramach partnerstwa strategicznego podpisanego między Mistral a Marokiem w styczniu 2026 r., a model opisano jako suwerenny zasób AI. To ujęcie jest spójne z produktem, który istnieje, ponieważ umowa wymaga, aby istniał, co jest jednym z prawdopodobnych powodów, dla których wagi mogą być publiczne, podczas gdy nie ma wpisu ogłaszającego premierę. To prawdopodobny powód. Nie jest to powód potwierdzony, a karta tego nie mówi.

Lista dialektów to faktyczna decyzja produktowa.

Karta zawiera szesnaście znaczników językowych. Tylko jeden z nich jest językiem w zwykłym tego słowa znaczeniu.

• Współczesny standardowy arabski — ar, znacznik, odmiana, którą obsługuje już każdy system ASR języka arabskiego.

• Maghreb — marokański (ary), libijski (ayl), tunezyjski (aeb), algierski (arq) i hasanija, odmiana mauretańska (mey).

• Zatoka — arabski z Zatoki Perskiej w Bahrajnie, Kuwejcie, Katarze i ZEA (afb), nadżdyjski (ars), omański (acx) oraz sanaański, odmiana jemeńska (ayn).

• Dolina Nilu — egipski (arz) i sudański (apd).

• Lewant i Irak — mezopotamski (acm), południowolewantyński dla Jordanii i Palestyny (ajp) oraz północnolewantyński dla Libanu i Syrii (apc).

• Inny — arabski czadyjski (shu).

Czytaj to jako specyfikację — sedno nie polega na tym, że „obsługuje arabski”. Wiele modeli obsługuje arabski. Sedno polega na tym, że marokański darija, arabski z Zatoki, arabski egipski i arabski czadyjski są wymienione jako oddzielne cele treningowe, a nie jako akcenty, które jeden model współczesnego standardowego arabskiego ma rzekomo wchłonąć. To istotnie trudniejszy problem i to właśnie ten problem psuje arabskie systemy mowy w produkcji — marokańskie centrum obsługi telefonicznej i linia wsparcia w Zatoce nie są tym samym dźwiękiem, a model dostrojony do fusḥā zwykle zawodzi w obu przypadkach. Karta stwierdza również, że przełączanie kodów, w którym mówiący zmienia języki w trakcie rozmowy, było celem treningowym, a nie efektem ubocznym.

Ograniczenie jest podane równie wprost i warto zacytować jego istotę, zamiast ją łagodzić: model jest przeznaczony do transkrypcji języka arabskiego, a w przypadku innych języków karta kieruje do oryginalnego Voxtral-Mini-4B-Realtime-2602. To specjalistyczny checkpoint, a nie ogólny. Nie ma w tym żadnej dwuznaczności ani sugestii, że nadchodzi wersja wielojęzyczna.

Architektura, odczytana z konfiguracji, a nie z prozy

Proza na karcie modelu ma charakter marketingowy; pliki konfiguracyjne są mechaniczne i to w nich tkwią ograniczenia operacyjne. Wszystko poniżej odczytano bezpośrednio z repozytorium: config.json, params.json i processor_config.json.

• Dwa stosy, nie jeden — przyczynowy koder audio o 32 warstwach, szerokości ukrytej 1280 i 32 głowicach uwagi, zasilający dekoder języka o 26 warstwach, szerokości ukrytej 3072, z 32 głowicami zapytań wobec 8 głowic klucz-wartość. Podane na karcie „około 4,4 miliarda parametrów” to suma; koder stanowi mniejszą połowę tej sumy.

• Wejściowy tor audio — sygnał wejściowy 16 kHz, 128 pasm mel, FFT o długości 400 próbek z krokiem 160 próbek, co daje częstotliwość ramek enkodera 12,5 na sekundę, czyli jedną ramkę co 80 milisekund. Architektura jest zarejestrowana jako voxtral_realtime z głową VoxtralRealtimeForConditionalGeneration.

• Opóźnienie jest liczbą tokenów, a nie polem w milisekundach — default_num_delay_tokens wynosi 6. Sześć ramek enkodera po 80 milisekund każda to 480 milisekund, czyli dokładnie to opóźnienie, przy którym karta podaje swoją wartość dokładności. Podana w materiałach marketingowych wartość latencji jest więc wartością konfiguracyjną, którą można zmienić, a liczba z nagłówka karty to jeden punkt na krzywej, a nie właściwość modelu.

• Uwaga enkodera jest okienkowana do 750 ramek — około sześćdziesięciu sekund dźwięku — podczas gdy dekoder działa w oknie przesuwnym o rozmiarze 8,192 tokenów względem maksymalnego osadzenia pozycji wynoszącego 131,072. Okno enkodera to pierwsza liczba, którą należy sprawdzić względem własnego obciążenia: sesja strumieniowa dłuższa niż minuta działa w oknie kroczącym, a nie w nieograniczonym kontekście, a to, jak model zachowuje się, gdy długie nagranie przesuwa się poza tę granicę, nie jest czymś, co karta omawia.

• Kwantyzacja nie jest udostępniana — publikowany typ danych to bfloat16 we wszystkich przypadkach. Każdy, kto chce wdrożenia int8 lub fp8, buduje je samodzielnie.

Liczba 8,82% i kto za nią stoi

Każda liczba dotycząca dokładności dołączona do tego modelu pochodzi z karty modelu. Nic z tego, co tu podano, nie zostało odtworzone przez stronę trzecią, a poniższe liczby należy odczytywać jako własne deklaracje dostawcy, a nie jako pomiary.

• Średni współczynnik błędów znaków — 8,82% w siedmiu arabskich zestawach testowych, przy domyślnym opóźnieniu transkrypcji wynoszącym 480 milisekund, temperatura 0,0.

• W porównaniu z własnym odpowiednikiem offline — Voxtral Transcribe Arabic osiąga 7,91% na tych samych siedmiu benchmarkach, więc model czasu rzeczywistego plasuje się 0,91 punktu procentowego za nieprzetwarzanym strumieniowo modelem arabskim od tego samego dostawcy. To porównanie pochodzi od samego Mistrala, co czyni je użytecznym: to czysty pomiar tego, ile kosztuje opóźnienie poniżej sekundy w tej rodzinie języków, na identycznych danych i przy identycznym sposobie oceniania.

• Nowe benchmarki w zestawieniu — wśród tych siedmiu znajdują się ISMA i Darija in the Wild, które, jak podano w karcie, zostały opracowane wspólnie z marokańską MTNRA. To normalne, że dostawca wprowadza własne zestawy ewaluacyjne wraz z modelem, a to również oznacza, że część zestawu benchmarków nie ma zewnętrznej historii do porównania.

• Normalizacja to kluczowe zastrzeżenie — wartości CER są obliczane według schematu normalizacji współtworzonego również z MTNRA, obejmującego pisownię specyficzną dla dialektów, klityki, zapożyczenia i liczebniki mówione, a karta wprost stwierdza, że wyniki mogą się różnić przy innych metodach normalizacji. Kod jest dostarczany w repozytorium jako normalization.py. Należy to odczytywać jako zaproszenie do sprawdzenia, a także jako ostrzeżenie: dwa zespoły mogą uruchomić ten model na tym samym materiale audio i opublikować różne wartości CER, przy czym żaden z nich nie będzie się mylił.

• Jeden przypis uderza w konkurenta — karta odnotowuje, że filtry bezpieczeństwa Gemini blokują transkrypcję niektórych próbek audio FLEURS. To konkretna, weryfikowalna obserwacja dotycząca konkurencyjnego pipeline'u i jest to właśnie taki rodzaj zachowania, który ranking spłaszcza: próbka, której model odmawia transkrybowania, jest odczytywana jako błąd albo jako brakujące dane, a żaden z tych odczytów nie jest sprawiedliwym wynikiem.

A screenshot of the Hugging Face model page for mistralai/Voxtral-Mini-4B-Realtime-Arabic (captured October 10, 2026), showing the repository header with a like count of 3, the tags 'vllm' and 'automatic-speech-recognition', the licence line 'License: apache-2.0', a banner reading 'You need to agree to share your contact information to access this model', and the model card prose describing the streaming Arabic-dialect ASR model, its 480 ms transcription delay, the 8.82% average character error rate and the 0.91 percentage-point gap to Voxtral Transcribe Arabic's 7.91%.

W bazie dowodowej brakuje dwóch rzeczy i obie mają znaczenie. Nie ma niezależnej oceny, więc żadna z podanych tu liczb nie przetrwała kontaktu ze stroną trzecią. I nie ma ceny, bo nie ma usługi — nic nie jest sprzedawane, więc nie ma czego wyceniać. Model trafiający na rynek z deklarowanymi liczbami i bez oferty komercyjnej to model, którego liczb nikt poza laboratorium nie miał powodu testować.

Uruchamianie tego dzisiaj

To jest ta część, która odróżnia prawdziwy checkpoint od zaślepki, a repozytorium jest wyjątkowo kompletne jak na coś nieogłoszonego. Na karcie dostępne są dwie obsługiwane ścieżki.

• vLLM — zainstaluj vLLM z dodatkami audio z mistral-common, następnie udostępnij checkpoint po nazwie i strumieniuj audio przez WebSocket do punktu końcowego /v1/realtime. Karta wskazuje na przykład czasu rzeczywistego rozpoznawania mowy na tekst w vLLM jako ten, który należy zaadaptować, co oznacza, że kontrakt strumieniowania jest udokumentowanym, utrzymywanym interfejsem, a nie czymś sklejonym na potrzeby demonstracji.

• Transformers — natywne wsparcie od wersji 5.2.0, ładowanie przez AutoProcessor i VoxtralRealtimeForConditionalGeneration w bfloat16, z pełnym przykładem w Pythonie na karcie modelu. Wykorzystywane przez niego przykładowe audio to arabska rozmowa z bankiem, assets/bank-take-2.wav, co jest przynajmniej uczciwym wyborem klipu demonstracyjnego dla tego modelu.

Obie ścieżki są hostowane samodzielnie. Nie ma hostowanego endpointu dla tego checkpointu w żadnym miejscu, które możemy zweryfikować, nie ma API dostawcy ani opublikowanej stawki. Wsparcie w szerszym ekosystemie jest z założenia naprawdę ubogie: natywne wsparcie dla Transformers w wersji 5.2.0 to tutaj najnowszy element, a ścieżka vLLM zależy od dodatków audio. Operator, który chce to mieć w środowisku produkcyjnym, zapewnia GPU, proces serwowania i klienta WebSocket, a dziedziczy checkpoint bez żadnego zobowiązania wsparcia.

A screenshot of the vLLM documentation page for realtime speech-to-text (captured October 10, 2026), showing the heading 'Realtime Speech-to-Text with Voxtral Realtime', the install commands 'pip install --upgrade vllm mistral-common[audio]' and 'vllm serve mistralai/Voxtral-Mini-4B-Realtime-Arabic', the instruction to stream audio over WebSocket to the /v1/realtime endpoint, and a following section on the OpenAI Realtime Client.

Ta luka to miejsce, w którym warstwa routingu jest naprawdę przydatna, i warto być precyzyjnym co do granicy. OrcaRouter nie obsługuje Voxtral-Mini-4B-Realtime-Arabic — ten checkpoint nie znajduje się w naszym katalogu i nie będziemy sugerować inaczej. To, do czego router faktycznie dociera w tym wdrożeniu, to wszystko poniżej transkrypcji: moduł streszczający, klasyfikator intencji, agent, który konsumuje strumień. To modele, które możesz wywoływać przez jeden klucz API spośród ponad 200 modeli w cenie katalogowej dostawcy z 0% marży, z automatycznym przełączaniem awaryjnym, gdy dostawca zaczyna działać gorzej, oraz DSL routingu do łączenia kilku modeli w jedno wywołanie. Jeśli uruchamiasz samodzielnie hostowaną usługę arabskiego ASR, część mowy tego stosu jest do prowadzenia po twojej stronie; część językowa nie potrzebuje do tego drugiej umowy, drugiego SDK ani drugiej relacji rozliczeniowej.

Co zamieniłoby to w opowieść?

To prawdziwy artefakt i niekompletne wydanie, a ta niekompletność jest najciekawsza. Licencji Apache 2.0 nie można wycofać z już pobranych wag, więc ryzyko licencyjne jest rozstrzygnięte. Nierozstrzygnięte jest wszystko to, czego licencja nie obejmuje.

Trzy rzeczy zmieniłyby obraz sytuacji, a żadna z nich jeszcze nie istnieje. Ogłoszenie: wpis na blogu, poziom cenowy albo wzmianka w indeksie wiadomości Mistrala wyjaśniłyby, czy to produkt, czy element dostarczany w ramach umowy, i prawie na pewno zawierałyby szczegół, który pomija karta. Niezależne uruchomienie: liczba 8,82% i różnica 0,91 punktu względem Voxtral Transcribe Arabic to twierdzenia najbardziej warte odtworzenia, a dołączony kod normalizacji sprawia, że jest to niezwykle łatwe dla każdego, kto chciałby spróbować. A drugi punkt kontrolny: model lewantyński, model z Zatoki albo model egipski pojawiający się osobno zmieniłby pojedynczego specjalistę od dialektu w rodzinę, co jest różnicą między obiecującym artefaktem badawczym a czymś, na czym regionalne wdrożenie może faktycznie oprzeć standard.

Dopóki przynajmniej jedno z nich nie stanie się faktem, dokładne podsumowanie Voxtral-Mini-4B-Realtime-Arabic jest następujące: kompletny, gotowy do uruchomienia checkpoint ASR do dialektów arabskich na licencji Apache-2.0, opublikowany z pełną kartą modelu i dwiema obsługiwanymi ścieżkami serwowania, który pojawił się bez ogłoszenia ze strony firmy, która go stworzyła, bez niezależnej oceny, bez ceny i bez zobowiązania do wsparcia — obok modelu identyfikacji języka arabskiego, który pojawił się pięćdziesiąt dziewięć sekund później i sugeruje, że tego typu rzeczy będzie więcej, a nie mniej.