
Voxtral Mini 4B Realtime Arabic vs Voxtral 4B TTS: Dwa końce tej samej rozmowy
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 118 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Te dwa modele łączy nazwa i liczba parametrów, a plik licencji zachowuje się w ich przypadku inaczej — i na tym podobieństwa się kończą. Voxtral Mini 4B Realtime Arabic, wypchnięty na Hugging Face 8 października 2026 r. bez towarzyszącego ogłoszenia, przyjmuje dźwięk na wejściu i generuje tekst arabski — strumieniowo dostrojona wersja modelu Voxtral-Mini-4B-Realtime-2602 zbudowana dla współczesnego standardowego arabskiego i piętnastu nazwanych dialektów, Apache 2.0, średni wskaźnik błędów znaków (Character Error Rate) 8,82% przy opóźnieniu 480 milisekund. Voxtral 4B TTS, ogłoszony przez Mistral AI w marcu 2026 r., działa odwrotnie: tekst na wejściu, mowa na wyjściu, dwadzieścia predefiniowanych głosów plus adaptacja na podstawie krótkiego klipu referencyjnego, dziewięć języków, w tym arabski, oraz licencja — CC BY-NC 4.0 — która zabrania komercyjnego wykorzystania samych wag. Nie są to alternatywy ani warianty. To dwie połowy pętli głosowej, a powód, by patrzeć na nie razem, jest taki, że decyzje podejmowane w odniesieniu do jednego z nich ograniczają drugi bardziej, niż spodziewa się większość zespołów.
Większość stron porównawczych powie ci, że te modele są ze sobą niepowiązane, ponieważ jeden to ASR, a drugi to TTS, i na tym poprzestanie. To prawda, ale nie jest to przydatne. Tak naprawdę warto wiedzieć, gdzie się spotykają: agent głosowy potrzebuje obu, dwie licencje wskazują przeciwne kierunki, wymagania sprzętowe obu są podobne, natomiast charakterystyki przepustowości już nie, a deklaracje dotyczące pokrycia języka arabskiego mają zupełnie inny kształt. Wszystko poniżej dotyczy tych czterech punktów styku.
Czym jest każdy model, w kategoriach istotnych dla potoku
• Voxtral Mini 4B Realtime Arabic — strumieniowe automatyczne rozpoznawanie mowy. Wejście audio 16 kHz, wyjście tekstowe, około 4,4 miliarda parametrów w BF16, udostępniane przez vLLM z WebSocketem pod /v1/realtime lub natywnie w Transformers od wersji 5.2.0. Kauzalny enkoder audio i dekoder języka, konfigurowalne opóźnienie transkrypcji podawane jako 480 milisekund dla publikowanego wyniku dokładności oraz dołączony moduł normalizacji, dzięki któremu można ponownie wyliczyć współczynnik błędów znaków dla języka arabskiego. Apache 2.0.
• Voxtral 4B TTS — strumieniowa i wsadowa synteza mowy. Tekst na wejściu, dźwięk 24 kHz na wyjściu w formatach WAV, PCM, FLAC, MP3, AAC lub Opus, około 4 miliardów parametrów, z zestawem 20 gotowych głosów i adaptacją głosu na podstawie próbki referencyjnej o długości zaledwie trzech sekund. Własny benchmark Mistrala na pojedynczym H200 z uruchomionym vLLM-Omni 0.18.0, przy wejściu 500 znaków i dziesięciosekundowej próbce referencyjnej, wykazuje 70 milisekund opóźnienia i współczynnik czasu rzeczywistego 0,103 przy współbieżności 1; wartości te rosną do 331 milisekund i 0,237 przy współbieżności 16 oraz do 552 milisekund przy współbieżności 32. Dostępny jako API w cenie 0,016 USD za tysiąc znaków.
Pierwsza obserwacja płynąca z tych dwóch akapitów jest taka, że ta para jest niewielka. Oba modele mieszczą się w zakresie 4 miliardów parametrów i oba mieszczą się na pojedynczym akceleratorze w BF16, co oznacza, że arabski agent głosowy zbudowany w całości na otwartych wagach to wdrożenie co najwyżej na dwóch GPU, a prawdopodobnie na jednym GPU z kwantyzacją po obu stronach. To jest praktyczny powód, by patrzeć na nie jako na zestaw, a nie jako na dwie osobne decyzje produktowe.

Asymetria licencji to wynik badania, a nie przypis.
Oto rzecz, która zaskakuje ludzi zakładających, że modele z tego samego laboratorium o tej samej konwencji nazewnictwa mają te same warunki.
• Voxtral Mini 4B Realtime Arabic — Apache 2.0. Komercyjne wykorzystanie, modyfikacja, redystrybucja i dostrajanie są dozwolone, z zastrzeżeniem standardowego ograniczenia dotyczącego naruszania praw stron trzecich.
Voxtral 4B TTS — CC BY-NC 4.0, odziedziczona po stojących za nim zbiorach danych głosów referencyjnych. Niekomercyjna. Karta Mistrala wyraźnie stwierdza, że model dziedziczy licencję swoich referencji głosowych, pochodzących ze źródeł, w tym EARS, CML-TTS, IndicVoices-R oraz arabskiego zbioru naturalnego dźwięku. Wagi można pobrać, a licencja nie jest licencją komercyjną.
To twarde ograniczenie dotyczące dokładnie tej architektury, po którą każdy sięga w pierwszej kolejności. Jeśli zbudujesz arabskiego agenta głosowego, którego część odpowiedzialna za zamianę mowy na tekst to Voxtral Mini 4B Realtime Arabic, a część odpowiedzialna za zamianę tekstu na mowę to Voxtral 4B TTS, otrzymasz potok, w którym połowa komponentów jest swobodnie dostępna komercyjnie, a połowa nie, i to ta restrykcyjna połowa rządzi produktem. To, że model ASR jest na licencji Apache 2.0, nie ratuje części TTS. Uruchamianie tej pary lokalnie nie zmienia licencji, podobnie jak niedostarczanie wag — ograniczenie dotyczy użycia, a nie dystrybucji.

Komercyjna ścieżka, którą Mistral oferuje w zakresie mowy, to hostowane API w cenie 0,016 USD za tysiąc znaków, co stanowi umowę o świadczenie usług, a nie udzielenie licencji. Dla zespołu produktowego praktyczną konsekwencją jest to, że połową pętli, którą można swobodnie komercjalizować, jest ta, która słucha, a ta, która mówi, jest albo zależnością od API, albo rozmową o licencji. Odwraca to założenia większości zespołów, gdy zabierają się za budowę otwartego stosu głosowego, i warto odkryć to przed napisaniem integracji, a nie po.
Arabskie roszczenia nie są spójne, a tylko jedno z nich jest obietnicą pokrycia.
Oba modele wymieniają arabski. Te wykazy oznaczają różne rzeczy.
• Voxtral Mini 4B Realtime Arabic — język arabski to cały zakres. Szesnaście odmian wymieniono jako cele treningowe: współczesny standardowy arabski, marokański, libijski, tunezyjski, algierski i hassanija, zatokowy, nadżdyjski, omański i sanajski, egipski i sudański, mezopotamski oraz zarówno południowy, jak i północny lewantyński, a także czadyjski. Wszystko poza tym zbiorem jest udokumentowane jako wykraczające poza zakres. Jedna zbiorcza wartość dokładności, 8,82% CER, uśredniona dla siedmiu arabskich benchmarków.
• Voxtral 4B TTS — arabski jest jednym z dziewięciu obsługiwanych języków, obok angielskiego, francuskiego, hiszpańskiego, niemieckiego, włoskiego, portugalskiego, niderlandzkiego i hindi. Karta opisuje „zróżnicowane dialekty” w ramach tego wsparcia, nie wymieniając ich, i nie opublikowano wskaźnika jakości dla poszczególnych języków dla arabskiego ani dla żadnego z pozostałych ośmiu.
Czytane razem, ta para daje szczegółową informację o tym, jak dobrze twój system będzie słyszeć arabski, a niemal żadnej informacji o tym, jak dobrze będzie nim mówić. Ta asymetria ma realną konsekwencję dla agenta głosowego obsługującego dialekt Darija lub arabski z Zatoki: strona wejściowa ma opublikowany benchmark i listę dialektów, względem których można prowadzić ocenę, a strona wyjściowa ma plakietkę języka i listę głosów. Nikt nie opublikował pomiaru zrozumiałości dialektalnego arabskiego dla Voxtral 4B TTS, a funkcja adaptacji głosu tego nie rozwiązuje — adaptacja głosu zmienia to, kogo przypomina mowa, a nie to, jaki dialekt generuje.
Jest jeszcze druga, subtelniejsza kwestia dotycząca samego wskaźnika dokładności modelu ASR, która przekłada się na stronę TTS. Mistral podaje 8,82% CER w trybie strumieniowym wobec 7,91% dla trybu offline Voxtral Transcribe Arabic na tych samych siedmiu benchmarkach z tą samą normalizacją, więc strumieniowanie kosztuje około punktu procentowego. Równoważny kompromis po stronie TTS — ile wnioskowanie strumieniowe kosztuje pod względem jakości wyjściowej w porównaniu z przetwarzaniem wsadowym — nie został w materiale w ogóle skwantyfikowany. Liczby dotyczące opóźnień istnieją; różnicy w jakości nie ma.
Przepustowość: jeden model jest stworzony do dużego obciążenia, drugi nie.
Mistral opublikował dane dotyczące przepustowości dokładnie dla jednego z tych modeli, a liczby wyjaśniają dlaczego.
• Voxtral 4B TTS — zmierzony na jednym H200 z vLLM-Omni, przy wejściu 500 znaków i dziesięciosekundowej referencji audio, przepustowość wynosi od około 119 znaków na sekundę czasu GPU przy współbieżności 1 do mniej więcej 879 przy współbieżności 16 i około 1431 przy współbieżności 32, a opóźnienie rośnie z 70 milisekund do 331, a następnie 552. To krzywa przepustowości, na podstawie której można planować zasoby, i ma kształt, jakiego można oczekiwać od modelu zaprojektowanego jako produkcyjna usługa głosowa.
• Voxtral Mini 4B Realtime Arabic — karta nie podaje żadnej wartości przepustowości, zachowania przy współbieżności ani benchmarku sprzętowego. Podaje natomiast architekturę: przyczynowy enkoder oraz mechanizm uwagi z przesuwnym oknem zarówno w enkoderze, jak i dekoderze, opisany w modelu bazowym jako obsługujący praktycznie nieograniczone strumieniowanie. Punkt dokładności podano przy opóźnieniu 480 milisekund, co sugeruje, że model nadąża za dźwiękiem w czasie rzeczywistym na odpowiednim sprzęcie, i na tym kończy się publikowany zakres wydajności.
Ta luka to nie tyle krytyka żadnego z modeli, ile stwierdzenie dotyczące dojrzałości. Model TTS ma opublikowaną tabelę SLO, ponieważ został wydany jako produkt wraz z wpisem na blogu, demem, API i ceną. Arabski model ASR nie ma opublikowanego zakresu wydajności, ponieważ pojawił się jako repozytorium z kartą modelu. Jeśli dziś określasz rozmiar floty do transkrypcji arabskiej, potrzebna wartość przepustowości jeszcze nie istnieje, a jedynym sposobem, aby ją uzyskać, jest uruchomienie ścieżki serwowania vLLM na własnym sprzęcie i z własnym materiałem audio.
To także miejsce, w którym warstwa routingu zmienia kształt wdrożenia, a nie tylko rozliczenia. OrcaRouter nie obsługuje routingu żadnego z tych modeli — nie hostujemy żadnego punktu końcowego mowy Mistral i ten artykuł nie twierdzi inaczej — ale warstwa modeli językowych pomiędzy nimi to dokładnie ta warstwa, która zyskuje dzięki routowaniu: jeden klucz API dla ponad 200 modeli w cenie katalogowej dostawcy z 0% marży, dzięki czemu zmiana ceny przez dostawcę jest uwzględniana po naszej stronie tego samego dnia, w którym zostaje ogłoszona, oraz automatyczne przełączanie awaryjne, dzięki któremu złe popołudnie jednego dostawcy upstream oznacza zmianę trasy, a nie awarię w Twojej pętli głosowej. Agent głosowy złożony z dwóch samodzielnie hostowanych modeli Mistral plus jednego hostowanego modelu rozumowania ma trzy domeny awarii; warstwa routingu sprawia, że środkowa z nich jest nudna.
Koszt, obok siebie, z zastrzeżeniem, że jedna strona nie ma ceny.
• Voxtral 4B TTS — 0,016 USD za tysiąc znaków przez API Mistrala albo koszt GPU, jeśli hostujesz go samodzielnie na warunkach, które pozwalają na Twój przypadek użycia. Dla przybliżenia skali: tysiąc znaków to około dwustu słów, więc minuta mowy na wyjściu kosztuje w cenie katalogowej niskie ułamki centa, zanim uwzględni się jakąkolwiek korzyść ze współbieżności płynącą z uruchomienia go u siebie.
• Voxtral Mini 4B Realtime Arabic — brak opublikowanej ceny, brak usługi hostowanej, brak cennika. Koszt to sprzęt i wykorzystanie. Model 4,4B BF16 na jednym nowoczesnym akceleratorze to stały miesięczny koszt, który amortyzujesz na tyle audio, ile maszyna jest w stanie przetworzyć; jest tani przy stałym wolumenie, a przy sporadycznym — czystym marnotrawstwem.
Porównanie, które prawdopodobnie ma większe znaczenie, wypada względem alternatyw, po które w przeciwnym razie byś sięgnął. Po stronie słuchania arabski checkpoint konkuruje ze strumieniowymi API rozliczanymi za godzinę, których stawki są publikowane i niskie — Microsoft MAI-Transcribe-2-Streaming w cenie wprowadzającej 0,54 USD za godzinę audio, xAI Grok Voice Transcribe 2.0 w cenie 0,20 USD za godzinę audio w trybie strumieniowym — co oznacza, że usługę transkrypcji arabskiej można kupić za kilka dziesiątych centa za minutę, a argument za otwartymi wagami trzeba budować na dokładności dialektów, rezydencji danych lub dostrajaniu, a nie na koszcie jednostkowym. Po stronie mówienia samodzielnie hostowany model TTS przy zerowym koszcie krańcowym jest realną przewagą nad API rozliczanymi za znak przy dużej skali, dlatego licencja CC BY-NC, a nie cena, jest czynnikiem ograniczającym.
Uwaga natury strukturalnej dla każdego, kto planuje budżet na przejście oparte na cenie: router, który przekazuje cenę katalogową dostawcy przy 0% narzutu, jest tym miejscem, w którym zmiana stawek dostawcy pojawia się w dniu ogłoszenia, a nie dopiero w kolejnym cyklu aktualizacji cen. Ma to większe znaczenie po stronie słuchania niż po stronie mówienia, ponieważ transkrypcja jest wyceniana za godzinę audio, a to liczba, którą dostawcy zmieniają.
Jak myśleć o wyborze między nimi
Nie wybierasz między nimi. Pytanie brzmi, którą połowę pętli możesz zbudować na otwartych wagach — i to licencja na nie odpowiada.
Jeśli Twoim wymaganiem jest samowystarczalny arabski agent głosowy, w którym dźwięk nigdy nie opuszcza Twojej infrastruktury, część odpowiedzialna za słuchanie jest dostępna bezwarunkowo: Apache 2.0, do pobrania, z możliwością dostrajania, wraz z listą dialektów do testowania i opublikowanym wskaźnikiem błędów dla języka arabskiego. To na części odpowiedzialnej za mówienie pojawia się ograniczenie i masz dwie uczciwe opcje — przenieść syntezę mowy do usługi hostowanej w ramach umowy komercyjnej albo usunąć Voxtral 4B TTS z architektury i znaleźć model syntezy dla języka arabskiego na permisywnej licencji.
Jeśli Twoim wymaganiem jest produkcyjna usługa transkrypcji, a językiem jest arabski, decyzja sprowadza się do wyboru między możliwym do pobrania checkpointem 4,4B z opublikowaną taksonomią dialektów i jednym zagregowanym wskaźnikiem błędu a hostowanym strumieniowym API z opublikowaną stawką, opublikowanym opóźnieniem i rankingiem podmiotu trzeciego. Model otwarty wygrywa pod względem kontroli, rezydencji danych i dostrajania; opcje hostowane wygrywają pod względem dowodów, wsparcia i prostoty operacyjnej. Dwa dni po pojawieniu się wag nikt poza firmą Mistral ich nie zmierzył, a to jest powód, by przeprowadzić własny benchmark, a nie powód, by odrzucać checkpoint.
Tym, co najbardziej zmieniłoby ten obraz, byłoby wydanie syntezy arabskiej na warunkach pozwalających na użycie komercyjne — ten sam wzorzec, który już obowiązuje po stronie słuchania. Dopóki ono nie istnieje, pętla pozostaje półotwarta, a praktyczna praca polega na decydowaniu, którą połowę jesteś gotów wynająć.

Nie hostujemy żadnego z tych modeli mowy Mistral i ten artykuł nie twierdzi inaczej; tym, czego pętla głosowa potrzebuje ponad nimi, jest warstwa językowa, a tę można trasować – jeden klucz API do ponad 200 modeli w cenie katalogowej dostawcy z 0% marży, więc zmiana stawek dostawcy trafia po naszej stronie tego samego dnia, w którym zostaje ogłoszona.
Automatyczne przełączanie awaryjne sprawia, że środkowy element trójkomponentowego agenta głosowego — jeden nadrzędny model rozumowania między dwoma samodzielnie hostowanymi modelami Mistral — nie jest tym, który powala produkt.
