Wygenerowana karta tytułowa hero dla porównania Voxtral Mini 4B Realtime Arabic i Voxtral 4B TTS, z podtytułem „dwa końce tej samej arabskiej pętli głosowej, dwie różne licencje”, z plakietką „mowa na wejściu kontra mowa na wyjściu”, z trzema polami statystyk pokazującymi 8,82% współczynnika błędów znaków arabskich przy 480 ms wobec 70 ms czasu do pierwszego dźwięku, 16 dialektów arabskich wobec 9 języków, w tym arabskiego, oraz wagi Apache 2.0 wobec wag CC BY-NC 4.0, a logo OrcaRouter nałożone w białym pasku w prawym dolnym rogu.
Engineering & Research

Voxtral Mini 4B Realtime Arabic vs Voxtral 4B TTS: Dwa końce tej samej rozmowy

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Te dwa modele łączy nazwa i liczba parametrów, a plik licencji zachowuje się w ich przypadku inaczej — i na tym podobieństwa się kończą. Voxtral Mini 4B Realtime Arabic, wypchnięty na Hugging Face 8 października 2026 r. bez towarzyszącego ogłoszenia, przyjmuje dźwięk na wejściu i generuje tekst arabski — strumieniowo dostrojona wersja modelu Voxtral-Mini-4B-Realtime-2602 zbudowana dla współczesnego standardowego arabskiego i piętnastu nazwanych dialektów, Apache 2.0, średni wskaźnik błędów znaków (Character Error Rate) 8,82% przy opóźnieniu 480 milisekund. Voxtral 4B TTS, ogłoszony przez Mistral AI w marcu 2026 r., działa odwrotnie: tekst na wejściu, mowa na wyjściu, dwadzieścia predefiniowanych głosów plus adaptacja na podstawie krótkiego klipu referencyjnego, dziewięć języków, w tym arabski, oraz licencja — CC BY-NC 4.0 — która zabrania komercyjnego wykorzystania samych wag. Nie są to alternatywy ani warianty. To dwie połowy pętli głosowej, a powód, by patrzeć na nie razem, jest taki, że decyzje podejmowane w odniesieniu do jednego z nich ograniczają drugi bardziej, niż spodziewa się większość zespołów.

Większość stron porównawczych powie ci, że te modele są ze sobą niepowiązane, ponieważ jeden to ASR, a drugi to TTS, i na tym poprzestanie. To prawda, ale nie jest to przydatne. Tak naprawdę warto wiedzieć, gdzie się spotykają: agent głosowy potrzebuje obu, dwie licencje wskazują przeciwne kierunki, wymagania sprzętowe obu są podobne, natomiast charakterystyki przepustowości już nie, a deklaracje dotyczące pokrycia języka arabskiego mają zupełnie inny kształt. Wszystko poniżej dotyczy tych czterech punktów styku.

Czym jest każdy model, w kategoriach istotnych dla potoku

• Voxtral Mini 4B Realtime Arabic — strumieniowe automatyczne rozpoznawanie mowy. Wejście audio 16 kHz, wyjście tekstowe, około 4,4 miliarda parametrów w BF16, udostępniane przez vLLM z WebSocketem pod /v1/realtime lub natywnie w Transformers od wersji 5.2.0. Kauzalny enkoder audio i dekoder języka, konfigurowalne opóźnienie transkrypcji podawane jako 480 milisekund dla publikowanego wyniku dokładności oraz dołączony moduł normalizacji, dzięki któremu można ponownie wyliczyć współczynnik błędów znaków dla języka arabskiego. Apache 2.0.

• Voxtral 4B TTS — strumieniowa i wsadowa synteza mowy. Tekst na wejściu, dźwięk 24 kHz na wyjściu w formatach WAV, PCM, FLAC, MP3, AAC lub Opus, około 4 miliardów parametrów, z zestawem 20 gotowych głosów i adaptacją głosu na podstawie próbki referencyjnej o długości zaledwie trzech sekund. Własny benchmark Mistrala na pojedynczym H200 z uruchomionym vLLM-Omni 0.18.0, przy wejściu 500 znaków i dziesięciosekundowej próbce referencyjnej, wykazuje 70 milisekund opóźnienia i współczynnik czasu rzeczywistego 0,103 przy współbieżności 1; wartości te rosną do 331 milisekund i 0,237 przy współbieżności 16 oraz do 552 milisekund przy współbieżności 32. Dostępny jako API w cenie 0,016 USD za tysiąc znaków.

Pierwsza obserwacja płynąca z tych dwóch akapitów jest taka, że ta para jest niewielka. Oba modele mieszczą się w zakresie 4 miliardów parametrów i oba mieszczą się na pojedynczym akceleratorze w BF16, co oznacza, że arabski agent głosowy zbudowany w całości na otwartych wagach to wdrożenie co najwyżej na dwóch GPU, a prawdopodobnie na jednym GPU z kwantyzacją po obu stronach. To jest praktyczny powód, by patrzeć na nie jako na zestaw, a nie jako na dwie osobne decyzje produktowe.

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

Asymetria licencji to wynik badania, a nie przypis.

Oto rzecz, która zaskakuje ludzi zakładających, że modele z tego samego laboratorium o tej samej konwencji nazewnictwa mają te same warunki.

• Voxtral Mini 4B Realtime Arabic — Apache 2.0. Komercyjne wykorzystanie, modyfikacja, redystrybucja i dostrajanie są dozwolone, z zastrzeżeniem standardowego ograniczenia dotyczącego naruszania praw stron trzecich.

Voxtral 4B TTS — CC BY-NC 4.0, odziedziczona po stojących za nim zbiorach danych głosów referencyjnych. Niekomercyjna. Karta Mistrala wyraźnie stwierdza, że model dziedziczy licencję swoich referencji głosowych, pochodzących ze źródeł, w tym EARS, CML-TTS, IndicVoices-R oraz arabskiego zbioru naturalnego dźwięku. Wagi można pobrać, a licencja nie jest licencją komercyjną.

To twarde ograniczenie dotyczące dokładnie tej architektury, po którą każdy sięga w pierwszej kolejności. Jeśli zbudujesz arabskiego agenta głosowego, którego część odpowiedzialna za zamianę mowy na tekst to Voxtral Mini 4B Realtime Arabic, a część odpowiedzialna za zamianę tekstu na mowę to Voxtral 4B TTS, otrzymasz potok, w którym połowa komponentów jest swobodnie dostępna komercyjnie, a połowa nie, i to ta restrykcyjna połowa rządzi produktem. To, że model ASR jest na licencji Apache 2.0, nie ratuje części TTS. Uruchamianie tej pary lokalnie nie zmienia licencji, podobnie jak niedostarczanie wag — ograniczenie dotyczy użycia, a nie dystrybucji.

Screenshot of the Hugging Face model card for mistralai/Voxtral-4B-TTS-2603, captured 10 October 2026, showing the model name, the mistralai organisation, the Text-to-Speech pipeline tag, 922 likes, a language badge, and the CC BY-NC 4.0 licence inherited from the reference-voice datasets.

Komercyjna ścieżka, którą Mistral oferuje w zakresie mowy, to hostowane API w cenie 0,016 USD za tysiąc znaków, co stanowi umowę o świadczenie usług, a nie udzielenie licencji. Dla zespołu produktowego praktyczną konsekwencją jest to, że połową pętli, którą można swobodnie komercjalizować, jest ta, która słucha, a ta, która mówi, jest albo zależnością od API, albo rozmową o licencji. Odwraca to założenia większości zespołów, gdy zabierają się za budowę otwartego stosu głosowego, i warto odkryć to przed napisaniem integracji, a nie po.

Arabskie roszczenia nie są spójne, a tylko jedno z nich jest obietnicą pokrycia.

Oba modele wymieniają arabski. Te wykazy oznaczają różne rzeczy.

• Voxtral Mini 4B Realtime Arabic — język arabski to cały zakres. Szesnaście odmian wymieniono jako cele treningowe: współczesny standardowy arabski, marokański, libijski, tunezyjski, algierski i hassanija, zatokowy, nadżdyjski, omański i sanajski, egipski i sudański, mezopotamski oraz zarówno południowy, jak i północny lewantyński, a także czadyjski. Wszystko poza tym zbiorem jest udokumentowane jako wykraczające poza zakres. Jedna zbiorcza wartość dokładności, 8,82% CER, uśredniona dla siedmiu arabskich benchmarków.

• Voxtral 4B TTS — arabski jest jednym z dziewięciu obsługiwanych języków, obok angielskiego, francuskiego, hiszpańskiego, niemieckiego, włoskiego, portugalskiego, niderlandzkiego i hindi. Karta opisuje „zróżnicowane dialekty” w ramach tego wsparcia, nie wymieniając ich, i nie opublikowano wskaźnika jakości dla poszczególnych języków dla arabskiego ani dla żadnego z pozostałych ośmiu.

Czytane razem, ta para daje szczegółową informację o tym, jak dobrze twój system będzie słyszeć arabski, a niemal żadnej informacji o tym, jak dobrze będzie nim mówić. Ta asymetria ma realną konsekwencję dla agenta głosowego obsługującego dialekt Darija lub arabski z Zatoki: strona wejściowa ma opublikowany benchmark i listę dialektów, względem których można prowadzić ocenę, a strona wyjściowa ma plakietkę języka i listę głosów. Nikt nie opublikował pomiaru zrozumiałości dialektalnego arabskiego dla Voxtral 4B TTS, a funkcja adaptacji głosu tego nie rozwiązuje — adaptacja głosu zmienia to, kogo przypomina mowa, a nie to, jaki dialekt generuje.

Jest jeszcze druga, subtelniejsza kwestia dotycząca samego wskaźnika dokładności modelu ASR, która przekłada się na stronę TTS. Mistral podaje 8,82% CER w trybie strumieniowym wobec 7,91% dla trybu offline Voxtral Transcribe Arabic na tych samych siedmiu benchmarkach z tą samą normalizacją, więc strumieniowanie kosztuje około punktu procentowego. Równoważny kompromis po stronie TTS — ile wnioskowanie strumieniowe kosztuje pod względem jakości wyjściowej w porównaniu z przetwarzaniem wsadowym — nie został w materiale w ogóle skwantyfikowany. Liczby dotyczące opóźnień istnieją; różnicy w jakości nie ma.

Przepustowość: jeden model jest stworzony do dużego obciążenia, drugi nie.

Mistral opublikował dane dotyczące przepustowości dokładnie dla jednego z tych modeli, a liczby wyjaśniają dlaczego.

• Voxtral 4B TTS — zmierzony na jednym H200 z vLLM-Omni, przy wejściu 500 znaków i dziesięciosekundowej referencji audio, przepustowość wynosi od około 119 znaków na sekundę czasu GPU przy współbieżności 1 do mniej więcej 879 przy współbieżności 16 i około 1431 przy współbieżności 32, a opóźnienie rośnie z 70 milisekund do 331, a następnie 552. To krzywa przepustowości, na podstawie której można planować zasoby, i ma kształt, jakiego można oczekiwać od modelu zaprojektowanego jako produkcyjna usługa głosowa.

• Voxtral Mini 4B Realtime Arabic — karta nie podaje żadnej wartości przepustowości, zachowania przy współbieżności ani benchmarku sprzętowego. Podaje natomiast architekturę: przyczynowy enkoder oraz mechanizm uwagi z przesuwnym oknem zarówno w enkoderze, jak i dekoderze, opisany w modelu bazowym jako obsługujący praktycznie nieograniczone strumieniowanie. Punkt dokładności podano przy opóźnieniu 480 milisekund, co sugeruje, że model nadąża za dźwiękiem w czasie rzeczywistym na odpowiednim sprzęcie, i na tym kończy się publikowany zakres wydajności.

Ta luka to nie tyle krytyka żadnego z modeli, ile stwierdzenie dotyczące dojrzałości. Model TTS ma opublikowaną tabelę SLO, ponieważ został wydany jako produkt wraz z wpisem na blogu, demem, API i ceną. Arabski model ASR nie ma opublikowanego zakresu wydajności, ponieważ pojawił się jako repozytorium z kartą modelu. Jeśli dziś określasz rozmiar floty do transkrypcji arabskiej, potrzebna wartość przepustowości jeszcze nie istnieje, a jedynym sposobem, aby ją uzyskać, jest uruchomienie ścieżki serwowania vLLM na własnym sprzęcie i z własnym materiałem audio.

To także miejsce, w którym warstwa routingu zmienia kształt wdrożenia, a nie tylko rozliczenia. OrcaRouter nie obsługuje routingu żadnego z tych modeli — nie hostujemy żadnego punktu końcowego mowy Mistral i ten artykuł nie twierdzi inaczej — ale warstwa modeli językowych pomiędzy nimi to dokładnie ta warstwa, która zyskuje dzięki routowaniu: jeden klucz API dla ponad 200 modeli w cenie katalogowej dostawcy z 0% marży, dzięki czemu zmiana ceny przez dostawcę jest uwzględniana po naszej stronie tego samego dnia, w którym zostaje ogłoszona, oraz automatyczne przełączanie awaryjne, dzięki któremu złe popołudnie jednego dostawcy upstream oznacza zmianę trasy, a nie awarię w Twojej pętli głosowej. Agent głosowy złożony z dwóch samodzielnie hostowanych modeli Mistral plus jednego hostowanego modelu rozumowania ma trzy domeny awarii; warstwa routingu sprawia, że środkowa z nich jest nudna.

Koszt, obok siebie, z zastrzeżeniem, że jedna strona nie ma ceny.

• Voxtral 4B TTS — 0,016 USD za tysiąc znaków przez API Mistrala albo koszt GPU, jeśli hostujesz go samodzielnie na warunkach, które pozwalają na Twój przypadek użycia. Dla przybliżenia skali: tysiąc znaków to około dwustu słów, więc minuta mowy na wyjściu kosztuje w cenie katalogowej niskie ułamki centa, zanim uwzględni się jakąkolwiek korzyść ze współbieżności płynącą z uruchomienia go u siebie.

• Voxtral Mini 4B Realtime Arabic — brak opublikowanej ceny, brak usługi hostowanej, brak cennika. Koszt to sprzęt i wykorzystanie. Model 4,4B BF16 na jednym nowoczesnym akceleratorze to stały miesięczny koszt, który amortyzujesz na tyle audio, ile maszyna jest w stanie przetworzyć; jest tani przy stałym wolumenie, a przy sporadycznym — czystym marnotrawstwem.

Porównanie, które prawdopodobnie ma większe znaczenie, wypada względem alternatyw, po które w przeciwnym razie byś sięgnął. Po stronie słuchania arabski checkpoint konkuruje ze strumieniowymi API rozliczanymi za godzinę, których stawki są publikowane i niskie — Microsoft MAI-Transcribe-2-Streaming w cenie wprowadzającej 0,54 USD za godzinę audio, xAI Grok Voice Transcribe 2.0 w cenie 0,20 USD za godzinę audio w trybie strumieniowym — co oznacza, że usługę transkrypcji arabskiej można kupić za kilka dziesiątych centa za minutę, a argument za otwartymi wagami trzeba budować na dokładności dialektów, rezydencji danych lub dostrajaniu, a nie na koszcie jednostkowym. Po stronie mówienia samodzielnie hostowany model TTS przy zerowym koszcie krańcowym jest realną przewagą nad API rozliczanymi za znak przy dużej skali, dlatego licencja CC BY-NC, a nie cena, jest czynnikiem ograniczającym.

Uwaga natury strukturalnej dla każdego, kto planuje budżet na przejście oparte na cenie: router, który przekazuje cenę katalogową dostawcy przy 0% narzutu, jest tym miejscem, w którym zmiana stawek dostawcy pojawia się w dniu ogłoszenia, a nie dopiero w kolejnym cyklu aktualizacji cen. Ma to większe znaczenie po stronie słuchania niż po stronie mówienia, ponieważ transkrypcja jest wyceniana za godzinę audio, a to liczba, którą dostawcy zmieniają.

Jak myśleć o wyborze między nimi

Nie wybierasz między nimi. Pytanie brzmi, którą połowę pętli możesz zbudować na otwartych wagach — i to licencja na nie odpowiada.

Jeśli Twoim wymaganiem jest samowystarczalny arabski agent głosowy, w którym dźwięk nigdy nie opuszcza Twojej infrastruktury, część odpowiedzialna za słuchanie jest dostępna bezwarunkowo: Apache 2.0, do pobrania, z możliwością dostrajania, wraz z listą dialektów do testowania i opublikowanym wskaźnikiem błędów dla języka arabskiego. To na części odpowiedzialnej za mówienie pojawia się ograniczenie i masz dwie uczciwe opcje — przenieść syntezę mowy do usługi hostowanej w ramach umowy komercyjnej albo usunąć Voxtral 4B TTS z architektury i znaleźć model syntezy dla języka arabskiego na permisywnej licencji.

Jeśli Twoim wymaganiem jest produkcyjna usługa transkrypcji, a językiem jest arabski, decyzja sprowadza się do wyboru między możliwym do pobrania checkpointem 4,4B z opublikowaną taksonomią dialektów i jednym zagregowanym wskaźnikiem błędu a hostowanym strumieniowym API z opublikowaną stawką, opublikowanym opóźnieniem i rankingiem podmiotu trzeciego. Model otwarty wygrywa pod względem kontroli, rezydencji danych i dostrajania; opcje hostowane wygrywają pod względem dowodów, wsparcia i prostoty operacyjnej. Dwa dni po pojawieniu się wag nikt poza firmą Mistral ich nie zmierzył, a to jest powód, by przeprowadzić własny benchmark, a nie powód, by odrzucać checkpoint.

Tym, co najbardziej zmieniłoby ten obraz, byłoby wydanie syntezy arabskiej na warunkach pozwalających na użycie komercyjne — ten sam wzorzec, który już obowiązuje po stronie słuchania. Dopóki ono nie istnieje, pętla pozostaje półotwarta, a praktyczna praca polega na decydowaniu, którą połowę jesteś gotów wynająć.

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and Voxtral 4B TTS across six shared rows: task speech to text against text to speech with 24 kHz audio output; Arabic claim 16 named dialects at 8.82% character error rate against 1 of 9 languages with no quality figure; licence Apache 2.0 permitting commercial use against CC BY-NC 4.0 non-commercial weights; service price none published against $0.016 per 1,000 characters; published throughput none against 119 to 1,431 characters per second per GPU; and hardware roughly 4.4B in BF16 on a single accelerator against roughly 4B in BF16 on a single accelerator. A footer reads that all figures are Mistral's own and unreproduced, and that the two models are complementary rather than competing. The OrcaRouter logo sits in a white strip at the bottom right.

Nie hostujemy żadnego z tych modeli mowy Mistral i ten artykuł nie twierdzi inaczej; tym, czego pętla głosowa potrzebuje ponad nimi, jest warstwa językowa, a tę można trasować – jeden klucz API do ponad 200 modeli w cenie katalogowej dostawcy z 0% marży, więc zmiana stawek dostawcy trafia po naszej stronie tego samego dnia, w którym zostaje ogłoszona.

Automatyczne przełączanie awaryjne sprawia, że środkowy element trójkomponentowego agenta głosowego — jeden nadrzędny model rozumowania między dwoma samodzielnie hostowanymi modelami Mistral — nie jest tym, który powala produkt.