Wygenerowana główna karta tytułowa do porównania Voxtral Mini 4B Realtime Arabic i MAI-Transcribe-2-Streaming, z podtytułem „dwa październikowe debiuty, dwa problemy z dowodami”, plakietką „październik 2026, oba zgłoszone przez dostawcę” oraz trzema plakietkami statystycznymi: 8,82% wskaźnika błędu znaków arabskich przy 480 ms wobec 2,5% wskaźnika błędu słów przy 0,13 s, 16 dialektów wobec 60 języków i wagi Apache 2.0 wobec wersji zapoznawczej Azure za 0,54 USD za godzinę audio, a także logo OrcaRouter wkomponowane w biały pasek w prawym dolnym rogu.
Guides & Insights

Voxtral Mini 4B Realtime Arabic kontra MAI-Transcribe-2-Streaming: Dwie październikowe premiery, dwa problemy z dowodami

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Siedem dni dzieli te dwa modele mowy w czasie rzeczywistym, a pojawiły się w skrajnie odmienny sposób. MAI-Transcribe-2-Streaming to pierwszy strumieniowy model transkrypcji Microsoft AI, ogłoszony 1 października 2026 r. wraz z postem premierowym, ofertą podglądową w Azure, ceną 0,54 USD za godzinę audio w promocji wprowadzającej do końca roku oraz twierdzeniem, że jest pierwszy na strumieniowym rankingu Artificial Analysis pod względem dokładności zarówno transkrypcji końcowej, jak i częściowej, przy 2,5% wskaźniku błędów słów i tekście końcowym gotowym 0,13 sekundy po zakończeniu wypowiedzi. Voxtral Mini 4B Realtime Arabic to strumieniowy model Mistral AI do dialektów arabskich, opublikowany na Hugging Face 8 października 2026 r. bez żadnej zapowiedzi — bez posta na blogu, bez ceny, bez usługi, tylko wagi Apache 2.0 i karta modelu podająca średni wskaźnik błędów znaków (Character Error Rate) wynoszący 8,82% w siedmiu arabskich testach porównawczych przy opóźnieniu 480 milisekund. Model Microsoftu to gotowy produkt z niepotwierdzalnym nagłówkiem. Model Mistrala to weryfikowalny artefakt, wokół którego nie ma żadnego produktu. Oba warto zrozumieć właśnie dlatego, że oba pozostawiają centralne pytanie — jak dobrze radzą sobie z arabskim — z odpowiedzią pochodzącą wyłącznie od dostawcy.

Porównanie i tak warto przeprowadzić, ponieważ oba modele ujmują tę samą decyzję inżynierską z przeciwnych stron. Microsoft sprzedaje szerokość i usługę zarządzaną: 60 języków z automatycznym, ciągłym wykrywaniem języka, działających w Azure AI Speech, rozliczanych za godzinę, w wersji zapoznawczej. Mistral oddaje za darmo głębię: szesnaście nazwanych odmian arabskiego, wystarczająco małych, by działały na jednym akceleratorze, wraz ze skryptem normalizacyjnym, dzięki któremu możesz samodzielnie prześwietlić punktację. Jeśli w tym miesiącu uruchamiasz potok transkrypcji arabskiej, wybierasz między tymi dwoma stanowiskami, a wybór zależy od dowodów, których w żadnym z tych przypadków jeszcze nie masz.

Co faktycznie powiedział każdy dostawca, a co mówią zarządy

Luka dowodowa to najważniejsza cecha tego starcia, dlatego omawia się ją w pierwszej kolejności.

• MAI-Transcribe-2-Streaming — 2,5% współczynnika błędów słów dla końcowej transkrypcji po 0,13 sekundy od zakończenia mowy oraz takie samo 2,5% dla pierwszych wyników częściowych po 0,12 sekundy; oba przedstawiono jako pierwsze miejsce pod względem dokładności według metodologii AA-WER Streaming firmy Artificial Analysis. To ujęcie samego Microsoftu. Na moment pisania tego tekstu tablica streamingowa trackera nie umieściła jeszcze wiersza dla tego modelu, więc twierdzenie opiera się na metodologii trackera, nie mając za sobą liczby opublikowanej przez tracker.

• Voxtral Mini 4B Realtime Arabic — średni współczynnik błędów znaków na poziomie 8,82% w siedmiu arabskich benchmarkach przy skonfigurowanym opóźnieniu 480 milisekund. Własna karta Mistrala, z dołączonym kodem ewaluacyjnym. Żadna strona trzecia nie odtworzyła tych wyników, a model ma dwa dni.

Zatem dwie kluczowe liczby w tym artykule to odpowiednio twierdzenie dostawcy oparte na cudzej miarce oraz twierdzenie dostawcy z dołączoną własną miarką. Żadna z nich nie jest niezależnym pomiarem. Różnica polega na tym, że liczba Mistrala przychodzi wraz ze skryptem normalizacyjnym, którego potrzebujesz, aby ponownie ją wyprowadzić, a liczba Microsoftu przychodzi wraz z tablicą, która jeszcze nie umieściła jej na wykresie. Jeśli podejmujesz decyzję zakupową, ta różnica ma większe znaczenie niż rozpiętość między 2,5 a 8,82, która i tak nic nie znaczy — wskaźnik błędów słów i wskaźnik błędów znaków nie przeliczają się na siebie, a ortografia arabska znacznie zwiększa dzielącą je różnicę.

Jedynym porównaniem w karcie Mistrala, które faktycznie przekonuje, jest zestawienie z jego własnym siostrzanym modelem offline: Voxtral Transcribe Arabic osiąga 7,91% CER na tych samych siedmiu benchmarkach i przy tej samej normalizacji, więc streaming kosztuje ten model 0,91 punktu procentowego. Microsoft opublikował równoważną wartość dla swojej własnej rodziny, gdy 3 września 2026 r. wprowadził batchowy MAI-Transcribe-2 przy 2,0% wskaźnika błędów słów — wariant strumieniowy oddaje pół punktu względem modelu batchowego, dodając przy tym dostarczanie w czasie rzeczywistym. Zestaw te dwie wewnętrzne delty producentów obok siebie, a otrzymasz jedyne w tym artykule stwierdzenie pozwalające porównać jabłka z jabłkami: na własnych benchmarkach strumieniowa wersja SKU każdego laboratorium pozostaje w tyle za swoim batchowym odpowiednikiem — o około jeden punkt w jednym przypadku i pół punktu w drugim — a oba mierzą różne języki.

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

Pokrycie językowe: 60 przeciwko 16, i ta sama nienazwana luka po obu stronach

• MAI-Transcribe-2-Streaming — 60 języków z automatycznym ciągłym wykrywaniem języka, dzięki czemu sesja, która przełącza języki w trakcie transmisji, nie wymaga wcześniejszego zadeklarowania języka. Materiały premierowe Microsoftu podają liczbę, a nie listę; dokumentacja obsługi języków w Azure dla rodziny MAI-Transcribe to miejsce, w którym wyszczególniono zakres pokrycia, i wymienia arabski wśród języków obsługiwanych przez tę rodzinę.

• Voxtral Mini 4B Realtime Arabic — szesnaście odmian języka arabskiego, wymienionych osobno: współczesny arabski standardowy, marokański, libijski, tunezyjski, algierski i arabski hassanija, arabski z Zatoki, nadżdyjski, omański i sanaański, egipski i sudański, mezopotamski oraz zarówno południowolewantyński, jak i północnolewantyński, a także czadyjski. Poza tym zestawem model jest udokumentowany jako poza zakresem, ze wskazaniem na ogólny Voxtral Mini 4B Realtime.

Żadna z tych liczb nie mówi ci tego, czego potrzebujesz. Liczba 60 firmy Microsoft to wskaźnik szerokości pokrycia, który obejmuje arabski, ale nie opisuje skuteczności w tym języku; wpis premierowy podaje łączną liczbę języków tylko raz i na tym poprzestaje. Liczba 16 firmy Mistral to wyliczenie celów treningowych z pojedynczym zagregowanym wskaźnikiem błędów dla siedmiu zestawów benchmarków, co oznacza, że rozbicie na poziomie dialektów — to, co faktycznie decyduje, czy twoje marokańskie nagranie rozmowy zostanie transkrybowane — również nie zostało opublikowane. Dwa modele, dwóch dostawców, a w obu przypadkach uczciwa odpowiedź na pytanie „jak dobry jest konkretnie w dialekcie arabskim z Zatoki” brzmi: nie podano.

To, co daje ci to wyliczenie, to rozkład a priori. Model z arabskim czadyjskim i arabskim hassaniya jako nazwanymi celami został dostrojony do dystrybucji północnoafrykańskiej; Mistral współtworzył go z marokańskim Ministère de la Transition Numérique et de la Réforme Administrative i zbudował dwa z siedmiu benchmarków wspólnie z tym ministerstwem — ISMA i Darija in the Wild — specjalnie po to, by mierzyć trudne przypadki. Ogólny model obsługujący 60 języków poprawia przede wszystkim współczesny standardowy arabski, ponieważ tam skupia się masa sygnału treningowego. Jeśli twoje audio jest w darija lub arabskim zatokowym, to są inne problemy, a tylko jeden z tych dwóch dostawców podał liczbę dla któregokolwiek z nich.

Latencja i kształt opóźnienia

• MAI-Transcribe-2-Streaming — 0,13 sekundy od zakończenia mowy do końcowej transkrypcji, a pierwsze transkrypcje częściowe już po 0,12 sekundy, co jest wystarczająco szybkie, że transkrypcja częściowa i końcowa mają praktycznie takie samo opóźnienie. Twierdzenie Microsoftu, zmierzone zgodnie z metodologią trackera.

• Voxtral Mini 4B Realtime Arabic — 480 milisekund skonfigurowanego opóźnienia w opublikowanym punkcie dokładności, przy czym opóźnienie można regulować. To około trzy i pół raza więcej niż wartość Microsoftu i jest to parametr wybierany przez operatora, a nie stała właściwość.

Trzy dziesiąte sekundy to realna różnica dla agenta głosowego, który musi odpowiadać w trakcie wypowiedzi, a niemal niewidoczna dla człowieka czytającego napisy. To także różnica między pokrętłem a liczbą. Parametr opóźnienia Mistrala oznacza, że można ustawić go ciaśniej i zaakceptować więcej błędów albo luźniej i odzyskać dokładność — model bazowy, z którego dostrojono ten checkpoint, podaje zakres od 240 milisekund do 2,4 sekundy — podczas gdy punkt pracy Microsoftu jest tym, co dostarcza Azure. To sprawia, że liczba Microsoftu jest łatwiejsza do zrozumienia, a liczba Mistrala łatwiejsza do dostrojenia, i oznacza, że wszelkie porównanie obu liczb dokładności jest w rzeczywistości porównaniem dwóch wybranych punktów na jednej krzywej i jednego stałego punktu na drugiej.

Zakres funkcji różni się równie wyraźnie, więc zanim dyskusja o dokładności stanie się interesująca, warto sprawdzić go pod kątem wymagań Twojego pipeline'u.

• MAI-Transcribe-2-Streaming — dostarczany przez Azure AI Speech z udokumentowanym zestawem funkcji tej rodziny: diaryzacja, znaczniki czasu na poziomie słów, ukierunkowanie na słowa kluczowe i frazy, dosłowne i oczyszczone style danych wyjściowych oraz automatyczna identyfikacja języka. Dokumentacja samej wersji SKU strumieniowej dotycząca diaryzacji i znaczników czasu jest skromniejsza niż w modelu wsadowym, dlatego należy je potwierdzić dla każdego punktu końcowego, zamiast zakładać równoważność.

Screenshot of the Microsoft Learn documentation page 'Use a MAI-Transcribe model' in Azure AI Speech, captured 10 October 2026, showing the public preview notice that the feature is provided without a service-level agreement and is not recommended for production workloads, alongside the statement that MAI-Transcribe is a next-generation speech-to-text model built in-house by the Microsoft AI team covering 60 languages.

• Voxtral Mini 4B Realtime Arabic — karta dokumentuje transkrypcję z przyczynowym enkoderem audio, obsługę vLLM przez WebSocket pod /v1/realtime, natywne wsparcie Transformers od wersji 5.2.0 oraz moduł normalizacji. Nie dokumentuje diaryzacji ani znaczników czasu na poziomie słów dla tego checkpointu.

Model dostarczania: usługa podglądu w przeciwieństwie do wag do pobrania

• MAI-Transcribe-2-Streaming — wersja zapoznawcza Azure, co oznacza brak SLA i zalecenie dostawcy, aby nie uzależniać od niej środowisk produkcyjnych. Wyceniono na 0,54 USD za godzinę audio jako stawkę wprowadzającą obowiązującą do końca 2026 r., przy czym stawka standardowa nie została opublikowana; wsadowa wersja MAI-Transcribe-2 zadebiutowała w cenie 0,10 USD za godzinę audio na tej samej ograniczonej czasowo zasadzie. Strumieniowanie kosztuje 5,4 razy więcej niż stawka wsadowa.

• Voxtral Mini 4B Realtime Arabic — Apache 2.0, około 4,4 miliarda parametrów w BF16, do pobrania, dostrajania i serwowania na pojedynczym akceleratorze. Bez ceny, bez SLA i bez zobowiązania do wsparcia, ponieważ nie stoi za tym żadna usługa.

Te dwa zdania zawierają decyzję. Usługa w wersji zapoznawczej z ceną promocyjną i nieujawnioną ceną standardową to zobowiązanie, które wygasa; zarówno 5,4-krotnie wyższa opłata za streaming, jak i okno obowiązywania do 2026 roku mogą zostać zmienione przez Microsoft, a proporcja między trybem wsadowym a strumieniowym to wartość, na którą trzeba uważać, gdy pojawi się cena standardowa. Wagi Apache 2.0 bez żadnego ogłoszenia są przeciwieństwem: artefaktem, którego nie da się cofnąć, powiązanym z relacją z dostawcą, której nikt nie opisał. Nie da się stwierdzić, czy checkpoint będzie utrzymywany, ale plik, który masz dzisiaj, i tak nadal działa.

Ograniczenie specyficzne dla danej branży to zwykle czynnik, który w praktyce rozstrzyga te kwestie. Wdrożenie arabskiego call center w instytucji podlegającej regulacjom może w ogóle nie móc wysyłać dźwięku do punktu końcowego chmury w wersji zapoznawczej; zespół, który przyjął już Azure AI Speech jako standard, może nie chcieć drugiego stosu lokalnego dla jednej rodziny językowej. Oba ograniczenia są zasadne i żadne z nich nie ma nic wspólnego z liczbami 2,5% i 8,82%, które trafiły na nagłówki przy obu premierach.

Powyżej warstwy transkrypcji ta sama zasada dotyczy obu. OrcaRouter nie trasuje żadnego z tych modeli mowy — to porównanie dwóch systemów, których nie obsługujemy — ale sumaryzator, klasyfikator czy agent konsumujący transkrypt są trasowalne: ponad 200 modeli na jednym kluczu API, w cenie katalogowej dostawcy z 0% marży, dzięki czemu zmiana ceny dostawcy dociera do nas tego samego dnia, oraz automatyczny failover, jeśli dostawca zacznie działać gorzej. W tym konkretnym przypadku pomaga to na etapie próbnym: skierowanie obu kandydatów do transkrypcji na jeden dalszy potok przetwarzania, za jednym kluczem, pozwala przeprowadzić bezpośrednie porównanie bez uruchamiania dwóch integracji.

Test, który by to rozstrzygnął

Żaden z dostawców nie opublikował wyników dotyczących konkretnie języka arabskiego i żaden nie został niezależnie oceniony na nagraniach w dialektach. Porównanie sprowadza się zatem do trzech faktów i jednej rekomendacji.

Fakty: strumieniowy model Microsoftu jest szybszy, osiągając 0,13 sekundy, i twierdzi, że ma lepszą łączną dokładność na tablicy wyników, która jeszcze go nie umieściła; model Mistrala publikuje listę dialektów, współczynnik błędów dla języka arabskiego oraz kod normalizacji pozwalający ponownie go wyprowadzić, w czasie 480 milisekund; a tych dwóch wartości dokładności nie można porównywać, ponieważ jedna to współczynnik błędów na poziomie słów, a druga to współczynnik błędów na poziomie znaków na innym korpusie.

Rekomendacja: ten, kto podejmuje tę decyzję, powinien przetestować oba na własnym audio, ponieważ to jedyny pomiar, którego nie zamknął żaden z dostawców. Zbuduj zestaw ewaluacyjny z rzeczywistych nagrań — mieszanki dialektów, jaką faktycznie otrzymujesz, kodeka, którego faktycznie używasz, słownictwa dziedzinowego, którego faktycznie potrzebujesz — i oceń oba za pomocą normalizacji Mistrala względem referencji, której ufasz. Dwugodzinny test na własnych nagraniach powie ci więcej niż oba posty premierowe razem wzięte i to jedyny sposób, aby dowiedzieć się, czy przewaga 0,13 sekundy jest warta zależności od wersji zapoznawczej i 5,4-krotnie wyższej opłaty za streaming, czy też model 4,4B do pobrania przy 480 milisekundach jest już wystarczająco dobry do tego zadania.

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and MAI-Transcribe-2-Streaming across six shared rows: price none published and self-host only against $0.54 per audio-hour introductory through the end of 2026; accuracy 8.82% Arabic character error rate at 480ms against a claimed 2.5% final word error rate at 0.13s; board status none because the model is days old against claimed first but not yet plotted; languages 16 named Arabic varieties against 60 with the list unpublished; delivery Apache 2.0 self-hosted weights against Azure preview with no SLA; and diarization and timestamps not documented against family documentation that requires per-SKU confirmation. A footer reads that both accuracy figures are vendor-reported and that no independent Arabic evaluation of either model exists. The OrcaRouter logo sits in a white strip at the bottom right.

OrcaRouter nie obsługuje żadnego z tych modeli mowy, a ten tekst nie sugeruje inaczej – omawia natomiast warstwę językową, która odczytuje transkrypcję: ponad 200 modeli za jednym kluczem w cenie katalogowej dostawcy z 0% marży, więc zmiana ceny dostawcy dla modelu podrzędnego dociera do Ciebie w dniu jej ogłoszenia.

Automatyczne przełączanie awaryjne pozwala obu kandydatom do transkrypcji zasilać jeden dalszy potok zamiast dwóch integracji, co jest również najtańszym sposobem przeprowadzenia bezpośredniego porównania.