Wygenerowana karta tytułowa hero do porównania Voxtral Mini 4B Realtime Arabic i Grok Voice Transcribe 2.0, z podtytułem „lider rankingu etykiet spotyka specjalistę od arabskiego z 16 dialektami”, z plakietką „repozytorium Mistral, 8 października 2026”, z trzema żetonami statystyk pokazującymi 8,82% współczynnika błędów znaków arabskich przy 480 ms wobec 2,7% współczynnika błędów słów przy 0,49 s, 16 nazwanych dialektów wobec 38+ nieudokumentowanych języków oraz wagi Apache 2.0 wobec 0,20 USD za godzinę audio, a logo OrcaRouter wkomponowane w biały pasek w prawym dolnym rogu.
Guides & Insights

Voxtral Mini 4B Realtime Arabic vs Grok Voice Transcribe 2.0: Lider rankingu spotyka specjalistę od dialektów

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Uczciwym punktem wyjścia dla tego porównania jest to, że Voxtral Mini 4B Realtime Arabic i G​rok Voice Transcribe 2.0 nie konkurują o to samo zadanie, a najszybszym sposobem, aby to zobaczyć, jest spojrzenie na to, co każdy dostawca był gotów opublikować. Mistral AI umieścił Voxtral Mini 4B Realtime Arabic na Hugging Face 8 października 2026 r. bez ogłoszenia — wagi Apache 2.0, kartę modelu wymieniającą szesnaście odmian języka arabskiego i pojedynczą wartość dokładności wynoszącą 8,82% średniego współczynnika błędów znaków (Character Error Rate) w siedmiu benchmarkach arabskich przy opóźnieniu 480 milisekund. x​AI wypuściło G​rok Voice Transcribe 2.0 18 września 2026 r. wraz z wpisem o premierze, ceną i wynikiem w rankingu niezależnego podmiotu: 2,7% współczynnika błędów słów w transkrypcjach końcowych, przy czym tekst stabilizuje się 0,49 sekundy po zakończeniu wypowiedzi przez mówiącego; pierwsze miejsce w rankingu strumieniowego rozpoznawania mowy Artificial Analysis w momencie premiery. Jeden model mówi dokładnie, które dialekty obsługuje, i odmawia zgadywania poza ich zakresem. Drugi mówi, że obejmuje ponad 38 języków, i nie wyszczególnia ani jednego z nich.

Na tej asymetrii opiera się całe porównanie. Jeśli kupujesz hurtowo moce transkrypcyjne do nagrań w mieszanych językach, model xAI jest o wiele bardziej kompletnym produktem. Jeśli twoje audio jest w języku arabskim — a konkretnie jeśli to arabski dialektalny, a nie współczesny standardowy arabski w wersji medialnej — checkpoint Mistrala celuje w problem, którego nie mierzy ranking, na którego szczycie znajduje się model xAI, a odczytywanie faktu, że plasuje się w tym rankingu na drugim, a nie pierwszym miejscu, jako werdyktu byłoby błędem.

Arytmetyka cen, ponieważ jest tu wyjątkowo przejrzysta

xAI publikuje stawkę. Mistral publikuje plik do pobrania. Ta różnica determinuje wszystko, co następuje dalej, więc zacznij od liczby, która istnieje.

• Grok Voice Transcribe 2.0 — 0,10 USD za godzinę audio przez REST dla plików nagrań, 0,20 USD za godzinę audio przez strumieniowy WebSocket. To około 1,67 USD za tysiąc minut w trybie wsadowym i 3,33 USD za tysiąc minut w trybie strumieniowym — bez zmian względem Grok Voice Transcribe 1.0 przy tych samych cenach.

• Voxtral Mini 4B Realtime Arabic — brak opublikowanej ceny, ponieważ nie ma opublikowanej usługi. Wagi są na licencji Apache 2.0 i mają około 4,4 miliarda parametrów w BF16, co oznacza, że kosztem jest GPU, do którego je podłączysz, oraz wykorzystanie, jakie z niego uzyskasz. Przy stałym wolumenie jest to tanie; przy zerowym wolumenie jest to najdroższa opcja w tym artykule, ponieważ płacisz za bezczynny sprzęt.

Próg opłacalności nie jest subtelny. Stawka strumieniowania w wysokości 0,20 USD za godzinę to około jednej trzeciej centa na minutę. Każdy akcelerator, na którym uruchomiłbyś model 4.4B, kosztuje więcej niż to za godzinę, chyba że przepuszczasz przez niego stały ruch, co oznacza, że podejście z otwartymi wagami wygrywa pod względem kosztów dopiero wtedy, gdy masz wystarczający wolumen arabskiego ruchu, aby utrzymać maszynę w ciągłym obciążeniu — i przegrywa na każdej innej osi, dopóki do tego nie dojdziesz, ponieważ API nie ma CAPEX-u, nie wymaga planowania przepustowości ani nie generuje obciążenia operacyjnego.

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

Jedno miejsce, w którym arytmetyka przechyla się wcześniej, to zgodność. Checkpoint Mistrala przetwarza dźwięk na sprzęcie, który kontrolujesz, więc nic nie opuszcza twojej sieci, a karta jest dostarczana z modułem normalizacji, dzięki czemu potok oceniania arabskiego możesz audytować samodzielnie. Grok Voice Transcribe 2.0 działa w regionach xAI i zgodnie ze swoją dokumentacją przetwarza dźwięk w czasie rzeczywistym, nie zachowując go ani nie wykorzystując go do trenowania, przy wsparciu SOC 2 Type II i kwalifikowalności HIPAA. Obie historie da się obronić; tylko jedna z nich pozwala regulatorowi skontrolować ścieżkę kodu.

Co tak naprawdę można kupić za 0,20 dolara za godzinę, a model Mistral nie jest wydawany

Luka w funkcjach jest tu większa niż luka w dokładności i omawia się ją znacznie rzadziej. Grok Voice Transcribe 2.0 to produkt z interfejsem; Voxtral Mini 4B Realtime Arabic to checkpoint, który emituje tekst.

• Diaryzacja mówców — dostępna w Grok Voice Transcribe 2.0, a także transkrypcja wielokanałowa do ośmiu niezależnych kanałów. Karta Mistral nie wymienia możliwości diaryzacji; model tworzy transkrypcję, a nie transkrypcję z przypisaniem mówców.

• Znaczniki czasu na poziomie słów — Grok zawiera je wraz z dołączonymi ocenami pewności, dzięki czemu można ustawić próg dla fragmentów o niskiej pewności, zamiast ufać całemu transkryptowi w równym stopniu. Karta Mistrala nie deklaruje znaczników czasu dla tego checkpointu.

• Faworyzowanie kluczowych terminów — do 100 terminów domenowych na żądanie w punkcie końcowym Grok, dzięki czemu można sprawić, by model poprawnie rozpoznawał nazwy produktów, kody kont i nazwy miejsc bez dostrajania. Droga Mistrala do tego samego rezultatu to dostrajanie na własnych danych, na co pozwala Apache 2.0, a na co hostowany endpoint już nie.

• Odwrotna normalizacja tekstu — Grok przekształca liczby, daty, waluty, numery telefonów i adresy e-mail w formę pisemną w 25 językach. Karta modelu Mistral zawiera skrypt normalizacyjny, ale jego deklarowanym celem jest punktowanie arabskich benchmarków, a nie formatowanie danych wyjściowych do wyświetlenia.

• Powierzchnia interfejsu — REST dla plików do 500 MB, strumieniowanie przez WebSocket pod wss://api.x.ai/v1/stt z wynikami tymczasowymi mniej więcej co 500 ms, udokumentowane 10 żądań na sekundę i 100 równoczesnych sesji strumieniowych oraz na razie jeden region. Po stronie Mistral: serwowanie za pomocą vLLM z WebSocketem pod /v1/realtime albo natywne Transformers od wersji 5.2.0, bez limitu szybkości innego niż możliwości Twojego sprzętu.

Jeśli potrzebujesz diaryzacji i znaczników czasu, porównanie kończy się, zanim w grę wejdzie dokładność. To nie jest przytyk do modelu Mistral — wyszkolony do tworzenia dokładnego tekstu dialektalnego arabski specjalista 4B to inny cel inżynieryjny niż ogólna usługa transkrypcji — ale oznacza to, że oba staną się wymienne tylko wtedy, gdy twój potok przetwarzania będzie traktować transkrypcję jako surowiec do własnego przetwarzania końcowego.

Problem z listą języków

Obaj dostawcy opisują obsługę języków w sposób, który z przeciwnych stron pozostawia to samo pytanie bez odpowiedzi.

• Grok Voice Transcribe 2.0 — ponad 38 języków, automatyczne wykrywanie języka z przełączaniem języka w trakcie nagrywania w jednym przebiegu, w 12 formatach audio od 8 kHz do 48 kHz. Dokumentacja podaje liczbę, a nie listę. Arabski nie jest wymieniony osobno nigdzie w materiale, co oznacza, że obsługa języka arabskiego jest sugerowana przez liczbę, a niepotwierdzona przez dostawcę.

• Voxtral Mini 4B Realtime – szesnaście odmian arabskiego wymienionych wprost: współczesny standardowy arabski; marokański, libijski, tunezyjski, algierski i hassanija z Maghrebu; zatokowy, nadżdyjski, omański i sanaański z Zatoki; egipski i sudański z Doliny Nilu; mezopotamski oraz południowo- i północno-lewantyński; i arabski czadyjski. Wszystko poza tym zestawem jest poza zakresem, a karta mówi, aby zamiast tego użyć ogólnego modelu czasu rzeczywistego.

Zatem pytanie „który z nich lepiej radzi sobie z arabskim” ma dziwną strukturę. Model Mistral to udokumentowany specjalista od języka arabskiego z opublikowanym współczynnikiem błędów dla arabskiego i bez niezależnej weryfikacji. Model xAI to udokumentowany lider rankingu, którego dostawca w ogóle nie potwierdził, że arabski wchodzi w zakres. Zarówno liczba 38 języków obejmująca arabski, jak i lista szesnastu dialektów obejmująca wyłącznie arabski odpowiadają na pytanie „czy obsługuje arabski” — ale tylko jedna z nich odpowiada na pytanie „czy obsługuje dariję”.

Screenshot of the xAI documentation page for the grok-voice-transcribe-2.0 model, captured 10 October 2026, showing the Speech to Text entry in the Voice documentation navigation, the model page slug grok-voice-transcribe-2.0, its audio-to-text modality, and the us-east-1 region listing with rate-limit sections.

Tabela wyników nie pomaga w tym przypadku. Ocena zamiany mowy na tekst Artificial Analysis to stały zestaw z przewagą angielskich rozmów agentowych, co jest właściwym rozwiązaniem do rankingu ogólnej transkrypcji, a niewłaściwym do ujawnienia wygranej w dialektalnym arabskim. Model może być naprawdę lepszy w arabskim z Zatoki Perskiej i arabskim marokańskim, a na tej tabeli wypadać jedynie jako dobry. To nie jest krytyka tej tabeli; to powód, by nie używać jej jako jedynego źródła danych przy wdrożeniu regionalnym.

Dokładność, w jednostkach, których nie można przeliczyć

• Grok Voice Transcribe 2.0 — 2,7% współczynnika błędów słów w końcowym zapisie przy 0,49 sekundy do końcowego wyniku oraz 3,4% w przypadku pierwszych wyników częściowych; oba mierzone na indeksie AA-WER v2 firmy Artificial Analysis, który łączy prywatny zestaw rozmów agentowych z VoxPopuli i Earnings22. Wartość dla pierwszego wyniku częściowego jest godna uwagi: spadła z 18,3% w Grok Voice Transcribe 1.0, co stanowi różnicę między częściowym zapisem, na którym można opierać routing, a takim, który można tylko wyświetlać.

• Voxtral Mini 4B Realtime Arabic — średni wskaźnik błędów znakowych na poziomie 8,82% w siedmiu arabskich benchmarkach przy opóźnieniu 480 milisekund, na podstawie własnej ewaluacji dostawcy z dołączonym do niej skryptem normalizacyjnym. Mistral podaje, że różnica dzieląca ten model od Voxtral Transcribe Arabic osiągającego 7,91% CER wynosi 0,91 punktu procentowego; Voxtral Transcribe Arabic to model arabski działający offline z tego samego laboratorium — porównanie warte więcej niż porównanie między dostawcami, ponieważ benchmarki, normalizacja i pomiar są identyczne po obu stronach.

Zestawienie 2,7% z 8,82% nie jest porównaniem; to błąd kategorii. Wskaźnik błędów słów (WER) liczy błędne słowa względem odniesienia, wskaźnik błędów znaków (CER) liczy błędne znaki, a ortografia arabska — w której to samo słowo toleruje wiele poprawnych zapisów, a klityki przyłączają się swobodnie — poszerza przepaść między tymi dwiema metrykami znacznie bardziej, niż pokazują to języki zapisywane alfabetem łacińskim. Korpusy są różne, normalizacja jest inna, a tylko jedna liczba pochodzi od strony trzeciej. To, co te dwie liczby mogą ci zasadnie powiedzieć, to że model xAI jest zmierzonym, dobrze sklasyfikowanym transkryberem ogólnym, a model Mistral — deklarowanym transkryberem specjalizującym się w arabskim. Nie mogą ci powiedzieć, który lepiej transkrybuje twoje audio.

Porównanie, które faktycznie przekonuje, to to z karty samego Mistrala: 8,82% w trybie strumieniowym wobec 7,91% w trybie offline, te same siedem benchmarków, ta sama normalizacja, to samo laboratorium. Tryb strumieniowy kosztuje około punktu dokładności w języku arabskim względem modelu wsadowego. Czy to dobry kompromis, twoja decyzja — a teraz jest to decyzja świadoma.

Gdzie mały model wygrywa, a nie ma tego na tablicy wyników

Trzy rzeczy dotyczące checkpointu Mistral są warte więcej, niż sugerują liczby, i żadna z nich nie pojawia się w żadnym rankingu.

Pierwszym punktem jest sama taksonomia dialektów. Wymienienie szesnastu odmian jako odrębnych celów treningowych, w tym hasanija i arabski czadyjski, jest stwierdzeniem o tym, gdzie mierzono błędy modelu. Ogólny model wielojęzyczny, który uwzględnia arabski jako jeden z 38 języków, poprawia wyniki najpierw w zakresie współczesnego standardowego arabskiego, ponieważ to tam skupia się większość sygnału treningowego i waga benchmarku. Model zbudowany na potrzeby partnerstwa marokańskiego wspólnie z ministerstwem północnoafrykańskim optymalizuje pod kątem innego rozkładu, a został współtworzony wraz z dwoma benchmarkami — ISMA i Darija in the Wild — stworzonymi specjalnie do pomiaru tego rozkładu.

Druga kwestia to konfigurowalne opóźnienie. Wartość 8,82% podaje się przy 480 milisekundach, a opóźnienie jest regulowane, a nie stałe, co zamienia liczbę dokładności w punkt na krzywej wybieranej przez operatora. W przypadku zadania polegającego na napisach na żywo można je skrócić i zaakceptować więcej błędów; w przypadku potoku rejestrowania rozmów można je wydłużyć i odzyskać dokładność. Grok Voice Transcribe 2.0 oferuje stały punkt pracy, a własna ścieżka aktualizacji dostawcy pokazuje, dlaczego ma to konsekwencje — przejście z 1.0 do 2.0 kosztowało około jednej trzeciej sekundy zarówno w opóźnieniu pierwszego wyniku częściowego, jak i wyniku końcowego, a dostępne rozwiązanie to przypięcie starego modelu, a nie regulacja pokrętła.

Po trzecie, licencja Apache 2.0 na wagi, które posiadasz, jest bezwarunkowa. Cokolwiek stanie się z checkpointem u źródła — czy zostanie ogłoszony, wyceniony, oznaczony jako przestarzały, czy już nigdy więcej nie wspomniany — artefakt pozostaje możliwy do pobrania, dostrojenia i wdrożenia w twoim własnym produkcie. Zarówno cennik hostowanego endpointu, jak i harmonogram wycofania jego modelu może zmienić dostawca, a xAI już zasygnalizowało zamiar uczynienia Grok Voice Transcribe 2.0 domyślnym i oznaczenia 1.0 jako przestarzałego, co naraz przeniesie na nowy profil opóźnień każdą integrację, która nigdy nie przekazała parametru modelu.

Na warstwie routingu powyżej transkrypcji jedna praktyczna uwaga: żaden z modeli nie jest hostowanym przez nas rozwiązaniem do zamiany mowy na tekst i ten artykuł nie twierdzi inaczej. To, co obejmuje OrcaRouter, to warstwa modeli językowych konsumująca strumień — sumaryzator, klasyfikator, agent — za jednym kluczem API w ponad 200 modelach w cenie katalogowej dostawcy z 0% marży, więc zmiana ceny u dostawcy trafia tutaj tego samego dnia. Zespoły korzystające z dwóch dostawców mowy w celu pokrycia językowego już teraz mają dwa kontrakty i dwie ścieżki uwierzytelniania; sprowadzenie dolnej połowy do jednego klucza to tania wygrana.

Co zrobić z tym

Oprzyj się na Grok Voice Transcribe 2.0, jeśli Twoje audio jest wielojęzyczne, jeśli potrzebujesz diaryzacji, znaczników czasu lub faworyzowania kluczowych terminów od razu po wyjęciu z pudełka, albo jeśli chcesz już dziś usługę z opublikowaną stawką i ścieżką wsparcia. To bardziej kompletny produkt, jest mierzony przez stronę trzecią, a stawka za streaming w wysokości 0,20 USD za godzinę audio jest wystarczająco niska, że argument kosztowy otwartych wag nie działa, dopóki nie działasz na poważną skalę.

Oprzyj się na Voxtral Mini 4B Realtime Arabic, jeśli Twoje audio jest arabskie, a konkretnie dialektalne, jeśli potrzebujesz tego modelu we własnej sieci ze względów zgodności albo jeśli zamierzasz go dostrajać — ponieważ tylko jedna z tych opcji na to pozwala. Najpierw zaakceptuj trzy rzeczy: brak diarizacji, brak znaczników czasu i brak niezależnej ewaluacji opublikowanej przez kogokolwiek. Dwa dni po pojawieniu się wag ten ostatni punkt nie jest czerwoną flagą; to po prostu taki jest stan dowodów.

Najszybciej zmieniłoby to porównanie przeprowadzenie ewaluacji specyficznej dla języka arabskiego na prawdziwych nagraniach dialektalnych, poza oboma dostawcami, z zastosowaniem tej samej normalizacji do obu systemów. Dopóki taka ewaluacja nie istnieje, decyzja opiera się na własnej liście dialektów jednego dostawcy przeciwko własnej, nieujawnionej liście innego, a jedynym wiarygodnym testem są Twoje nagrania.

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and Grok Voice Transcribe 2.0 across six shared rows: price none published and self-host only against $0.10 per audio-hour over REST and $0.20 streaming; accuracy 8.82% Arabic character error rate vendor-reported against 2.7% final word error rate per Artificial Analysis; delay configurable with 480ms quoted against 0.49s to final and 0.49s to first partial; languages 16 named Arabic varieties against 38+ with none itemised by the vendor; diarization and timestamps not documented against included with confidence scores; and distribution Apache 2.0 weights on Hugging Face against API only. A footer reads that Mistral figures are vendor-reported and unverified while Grok figures are per Artificial Analysis, and that character error rate and word error rate are not comparable. The OrcaRouter logo sits in a white strip at the bottom right.

Żaden z tych endpointów nie należy do naszych usług — to porównanie dwóch systemów spoza naszego katalogu — ale modele, które przetwarzają transkrypcję, są dostępne w routingu:ponad 200 modeli na jednym kluczu API w cenniku dostawcy z 0% marży, więc zmiana stawki dla modelu streszczającego lub klasyfikującego obowiązuje od tego samego dnia, w którym zostaje ogłoszona.

Automatyczne przełączanie awaryjne jest tym, co powstrzymuje konfigurację mowy od dwóch dostawców przed przenoszeniem dwóch pojedynczych punktów awarii do warstwy językowej, która z niej czerpie.