
Voxtral Mini 4B Realtime Arabic kontra Gemini 3.5 Transcribe Live: dialekty kontra zakres
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 118 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Dwa strumieniowe modele zamiany mowy na tekst, dwa zupełnie różne zakłady o to, co stanowi trudną część transkrypcji. Voxtral Mini 4B Realtime Arabic to dostrojony model o 4,4 miliarda parametrów, który Mistral AI wypchnął do publicznego repozytorium 8 października 2026 r. bez wpisu premierowego, artykułu na blogu czy choćby wzmianki w firmowym indeksie nowości, wytrenowany specjalnie na współczesnym standardowym arabskim i piętnastu nazwanych dialektach, wydany na licencji Apache 2.0 z możliwymi do pobrania wagami BF16. Gemini 3.5 Transcribe Live to strumieniowy punkt końcowy Gemini 3.5 Transcribe firmy Google, ogłoszony w sierpniu 2026 r. z całą oprawą wydania platformowego, obejmujący ponad 85 lokalizacji i zamknięty — API w wersji zapoznawczej bez wag i z limitem sesji wynoszącym dziesięć minut. Jeden model zagłębił się w jedną rodzinę językową i przyznał to we własnej sekcji ograniczeń; drugi poszedł szeroko i nie sprecyzował gwarancji na poziomie akcentu. To, którego z nich chcesz, zależy od osi, której marketing żadnego z dostawców nie stawia na pierwszym miejscu: jak faktycznie brzmi twoje audio.
To nie jest symetryczne porównanie i warto powiedzieć to na wstępie, zamiast to ukrywać. Model Mistral ma w chwili pisania 48 godzin, nie ma ogłoszenia dostawcy, niezależnej oceny ani opublikowanej ceny. Model Google jest w publicznej wersji zapoznawczej od końca sierpnia i jest mierzony w narzędziu śledzącym należącym do strony trzeciej. Traktuj stronę Mistral jako zestaw twierdzeń z karty modelu, a stronę Google jako zestaw pomiarów plus zestaw twierdzeń, a porównanie pozostanie uczciwe.
Czym jest każdy model, zanim przejdziemy do liczb
• Voxtral Mini 4B Realtime Arabic — strumieniowy model ASR dostrojony na podstawie Voxtral-Mini-4B-Realtime-2602, mający około 4,4 mld parametrów w BF16, przetwarzający dźwięk 16 kHz za pomocą przyczynowego enkodera audio i dekodera języka. Emituje tekst w miarę napływania dźwięku, z konfigurowalnym opóźnieniem transkrypcji, jest objęty licencją Apache 2.0, a jego wagi są dostępne na Hugging Face. Mistral współtworzył go z marokańskim Ministerstwem Transformacji Cyfrowej i Reformy Administracyjnej w ramach partnerstwa podpisanego w styczniu 2026 r. i opisuje ten model jako suwerenny zasób AI.
• Gemini 3.5 Transcribe Live — strumieniowa połowa wydania dwóch modeli. Punkt końcowy Live API przesyła ciągły dźwięk z mikrofonu przez WebSocket, zwraca częściowe transkrypcje, gdy mówca jeszcze mówi, i niedługo po zakończeniu każdej wypowiedzi ustala ostateczną transkrypcję. Pokrewny model wsadowy, gemini-3.5-transcribe, obsługuje wcześniej nagrane pliki o długości do godziny. Oba są dostępne w publicznej wersji zapoznawczej, oba działają wyłącznie przez API i żaden nie ma opublikowanych wag.
Pierwsza różnica strukturalna nie dotyczy dokładności. Polega ona na tym, że jedno z nich to plik, który możesz pobrać jeszcze dziś wieczorem, a drugie to usługa, do korzystania z której musisz zostać dopuszczony.

Pokrycie językowe: 16 wobec ponad 85, a różnica nie jest tu sednem
Liczenie języków sprawia, że model Mistral wydaje się wąski, a model Google – ogromny. Te liczby mierzą różne rzeczy, a czytanie ich obok siebie bez tego zastrzeżenia to najczęstszy błąd, do jakiego zachęca to porównanie.
• Voxtral Mini 4B Realtime Arabic — 16 wariantów języka arabskiego, wymienionych osobno na karcie modelu według rodziny dialektów: współczesny arabski standardowy oraz marokański, libijski, tunezyjski, algierski i arabski hassanija z Maghrebu; zatokowy, nadżdyjski, omański i sanaański z Zatoki; egipski i sudański z Doliny Nilu; mezopotamski oraz zarówno południowolewantyński, jak i północnowolewantyński; a także arabski czadyjski. Sama karta ujmuje to tak, że model jest ukierunkowany na transkrypcję arabskiego, a przełączanie kodów — osoby mówiące naprzemiennie różnymi językami w trakcie rozmowy — to zdolność, którą miał opanować, a nie efekt uboczny.
• Gemini 3.5 Transcribe Live — automatyczne wykrywanie języka w ponad 85 lokalizacjach, z przełączaniem kodu w obrębie zdania i między zdaniami. Dokumentacja Google wymienia arabski w tym zestawie; tabela lokalizacji podaje arabski (Egipt) jako wpis dla języka arabskiego, a szerszy zakres lokalizacji arabskich nie jest wyszczególniony w dokumentacji samego modelu.
Przeczytaj to uczciwie, a kształt tej wymiany się wyłania. Wynik 85+ Google’a to twierdzenie o szerokości: jeśli twoje audio jest w języku innym niż arabski, endpoint Google’a je obejmuje, a model Mistrala odmówi jego obsługi — karta mówi wprost, że w przypadku innych języków należy użyć oryginalnego Voxtral Mini 4B Realtime, a nie tego checkpointu. Wynik 16 Mistrala to twierdzenie o głębokości. Nie twierdzi on, że transkrybuje arabski; twierdzi, że transkrybuje dariję marokańską, arabski zatokowy, arabski egipski i arabski czadyjski jako odrębne cele, co jest istotnie trudniejszym problemem niż transkrybowanie współczesnego standardowego arabskiego i liczenie, że dialekt z tego wyniknie. Benchmark z przewagą angielskiego, nastawiony na szerokość, nigdy nie pokaże ci tej różnicy, ponieważ nie ma w nim zestawów dialektalnych.
Dla marokańskiego centrum obsługi telefonicznej lub linii wsparcia klientów w Zatoce model, który obsługuje 16 dialektów i nic poza tym, może pobić model obsługujący 85 lokalizacji przy nieokreślonej dokładności na dialekt. Dla europejskiej firmy transkrybującej spotkania w pięciu językach równanie natychmiast się odwraca. Żaden dostawca nie jest w błędzie; wybrali różnych klientów.

Liczby, które możesz porównać, i te, których nie możesz
I tu właśnie daje o sobie znać asymetria. Te dwa modele podają różne jednostki, na różnych korpusach, mając za sobą różne dowody, a żadna strona trzecia nie skonfrontowała ich ze sobą.
• Voxtral Mini 4B Realtime Arabic — średni współczynnik błędów znaków na poziomie 8,82% w siedmiu arabskich benchmarkach, przy skonfigurowanym opóźnieniu transkrypcji wynoszącym 480 milisekund. Według własnej karty Mistrala, bez niezależnego odtworzenia.
• Model, który próbuje dogonić — Voxtral Transcribe Arabic z 7,91% CER na tych samych siedmiu benchmarkach według tego samego pomiaru, więc model działający w czasie rzeczywistym wypada o 0,91 punktu procentowego za offlinowym modelem arabskim od tego samego dostawcy. Ta różnica pochodzi z porównania samego Mistrala, co czyni je wyjątkowo pouczającym: dostawca mówi ci, ile dokładności kosztuje strumieniowanie w tej rodzinie językowej.
• Gemini 3.5 Transcribe Live — 4,0% wskaźnika błędów słów w trybie strumieniowym, zmierzonego przez Artificial Analysis i cytowanego przez Google, przy czym końcowy transkrypt pojawia się 0,40 sekundy po zakończeniu mowy. Zmierzono również: 2,6% na tablicy niestrumieniowej tego samego narzędzia śledzącego oraz 5,50% w trybie strumieniowym na FLEURS według własnych raportów Google.
Nie stawiaj 8,82% CER obok 4,0% WER i nie wyciągaj z tego żadnych wniosków. Współczynnik błędów na poziomie znaku i współczynnik błędów na poziomie słowa mają różne mianowniki — ortografia arabska sprawia, że różnica między nimi jest większa niż w językach zapisywanych alfabetem łacińskim — a korpusy nie są takie same, normalizacja nie jest taka sama, a jedna liczba ma dołączony odtwarzalny skrypt, podczas gdy druga pochodzi ze stałej mieszanki trackera, która jest obciążona w stronę angielskich rozmów agentów.
Bardziej użyteczne jest porównanie zawarte w samej karcie Mistrala: 8,82% w trybie strumieniowym wobec 7,91% w trybie offline, na identycznych benchmarkach i przy identycznej normalizacji. To rzetelny pomiar tego, co daje i ile kosztuje niska latencja konkretnie w języku arabskim, i jest wart więcej niż jakikolwiek procentowy wskaźnik między dostawcami. Nikt nie opublikował jednak porównywalnego testu modeli Google i Mistrala w języku arabskim na tym samym materiale audio. Dopóki ktoś tego nie zrobi, „który jest dokładniejszy w języku arabskim” pozostaje pytaniem otwartym, a jedyna możliwa do obrony odpowiedź brzmi: wypróbuj oba na swoich nagraniach.
Jeden szczegół w karcie Mistrala zasługuje na wzmiankę, ponieważ działa przeciwko interesowi samego dostawcy. Wskazuje ona, że filtry bezpieczeństwa Gemini blokują transkrypcję niektórych próbek audio FLEURS. To realna, możliwa do sprawdzenia obserwacja dotycząca potoku konkurenta, a jednocześnie dokładnie taki rodzaj informacji, który nigdy nie pojawia się na leaderboardzie — model, który odmawia transkrypcji próbki, jest oceniany jako porażka albo jako brak wyniku, a żadna z tych interpretacji nie jest sprawiedliwa. Jeśli Twoje audio zawiera materiał, który mógłby wychwycić filtr treści, to ryzyko wdrożeniowe, którego nie ujawni żadna wartość WER.
Opóźnienie: pokrętło kontra stała liczba
Modele streamingowe są zwykle porównywane na podstawie jednego wskaźnika opóźnienia. Te dwa nie mają ani jednego wspólnego.
• Voxtral Mini 4B Realtime Arabic — konfigurowalne opóźnienie transkrypcji. Wartość CER 8,82% podaje się przy 480 milisekundach, a opóźnienie jest regulowane, co oznacza, że wartość dokładności jest jednym punktem na krzywej wybieranej przez operatora, a nie właściwością modelu. Jego model bazowy deklaruje zakres od 240 milisekund do 2,4 sekundy.
• Gemini 3.5 Transcribe Live — 0,40 sekundy od końca mowy do końcowej transkrypcji, zmierzone przez Artificial Analysis, z częściowymi transkrypcjami napływającymi w sposób ciągły podczas mowy. Google niezależnie twierdzi o 70% poprawie czasu do końcowej transkrypcji w porównaniu z Chirp 3, co jest danymi producenta i nie zostało odtworzone.
Oba trafiają w podobne rejony — około pół sekundy — ale ich znaczenie inżynieryjne jest inne. Model Mistral oddaje Ci kompromis między opóźnieniem a dokładnością jako parametr, więc możesz działać z opóźnieniem 240 ms, gdy napisy poniżej sekundy liczą się bardziej niż ostatnie kilka punktów dokładności, i wydłużyć opóźnienie, gdy tak nie jest. Punkt końcowy Google prezentuje stały punkt pracy z dołączonym własnym zachowaniem filtra treści Google. Dla agenta głosowego regulacja jest warta więcej niż nieco lepsza stała liczba, ponieważ właściwe ustawienie zależy od Twojego audio i Twoich użytkowników, a żaden z dostawców nie może wybrać go za Ciebie.
Prawdziwy podział: otwarte wagi kontra endpoint podglądowy
Różnica w licencji i dystrybucji jest większa niż jakakolwiek luka w benchmarkach w tym porównaniu i przesądza o większości rzeczywistych wdrożeń, zanim jeszcze omówiona zostanie dokładność.
• Voxtral Mini 4B Realtime Arabic — Apache 2.0, wagi BF16 na Hugging Face, można go udostępniać za pomocą vLLM przez WebSocket pod adresem /v1/realtime, a także jest natywnie obsługiwany w Transformers od wersji 5.2.0. Karta modelu zawiera przykład w Pythonie i moduł normalizacji, dzięki czemu możesz samodzielnie odtworzyć obliczanie CER dla języka arabskiego. Żaden element tego potoku nie wymaga serwerów Mistrala, a model jest wystarczająco mały, że pytanie operacyjne sprowadza się do tego, który GPU wybrać, a nie czy stać cię na jakikolwiek.
• Gemini 3.5 Transcribe Live — wyłącznie przez API, publiczna wersja zapoznawcza, brak opublikowanego zobowiązania cenowego poza stawkami cennikowymi oraz limit sesji wynoszący dziesięć minut, co oznacza, że wszystko dłuższe trzeba dzielić na fragmenty, ponownie łączyć i scalać za pomocą własnego kodu. Trzy ograniczenia zgłoszone wraz z premierą mają szczególne znaczenie właśnie dla wdrożeń arabskich: endpoint strumieniowy nie zwraca diaryzacji mówców ani znaczników czasu na poziomie słów; oba te elementy występują w endpointcie wsadowym, ale nie w tym. Jeśli Twój arabski transkrypt musi wiedzieć, kto co powiedział, albo być zsynchronizowany czasowo z dźwiękiem, endpoint Live nie może tego wytworzyć niezależnie od języka.
Te dwa ograniczenia są najsilniejszym argumentem za małym otwartym modelem w rzeczywistym wdrożeniu arabskim i nie mają nic wspólnego z dokładnością. Pipeline centrum obsługi telefonicznej potrzebuje przypisania mówcy, pipeline zgodności potrzebuje znaczników czasu, a offline'owy model arabski ze skryptem normalizacyjnym, który kontrolujesz, daje jedno i drugie bez spierania się z kontraktem punktu końcowego. Karta modelu Mistral również wymienia to jako ograniczenie, a nie funkcję — jest ukierunkowany na transkrypcję, jest dostrojeniem ogólnego modelu czasu rzeczywistego i uczciwie przyznaje, że szerszy model istnieje wyżej w łańcuchu, jeśli go potrzebujesz.
Ile kosztuje każdy z nich i co jest nieznane
• Gemini 3.5 Transcribe Live — około 0,009 USD za minutę audio w ujęciu łączonym, obliczone na podstawie cen katalogowych 3,50 USD za milion tokenów wejściowych i 21 USD za milion tokenów wyjściowych, przy czym audio jest szacowane na 25 tokenów na sekundę, a transkrypcja na około 175 tokenów na minutę. Endpoint wsadowy to około 0,005 USD za minutę. Obie liczby to szacunki wynikające z przyjętego przez Google sposobu tokenizacji, więc zmienią się, jeśli zmieni się sposób rozliczania. Obecnie dostępny jest bezpłatny poziom.
• Voxtral Mini 4B Realtime Arabic — brak opublikowanej ceny, ponieważ nie ma opublikowanej usługi. Koszt jest taki, jaki jest koszt twojego sprzętu. Model BF16 o 4,4 miliarda parametrów mieści się na jednym nowoczesnym akceleratorze, więc koszt krańcowy na godzinę audio to energia elektryczna i wykorzystanie zasobów, a koszt stały to maszyna. Przy dużym wolumenie jest to tańsze niż jakiekolwiek API rozliczane za minutę, a przy zerowym wolumenie droższe niż jakiekolwiek API rozliczane za minutę — co jest typowym kształtem handlu modelami o otwartych wagach.
Najważniejszą niewiadomą po stronie Mistrala nie jest cena. Jest nią to, czy to repozytorium jest początkiem linii produktowej, czy jednorazowym rezultatem w ramach partnerstwa z Marokiem. Model, który pojawia się po cichu, bez ogłoszenia, bez cennika i bez usługi, to model, za którym nie stoi żadne zobowiązanie do wsparcia. Apache 2.0 oznacza, że licencji nie można wycofać w przypadku wag, które już się ma, ale nie mówi nic o tym, czy checkpoint będzie utrzymywany, a wskazanie modelu bazowego na samej karcie sugeruje, że nadal wspieraną linią jest ogólny model czasu rzeczywistego.
Dla warstwy powyżej transkrypcji warstwa routingu uzasadnia swoje istnienie w sposób, który nie ma nic wspólnego z transkrypcją. Żaden z tych modeli nie jest hostowaną przez nas usługą zamiany mowy na tekst — OrcaRouter nie kieruje ruchu do żadnego z tych punktów końcowych — ale sumaryzator, klasyfikator intencji lub agent konsumujący strumień to model, który możesz trasować: jeden klucz API do ponad 200 modeli w cenie katalogowej dostawcy z zerową marżą, dzięki czemu obniżka ceny dostawcy trafia do nas tego samego dnia, a także automatyczne przełączanie awaryjne, jeśli dostawca ulegnie degradacji. Jeśli już łączysz dwóch dostawców rozpoznawania mowy, aby pokryć dialekty, umieszczenie dalszych modeli językowych za jednym kluczem, a nie w oparciu o dwie umowy, to tańsza połowa integracji.
Na którym budować?
Jeśli Twoje audio jest w języku arabskim — w jednym dialekcie, w kilku albo z przełączaniem kodu między arabskim a czymś innym — model Mistral jest poważniejszym kandydatem, a powód jest strukturalny, a nie liczbowy. Wymienia dialekty, dla których został zbudowany, jest wystarczająco mały, aby działać na Twoim własnym sprzęcie, zwraca surowy tekst, który możesz poddać dalszej obróbce za pomocą własnej normalizacji, i nie stoi za dziesięciominutowym limitem sesji ani filtrem treści, którego nie możesz sprawdzić. Koszt jest taki, że obsługuje jedną rodzinę językową i odrzuca resztę oraz że nikt jeszcze nie opublikował jego niezależnej ewaluacji.
Jeśli Twoje nagrania audio obejmują wiele języków lub jeśli potrzebujesz usługi ze ścieżką wsparcia i opublikowanym cennikiem już dziś, Gemini 3.5 Transcribe Live można wywołać teraz, jest mierzony w niezależnym trackerze i obsługuje języki, które odrzuci checkpoint Mistral. Koszty to limit sesji, brak diarizacji i znaczników czasu w punkcie końcowym strumieniowania oraz fakt, że dokładność dla języka arabskiego jest twierdzeniem, które musisz przetestować samodzielnie — lista lokalizacji wymienia Egipt, a wydajność dialektów nie jest wyszczególniona.
To, na co trzeba patrzeć, to nie benchmark. Liczy się, czy Mistral w ogóle ogłosi ten model, a jeśli tak, to z jaką ceną i jaką roadmapą językową. Ciche repozytorium z licencją Apache 2.0 to użyteczny artefakt i słabe zobowiązanie. Jeśli pojawi się roadmapa dialektów arabskich — lewantyńskiego, z Zatoki i egipskiego jako osobnych checkpointów — droga małych modeli staje się naprawdę kompletną odpowiedzią dla regionu, a argument o szerokości staje się znacznie trudniejszy do wysunięcia.

Żaden z nich nie jest hostowanym przez nas modelem mowy, ale warstwa powyżej transkryptu jest routowalna - ponad 200 modeli za jednym kluczem API w cenie katalogowej dostawcy z 0% marży, więc obniżka ceny przez dostawcę modelu rozumującego działającego poniżej Twojego transkryptu obowiązuje tego samego dnia.
Automatyczne przełączanie awaryjne oznacza, że potok mowy złożony z wielu elementów ma o jedną domenę awarii mniej, ponieważ sumaryzator lub klasyfikator intencji korzystający z transkrypcji można przekierować, zamiast tracić go razem z dostawcą.
