Karta hero artykułu z napisem „Grok Voice Transcribe 2.0 vs Whisper Large v3 Turbo”, plakietką „PORÓWNANIE MODELI” i podtytułem „Co darmowy model bazowy wciąż robi lepiej”, z chipami o treści: 2,7% vs 4,07% WER, 0,20 USD za godzinę vs wagi MIT, 0,49 s vs 1-5 s self-hosted i zarządzane vs własne, na tle gradientu od białego do niebieskiego, z logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

Grok Voice Transcribe 2.0 vs Whisper Large v3 Turbo: Co darmowy punkt odniesienia wciąż robi lepiej

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Whisper Large v3 Turbo pozostaje domyślną odpowiedzią na „potrzebujemy transkrypcji” od czasu, gdy został wydany na licencji MIT 1 października 2024 r., a nic w Grok Voice Transcribe 2.0 nie zmienia powodu, dla którego tak jest. Nowy model SpaceXAI, wydany 18 września 2026 r., jest naprawdę lepszym transkryberem, i to o dużej przewadze — 2,7% wskaźnika błędu słów dla transkrypcji końcowych i 3,4% dla pierwszych wyników częściowych w rankingu AA-WER Streaming serwisu Artificial Analysis, wobec wyniku 4,07% dla rodziny Whisper w rankingu dla trybu nieprzesyłanego strumieniowo, przy czym sam Turbo jest zwykle o kilka dziesiątych punktu gorszy od pełnego Large v3, z którego powstał w procesie destylacji. Jego cena wynosi również 0,10 USD za godzinę audio w trybie wsadowym i 0,20 USD za godzinę w trybie strumieniowym. Whisper Large v3 Turbo to plik o rozmiarze 1,6 GB zawierający 809 milionów parametrów, który działa na własnym sprzęcie, nie mierzy zużycia, nie wysyła audio nigdzie i nie ma limitu liczby żądań, limitu współbieżności ani harmonogramu wycofania. Nie chodzi o porównanie lepszego modelu z gorszym. Chodzi o wynajmowanie dokładności kontra posiadanie komponentu.

Trzydziestosekundowe okno to cała architektura

Whisper Large v3 Turbo dziedziczy strukturę każdego modelu Whisper: dźwięk jest przetwarzany w stałych 30-sekundowych oknach, enkoder uruchamia się raz na okno, a dekoder emituje tekst dla tego fragmentu. Turbo uczyniło to tańszym — cztery warstwy dekodera zamiast trzydziestu dwóch, około 8× szybciej niż Large v3, około 6 GB VRAM zamiast 10 — ale nie zmieniło kształtu. W modelu nie ma pojęcia „zdania dotychczasowego”, ponieważ nie ma trwałego stanu między oknami.

Ten jeden fakt projektowy wyjaśnia wszystko, co dzieje się dalej. Nie ma natywnego strumieniowania, ponieważ strumieniowanie wymaga zwracania częściowego wyniku w trakcie wypowiedzi, a model nie ma do tego mechanizmu. Wdrożenia Whisper działające w czasie rzeczywistym istnieją, ale to dzielenie na fragmenty plus detekcja aktywności głosowej plus warstwa sklejania, którą ktoś napisał i teraz utrzymuje, a opóźnienie wynikające z tego potoku mierzy się w sekundach, a nie w pół sekundy, jaką osiąga Grok Voice Transcribe 2.0. Nie ma diaryzacji mówców, ponieważ diaryzacja to osobny problem dotyczący tego, kto mówi, a nie tego, co zostało powiedziane. A wariant Turbo zwraca konkretnie czysty tekst — bez znaczników czasu, bez ocen pewności, bez odwrotnej normalizacji tekstu zamieniającej wypowiadane liczby i adresy e-mail na formę pisemną.

Grok Voice Transcribe 2.0 został zbudowany odwrotnie. Strumieniowanie jest podstawowym transportem, przetwarzanie wsadowe to te same wagi za punktem końcowym REST, a lista funkcji wygląda jak lista rzeczy, które Whisper pozostawił aplikacji: znaczniki czasu na poziomie słów z pewnością dla każdego słowa, diaryzacja mówców wliczona bez dodatkowych kosztów, transkrypcja wielokanałowa obejmująca do 8 niezależnych kanałów, faworyzowanie kluczowych terminów dla maksymalnie 100 terminów dziedzinowych na żądanie, odwrotna normalizacja tekstu w 25 językach, usuwanie słów wypełniających oraz wykrywanie końca tury Smart Turn dla agentów głosowych. Jeśli utrzymywałeś wokół Whisper pipeline dzielenia na fragmenty i sklejania, ta lista jest opisem kodu, który napisałeś.

Luka w dokładności i dlaczego jest mniejsza, niż się wydaje

• Dokładność końcowej transkrypcji (strumieniowanie) — Grok Voice Transcribe 2.0 przy 2,7% WER w AA-WER Streaming w porównaniu z brakiem wpisu Whisper Large v3 Turbo, ponieważ model nie potrafi natywnie strumieniować

• Dokładność wsadowa — Grok Voice Transcribe 2.0 przy 2,29% AA-WER w porównaniu z Whisper Large v3 przy 4,07% na tablicy wyników non-streaming Artificial Analysis, przy czym Turbo zwykle pozostaje 0,4 do 0,6 punktu za pełnym Large v3 w niezależnych testach

• Czyste angielskie audio — Whisper Large v3 Turbo osiąga około 2,1% WER na LibriSpeech test-clean i około 4,2% na test-other, więc w przypadku mowy o jakości studyjnej różnica do czołowego API zmniejsza się do niemal zera

• Dźwięk z rzeczywistych warunków — te same niezależne benchmarki wskazują dla Turbo około 4,6% w biznesowych rozmowach dwuosobowych i 8–12% w hałaśliwym audio, i właśnie tam uwidacznia się przewaga modelu czołowego

• Przepustowość wsadowa — Grok Voice Transcribe 2.0 przy około 162× czasu rzeczywistego w porównaniu z Whisper Large v3 Turbo przy około 80× na pojedynczym, skromnym konsumenckim GPU, a na szybszym sprzęcie serwerowym osiąga wielokrotności tej wartości

• Opóźnienie strumieniowania — 0,49 sekundy do pierwszego wyniku częściowego w Grok Voice Transcribe 2.0 w porównaniu z 1–5 sekundami dla samodzielnie hostowanych potoków strumieniowych Whisper, co jest kodem klejącym plus VAD, a nie możliwością modelu

Uczciwa lektura tej listy prowadzi do wniosku, że argument za płaceniem oparty na dokładności jest realny, ale warunkowy. W przypadku czystego, dobrze nagranego angielskiego z jednym mówcą Whisper Large v3 Turbo jest wystarczająco blisko, że różnica rzadko zmienia wynik. W przypadku telefonii 8 kHz, zaszumionego audio z centrów obsługi, mowy z akcentem i krótkich fraz dziedzinowych — dokładnie tych zestawów, pod kątem których SpaceXAI dostrajało 2.0, gdzie własne raportowane przez SpaceXAI liczby przesunęły się z 10,6% do 7,1% w telefonii i z 20,6% do 6,8% dla krótkich wielojęzycznych poleceń — luka staje się różnicą między transkrypcją, na której można oprzeć routing, a taką, którą trzeba przeczytać. Są to liczby raportowane przez firmę, oparte na jej własnym audio, niepowtórzone przez nikogo spoza SpaceXAI, a kierunek, na który wskazują, jest zgodny z każdym niezależnym testem Whispera na audio o obniżonej jakości.

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs Whisper Large v3 Turbo — the scoreboard': the left column gives Grok Voice Transcribe 2.0 native streaming with a 0.49s partial, 2.29% batch WER, included diarization, word timestamps with confidence scores, $0.20 per streaming hour and a vendor API data path; the right column gives Whisper Large v3 Turbo self-built chunking only, 4.07% for full v3, no diarization, no timestamps in Turbo, MIT weights where you pay compute, and a data path that stays on your own hardware.

Porównanie kosztów to nie 0,10 USD w porównaniu z 0 USD

Licencja Whispera nic nie kosztuje; jego uruchamianie już tak. Instancja GPU, która mieści model o rozmiarze 1,6 GB w 6 GB VRAM i transkrybuje z szybkością około 80× czasu rzeczywistego, to prawdziwa pozycja kosztowa, a przy typowych stawkach za GPU w chmurze plasuje się w tym samym rzędzie wielkości co hostowane API dla ciągłych obciążeń — z ważnym wyjątkiem, że płacisz za moc obliczeniową niezależnie od tego, czy audio przepływa. Hostowane punkty końcowe Whisper są dostępne w szerokim zakresie cen, od poniżej 1,20 USD za 1000 minut w najtańszym wariancie do kilku dolarów, a ta rozbieżność to przydatne przypomnienie, że „Whisper” to model, a nie poziom usługi. Znormalizowana tablica cen Artificial Analysis umieszcza najtańsze hostowane punkty końcowe Whisper Large v3 na poziomie 0,50 USD i 1,15 USD za 1000 minut, z których oba są niższe niż stawka wsadowa 1,67 USD w Grok Voice Transcribe 2.0 — ale żaden z tych punktów końcowych nie jest twój, a oba mają dołączone limity szybkości i politykę przechowywania danych kogoś innego.

Hostowanie u siebie wygrywa bezapelacyjnie przy dużym wolumenie o skokowym profilu. Archiwum mediów o długości dziesięciu tysięcy godzin kosztuje tyle samo na własnym GPU, niezależnie od tego, czy przetworzysz je w tydzień, czy w rok, a żaden licznik za godzinę nie nalicza opłat, gdy podejmujesz decyzję. Pipeline zgodności, który nigdy nie może wysyłać audio poza sieć, nie ma hostowanej alternatywy za żadną cenę, ponieważ wymóg jest architektoniczny, a nie finansowy. A dostrajanie jest dostępne tylko wtedy, gdy dysponujesz wagami: licencja MIT Whispera pozwala ci wziąć model o 809M parametrów i dostosować go do pojedynczego mówcy, pojedynczego akcentu lub wąskiego słownictwa domenowego, co jest możliwością, której żadne API nie udostępnia w żadnym przedziale cenowym.

Odwrotnością jest to, że cena hostowanego modelu może się zmienić w trakcie. SpaceXAI pozostawiło swoją stawkę bez zmian, przechodząc z wersji 1.0 do 2.0 — ulepszenie modelu przy stałej cenie — a MAI-Transcribe-2 firmy Microsoft osiągnął identyczną stawkę $0.10 za godzinę audio, co mówi ci, gdzie znajduje się dolna granica frontieru. Jeśli kierujesz ruch przez OrcaRouter, te ceny katalogowe są przekazywane z 0% marży, więc obniżka od dostawcy trafia na twój rachunek w dniu, w którym następuje, a nie po cyklu zmiany cen. To jest prawdziwa zaleta strony wynajmowanej w tym porównaniu i warto ją zważyć w zestawieniu z faktem, że darmowa strona nigdy nie wysyła ci żadnej faktury.

Screenshot of the Artificial Analysis non-streaming speech-to-text leaderboard showing Whisper Large v3 at 4.07% AA-WER and 118.9x real time at $1.15 per 1,000 minutes, alongside the cheaper hosted Whisper endpoints and the frontier rows for comparison.

Do czego właściwie służy każdy z nich

Pozostań przy Whisper Large v3 Turbo, gdy audio jest już plikiem, głośność jest wysoka lub nierówna, nagrania są w miarę czyste, a dane nie mogą opuścić twojej sieci albo budżet nie zniesie rozliczania za godzinę. To wciąż właściwy wybór do archiwów offline, transkrypcji brzegowej i na urządzeniu, gdzie model o rozmiarze 1,6 GB po kwantyzacji mieści się w ograniczeniach, do potoków wsadowych, w których wąskim gardłem jest przepustowość, a nie opóźnienie, oraz do każdego projektu, w którym dostrajanie na własnym audio jest drogą do potrzebnej dokładności. Narzędzia wokół niego — whisper.cpp dla brzegu, faster-whisper dla produkcji, kompilacje GGUF dla ograniczonej pamięci — mają za sobą dwa lata hartowania przez społeczność, a to forma niezawodności, jakiej nie ma żadne dwudniowe API.

Przejdź na Grok Voice Transcribe 2.0, gdy dźwięk wciąż napływa, gdy nagrania są zdegradowane, gdy musisz wiedzieć, kto mówił i kiedy, gdy słownictwo domenowe trzeba ukierunkować przez biasowanie, a nie dostrajać, albo gdy aplikacja działa na częściowym transkrypcie, zanim mówiący skończy. Ścieżka aktualizacji to jeden parametr w istniejącej integracji oraz przypięcie z powrotem do wersji 1.0, jeśli coś pójdzie nie tak, co sprawia, że test jest tani. Warto zauważyć, że migracja odwrotna nie jest tania: kod napisany pod strumieniowe API z diarizacją i wykrywaniem tur nie przechodzi łagodnie do modelu wsadowego zwracającego zwykły tekst, co jest argumentem za sprawdzeniem ścieżki hostowanej na wycinku prawdziwego dźwięku, zanim powierzy się jej potok.

Screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models, showing the browsable list of routed models and vendors that sit behind a single OrcaRouter API key.

Gdzie tak naprawdę zapada decyzja

Większość zespołów używających Whispera na dowolną skalę nie wybiera między tymi dwoma modelami, lecz stosuje hybrydę: Whisper do archiwum, ponieważ jest darmowy i wystarczająco dobry dla czystego audio, API frontier do ścieżki na żywo, ponieważ nic innego nie streamuje przy 3,4% częściowego WER, oraz trzeci model w dalszej części przetwarzania, który podsumowuje, klasyfikuje lub działa na dowolnym tekście, który się pojawi. Ten trzeci krok to miejsce, w którym zwykle pojawia się rozrost — drugi kontrakt z dostawcą na model rozumujący, drugi zestaw poświadczeń, drugi limit szybkości do monitorowania. OrcaRouter spłaszcza tę warstwę: jeden klucz dla ponad 200 modeli, automatyczne przełączanie awaryjne, gdy dostawca działa gorzej, oraz DSL routingu, jeśli chcesz wysłać ten sam transkrypt przez kilka modeli i porównać je przed wyborem jednego. Same wywołania transkrypcji nadal trafiają do wybranego przez ciebie dostawcy; to, co przestaje się mnożyć, to wszystko po nich.

To, na co warto patrzeć po stronie Whisper, to nie nowy checkpoint — rodzina nie ruszyła się od czasów Turbo, a uwaga OpenAI przeniosła się na linię GPT Transcribe. Chodzi o warstwę serwowania. Z każdym rokiem narzędzia do samodzielnego hostowania stają się szybsze, a potrzebny im sprzęt mniejszy, i każda poprawa w tym obszarze osłabia argument za płaceniem za godzinę. Po stronie SpaceXAI warto wypatrywać zmiany domyślnego ustawienia: gdy 2.0 stanie się domyślne, a 1.0 zostanie wycofane, każda integracja, która nigdy nie wskazywała modelu, przestawi się naraz — łącznie z opóźnieniem. Żaden z tych dwóch kierunków nie zmienia fundamentalnego podziału. Jeden model, który posiadasz i dostrajasz, drugi, który wynajmujesz i wywołujesz, a uczciwa odpowiedź jest taka, że większość produkcyjnych stacków ostatecznie używa obu.