Wygenerowana karta tytułowa hero z nagłówkiem „StepAudio 3 ASR vs Whisper Large v3 Turbo" i podtytułem „1,7 procent wobec 4,6 procent, a bezpośredni test porównawczy nie istnieje", nad stopką „StepAudio według Artificial Analysis; Whisper według Hugging Face."
Guides & Insights

StepAudio 3 ASR kontra Whisper Large v3 Turbo: 1,7% wobec 4,6%, a nikt nie przeprowadził testu

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Porównanie, którego szukasz, nie istnieje. StepAudio 3 ASR i Whisper Large v3 Turbo znajdują się na tym samym indeksie AA-WER Artificial Analysis dla nieprzetwarzanej strumieniowo zamiany mowy na tekst — 1,7% współczynnika błędów słów w porównaniu z wartościami w zakresie od 4 do 5,5% — a na koniec września 2026 nikt nie opublikował bezpośredniego porównania na identycznym dźwięku. Ani StepFun, ani opiekunowie Whisper, ani niezależne laboratorium. Własna dokumentacja StepFun zawiera testy porównawcze z Doubao ASR 2.0, Seed 2.0 Lite i HY3.0 ASR Preview, czyli produktami chińskiego ASR. Po stronie Whisper żaden dostawca nie publikuje porównań, ponieważ Whisper Large v3 Turbo jest dostępny do pobrania od lat, a jego wyniki zależą od tego, kto go obsługuje.

Ta strona przedstawia uczciwą wersję: odczytuje jedyną tablicę, która mierzy oba, oddziela to, co porównywalne, od tego, co nie jest, i wyraźnie stwierdza, gdzie kończą się dowody. Krótka odpowiedź jest taka, że różnica w dokładności jest realna i wynosi około trzech punktów, a różnica we wszystkim innym — cenie, licencji, możliwości wdrożenia — biegnie w przeciwnym kierunku i jest większa.

Czym każdy z nich właściwie jest

StepAudio 3 ASR to hostowany model transkrypcji udostępniony przez StepFun 15 września 2026 r. w ramach pięciomodelowej rodziny audio StepAudio 3. Dostęp do niego uzyskuje się przez pojedynczy endpoint strumieniowy, który podczas dekodowania zwraca tekst przyrostowo, a na końcu — finalny transkrypt. StepFun opisuje go jako transkrypcję z dołączonym modelem językowym zapewniającym kontekst, dostrojoną do nagrań medycznych, prawniczych, finansowych, motoryzacyjnych i programistycznych oraz do materiałów, które przełamują konwencjonalne rozpoznawanie mowy — szeptu, szybkiej mowy, mowy połączonej, śpiewu i dźwięku z podkładem muzycznym. Nie ma otwartych wag, ścieżki on-premise ani opcji samodzielnego hostowania na żadnym poziomie. Publikowana stawka cennikowa wynosi 2,8 juana za godzinę, czyli około 6,67 dolara za 1000 minut według własnej osi cenowej rankingu.

Whisper Large v3 Turbo to model o otwartych wagach opublikowany przez OpenAI na licencji MIT: 809 milionów parametrów, 99 języków, przycięta i dostrojona pochodna Whisper large-v3 z zredukowaną liczbą warstw dekodera. Został pobrany miliony razy i jest komercyjnie udostępniany przez długą listę platform oraz można go uruchomić na własnym sprzęcie. Ta ostatnia właściwość stanowi sedno całego porównania i jest powodem, dla którego luka w dokładności nie jest jedyną liczbą, która ma znaczenie.

Jedyna płytka, która mierzy jedno i drugie

Indeks AA-WER firmy Artificial Analysis podaje odsetek błędnie transkrybowanych słów; niższa wartość jest lepsza, a jego wersja 2 łączy trzy zbiory danych: AA-AgentTalk w 50%, VoxPopuli-Cleaned-AA w 25% i Earnings22-Cleaned-AA w 25%. Widok niestrumieniowy pokazuje 36 z 71 śledzonych modeli. Oba modele się na nim pojawiają, czym większość porównań nie może się pochwalić.

Czytaj w kolejności, w jakiej wymienia je zarząd:

• StepAudio 3 ASR — 1,7% AA-WER, około 6,67 USD za 1000 minut audio

• Whisper Large v3 Turbo, jeden hostowany endpoint — 4,6% AA-WER, około 0,67 USD za 1000 minut

• Whisper Large v3 Turbo, drugi hostowany endpoint — 5,5% AA-WER, około 15,00 USD za 1000 minut

• Whisper Large v3, inna generacja z otwartymi wagami — 4,1% na jednym punkcie końcowym, 10,1% na innym

• StepAudio 2.5 ASR, poprzednia generacja StepFun — 4,7%

Dwa ostatnie wiersze na tablicy są najbardziej pouczające i wcale nie dotyczą StepFun. Te same otwarte wagi Whisper osiągają 4,1% na jednym punkcie końcowym i 10,1% na innym. To rozrzut wynoszący 6 punktów przy identycznych parametrach, wywołany wyłącznie różnicami w sposobie serwowania: strategią dzielenia na fragmenty, sprzętem, konfiguracją dekodowania i tym, jak każdy host obsługuje audio dłuższe niż jego wewnętrzne limity. Sam przypis na tablicy mówi o tym wprost, zauważając, że w przypadku jednego z jej zbiorów danych niektóre modele mają audio dzielone na fragmenty o długości około dziewięciu minut, a inne około trzydziestu sekund z powodu limitów czasu.

Co oznacza, że porównanie „StepAudio 3 ASR vs Whisper Large v3 Turbo” to tak naprawdę dwa porównania nałożone na siebie. Modelu z wagami oraz modelu z tym endpointem, który akurat poddałeś benchmarkowi. To drugie różni się bardziej niż pierwsze.

A generated two-column scoreboard titled 'StepAudio 3 ASR vs Whisper Large v3 Turbo — the scoreboard'. Left column StepAudio 3 ASR reads AA-WER '1.7%', Price per 1000 min '6.67 dollars', Weights 'hosted only', Licence 'proprietary', Deployment 'StepFun API', Head-to-head test 'none published'. Right column Whisper Large v3 Turbo reads AA-WER '4.6% to 5.5%', Price per 1000 min '0.67 to 15 dollars', Weights '809M open', Licence 'MIT', Deployment 'self-host or any host', Head-to-head test 'none published'. Footer reads 'StepAudio per Artificial Analysis; Whisper per Hugging Face and Artificial Analysis.'

Skąd bierze się luka w dokładności i na ile można jej ufać

Trzy punkty wskaźnika błędów słów to duża różnica w dziedzinie, w której pięć najlepszych systemów mieści się w granicach 0,6 punktu od siebie. To także jedyna liczba w tym porównaniu zmierzona przez stronę trzecią i wiążą się z nią realne zastrzeżenia, które działają w obu kierunkach.

Przeciwko StepAudio 3 ASR: ta liczba to indeks mieszany, a mieszanka w 50% składa się z AA-AgentTalk — zbioru danych rozmów agentowych. Model dostrojony do transkrypcji w określonej dziedzinie z dołączonym LLM-em zapewniającym kontekst dobrze pasuje do takiego kształtu dźwięku. Gdy przełożyć wagi indeksu w stronę mowy czytanej lub wiadomości radiowo-telewizyjnych, kolejność mogłaby się zacieśnić. Wciąż nie ma też opublikowanego raportu technicznego dla modelu ASR, udostępnionego zbioru testowego, konfiguracji dekodowania ani powtarzalnego protokołu od kogokolwiek spoza StepFun.

W zestawieniu z Whisper Large v3 Turbo: 4,6% to wynik jednego hostowanego endpointu, a nie właściwość modelu. Wagi są stałe i publiczne; wynik już nie. Zespół, który uruchamia te same wagi starannie, z podziałem na fragmenty odpowiednim dla domeny i dobrą konfiguracją dekodera, może osiągnąć znacząco lepszy rezultat niż wiersz na tablicy wyników — a zespół, który uruchamia je niedbale, może wypaść gorzej niż 10,1%, które odnotowała inna generacja otwartych wag. Uczciwe podsumowanie jest takie, że strona otwartych wag w tym porównaniu ma dolną granicę, którą można zmierzyć, i górną, na którą trzeba sobie zapracować.

Brakuje liczby, która by to rozstrzygnęła: oba systemy, jeden zestaw audio, jeden protokół dekodowania, opublikowane. Nikt tego nie przeprowadził, a dopóki ktoś tego nie zrobi, „1.7% vs 4.6%” to porównanie dwóch pomiarów wykonanych w różnych warunkach, a nie pomiar dwóch systemów względem siebie.

Pozostałe cztery wymiary, w których Whisper wygrywa z większą przewagą

Dokładność to wymiar, w którym StepFun wygrywa. W pozostałych pozycjach na liście model z otwartymi wagami nie jest nawet blisko, a to właśnie one decydują, czy wdrożenie jest w ogóle możliwe:

• Licencja i wagi — otwarte wagi na licencji MIT z 809M parametrami kontra hostowane API bez opublikowanych wag na żadnym poziomie.

• Wdrożenie — hostowane samodzielnie, lokalnie (on-premise), w środowisku odizolowanym lub za pośrednictwem dowolnej z dziesiątek komercyjnych platform, w przeciwieństwie do wyłącznie API StepFun.

• Minimalny koszt — około 0,67 USD za 1000 minut na jednym hostowanym punkcie końcowym, a jeszcze niższy, jeśli uruchomisz to samodzielnie, w porównaniu z około 6,67 USD za 1000 minut według opublikowanej stawki dostawcy.

• Lokalizacja danych — dźwięk nigdy nie opuszcza infrastruktury, którą kontrolujesz, w przeciwieństwie do dźwięku wysyłanego do punktu końcowego strony trzeciej.

• Ryzyko integracji — model nie może zostać wycofany, przeceniony ani oznaczony jako przestarzały bez ostrzeżenia, ponieważ posiadasz wagi, a nie stawkę hostowaną, która może się zmienić wraz z cennikiem.

• Obsługa długiego audio — dzielenie na fragmenty to twoja decyzja i można je dostosować dla każdego pliku, w przeciwieństwie do tego, co wewnętrznie robi endpoint dostawcy, co nie jest udokumentowane.

Ta różnica cen wynosi około dziesięć do jednego w porównaniu z tańszym endpointem Whisper i stanowi lustrzane odbicie tego, co wydarzyło się w samej linii produktowej StepFun: model, który ten zastępuje, StepAudio 2.5 ASR, był wyceniony na 0,15 juana za godzinę, a obecny poziom to 2,8. StepFun podniósł stawkę za transkrypcję około dziewiętnastokrotnie, aby uzyskać dokładność, co stawia go na innym rynku niż hostowany samodzielnie model z otwartymi wagami, a nie jako droższą wersję tamtego.

Screenshot of the Hugging Face model card for whisper-large-v3-turbo, showing the MIT licence badge, Safetensors format and 99 languages tags, 6,637,070 downloads last month, and the note that the model is a finetuned version of a pruned Whisper large-v3 with the decoding layers reduced from 32 to 4.

Który powinieneś wybrać

Podział jest czystszy niż w większości bezpośrednich porównań:

• Wybierz Whisper Large v3 Turbo, jeśli audio jest zwykłe, głośność jest wysoka, dane nie mogą opuścić Twojej infrastruktury albo potrzebujesz wdrożenia trwałego i stabilnego cenowo. Licencja MIT oznacza, że decyzja należy do Ciebie i możesz ją odwrócić, a nikt nie może Ci tego odebrać.

• Wybierz StepAudio 3 ASR, jeśli nagranie jest naprawdę trudne — z akcentem, szeptem, śpiewem lub z muzyką w tle — albo jeśli domena należy do pięciu, dla których StepFun dostroił model. To właśnie daje wersja premium, a w przypadku takiego nagrania trzypunktowa różnica w dokładności to różnica między transkrypcją nadającą się do użycia a koniecznością ręcznej korekty.

• Nie wybieraj wyłącznie żadnej z nich, jeśli nie wiesz, do której kategorii należy twoje audio. Koszt pomyłki jest asymetryczny: ścieżkę open-weights można przetestować na własnym sprzęcie za cenę godziny GPU, a ścieżka hostowana nic nie kosztuje, by ją wypróbować, ale wiąże cię ze stawką, której nie możesz kontrolować.

Argument za hybrydą jest tu silniejszy niż w większości porównań, a powodem jest rozrzut wyników endpointów na tablicy. Ponieważ te same wagi Whisper uzyskują od 4,1% do 10,1% w zależności od tego, kto je hostuje, praktycznym posunięciem jest skierowanie ścieżki open-weights przez więcej niż jednego hosta, zamiast decydowania się na jednego — co zapewnia automatyczny failover, i to ten sam mechanizm, który pozwala umieścić hostowany model przed ścieżką produkcyjną, nie ryzykując całej ścieżki.

Jak to wpisuje się w stos i co obsługujemy, a czego nie obsługujemy

Cokolwiek wybierzesz do transkrypcji, transkrypt trafia gdzieś. Sumaryzator, ekstrakcja strukturalna, kontrola zgodności, indeks wyszukiwania — te wywołania trafiają do zwykłych modeli tekstowych i to one stanowią tę część rachunku, która skaluje się wraz z użyciem, a nie z minutami audio. Własny model czasu rzeczywistego StepFun reklamuje wywoływanie narzędzi i asynchroniczne wykonywanie długich zadań, co oznacza, że nawet warstwa audio nieustannie przekazuje pracę czemuś, co nie jest modelem audio.

Aby jasno określić zakres, bo łatwo byłoby zasugerować inaczej: ani StepAudio 3 ASR, ani Whisper Large v3 Turbo nie znajdują się w OrcaRouter. StepAudio jest dostępny przez własne API StepFun, a wagi modelu Whisper możesz uruchomić samodzielnie albo zabrać na platformę hostingową. To, co oferuje OrcaRouter, to warstwa delegacji, do której trafia transkrypt — prawie 200 modeli tekstowych za jednym API, z automatycznym przełączaniem awaryjnym, dzięki czemu wywołanie niższego poziomu nie pada wraz z jednym dostawcą, językiem DSL do routingu, który łączy kilka modeli w jedno wywołanie, oraz fuzją modeli, gdy osąd jednego modelu nie wystarcza. Gdy dostawca publikuje stawkę, ta cena katalogowa jest przekazywana bez marży, więc zmiana ceny trafia na Twój rachunek w dniu jej ogłoszenia — co, biorąc pod uwagę, że to porównanie obejmuje dostawcę, który w jednym wydaniu podniósł swoją stawkę za transkrypcję dziewiętnastokrotnie, nie jest korzyścią hipotetyczną.

Jeśli zamierzasz wydać prawdziwe pieniądze na kwestię dokładności, tania kolejność działań jest następująca: najpierw uruchom modele o otwartych wagach na własnym audio, bo możesz, i bo uzyskany wynik będzie bardziej istotny niż jakikolwiek ranking. Potem zdecyduj, czy pozostała luka jest warta dziesięciokrotności stawki. Większość zespołów stwierdzi, że warto dla części ich ruchu, a nie dla reszty, i to jest problem routingu, a nie wybór modelu.

Co by to rozstrzygnęło

Jeden opublikowany test. Oba systemy, to samo audio, ten sam protokół dekodowania, uczciwy podział między mową czytaną, mową konwersacyjną i trudnymi przypadkami, pod kątem których StepFun twierdzi, że dostroił model. Dopóki taki test nie powstanie, porównanie to z jednej strony indeks strony trzeciej, a z drugiej zestaw otwartych wag ze zmiennym wynikiem, a jedynym odpowiedzialnym sposobem jego odczytania jest potraktowanie go jako punktu wyjścia, a nie odpowiedzi.

Screenshot of the Artificial Analysis AA-WER non-streaming leaderboard, showing StepAudio 3 ASR near the top at 1.7% and Whisper Large v3 Turbo rows further down at 4.6% and 5.5% on two different hosted endpoints, with the AA-WER v2 methodology line and the per-1000-minutes price axis visible.