
StepAudio 3 ASR vs StepAudio 3: Nie ma modelu o takiej nazwie
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Wyszukaj StepAudio 3 a znajdziesz rodzinę, nie model. Wraz z premierą audio StepFun z 15 września 2026 r. pięć produktów pojawiło się pod tą nazwą — Realtime, ASR, zamiana tekstu na mowę, Gen i Music — a produkt transkrypcyjny wśród nich, StepAudio 3 ASR, to ten, który od tego czasu wspina się w rankingach. Wariant, który sama dokumentacja StepFun nazywa swoim największym jak dotąd modelem ASR, to StepAudio 3 ASR Max, a konwersacyjnym bliźniakiem, z którym dzieli szkielet, jest StepAudio 3 Realtime. Jeśli próbujesz porównać „StepAudio 3 ASR” z „StepAudio 3”, porównujesz produkt z linią produktów, a odpowiedź zależy wyłącznie od tego, który z tych trzech tak naprawdę miałeś na myśli.
Ta strona to rozwiązuje. To nie jest porównanie marketingowe — to rozróżnienie, którego potrzebujesz, zanim będziesz mógł poprawnie odczytać jakąkolwiek kartę specyfikacji StepAudio 3, ponieważ trzy powyższe nazwy wiążą się z różnymi cenami, różnymi punktami końcowymi i różnymi trybami awarii.
Dlaczego nazwa jest niejednoznaczna
StepFun wypuściło cały stos audio w ciągu jednego dnia, a konwencja nazewnictwa sprawiła, że nazwa rodziny stała się rdzeniem każdej nazwy produktu. To wygląda schludnie na slajdzie premierowym, a wszędzie indziej jest niezręczne. Oznacza to, że wyszukiwanie nazwy rodziny zwraca mieszankę pięciu różnych produktów, a wiersz benchmarku oznaczony „StepAudio 3” równie dobrze może dotyczyć każdego z nich.
Praktyczna konsekwencja jest taka, że na podstawie nagłówka nie można stwierdzić, co zostało zmierzone. Wpis, który mówi „StepAudio 3 prowadzi w rankingu transkrypcji”, opisuje StepAudio 3 ASR. Wpis, który mówi „StepAudio 3 wygrywa pod względem dynamiki konwersacyjnej”, opisuje StepAudio 3 Realtime. Oba są prawdziwe, to różne produkty i nie są zamienne.
W samej linii ASR występuje druga niejednoznaczność. Dokumentacja StepFun określa poziom ASR Max jako swój największy dotychczasowy model ASR, z własnym cennikiem i własnym punktem końcowym, podczas gdy publiczne wiersze rankingu noszą prostszą etykietę. Rozstrzygnięcie, czy chodzi o jeden SKU pod dwiema nazwami, czy o dwa SKU, jest najbardziej użyteczną rzeczą, jaką może zrobić ta strona — i następna sekcja to robi.
Trzy rzeczy, które nazwa może oznaczać
• StepAudio 3 ASR — produkt do transkrypcji. Strumieniowy punkt końcowy, który podczas dekodowania zwraca tekst przyrostowo, a na końcu końcową transkrypcję. StepFun opisuje go jako transkrypcję z dołączonym modelem językowym zapewniającym kontekst, dostrojoną do materiałów audio z obszaru medycyny, prawa, finansów, motoryzacji i programowania oraz do trudnych danych wejściowych, takich jak mowa szeptana, szybka mowa, mowa łączona, śpiew i muzyka w tle. To model plasujący się na poziomie 1,7% współczynnika błędów słów w indeksie AA-WER Artificial Analysis dla nie strumieniowej zamiany mowy na tekst.
• StepAudio 3 ASR Max — poziom, który dokumentacja StepFun nazywa największym jak dotąd modelem ASR tej firmy. Ma opublikowaną stawkę cennikową 2,8 juana za godzinę. To nie tańszy model do transkrypcji; to szczyt linii ASR.
• StepAudio 3 Realtime — pełnodupleksowy model konwersacyjny. Rozumuje bezpośrednio na mowie, zamiast uruchamiać łańcuch transkrypcja-następnie-rozumowanie, a transkrypcję wykonuje jako efekt uboczny tego. Nie jest produktem ASR, a jego dokładność w zadaniach transkrypcji nie jest tym, do czego został dostrojony.
Wszystko inne w rodzinie — TTS, Gen, Music — to zupełnie odrębne zadanie i nie powinno w ogóle pojawiać się w porównaniu transkrypcji.
Czy ASR i ASR Max to ten sam model?
Dowody wskazują, że tak, a weryfikacja to arytmetyka. StepFun podaje poziom ASR Max w cenie 2,8 juana za godzinę. Po przeliczeniu przy kursie około 7,1 juana za dolara daje to około 0,39 USD za godzinę, czyli mniej więcej 6,6 USD za 1000 minut. Artificial Analysis umieszcza ten model w swoim rankingu z ceną 6,67 USD za 1000 minut. Dwie niezależnie opublikowane liczby, jedna z cennika dostawcy, a druga z rankingu strony trzeciej, różnią się od siebie o mniej niż cent. Właśnie tego można by oczekiwać, gdyby wiersz w rankingu i stawka z cennika ASR Max opisywały ten sam SKU.
Warto być precyzyjnym co do tego, co to dowodzi, a czego nie. Dowodzi, że oś cenowa rankingu i cennik dostawcy opisują ten sam produkt w tej samej cenie. Nie dowodzi, że 1,7% z rankingu zostało zmierzone na dokładnie tym punkcie końcowym, który byś wywołał, ponieważ ranking nie publikuje swojej konfiguracji dekodowania ani punktu końcowego, który został wywołany. A więc: ten sam produkt, bardzo prawdopodobnie; te same warunki pomiaru, niezweryfikowane.
Pewne jest jedno: w obrębie linii nastąpił skok generacyjny. StepAudio 2.5 ASR osiąga 4,7% na tej samej tablicy wyników przy 0,15 juana za godzinę. Obecny poziom to 1,7% przy 2,8 juana za godzinę. To redukcja współczynnika błędów słów o 64% przy około dziewiętnastokrotnie wyższej stawce — najostrzejszy kompromis w rodzinie i ten, który decyduje, czy aktualizacja jest warta zachodu.

Wymiary, które faktycznie się różnią
Gdy nazewnictwo zostanie ustalone, porównanie sprowadza się do krótkiej listy. To te, które zmieniają decyzję:
• Dokładność — StepAudio 3 ASR w trybie niestrumieniowym osiąga 1,7% AA-WER, podczas gdy StepAudio 2.5 ASR osiąga 4,7% na tej samej tablicy wyników. Zmierzone przez Artificial Analysis, a nie przez StepFun.
• Cena — 2,8 juana za godzinę w porównaniu z 0,15 juana za godzinę. Obie to stawki katalogowe dostawców, obie aktualne. Około 19 razy.
• Wagi — wyłącznie hostowane API w przypadku obu. Nigdzie w całej rodzinie nie ma otwartych wag, brak możliwości wdrożenia lokalnego (on-premise), brak opcji samodzielnego hostowania na żadnym poziomie.
• Kształt endpointu — pojedynczy endpoint transkrypcji strumieniowej zwracający tekst przyrostowy i końcowy w porównaniu z tym samym kształtem w poprzedniej generacji. Nic w modelu integracji się nie zmieniło, więc migracja to podmiana identyfikatora modelu, a nie przepisanie.
• Strojenie pod trudne warunki audio — StepAudio 3 ASR jest wyraźnie dostrojony pod mowę szeptaną, szybką, łączoną i śpiewaną oraz pod audio z muzyką w tle. To dostrojenie jest produktem; poprzednia generacja nie była do tego stworzona.
Deklarowane przez dostawcę zyski w domenach — StepFun podaje, że chiński spadł o 9,3%, angielski o 25,0%, dialekty o 22,3%, domeny wertykalne o 42,1%, a przełączanie kodów o 27,9% w porównaniu z poprzednią generacją. Dane zgłoszone przez dostawcę i nieodtworzone, więc traktuj je jako orientacyjne.
Na tej liście wyraźnie brakuje: długości kontekstu, obsługi formatów audio, maksymalnego czasu trwania audio oraz identyfikatora modelu. Publiczna dokumentacja StepFun dotycząca tego modelu ich nie podaje, a każdy, kto cytuje te liczby, cytuje coś innego.
ASR vs Realtime to porównanie, którego ludzie naprawdę potrzebują
Jeśli wybierasz między produktami do transkrypcji, a nie między generacjami, ciekawym porównaniem nie jest ASR kontra ASR Max — lecz ASR kontra Realtime. Własne materiały techniczne StepFun mówią, że oba dzielą etapy pretreningu i treningu pośredniego, a rozchodzą się dopiero podczas nadzorowanego dostrajania. Ta sama baza, inne dostrajanie, inny produkt.
Ten pojedynczy fakt ma praktyczny wymiar. Wskaźnik błędów słów na poziomie 1,7% jest właściwością dostrojenia ASR. Nie jest obietnicą dotyczącą modelu czasu rzeczywistego, który jest optymalizowany pod kątem zarządzania turami, obsługi przerwań i rozumowania nad mową, a nie dokładności transkrypcji. Jeśli twoja architektura dokonuje transkrypcji jako efektu ubocznego rozmowy na żywo, nie kupujesz tych 1,7% — kupujesz model konwersacyjny, który przypadkiem emituje tekst.
Jest też odwrotnie, co jest mniej oczywiste: ponieważ mają wspólny szkielet, model ASR nie jest małym specjalistycznym modelem doklejonym do rodziny. To system tej samej skali, dostrojony inaczej. Dlatego stawka ASR jest zbliżona do stawek reszty rodziny, a nie do taniego końca rynku.
Co z tym zrobić, jeśli wybierasz jeden
Trzy pytania to rozstrzygają. Czy potrzebujesz transkrypcji, czy rozmowy? Jeśli transkrypcji, produktem jest StepAudio 3 ASR, a nazwa rodziny to szum. Jeśli rozmowy, chcesz StepAudio 3 Realtime i nie powinieneś w ogóle czytać benchmarków ASR. A jeśli potrzebujesz transkrypcji naprawdę trudnego audio — z akcentem, szeptanego, śpiewanego lub z muzyką w tle — premia 19x to cena warstwy, która została pod to dostrojona, a uczciwym testem jest Twoje własne audio, a nie zbiorczy indeks.
Decyzja, którą łatwo podjąć błędnie, to potraktowanie warstwy transkrypcji jako czegoś stałego. Cokolwiek wybierzesz, transkrypcja jest danymi wejściowymi dla czegoś innego — sumaryzatora, ekstrakcji strukturalnej, kontroli zgodności, indeksu wyszukiwania — a te wywołania trafiają do zwykłych modeli tekstowych. To właśnie ta warstwa skaluje się wraz z użyciem, a nie z minutami audio, i to ją warto od początku utrzymywać przenośną. OrcaRouter udostępnia niemal 200 modeli tekstowych pod jednym API z automatycznym przełączaniem awaryjnym między dostawcami, DSL routingu, który łączy kilka z nich w jedno wywołanie, oraz fuzją modeli, gdy osąd jednego modelu nie wystarcza. Gdy dostawca publikuje stawkę, ta cena katalogowa jest przekazywana bez marży, więc zmiana ceny po stronie tekstu trafia na Twoje rozliczenie w dniu, w którym zostanie ogłoszona.
Dla jasności zakresu, ponieważ ta strona dotyczy rodziny, której nie obsługujemy: na OrcaRouter nie ma żadnego endpointu StepAudio 3. Modele transkrypcji i głosu są dostępne przez własne API StepFun. To, co oferuje OrcaRouter, to warstwa rozumowania po transkrypcji — a właśnie tam decyzja o przełączeniu jest tania do podjęcia i kosztowna do odroczenia.

Czego nikt nie rozstrzygnął
Kwestię nazewnictwa da się rozstrzygnąć. Twierdzenia o wynikach — jeszcze nie. Nadal nie ma opublikowanego raportu technicznego dla modelu ASR, udostępnionego zestawu testowego, konfiguracji dekodowania ani odtwarzalnego protokołu od kogokolwiek spoza StepFun, a własne porównania dostawcy są z innymi chińskimi produktami ASR, a nie z dotychczasowym liderem wśród modeli open-weights. Wartość 1,7% to rzeczywisty pomiar strony trzeciej na połączonym indeksie trzech zestawów danych; wszystko inne dotyczące tego modelu to deklaracja dostawcy.
Dwie rzeczy zmieniłyby obraz sytuacji. Bezpośrednie porównanie z Whisper Large v3 Turbo na identycznym audio, którego nikt nie opublikował. I stawka dla reszty rodziny — cztery z pięciu modeli StepAudio 3 w momencie premiery wciąż miały ograniczoną czasowo darmową cenę w wersji podglądowej, a tylko transkrypcja i synteza miały opublikowane stawki, co oznacza, że cennik, który można dziś przeczytać, obejmuje dwa z pięciu produktów.

To jest ta warstwa, która skaluje się wraz z użyciem, a nie wraz z minutami audio, i to jest warstwa, którą warto od początku utrzymywać jako przenośną. automatyczne przełączanie awaryjne między dostawcami, DSL routingu, który łączy kilka z nich w jedno wywołanie, oraz fuzja modeli, gdy osąd jednego modelu nie wystarcza.
