Wygenerowana karta tytułowa hero z nagłówkiem „StepAudio 3 ASR vs StepAudio 3” i podtytułem „Jeden to model. Drugi to pięć produktów pod jedną nazwą”, nad stopką „Dane StepFun zgodnie z publikacją z września 2026 r.”
Guides & Insights

StepAudio 3 ASR vs StepAudio 3: Nie ma modelu o takiej nazwie

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Wyszukaj StepAudio 3 a znajdziesz rodzinę, nie model. Wraz z premierą audio StepFun z 15 września 2026 r. pięć produktów pojawiło się pod tą nazwą — Realtime, ASR, zamiana tekstu na mowę, Gen i Music — a produkt transkrypcyjny wśród nich, StepAudio 3 ASR, to ten, który od tego czasu wspina się w rankingach. Wariant, który sama dokumentacja StepFun nazywa swoim największym jak dotąd modelem ASR, to StepAudio 3 ASR Max, a konwersacyjnym bliźniakiem, z którym dzieli szkielet, jest StepAudio 3 Realtime. Jeśli próbujesz porównać „StepAudio 3 ASR” z „StepAudio 3”, porównujesz produkt z linią produktów, a odpowiedź zależy wyłącznie od tego, który z tych trzech tak naprawdę miałeś na myśli.

Ta strona to rozwiązuje. To nie jest porównanie marketingowe — to rozróżnienie, którego potrzebujesz, zanim będziesz mógł poprawnie odczytać jakąkolwiek kartę specyfikacji StepAudio 3, ponieważ trzy powyższe nazwy wiążą się z różnymi cenami, różnymi punktami końcowymi i różnymi trybami awarii.

Dlaczego nazwa jest niejednoznaczna

StepFun wypuściło cały stos audio w ciągu jednego dnia, a konwencja nazewnictwa sprawiła, że nazwa rodziny stała się rdzeniem każdej nazwy produktu. To wygląda schludnie na slajdzie premierowym, a wszędzie indziej jest niezręczne. Oznacza to, że wyszukiwanie nazwy rodziny zwraca mieszankę pięciu różnych produktów, a wiersz benchmarku oznaczony „StepAudio 3” równie dobrze może dotyczyć każdego z nich.

Praktyczna konsekwencja jest taka, że na podstawie nagłówka nie można stwierdzić, co zostało zmierzone. Wpis, który mówi „StepAudio 3 prowadzi w rankingu transkrypcji”, opisuje StepAudio 3 ASR. Wpis, który mówi „StepAudio 3 wygrywa pod względem dynamiki konwersacyjnej”, opisuje StepAudio 3 Realtime. Oba są prawdziwe, to różne produkty i nie są zamienne.

W samej linii ASR występuje druga niejednoznaczność. Dokumentacja StepFun określa poziom ASR Max jako swój największy dotychczasowy model ASR, z własnym cennikiem i własnym punktem końcowym, podczas gdy publiczne wiersze rankingu noszą prostszą etykietę. Rozstrzygnięcie, czy chodzi o jeden SKU pod dwiema nazwami, czy o dwa SKU, jest najbardziej użyteczną rzeczą, jaką może zrobić ta strona — i następna sekcja to robi.

Trzy rzeczy, które nazwa może oznaczać

StepAudio 3 ASR — produkt do transkrypcji. Strumieniowy punkt końcowy, który podczas dekodowania zwraca tekst przyrostowo, a na końcu końcową transkrypcję. StepFun opisuje go jako transkrypcję z dołączonym modelem językowym zapewniającym kontekst, dostrojoną do materiałów audio z obszaru medycyny, prawa, finansów, motoryzacji i programowania oraz do trudnych danych wejściowych, takich jak mowa szeptana, szybka mowa, mowa łączona, śpiew i muzyka w tle. To model plasujący się na poziomie 1,7% współczynnika błędów słów w indeksie AA-WER Artificial Analysis dla nie strumieniowej zamiany mowy na tekst.

StepAudio 3 ASR Max — poziom, który dokumentacja StepFun nazywa największym jak dotąd modelem ASR tej firmy. Ma opublikowaną stawkę cennikową 2,8 juana za godzinę. To nie tańszy model do transkrypcji; to szczyt linii ASR.

StepAudio 3 Realtime — pełnodupleksowy model konwersacyjny. Rozumuje bezpośrednio na mowie, zamiast uruchamiać łańcuch transkrypcja-następnie-rozumowanie, a transkrypcję wykonuje jako efekt uboczny tego. Nie jest produktem ASR, a jego dokładność w zadaniach transkrypcji nie jest tym, do czego został dostrojony.

Wszystko inne w rodzinie — TTS, Gen, Music — to zupełnie odrębne zadanie i nie powinno w ogóle pojawiać się w porównaniu transkrypcji.

Czy ASR i ASR Max to ten sam model?

Dowody wskazują, że tak, a weryfikacja to arytmetyka. StepFun podaje poziom ASR Max w cenie 2,8 juana za godzinę. Po przeliczeniu przy kursie około 7,1 juana za dolara daje to około 0,39 USD za godzinę, czyli mniej więcej 6,6 USD za 1000 minut. Artificial Analysis umieszcza ten model w swoim rankingu z ceną 6,67 USD za 1000 minut. Dwie niezależnie opublikowane liczby, jedna z cennika dostawcy, a druga z rankingu strony trzeciej, różnią się od siebie o mniej niż cent. Właśnie tego można by oczekiwać, gdyby wiersz w rankingu i stawka z cennika ASR Max opisywały ten sam SKU.

Warto być precyzyjnym co do tego, co to dowodzi, a czego nie. Dowodzi, że oś cenowa rankingu i cennik dostawcy opisują ten sam produkt w tej samej cenie. Nie dowodzi, że 1,7% z rankingu zostało zmierzone na dokładnie tym punkcie końcowym, który byś wywołał, ponieważ ranking nie publikuje swojej konfiguracji dekodowania ani punktu końcowego, który został wywołany. A więc: ten sam produkt, bardzo prawdopodobnie; te same warunki pomiaru, niezweryfikowane.

Pewne jest jedno: w obrębie linii nastąpił skok generacyjny. StepAudio 2.5 ASR osiąga 4,7% na tej samej tablicy wyników przy 0,15 juana za godzinę. Obecny poziom to 1,7% przy 2,8 juana za godzinę. To redukcja współczynnika błędów słów o 64% przy około dziewiętnastokrotnie wyższej stawce — najostrzejszy kompromis w rodzinie i ten, który decyduje, czy aktualizacja jest warta zachodu.

A generated two-column scoreboard titled 'StepAudio 3 ASR vs StepAudio 2.5 ASR — the scoreboard'. Left column StepAudio 3 ASR reads AA-WER '1.7%', List price '2.8 yuan per hour', Open weights 'none', Deployment 'StepFun API only', Hard audio 'tuned for whisper and singing', Vendor gains 'Chinese down 9.3%'. Right column StepAudio 2.5 ASR reads AA-WER '4.7%', List price '0.15 yuan per hour', Open weights 'none', Deployment 'StepFun API only', Hard audio 'not tuned for it', Vendor gains 'previous baseline'. Footer reads 'Accuracy figures per Artificial Analysis; the rest vendor-reported.'

Wymiary, które faktycznie się różnią

Gdy nazewnictwo zostanie ustalone, porównanie sprowadza się do krótkiej listy. To te, które zmieniają decyzję:

• Dokładność — StepAudio 3 ASR w trybie niestrumieniowym osiąga 1,7% AA-WER, podczas gdy StepAudio 2.5 ASR osiąga 4,7% na tej samej tablicy wyników. Zmierzone przez Artificial Analysis, a nie przez StepFun.

• Cena — 2,8 juana za godzinę w porównaniu z 0,15 juana za godzinę. Obie to stawki katalogowe dostawców, obie aktualne. Około 19 razy.

• Wagi — wyłącznie hostowane API w przypadku obu. Nigdzie w całej rodzinie nie ma otwartych wag, brak możliwości wdrożenia lokalnego (on-premise), brak opcji samodzielnego hostowania na żadnym poziomie.

• Kształt endpointu — pojedynczy endpoint transkrypcji strumieniowej zwracający tekst przyrostowy i końcowy w porównaniu z tym samym kształtem w poprzedniej generacji. Nic w modelu integracji się nie zmieniło, więc migracja to podmiana identyfikatora modelu, a nie przepisanie.

• Strojenie pod trudne warunki audio — StepAudio 3 ASR jest wyraźnie dostrojony pod mowę szeptaną, szybką, łączoną i śpiewaną oraz pod audio z muzyką w tle. To dostrojenie jest produktem; poprzednia generacja nie była do tego stworzona.

Deklarowane przez dostawcę zyski w domenach — StepFun podaje, że chiński spadł o 9,3%, angielski o 25,0%, dialekty o 22,3%, domeny wertykalne o 42,1%, a przełączanie kodów o 27,9% w porównaniu z poprzednią generacją. Dane zgłoszone przez dostawcę i nieodtworzone, więc traktuj je jako orientacyjne.

Na tej liście wyraźnie brakuje: długości kontekstu, obsługi formatów audio, maksymalnego czasu trwania audio oraz identyfikatora modelu. Publiczna dokumentacja StepFun dotycząca tego modelu ich nie podaje, a każdy, kto cytuje te liczby, cytuje coś innego.

ASR vs Realtime to porównanie, którego ludzie naprawdę potrzebują

Jeśli wybierasz między produktami do transkrypcji, a nie między generacjami, ciekawym porównaniem nie jest ASR kontra ASR Max — lecz ASR kontra Realtime. Własne materiały techniczne StepFun mówią, że oba dzielą etapy pretreningu i treningu pośredniego, a rozchodzą się dopiero podczas nadzorowanego dostrajania. Ta sama baza, inne dostrajanie, inny produkt.

Ten pojedynczy fakt ma praktyczny wymiar. Wskaźnik błędów słów na poziomie 1,7% jest właściwością dostrojenia ASR. Nie jest obietnicą dotyczącą modelu czasu rzeczywistego, który jest optymalizowany pod kątem zarządzania turami, obsługi przerwań i rozumowania nad mową, a nie dokładności transkrypcji. Jeśli twoja architektura dokonuje transkrypcji jako efektu ubocznego rozmowy na żywo, nie kupujesz tych 1,7% — kupujesz model konwersacyjny, który przypadkiem emituje tekst.

Jest też odwrotnie, co jest mniej oczywiste: ponieważ mają wspólny szkielet, model ASR nie jest małym specjalistycznym modelem doklejonym do rodziny. To system tej samej skali, dostrojony inaczej. Dlatego stawka ASR jest zbliżona do stawek reszty rodziny, a nie do taniego końca rynku.

Co z tym zrobić, jeśli wybierasz jeden

Trzy pytania to rozstrzygają. Czy potrzebujesz transkrypcji, czy rozmowy? Jeśli transkrypcji, produktem jest StepAudio 3 ASR, a nazwa rodziny to szum. Jeśli rozmowy, chcesz StepAudio 3 Realtime i nie powinieneś w ogóle czytać benchmarków ASR. A jeśli potrzebujesz transkrypcji naprawdę trudnego audio — z akcentem, szeptanego, śpiewanego lub z muzyką w tle — premia 19x to cena warstwy, która została pod to dostrojona, a uczciwym testem jest Twoje własne audio, a nie zbiorczy indeks.

Decyzja, którą łatwo podjąć błędnie, to potraktowanie warstwy transkrypcji jako czegoś stałego. Cokolwiek wybierzesz, transkrypcja jest danymi wejściowymi dla czegoś innego — sumaryzatora, ekstrakcji strukturalnej, kontroli zgodności, indeksu wyszukiwania — a te wywołania trafiają do zwykłych modeli tekstowych. To właśnie ta warstwa skaluje się wraz z użyciem, a nie z minutami audio, i to ją warto od początku utrzymywać przenośną. OrcaRouter udostępnia niemal 200 modeli tekstowych pod jednym API z automatycznym przełączaniem awaryjnym między dostawcami, DSL routingu, który łączy kilka z nich w jedno wywołanie, oraz fuzją modeli, gdy osąd jednego modelu nie wystarcza. Gdy dostawca publikuje stawkę, ta cena katalogowa jest przekazywana bez marży, więc zmiana ceny po stronie tekstu trafia na Twoje rozliczenie w dniu, w którym zostanie ogłoszona.

Dla jasności zakresu, ponieważ ta strona dotyczy rodziny, której nie obsługujemy: na OrcaRouter nie ma żadnego endpointu StepAudio 3. Modele transkrypcji i głosu są dostępne przez własne API StepFun. To, co oferuje OrcaRouter, to warstwa rozumowania po transkrypcji — a właśnie tam decyzja o przełączeniu jest tania do podjęcia i kosztowna do odroczenia.

Screenshot of the Artificial Analysis AA-WER non-streaming leaderboard, showing StepAudio 3 ASR in first place at 1.7% and StepAudio 2.5 ASR at 4.7% further down the ranking, with the AA-WER v2 three-dataset methodology line naming AA-AgentTalk, VoxPopuli-Cleaned-AA and Earnings22-Cleaned-AA.

Czego nikt nie rozstrzygnął

Kwestię nazewnictwa da się rozstrzygnąć. Twierdzenia o wynikach — jeszcze nie. Nadal nie ma opublikowanego raportu technicznego dla modelu ASR, udostępnionego zestawu testowego, konfiguracji dekodowania ani odtwarzalnego protokołu od kogokolwiek spoza StepFun, a własne porównania dostawcy są z innymi chińskimi produktami ASR, a nie z dotychczasowym liderem wśród modeli open-weights. Wartość 1,7% to rzeczywisty pomiar strony trzeciej na połączonym indeksie trzech zestawów danych; wszystko inne dotyczące tego modelu to deklaracja dostawcy.

Dwie rzeczy zmieniłyby obraz sytuacji. Bezpośrednie porównanie z Whisper Large v3 Turbo na identycznym audio, którego nikt nie opublikował. I stawka dla reszty rodziny — cztery z pięciu modeli StepAudio 3 w momencie premiery wciąż miały ograniczoną czasowo darmową cenę w wersji podglądowej, a tylko transkrypcja i synteza miały opublikowane stawki, co oznacza, że cennik, który można dziś przeczytać, obejmuje dwa z pięciu produktów.

Screenshot of the arXiv abstract page for the StepAudio 3 Realtime Technical Report, listing the v1 submission of 12 September 2026 and the v2 revision of 19 September 2026, with the abstract describing the integrated voice agent and the top-performer claim on the Artificial Analysis Full-Duplex Bench.

To jest ta warstwa, która skaluje się wraz z użyciem, a nie wraz z minutami audio, i to jest warstwa, którą warto od początku utrzymywać jako przenośną. automatyczne przełączanie awaryjne między dostawcami, DSL routingu, który łączy kilka z nich w jedno wywołanie, oraz fuzja modeli, gdy osąd jednego modelu nie wystarcza.