Wygenerowana karta tytułowa dla Step 5 Preview z napisem „Step 5 Preview — dotychczasowy przeciek”, wymieniająca sześć specyfikacji w wierszach typu etykieta–wartość: łączna liczba parametrów około 600B, aktywowanych na inferencję około 27B, dane wejściowe: tekst i obraz, okno kontekstu 1M tokenów, AA Intelligence Index 44 oraz cena $1.00 za wejście i $2.70 za wyjście za 1M tokenów. W stopce czytamy: „Wszystkie wartości pochodzą od podmiotów trzecich i nie zostały poddane audytowi – StepFun nie ogłosił tego modelu.” Logo OrcaRouter znajduje się w prawym dolnym rogu.
Guides & Insights

Zapowiedź Step 5: Niezapowiedziany flagowiec 600B od StepFun już jest na leaderboardzie

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Step 5 Previewma pozycję w rankingu, opublikowaną cenę, zmierzoną szybkość generowania i wynik Intelligence Index na poziomie 44 — taki sam jak Kimi K3, model około pięć razy większy. Czego jednak nie ma, to premiery. StepFun go nie ogłosił, dokumentacja własnej platformy StepFun go nie wymienia, a wag nie ma do pobrania. Każda z poniższych liczb pochodzi od strony trzeciej, która uzyskała dostęp, zanim dostawca powiedział cokolwiek publicznie, co czyni ten tekst opisem tego, co wiemy do tej pory, a nie recenzją. Czytaj te liczby jako dowód na to, co nadchodzi, a nie jako specyfikację.

Przeciek jest historią

Pierwszy publiczny ślad Step 5 Preview to przebieg ewaluacji. Artificial Analysis ma dla niego aktywną stronę modelu, ocenianego przez własne API StepFun pod tagiem testowym step-5-preview-b, a platforma datuje model na 18 września 2026. Z tej strony pochodzą 44, cennik, pomiar szybkości i wiersze benchmarków w tym artykule.

W przeciwieństwie do tego po stronie dostawcy panuje pustka. Dokumentacja deweloperska StepFun wymienia modele do Step 3.7 Flash i Step 3.5 Flash i na tym się kończy — brak step-5, brak wpisu o wersji zapoznawczej. Organizacja stepfun-ai na Hugging Face nie ma repozytorium Step 5, co jest spójne z flagowym modelem o zamkniętych wagach, a nie z przeoczeniem. Relacje społeczności na chińskich forach deweloperskich wskazują na możliwą premierę podczas wydarzenia AGI Frontier w Szanghaju 19 września, co wypadałoby mniej więcej dzień po pojawieniu się wyników ewaluacji. W chwili pisania tego tekstu nikt poza StepFun nie dysponuje oficjalną specyfikacją, oficjalną ceną ani oficjalną nazwą wersji przeznaczonej do sprzedaży.

Sama nazwa jest pierwszą wskazówką, że to zapowiedź, a nie premiera. StepFun całkowicie pominął linię Step 4.x i przeszedł od razu do Step 5. Model wydany z przyrostkiem Preview, poddany benchmarkom, zanim doczekał się strony produktu, to model, który dostawca wciąż kalibruje — ceny, routing i limity mogą się jeszcze zmienić przed ogólną dostępnością.

Jak wygląda specyfikacja, o ile można stwierdzić

To są krążące liczby i jednocześnie najczęściej powtarzane twierdzenia z tego przecieku — co nie znaczy, że są to twierdzenia najlepiej potwierdzone:

• Łączna liczba parametrów — około 600 mld, w porównaniu z około 2,8 bln dla Kimi K3

• Aktywowane na jedno wnioskowanie — około 27B, mniej więcej 4,5% całości, nietypowo rzadki współczynnik mieszaniny ekspertów

• Modalności wejściowe — tekst i obrazy; wyjście wyłącznie w formie tekstu

• Rozumowanie — tak, z rozszerzonym myśleniem

• Okno kontekstu — 1 mln tokenów w Artificial Analysis; oddzielna konfiguracja strony trzeciej krążąca w narzędziach deweloperskich podaje 350 000, z maksymalnym wyjściem 64 000

• Dostępność wagi — zamknięta, brak repozytorium

Ta sprzeczność dotycząca okna kontekstowego zasługuje na wyraźne zaznaczenie, ponieważ nie została przez nikogo rozwiązana. Okno o rozmiarze 1 mln tokenów i okno o rozmiarze 350 tys. tokenów to różne produkty o różnych kosztach pamięci, a druga wartość wiąże się z limitem wyjścia wynoszącym 64 tys. tokenów, o którym pierwsza nic nie mówi. Jeśli planujesz potok przetwarzania długich dokumentów w oparciu o liczbę 1 mln, konfiguracja 350 tys. jest powodem, by poczekać na stronę dostawcy. Liczby parametrów są podobnie nieostre: tracker serwisu DataLearner nadal podaje architekturę MoE i liczby parametrów dla Step 5 Preview jako niedostępne, co oznacza, że para 600B/27B — najczęściej cytowany fakt o tym modelu — należy też do najsłabiej oficjalnie potwierdzonych.

Interesująca liczba to 27B, a nie 600B.

Rzadkie modele mieszanki ekspertów przeznaczają moc obliczeniową wyłącznie na tych ekspertów, do których token faktycznie trafia, więc to liczba aktywnych parametrów decyduje o tym, jak model zachowuje się w środowisku produkcyjnym. Przy około 27B aktywnych parametrów Step 5 Preview wykonuje pracę na token w tym samym zakresie co modele o ułamku jego rozmiaru, podczas gdy łączne 600B to w dużej mierze kwestia zajętości pamięci.

Wynikają z tego dwie konsekwencje i obie widać w pomiarach zewnętrznych. Koszt obsługi zależy od aktywowanych parametrów, co jest częścią powodu, dla którego cena jest taka, jaka jest. A szybkość na token również na tym zyskuje: Artificial Analysis mierzy 99,8 tokena wyjściowego na sekundę, co daje 42. miejsce na 200 modeli, wobec mediany 64,6. Czas do pierwszego tokena wynosi 2,96 sekundy wobec mediany około 3,57 sekundy. Jeśli podział 600B/27B jest dokładny, to model zaprojektowany tak, by był tani w obsłudze, a nie tani w hostowaniu — istotne rozróżnienie, jeśli to ty płacisz za GPU, a nie za tokeny.

Gdzie plasuje się w Intelligence Index

Artificial Analysis przyznaje Step 5 Preview 44 punkty w Intelligence Index v4.3, który obejmuje dziesięć ewaluacji. To 25. miejsce wśród 200 modeli w rankingu i znacznie powyżej mediany wyników modeli w tym indeksie, która wynosi 25.

• Indeks Inteligencji — Step 5 Preview 44 vs Kimi K3 44

• Bezpośrednio powyżej — GLM-5.3 i Claude Opus 5, oba na poziomie 45

• Bezpośrednio poniżej — DeepSeek V4.1 Flash z wynikiem 40 i DeepSeek V4 Pro z wynikiem 36

• Terminal-Bench 4.0 — Step 5 Preview 33,3% vs Kimi K3 na poziomie około 12,6%, a vs DeepSeek V4.1 Flash na poziomie 26,8%

• SciCode — 59% dla Step 5 Preview, na poziomie Kimi K3

• Szybkość generowania — 99,8 tokena na sekundę w porównaniu z medianą dla tej dziedziny wynoszącą 64,6

Nagłówek to remis z Kimi K3, a uczciwa lektura jest węższa, niż sugerują nagłówki. Dorównanie modelowi o 2,8 bln parametrów w zagregowanym indeksie przy łącznie 600 mld to realny wynik pod względem efektywności, ale agregat ukrywa jego kształt: różnica w Terminal-Bench 4.0 na korzyść Step 5 Preview jest dramatyczna, podczas gdy wynik SciCode to remis. Zagregowany parytet w indeksie nie oznacza parytetu wszędzie, a build preview to najmniej wiarygodny moment, by zakładać, że te różnice się utrzymają.

Jeszcze jedna rozbieżność warta wymienienia: Artificial Analysis podaje 44, podczas gdy niezależny tracker DataLearner odnotowuje ten sam przebieg jako 43,6. To różnica wynikająca z zaokrąglenia, a nie spór o możliwości, ale właśnie takie rzeczy dobrze ilustrują ogólną kwestię dotyczącą liczb tego modelu — to odczyty podmiotów trzecich dotyczące nieogłoszonego modelu, dokonane w nieco różnych momentach, i żaden z nich nie został potwierdzony przez StepFun. Żaden z tych benchmarków nie jest raportowany przez dostawcę, co działa w obie strony: nikt w StepFun nie zgłosił tu żadnej liczby i nikt w StepFun nie poparł żadnej z nich.

Screenshot of the Artificial Analysis model page for Step 5 Preview, headed 'Step 5 Preview Intelligence, Performance & Price Analysis', showing StepFun as the creator, a release date of September 2026, an Intelligence Index of 44 at rank 25 of 200, an output speed of 99.8 tokens per second at rank 42 of 200, input pricing of $1.00 and output pricing of $2.70 per million tokens with a 95% cache discount, $0.71 per Intelligence Index task, verbosity of 160M output tokens, and technical specifications listing reasoning as supported, input modality as text plus image, and a 1M token context window.

Cena, a do tego rozwlekłość, która ją nadgryza.

Ceny to część tego wycieku, która najszybciej wpłynie na budżet. Za pośrednictwem API StepFun, Artificial Analysis odnotowuje następujące dane:

• Wejście — 1,00 USD za milion tokenów, wobec mediany 1,88 USD dla porównywalnych modeli

• Dane wyjściowe — 2,70 USD za milion tokenów, wobec mediany 10,00 USD

• Pamięć podręczna — 95% zniżki na pamięć podręczną, co daje trafienia w pamięć podręczną na poziomie około 0,05 USD za milion tokenów

• Mieszane — około 0,51 USD za milion tokenów przy proporcji 7:2:1 trafień w pamięć podręczną, danych wejściowych i danych wyjściowych

• Koszt na zadanie Intelligence Index — $0,71

• Koszt pełnego przebiegu indeksowania — łącznie 918,34 USD

Stawka za tokeny wyjściowe na poziomie 2,70 USD to pozycja, która ma największe znaczenie, ponieważ jest to mniej niż jedna piąta tego, co Kimi K3 pobiera za ten sam milion tokenów po 15,00 USD. Jest jednak haczyk, który porównanie kosztu na token ukrywa, a Artificial Analysis mierzy go bezpośrednio: rozwlekłość. Step 5 Preview wygenerował 160 mln tokenów wyjściowych, aby ukończyć Intelligence Index, wobec mediany 90 mln dla całego zestawu i 65. miejsca na 200 w tym pomiarze.

Przeanalizuj to. Przy $2.70 za milion 160 mln tokenów wyjściowych to około $432 — mniej więcej połowa całkowitego kosztu całego przebiegu indeksu wynoszącego $918.34, wydana na własną gadatliwość modelu, a nie na zadania. Przepuść te same 160 mln tokenów przez stawkę wyjściową Kimi K3 wynoszącą $15.00 i masz $2,400 — i stąd bierze się przewaga cenowa. Ale praktyczne ostrzeżenie jest dla każdego, kto szacuje koszty, przenosząc liczbę tokenów z innego modelu: Step 5 Preview generuje około 1,8 razy więcej niż mediana, więc obciążenie z dużą ilością danych wyjściowych kupuje tańszą stawkę i więcej tokenów jednocześnie. Zniżka się utrzymuje, ale jest mniejsza, niż sugeruje porównanie $1.00/$2.70 z $3.00/$15.00, a jej wielkość zależy w całości od tego, jak gadatliwe są twoje prompty wobec modelu.

95% zniżki na pamięć podręczną to druga dźwignia, i jest ona niezwykle agresywna. Obciążenie z intensywnym ponownym wykorzystaniem promptów — długi prompt systemowy, stały dokument, wspólna baza kodu — plasuje się znacznie bliżej mieszanej stawki 0,51 USD niż stawki wejściowej 1,00 USD. Ta mieszana wartość zakłada stosunek 7:2:1, co jest założeniem modelowym, a nie gwarancją, ale to właściwy kształt arytmetyki do zastosowania wobec własnego ruchu.

A generated two-column comparison scoreboard titled 'Step 5 Preview vs Kimi K3 — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, total params about 600B, active params about 27B, Terminal-Bench 4.0 33.3%, SciCode 59%, and price $1.00 / $2.70. The right column gives Kimi K3 the rows AA Index 44, total params about 2.8T, active params not disclosed, Terminal-Bench 4.0 about 12.6%, SciCode 59%, and price $3.00 / $15.00. A footer reads 'Step 5 Preview figures third-party via Artificial Analysis and unaudited; Kimi K3 figures per Artificial Analysis. Prices per 1M tokens.' The OrcaRouter logo sits in the bottom-right corner.

Na co natrafiają pierwsi testerzy

To są pojedyncze relacje z forów deweloperskich i postów w mediach społecznościowych z dni wokół wycieku, a nie pomiary, więc należy je odpowiednio ważyć:

• Wywoływanie narzędzi to najczęstsza skarga — wybieranie błędnych nazw narzędzi oraz próby edycji bez uprzedniego odczytania pliku docelowego

• Błędy zgłaszane po przekroczeniu około 340 000 tokenów kontekstu, co jest trybem awarii, na który należy uważać, jeśli okno 1M okaże się prawdziwą liczbą

• Filtrowanie treści obcina dane wyjściowe w przypadku niektórych promptów

• Podzielone opinie na temat możliwości: część testerów stawia go powyżej GLM-5.3 Flash, inni umieszczają go poniżej DeepSeek V4.1 Flash

Niewydana kompilacja zapoznawcza, która zawodzi przy korzystaniu z narzędzi, nie jest skandalem — właśnie do tego służy etykieta zapoznawcza. Ale oznacza to, że 44 nie należy odczytywać jako obietnicy dotyczącej niezawodności agentowej, ponieważ Intelligence Index nie testuje tego, na co najbardziej narzekają wcześni testerzy.

Jak właściwie byś to nazwał — i czego użyć w międzyczasie

OrcaRouter nie routuje Step 5 Preview. Nie ma publicznego endpointu ani wag, więc nie ma czego routować, a żadna platforma zewnętrzna nie może jeszcze uczciwie twierdzić inaczej. Każdy, kto mówi ci, gdzie można go dziś wywołać, opisuje endpoint ewaluacyjny, a nie produkt.

Modele, z którymi jest porównywany, to inna sprawa. Kimi K3, GLM-5.3 i DeepSeek V4.1 Flash są dostępne przez OrcaRouter, obok 199 modeli od 15 dostawców, za jednym kluczem API i jednym rachunkiem. Ceny są przekazywane po cenie katalogowej dostawcy z 0% marży, co ma większe znaczenie niż zwykle w przypadku takiego modelu: jeśli $1.00/$2.70 dla Step 5 Preview utrzyma się przy premierze, a następnie się zmieni, trasa przekazująca cenę zmienia się tego samego dnia, a nie według harmonogramu zmian cen kogoś innego.

Gdy stanie się możliwy do wywołania, rozsądnym sposobem uruchamiania modelu bliskiego niepublikowanemu jest sposób, w jaki uruchamiałbyś każdy model, któremu jeszcze nie ufasz — za trasą z automatycznym przełączaniem awaryjnym, aby awaria wywołania narzędzia lub błąd długiego kontekstu przechodziły do modelu, który działa, zamiast pociągać za sobą awarię twojej aplikacji. To właśnie wzorzec, który wczesne raporty zalecają konkretnie tutaj: kompilacja przedpremierowa ze zgłoszonymi problemami z wywoływaniem narzędzi i błędami długiego kontekstu to dokładnie ten model, za którym chcesz mieć fallback, a nie ten, który chcesz samodzielnie umieszczać na ścieżce produkcyjnej.

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models showing 199 models from 15 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a 'How to call any model' card showing a POST request to the OrcaRouter chat completions endpoint.

Co sprawiłoby, że zmieniłoby się to z wycieku w wydanie?

Trzy rzeczy, którym warto się przyjrzeć, w kolejności od tego, jak wiele by rozstrzygnęły. Po pierwsze, strona modelu i cennik na własnej platformie deweloperskiej StepFun — w momencie, gdy step-5 pojawi się na liście modeli, specyfikacja producenta zastąpi wszelkie odczyty stron trzecich w tym artykule, w tym parę 600B/27B i twierdzenie o kontekście 1M. Po drugie, rozstrzygnięcie sprzeczności dotyczącej kontekstu 1M kontra 350k; limit wyjścia 64k przy oknie 1M to znacząca różnica dla każdego, kto buduje pipeline'y do długich dokumentów lub pipeline'y agentowe, i obecnie pozostaje nierozstrzygnięte. Po trzecie, czy cennik to strategia startowa, czy stała pozycja — ceny w wersji preview chińskich flagowych modeli mają historię zmieniania się, gdy tylko zaczyna brakować mocy, a 2,70 USD za milion tokenów wyjściowych jest wystarczająco agresywne, by nasuwać to pytanie.

Dopóki przynajmniej pierwszy z nich się nie pojawi, uczciwe podsumowanie jest takie, że Step 5 Preview wygląda na naprawdę wydajny model — 600B łącznie wykonujące pracę zagregowaną klasy 2.8T, w cenie kilkukrotnie niższej niż reszta rynku — z niezweryfikowaną specyfikacją, realnym podatkiem od rozwlekłości i reputacją w wywoływaniu narzędzi, na którą jeszcze nie zapracował. Warto to uwzględniać w planach. Jeszcze nie warto na tym opierać ścieżki produkcyjnej.

Porównane w tym artykule4

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie