Wygenerowana karta tytułowa zatytułowana „Step 5 Preview — co mówi repozytorium”, zawierająca sześć wierszy: łączna liczba parametrów: 600B, aktywowanych na token: 27B, okno kontekstu: 1M tokenów, dane wejściowe: tekst i obraz, AA Intelligence Index 44 oraz cena: $1.00 za wejście / $2.70 za wyjście. W stopce widnieje tekst: „StepFun ogłosił 20 września 2026 r.; wagi mają zostać udostępnione 15 października 2026 r. Wartość indeksu według Artificial Analysis.”
Engineering & Research

Ogłoszono Step 5 Preview: co faktycznie dostarcza flagowy model 600B od StepFun, a czego wciąż brakuje

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

StepFun ogłosiła Step 5 Preview 20 września 2026 r. — flagowy rzadki model typu mixture-of-experts o 600 miliardach parametrów, z których 27 mld jest aktywnych na token, z oknem kontekstu 1 mln tokenów, natywnym wejściem obrazów i wynikiem 44 w Artificial Analysis Intelligence Index. API zostało otwarte tego samego dnia. Nie otwarto natomiast samego modelu: repozytorium Hugging Face stepfun-ai/Step-5-Preview-BF16 istniało już po południu w dniu ogłoszenia i zawiera dokładnie jeden plik, .gitattributes, bez wag, bez licencji, bez karty modelu i bez konfiguracji. Materiały samego StepFun wskazują, że wydanie otwartych wag nastąpi 15 października 2026 r. Uczciwym jednowierszowym podsumowaniem tej premiery jest więc to, że model można dziś wywołać, a pobrać go dopiero za około trzy i pół tygodnia — i są to dwie różne rzeczy. To także ten sam model, o którym ten blog pisał wcześniej dziś jako o nieogłoszonym przecieku, benchmarkowany pod tagiem testowym, zanim StepFun opublikowała stronę produktu — użyteczne przypomnienie, że zapowiedź może przejść od przecieku do premiery bez zmiany choćby jednej liczby.

Repo jest placeholderem, i to jest cała historia

Gdy dostawca publikuje wagi, repozytorium jest dowodem. Ma plik licencji, konfigurację z liczbą parametrów, README z zamierzonym zastosowaniem i tabelą ewaluacji oraz shardy safetensors, których łączny rozmiar mówi, czy deklaracja liczby parametrów jest prawdziwa. stepfun-ai/Step-5-Preview-BF16 nie ma nic z tego. Rekord API Hugging Face dla niego pokazuje znacznik czasu utworzenia 2026-09-20T03:52Z, zero pobrań, dwa polubienia, pusty obiekt konfiguracji, brak pipeline_tag, brak licencji i tylko jeden plik. Strona organizacji StepFun wymienia je i nie wymienia żadnego innego repozytorium Step 5 — żadnej kompilacji FP8, żadnej kompilacji NVFP4, żadnego GGUF, żadnego z wariantów kwantyzacji, które towarzyszyły Step-3.7-Flash w czerwcu.

Odczytuj to jako kwestię harmonogramu, a nie zagadkę. Sufiks BF16 w nazwie repozytorium wszystko zdradza: laboratorium, które zamierza najpierw opublikować checkpoint bfloat16 — format, z którego się dostraja i kwantyzuje, zanim pojawią się buildy FP8 i NVFP4 do serwowania — nazywa repozytorium w ten sposób w momencie tworzenia i wypełnia je później. StepFun podało datę 15 października w swoich własnych materiałach ogłoszeniowych. Do tego czasu repozytorium jest deklaracją zamiaru, a jedyne, co dowodzi, to że StepFun zarezerwowało przestrzeń nazw.

Ma to znaczenie z praktycznego powodu. Preview jako sufiks i brakujące wagi to ten sam sygnał wskazujący ten sam kierunek: model można wywołać, cennik jest ustalony, a artefakt, który uruchomiłbyś na własnym sprzęcie, jeszcze nie istnieje. Każdy plan zakładający samodzielnie hostowany Step 5 Preview przed połową października to plan, za którym nie stoi żaden artefakt.

Co tak naprawdę ogłoszono

Narracja StepFun jest wąska i konkretna: Step 5 Preview to model bazowy do rzeczywistej pracy agentowej — kodowania z AI, inżynierii oprogramowania, profesjonalnej pracy wiedzowej i finansów — z naciskiem na długi kontekst, wieloturowe wywołania narzędzi i ciągłe wykonywanie zadań, a nie na jakość rozmowy. Firma całkowicie pominęła linię Step 4.x, przechodząc bezpośrednio z Step-3.7-Flash do Step 5, co samo w sobie jest deklaracją, jak dużym krokiem jej zdaniem to jest.

Warto zwrócić uwagę na jeden szczegół dotyczący datowania, bo to właśnie tego typu rzecz potrafi namieszać w kalendarzu zakupowym: Artificial Analysis datuje ten model na 18 września 2026 r., dwa dni przed własnym ogłoszeniem StepFun. Ranking ocenia model wtedy, gdy może uzyskać do niego dostęp, a ta dwudniowa luka to zwykłe opóźnienie między momentem, w którym model staje się wywoływalny, a tym, gdy dostawca o nim pisze. Ogłoszenie StepFun — 20 września, wraz z otwarciem API i Studio tego samego dnia — to data, którą należy podawać, a data wag z 15 października pochodzi z tych samych materiałów.

Specyfikacja w opublikowanej wersji:

• Całkowita liczba parametrów — 600B, rzadka mieszanka ekspertów

• Aktywne na token — 27B, około 4,5% całości, niezwykle rzadka proporcja

• Okno kontekstowe — 1 mln tokenów

• Wejście — natywnie tekst i obrazy; wyjście — tylko tekst

• Rozumowanie — tak, z rozszerzonym myśleniem

• Cena — 1,00 USD za milion tokenów wejściowych, 2,70 USD za milion tokenów wyjściowych, z 95-procentową zniżką na pamięć podręczną

• Dostępność — API i Studio dostępne od 20 września; wagi zaplanowane na 15 października

Twierdzenie o wydajności, które StepFun stawia na czele, głosi, że podział 600B/27B umieszcza model na granicy Pareto — możliwości na jednostkę obliczeń — a firma przedstawia to jako trzy generacje tego samego dążenia, od Step-3.5-Flash przez Step-3.7-Flash do tego modelu. To spójna historia, a mechanizmem jest współczynnik rzadkości: przy 27B aktywnych parametrach koszt obsługi na token mieści się w przedziale znacznie mniejszego modelu, podczas gdy łączne 600B to głównie kwestia zajętości pamięci.

Deklaracje dostawców i towarzyszące im liczby od stron trzecich

W materiałach premierowych pojawiają się dwie klasy liczb i nie należy ich czytać w ten sam sposób. Własne ewaluacje StepFun to pierwsza klasa: deklaracja kosztu pojedynczego zadania na poziomie jednej ósmej kosztu Claude Opus 5; drugie miejsce za którymś z modeli GPT-6 Astra lub Claude Opus 5 w ALE-CLI, FrontierFinance i DRACO; 24-godzinny przebieg optymalizacji jądra GPU, który podniósł szczytową wydajność jądra MLA do 508 TFLOPS wobec 493 uzyskanych przez Claude Opus 5; zautomatyzowany eksperyment po treningu, który przesunął Qwen3-30B-A3B z 53,3% do 60% na AIME24; DeepSWE v1.1 na poziomie 67,7% i jego wewnętrzny StepCodeBench na poziomie 49,0%. StepFun sam zbudował StepCodeBench — 553 repozytoria kodu, dziewięć typów zadań, 33 języki programowania — co czyni go rozsądnym narzędziem do mierzenia własnego modelu, a nie niezależnym narzędziem.

Druga klasa jest mierzona przez kogoś innego i to właśnie tę część należy uwzględnić w planowaniu. Artificial Analysis ocenia Step 5 Preview na 44 punkty w Intelligence Index v4.3.2, plasując go na 24. miejscu spośród 200 modeli — na równi z Kimi K3, o punkt za GLM-5.3 i na równi ze średnim ustawieniem wysiłku rozumowania Claude Opus 5. W Terminal-Bench 4.0 ten sam ranking odnotowuje 33,3%, wyprzedzając DeepSeek V4.1 Flash z 26,8% i znacznie wyprzedzając Kimi K3 z około 12,6%. Prędkość generowania wynosi 99,8 tokena na sekundę, a czas do pierwszego tokena — 2,96 sekundy; oba te wyniki pochodzą z tego samego niezależnego przebiegu i oba są tym rodzajem liczb, które decydują, czy pętla agenta sprawia wrażenie interaktywnej.

Jedna liczba pochodząca od strony trzeciej działa w przeciwnym kierunku i zasługuje na miejsce obok ceny. To samo uruchomienie indeksu zużyło 160 mln tokenów wyjściowych dla Step 5 Preview wobec mediany 92 mln wśród ocenianych modeli — model jest rozwlekły. Przy 2,70 USD za milion tokenów wyjściowych ta rozwlekłość nie jest darmowa: 160 mln tokenów wyjściowych to około 432 USD z 922,84 USD całkowitego kosztu uruchomienia, a przy modelu pobierającym trzy razy większą opłatę byłaby to dominująca pozycja na fakturze. Niska cena nagłówkowa i wysoka liczba tokenów na zadanie to dwie połowy jednej liczby, a koszt na zadanie indeksu — 0,71 USD — jest tym, który już zawiera obie.

Screenshot of the Artificial Analysis model page for Step 5 Preview, showing StepFun as the creator and a September 2026 release date, an Intelligence Index of 44 at rank 24 of 200, output speed 99.8 tokens per second at rank 45 of 200, cost per Intelligence Index task $0.71 at rank 27 of 200, verbosity 160M output tokens at rank 64 of 200, pricing of $1.00 per million input tokens and $2.70 per million output tokens with a 95% cache discount, and technical specifications listing reasoning, text and image input, and a 1M-token context window.

Co przeciek podał poprawnie — i ta jedna rzecz, której nie rozstrzygnął

Wcześniejsza relacja tego bloga powstała na podstawie przebiegu ewaluacji, który pojawił się przed jakimkolwiek ogłoszeniem, i oznaczyła twierdzenia, których nie mogła potwierdzić. Ogłoszenie rozwiało większość z nich. Para 600B/27B jest teraz deklarowana przez dostawcę, a nie wywnioskowana. Okno kontekstowe 1 mln tokenów jest teraz w specyfikacji samego StepFun, a nie tylko na tablicy strony trzeciej. Cena 1,00 USD i 2,70 USD to cena. Nazwa to Step 5 Preview, a nie alternatywa, o której plotkowano.

To, czego ogłoszenie nie zrobiło, to rozstrzygnięcie sprzeczności dotyczącej okna kontekstowego, którą podniosły doniesienia o przecieku. Odrębna konfiguracja zewnętrznego dostawcy, krążąca w narzędziach deweloperskich, podawała model jako mający 350 000 tokenów kontekstu i maksymalnie 64 000 tokenów wyjścia. Okno 1 mln i okno 350 tys. to różne produkty o różnych kosztach pamięci, a limit wyjścia 64 tys. jest twardym ograniczeniem dokładnie dla pracy agentowej o długim horyzoncie, do której ten model jest sprzedawany. Ogłoszenie StepFun mówi o 1 mln i nie wspomina o limicie wyjścia. Warto wiedzieć, na którym z nich ostatecznie wyląduje Twój routing, zanim zbudujesz potok zależny od odpowiedzi, a to pytanie do dokumentacji dostawcy, a nie do tabeli wyników.

Inną rzeczą, której nie zmieniła premiera, jest niezależne odtworzenie. Każdy wiersz benchmarku powyżej, który nie pochodzi z Artificial Analysis, jest autorstwa StepFun, uruchomiony na środowiskach testowych StepFun, a żadna strona trzecia nie odtworzyła wyników agentowych. Wzorzec z tegorocznych flagowych modeli chińskich laboratoriów jest taki, że wskaźnik zagregowany się utrzymuje, a wiersze nagłówkowe dostawcy dryfują; traktuj agregat jako wartość do planowania.

Do czego możesz dziś zadzwonić, a co w międzyczasie przekierować

Step 5 Preview nie znajduje się w naszym katalogu, a OrcaRouter go nie routuje — po stronie StepFun istnieje publiczne API i Studio, i tam właśnie działa. To, co mamy, to zestaw modeli, z którymi jest porównywany, za jednym kluczem: DeepSeek V4.1 Flash za $0,15 za wejście i $0,60 za wyjście za milion, GLM-5.3 za $1,26 i $3,96 w porównaniu z cennikiem Z.ai wynoszącym $1,40 i $4,40, Claude Opus 5 za $5,00 i $25,00 oraz Kimi K3 obok nich. Taki jest praktyczny kształt najbliższych trzech tygodni: podgląd, względem którego można przeprowadzać benchmarki, oraz zestaw modeli produkcyjnych, na których naprawdę można polegać, dostępnych przez jedno API dla ponad 200 modeli, z ceną katalogową dostawcy przekazywaną dalej przy 0% marży — więc jeśli ceny StepFun zmienią się przed październikiem, kwota, którą zapłacisz, zmieni się wraz z nimi tego samego dnia, a nie przy odnowieniu.

Automatyczne przełączanie awaryjne jest w tym oknie warte więcej niż zwykle, ponieważ tryb awarii wersji zapoznawczej nie polega na tym, że jest zła — polega na tym, że ma ograniczoną przepustowość. Model, który udostępnił swoje API w dniu ogłoszenia i nie ma jeszcze wag, to model, którego flota obsługująca dopiero powstaje, a endpoint wersji zapoznawczej, który degraduje o 2 w nocy, pociąga za sobą twoją pętlę agenta. Umieść wersję zapoznawczą za routerem ze sprawdzonym modelem jako opcją zapasową, a otrzymasz sygnał jakości na własnym obciążeniu, nie stawiając ścieżki produkcyjnej na nieprzetestowanej flocie.

Screenshot of the Hugging Face repository page for stepfun-ai/Step-5-Preview-BF16, showing the repository created on September 20, 2026 with one contributor, a single initial commit and a single file listed, .gitattributes at 1.52 kB, with no model card, no license and no configuration.

Data, która ma znaczenie, to 15 października.

Wszystko powyżej jest tymczasowe pod jednym konkretnym względem: to wagi są tym, co czyni model trwałym. Zamknięta wersja zapoznawcza w cenie 1,00 i 2,70 USD to dobra cena od jednego dostawcy, a checkpoint BF16 na opublikowanej licencji to cena, której nie kontroluje już żaden pojedynczy dostawca. StepFun zobowiązał się do drugiej opcji na 15 października, a nazwa repozytorium, które już zarezerwował, mówi najpierw o bfloat16.

To, na co warto patrzeć między teraz a wtedy, jest wąskie i sprawdzalne. Czy repozytorium się zapełni — i na jakiej licencji? Czy plik konfiguracyjny potwierdzi 600B łącznie i 27B aktywnych? Czy StepFun opublikuje limit wyjścia obok okna kontekstu, rozstrzygając kwestię 350k/64k? Czy cena się utrzyma, gdy wersja preview straci swój sufiks? Te cztery odpowiedzi zdecydują, czy Step 5 Preview stanie się modelem, który hostujesz u siebie, modelem, który wynajmujesz, czy modelem, który przetestujesz raz i pójdziesz dalej. Dopóki w repozytorium nie znajdziemy niczego poza .gitattributes, ogłoszenie jest początkiem historii, a nie jej końcem.

Generated two-column infographic titled 'Step 5 Preview — live today vs promised October 15'. The left card 'Callable now' lists rows: API and Studio open September 20, price $1.00 in / $2.70 out, AA Intelligence Index 44, 1M-token context, output speed 99.8 tokens/sec. The right card 'Promised October 15' lists rows: BF16 weights, licence terms, config with parameter counts, output ceiling. A footer reads 'The announcement covers the left card; the right card is unconfirmed until the repository is filled.'

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie