
Ogłoszono Step 5 Preview: co faktycznie dostarcza flagowy model 600B od StepFun, a czego wciąż brakuje
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
StepFun ogłosiła Step 5 Preview 20 września 2026 r. — flagowy rzadki model typu mixture-of-experts o 600 miliardach parametrów, z których 27 mld jest aktywnych na token, z oknem kontekstu 1 mln tokenów, natywnym wejściem obrazów i wynikiem 44 w Artificial Analysis Intelligence Index. API zostało otwarte tego samego dnia. Nie otwarto natomiast samego modelu: repozytorium Hugging Face stepfun-ai/Step-5-Preview-BF16 istniało już po południu w dniu ogłoszenia i zawiera dokładnie jeden plik, .gitattributes, bez wag, bez licencji, bez karty modelu i bez konfiguracji. Materiały samego StepFun wskazują, że wydanie otwartych wag nastąpi 15 października 2026 r. Uczciwym jednowierszowym podsumowaniem tej premiery jest więc to, że model można dziś wywołać, a pobrać go dopiero za około trzy i pół tygodnia — i są to dwie różne rzeczy. To także ten sam model, o którym ten blog pisał wcześniej dziś jako o nieogłoszonym przecieku, benchmarkowany pod tagiem testowym, zanim StepFun opublikowała stronę produktu — użyteczne przypomnienie, że zapowiedź może przejść od przecieku do premiery bez zmiany choćby jednej liczby.
Repo jest placeholderem, i to jest cała historia
Gdy dostawca publikuje wagi, repozytorium jest dowodem. Ma plik licencji, konfigurację z liczbą parametrów, README z zamierzonym zastosowaniem i tabelą ewaluacji oraz shardy safetensors, których łączny rozmiar mówi, czy deklaracja liczby parametrów jest prawdziwa. stepfun-ai/Step-5-Preview-BF16 nie ma nic z tego. Rekord API Hugging Face dla niego pokazuje znacznik czasu utworzenia 2026-09-20T03:52Z, zero pobrań, dwa polubienia, pusty obiekt konfiguracji, brak pipeline_tag, brak licencji i tylko jeden plik. Strona organizacji StepFun wymienia je i nie wymienia żadnego innego repozytorium Step 5 — żadnej kompilacji FP8, żadnej kompilacji NVFP4, żadnego GGUF, żadnego z wariantów kwantyzacji, które towarzyszyły Step-3.7-Flash w czerwcu.
Odczytuj to jako kwestię harmonogramu, a nie zagadkę. Sufiks BF16 w nazwie repozytorium wszystko zdradza: laboratorium, które zamierza najpierw opublikować checkpoint bfloat16 — format, z którego się dostraja i kwantyzuje, zanim pojawią się buildy FP8 i NVFP4 do serwowania — nazywa repozytorium w ten sposób w momencie tworzenia i wypełnia je później. StepFun podało datę 15 października w swoich własnych materiałach ogłoszeniowych. Do tego czasu repozytorium jest deklaracją zamiaru, a jedyne, co dowodzi, to że StepFun zarezerwowało przestrzeń nazw.
Ma to znaczenie z praktycznego powodu. Preview jako sufiks i brakujące wagi to ten sam sygnał wskazujący ten sam kierunek: model można wywołać, cennik jest ustalony, a artefakt, który uruchomiłbyś na własnym sprzęcie, jeszcze nie istnieje. Każdy plan zakładający samodzielnie hostowany Step 5 Preview przed połową października to plan, za którym nie stoi żaden artefakt.
Co tak naprawdę ogłoszono
Narracja StepFun jest wąska i konkretna: Step 5 Preview to model bazowy do rzeczywistej pracy agentowej — kodowania z AI, inżynierii oprogramowania, profesjonalnej pracy wiedzowej i finansów — z naciskiem na długi kontekst, wieloturowe wywołania narzędzi i ciągłe wykonywanie zadań, a nie na jakość rozmowy. Firma całkowicie pominęła linię Step 4.x, przechodząc bezpośrednio z Step-3.7-Flash do Step 5, co samo w sobie jest deklaracją, jak dużym krokiem jej zdaniem to jest.
Warto zwrócić uwagę na jeden szczegół dotyczący datowania, bo to właśnie tego typu rzecz potrafi namieszać w kalendarzu zakupowym: Artificial Analysis datuje ten model na 18 września 2026 r., dwa dni przed własnym ogłoszeniem StepFun. Ranking ocenia model wtedy, gdy może uzyskać do niego dostęp, a ta dwudniowa luka to zwykłe opóźnienie między momentem, w którym model staje się wywoływalny, a tym, gdy dostawca o nim pisze. Ogłoszenie StepFun — 20 września, wraz z otwarciem API i Studio tego samego dnia — to data, którą należy podawać, a data wag z 15 października pochodzi z tych samych materiałów.
Specyfikacja w opublikowanej wersji:
• Całkowita liczba parametrów — 600B, rzadka mieszanka ekspertów
• Aktywne na token — 27B, około 4,5% całości, niezwykle rzadka proporcja
• Okno kontekstowe — 1 mln tokenów
• Wejście — natywnie tekst i obrazy; wyjście — tylko tekst
• Rozumowanie — tak, z rozszerzonym myśleniem
• Cena — 1,00 USD za milion tokenów wejściowych, 2,70 USD za milion tokenów wyjściowych, z 95-procentową zniżką na pamięć podręczną
• Dostępność — API i Studio dostępne od 20 września; wagi zaplanowane na 15 października
Twierdzenie o wydajności, które StepFun stawia na czele, głosi, że podział 600B/27B umieszcza model na granicy Pareto — możliwości na jednostkę obliczeń — a firma przedstawia to jako trzy generacje tego samego dążenia, od Step-3.5-Flash przez Step-3.7-Flash do tego modelu. To spójna historia, a mechanizmem jest współczynnik rzadkości: przy 27B aktywnych parametrach koszt obsługi na token mieści się w przedziale znacznie mniejszego modelu, podczas gdy łączne 600B to głównie kwestia zajętości pamięci.
Deklaracje dostawców i towarzyszące im liczby od stron trzecich
W materiałach premierowych pojawiają się dwie klasy liczb i nie należy ich czytać w ten sam sposób. Własne ewaluacje StepFun to pierwsza klasa: deklaracja kosztu pojedynczego zadania na poziomie jednej ósmej kosztu Claude Opus 5; drugie miejsce za którymś z modeli GPT-6 Astra lub Claude Opus 5 w ALE-CLI, FrontierFinance i DRACO; 24-godzinny przebieg optymalizacji jądra GPU, który podniósł szczytową wydajność jądra MLA do 508 TFLOPS wobec 493 uzyskanych przez Claude Opus 5; zautomatyzowany eksperyment po treningu, który przesunął Qwen3-30B-A3B z 53,3% do 60% na AIME24; DeepSWE v1.1 na poziomie 67,7% i jego wewnętrzny StepCodeBench na poziomie 49,0%. StepFun sam zbudował StepCodeBench — 553 repozytoria kodu, dziewięć typów zadań, 33 języki programowania — co czyni go rozsądnym narzędziem do mierzenia własnego modelu, a nie niezależnym narzędziem.
Druga klasa jest mierzona przez kogoś innego i to właśnie tę część należy uwzględnić w planowaniu. Artificial Analysis ocenia Step 5 Preview na 44 punkty w Intelligence Index v4.3.2, plasując go na 24. miejscu spośród 200 modeli — na równi z Kimi K3, o punkt za GLM-5.3 i na równi ze średnim ustawieniem wysiłku rozumowania Claude Opus 5. W Terminal-Bench 4.0 ten sam ranking odnotowuje 33,3%, wyprzedzając DeepSeek V4.1 Flash z 26,8% i znacznie wyprzedzając Kimi K3 z około 12,6%. Prędkość generowania wynosi 99,8 tokena na sekundę, a czas do pierwszego tokena — 2,96 sekundy; oba te wyniki pochodzą z tego samego niezależnego przebiegu i oba są tym rodzajem liczb, które decydują, czy pętla agenta sprawia wrażenie interaktywnej.
Jedna liczba pochodząca od strony trzeciej działa w przeciwnym kierunku i zasługuje na miejsce obok ceny. To samo uruchomienie indeksu zużyło 160 mln tokenów wyjściowych dla Step 5 Preview wobec mediany 92 mln wśród ocenianych modeli — model jest rozwlekły. Przy 2,70 USD za milion tokenów wyjściowych ta rozwlekłość nie jest darmowa: 160 mln tokenów wyjściowych to około 432 USD z 922,84 USD całkowitego kosztu uruchomienia, a przy modelu pobierającym trzy razy większą opłatę byłaby to dominująca pozycja na fakturze. Niska cena nagłówkowa i wysoka liczba tokenów na zadanie to dwie połowy jednej liczby, a koszt na zadanie indeksu — 0,71 USD — jest tym, który już zawiera obie.

Co przeciek podał poprawnie — i ta jedna rzecz, której nie rozstrzygnął
Wcześniejsza relacja tego bloga powstała na podstawie przebiegu ewaluacji, który pojawił się przed jakimkolwiek ogłoszeniem, i oznaczyła twierdzenia, których nie mogła potwierdzić. Ogłoszenie rozwiało większość z nich. Para 600B/27B jest teraz deklarowana przez dostawcę, a nie wywnioskowana. Okno kontekstowe 1 mln tokenów jest teraz w specyfikacji samego StepFun, a nie tylko na tablicy strony trzeciej. Cena 1,00 USD i 2,70 USD to cena. Nazwa to Step 5 Preview, a nie alternatywa, o której plotkowano.
To, czego ogłoszenie nie zrobiło, to rozstrzygnięcie sprzeczności dotyczącej okna kontekstowego, którą podniosły doniesienia o przecieku. Odrębna konfiguracja zewnętrznego dostawcy, krążąca w narzędziach deweloperskich, podawała model jako mający 350 000 tokenów kontekstu i maksymalnie 64 000 tokenów wyjścia. Okno 1 mln i okno 350 tys. to różne produkty o różnych kosztach pamięci, a limit wyjścia 64 tys. jest twardym ograniczeniem dokładnie dla pracy agentowej o długim horyzoncie, do której ten model jest sprzedawany. Ogłoszenie StepFun mówi o 1 mln i nie wspomina o limicie wyjścia. Warto wiedzieć, na którym z nich ostatecznie wyląduje Twój routing, zanim zbudujesz potok zależny od odpowiedzi, a to pytanie do dokumentacji dostawcy, a nie do tabeli wyników.
Inną rzeczą, której nie zmieniła premiera, jest niezależne odtworzenie. Każdy wiersz benchmarku powyżej, który nie pochodzi z Artificial Analysis, jest autorstwa StepFun, uruchomiony na środowiskach testowych StepFun, a żadna strona trzecia nie odtworzyła wyników agentowych. Wzorzec z tegorocznych flagowych modeli chińskich laboratoriów jest taki, że wskaźnik zagregowany się utrzymuje, a wiersze nagłówkowe dostawcy dryfują; traktuj agregat jako wartość do planowania.
Do czego możesz dziś zadzwonić, a co w międzyczasie przekierować
Step 5 Preview nie znajduje się w naszym katalogu, a OrcaRouter go nie routuje — po stronie StepFun istnieje publiczne API i Studio, i tam właśnie działa. To, co mamy, to zestaw modeli, z którymi jest porównywany, za jednym kluczem: DeepSeek V4.1 Flash za $0,15 za wejście i $0,60 za wyjście za milion, GLM-5.3 za $1,26 i $3,96 w porównaniu z cennikiem Z.ai wynoszącym $1,40 i $4,40, Claude Opus 5 za $5,00 i $25,00 oraz Kimi K3 obok nich. Taki jest praktyczny kształt najbliższych trzech tygodni: podgląd, względem którego można przeprowadzać benchmarki, oraz zestaw modeli produkcyjnych, na których naprawdę można polegać, dostępnych przez jedno API dla ponad 200 modeli, z ceną katalogową dostawcy przekazywaną dalej przy 0% marży — więc jeśli ceny StepFun zmienią się przed październikiem, kwota, którą zapłacisz, zmieni się wraz z nimi tego samego dnia, a nie przy odnowieniu.
Automatyczne przełączanie awaryjne jest w tym oknie warte więcej niż zwykle, ponieważ tryb awarii wersji zapoznawczej nie polega na tym, że jest zła — polega na tym, że ma ograniczoną przepustowość. Model, który udostępnił swoje API w dniu ogłoszenia i nie ma jeszcze wag, to model, którego flota obsługująca dopiero powstaje, a endpoint wersji zapoznawczej, który degraduje o 2 w nocy, pociąga za sobą twoją pętlę agenta. Umieść wersję zapoznawczą za routerem ze sprawdzonym modelem jako opcją zapasową, a otrzymasz sygnał jakości na własnym obciążeniu, nie stawiając ścieżki produkcyjnej na nieprzetestowanej flocie.

Data, która ma znaczenie, to 15 października.
Wszystko powyżej jest tymczasowe pod jednym konkretnym względem: to wagi są tym, co czyni model trwałym. Zamknięta wersja zapoznawcza w cenie 1,00 i 2,70 USD to dobra cena od jednego dostawcy, a checkpoint BF16 na opublikowanej licencji to cena, której nie kontroluje już żaden pojedynczy dostawca. StepFun zobowiązał się do drugiej opcji na 15 października, a nazwa repozytorium, które już zarezerwował, mówi najpierw o bfloat16.
To, na co warto patrzeć między teraz a wtedy, jest wąskie i sprawdzalne. Czy repozytorium się zapełni — i na jakiej licencji? Czy plik konfiguracyjny potwierdzi 600B łącznie i 27B aktywnych? Czy StepFun opublikuje limit wyjścia obok okna kontekstu, rozstrzygając kwestię 350k/64k? Czy cena się utrzyma, gdy wersja preview straci swój sufiks? Te cztery odpowiedzi zdecydują, czy Step 5 Preview stanie się modelem, który hostujesz u siebie, modelem, który wynajmujesz, czy modelem, który przetestujesz raz i pójdziesz dalej. Dopóki w repozytorium nie znajdziemy niczego poza .gitattributes, ogłoszenie jest początkiem historii, a nie jej końcem.

Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
