
Step 5 Preview kontra DeepSeek V4 Pro: jedno to obietnica, drugie to licencja MIT
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
W tym zestawieniu wszystko sprowadza się do pytania, które nie ma nic wspólnego z benchmarkami: co tak naprawdę możesz pobrać? DeepSeek V4 Pro — kompilacja, którą dostawca wydał jako DeepSeek-V4-Pro-0813 13 sierpnia 2026 r. — to model typu mixture-of-experts o 1,6 biliona parametrów na licencji MIT, którego wagi są już teraz dostępne na Hugging Face. Step 5 Preview, który StepFun ogłosił 20 września 2026 r., to rzadki model MoE o 600 miliardach parametrów, zdobywający o osiem punktów więcej na tej samej niezależnej liście rankingowej, a jego repozytorium na Hugging Face zawiera dokładnie jeden plik, .gitattributes. StepFun twierdzi, że checkpoint BF16 pojawi się 15 października. Uczciwy kształt tego porównania nie brzmi więc: „który model jest lepszy”, lecz: „na którym z tych dwóch możesz budować w tym kwartale, a na który jeszcze czekasz”.
Takie ujęcie jest mniej ekscytujące niż starcie benchmarków i znacznie bardziej użyteczne, ponieważ ośmiopunktowa różnica i dwudziestopięciodniowe oczekiwanie to nie fakty tego samego rodzaju. Jedno z nich możesz już dziś uwzględnić w swoich planach.
Osiem punktów i cztery, które mają znaczenie
Artificial Analysis przepuszcza oba modele przez Intelligence Index v4.3.2 — dziesięć ewaluacji — i jest to jedyne miejsce, w którym te dwa zostały zmierzone tą samą ręką.
• Indeks Inteligencji — Step 5 Preview 44 vs DeepSeek V4 Pro 36
• Miejsce w tym rankingu — Step 5 Preview 24. na 200 vs DeepSeek V4 Pro 7. na 113 w swojej klasie
• Terminal-Bench 4.0 — Step 5 Preview 33,3%; DeepSeek V4 Pro nie znajduje się na tej samej tablicy, więc nie ma porównywalnego wiersza agentowego, który można by przytoczyć
• Szybkość generowania — Step 5 Preview 99,8 tokenów/s vs DeepSeek V4 Pro 88,8 tokenów/s
• Czas do pierwszego tokenu — Step 5 Preview 2,96 s vs DeepSeek V4 Pro 1,69 s
• Cena za 1 mln tokenów — Step 5 Preview 1,00 USD za wejście / 2,70 USD za wyjście w porównaniu z DeepSeek V4 Pro 1,32 USD za wejście / 3,96 USD za wyjście przy szczytowej stawce DeepSeek, spadając o połowę do 0,66 USD / 1,98 USD poza szczytem
• Rabat za cache — Step 5 Preview 95% vs DeepSeek V4 Pro 97%
• Kontekst — oba mają 1 mln tokenów; DeepSeek publikuje limit wyjściowy 384 000 tokenów, StepFun nie opublikował takiego.
• Wagi — Step 5 Preview zamknięty, checkpoint BF16 zaplanowany na 15 października; DeepSeek V4 Pro MIT, dostępny do pobrania już teraz
Dwa wiersze przeczą nagłówkowi. DeepSeek V4 Pro odpowiada pierwszym tokenem w 1,69 sekundy wobec 2,96 w Step 5 Preview — 43% przewagi na starcie przy każdym wywołaniu, co w długiej pętli agenta kumuluje się w rzeczywisty czas zegarowy. A jego rabat za cache jest o dwa punkty lepszy, co ma największe znaczenie dokładnie w przypadku obciążenia, dla którego sprzedawane są oba te modele: agent, który przy każdej turze ponownie wysyła ten sam prompt systemowy i kontekst repozytorium, w niemal całości mieści się w tym rabacie.
Ośmiopunktowa luka w wyniku zagregowanym jest realna, a jednocześnie mniejsza, niż sugeruje liczba osiem punktów. Indeks to złożenie dziesięciu ocen, a właśnie w tej kompozycji dwa modele się rozchodzą. Wynik 33,3% Step 5 Preview w Terminal-Bench 4.0 to autentyczny rezultat agentowy; sztandarową zaletą samego DeepSeek V4 Pro jest rozumowanie w długim horyzoncie w cenie, której nic innego w segmencie otwartych wag nie dorównuje. Żadna z tablic wyników nie publikuje wiersza, w którym te dwa modele są bezpośrednio przeciwstawione, i to jest uczciwy powód, dla którego tego porównania nie da się rozstrzygnąć jednym numerem.

Co daje ci „open”, gdy dostawca zmienia zdanie
Oto ta część tego pojedynku, której nie odda żadna karta specyfikacji, i warto podać ją wraz z konkretnymi datami, ponieważ miała miejsce jedenaście dni przed ogłoszeniem Step 5 Preview.
DeepSeek poinformował użytkowników, że wycofuje V4 Pro. 9 września firma podała, że żądania będą kierowane do nowszego DeepSeek V4.1 Flash; 10 września potwierdziła datę na 14 września, godz. 12:00 czasu pekińskiego. 11 września zmieniła jednak decyzję — usługa API V4 Pro będzie kontynuowana po 14 września, a rozliczenia pozostają bez zmian, jak ujął to sam DeepSeek. Identyfikator modelu, kontekst 1 mln tokenów i limit współbieżności 500 żądań wciąż pozostają takie same, a na stronie Models & Pricing firmy DeepSeek zmiana ta figuruje jako przypis przy deepseek-v4-pro, w wierszu tabeli.
Odczytaj to jako demonstrację tego, przed czym otwarte wagi faktycznie cię chronią, oraz tego, przed czym nie. API niemal zostało odebrane przez decyzję o harmonogramie. Wag nie można było. Checkpoint na licencji MIT na twoim własnym sprzęcie nie ma dostawcy, który mógłby ogłosić jego wycofanie, a to inny rodzaj gwarancji niż obietnica cenowa — to w ogóle nie jest obietnica.
To dokładnie ta luka, w której tkwi Step 5 Preview. StepFun zobowiązał się, że checkpoint BF16 pojawi się 15 października, a nazwa repozytorium, którą już zarezerwował — stepfun-ai/Step-5-Preview-BF16 — jest formatem, z którego przeprowadzasz fine-tuning i kwantyzację, nazwanym przy tworzeniu i wypełnionym później. To sygnał dotyczący harmonogramu, a nie artefakt. Dopóki w repozytorium nie ma czegoś innego niż .gitattributes, Step 5 Preview jest modelem, który wynajmujesz, na warunkach jednego dostawcy, bez licencji na czytanie i bez alternatywy, jeśli warunki się zmienią.
Dwa sposoby, by być tanią opcją
Oba te modele znacznie zaniżają cenę względem zamkniętej granicy, a mechanizmy nie są takie same, co ma znaczenie dla trwałości tej ceny.
DeepSeek V4 Pro jest tani, ponieważ laboratorium opublikowało wagi, a konkurencyjny rynek usług inferencji wyeliminował marżę. To strukturalne minimum: każdy może udostępniać ten checkpoint, więc cenę wyznacza koszt godziny GPU, a nie strategia cenowa firmy. Własne API DeepSeek wycenia go w dwóch przedziałach — 1,32 USD i 3,96 USD w godzinach szczytu, o połowę mniej poza nimi — a szczyt jest wąski: kilka godzin rano w dni powszednie czasu UTC, więc większość ruchu trafia na niższą stawkę, a weekendy nigdy nie widzą wyższej.
Step 5 Preview jest tanie, ponieważ StepFun zdecydował się wycenić je w ten sposób. Jest jeden endpoint, jedna lista cen i brak drugiego źródła. To nie jest oskarżenie — model o rzadkiej architekturze 600B/27B naprawdę kosztuje mniej w obsłudze, niż sugeruje liczba jego parametrów, a powodem jest współczynnik aktywowanych parametrów. To po prostu inny rodzaj ceny, a różnica uwidacznia się w dniu, w którym StepFun uzna, że wersja zapoznawcza spełniła swoje zadanie.
Różnica cen między nimi jest na tyle mała, że nie powinna o niczym decydować: $1.00 i $2.70 w porównaniu z $1.32 i $3.96 to 24% różnicy na wejściu i 32% na wyjściu, spokojnie w przedziale, który mogą zniwelować zniżka za cache, różnica długości wyjścia albo wskaźnik ponowień. W kwestii rozwlekłości oba są blisko siebie — Step 5 Preview wygenerował 160 mln tokenów wyjściowych w przebiegu indeksowym wobec mediany 92 mln, a własny przebieg DeepSeek V4 Pro mieści się w tym samym przedziale. Żaden z nich nie jest oszczędnym modelem, a oba sprzedaje się jako tanie w przeliczeniu na token, a nie tanie w przeliczeniu na zadanie.

Gdzie każde z nich ma swoje miejsce w prawdziwym stosie
Jeśli potrzebujesz modelu, który możesz dostroić, skwantyzować, hostować we własnym VPC albo przekazać zespołowi prawnemu wraz z plikiem licencji, który zespół ten może odczytać, to nie jest trudny wybór i nie chodzi tu o benchmarki. DeepSeek V4 Pro jest dziś dostępny na licencji MIT. Step 5 Preview nie ma licencji, konfiguracji ani pliku parametrów, a najwcześniejszy termin, na jaki możesz planować, to połowa października. Ośmiopunktowa różnica w indeksie nie zmienia tej arytmetyki, ponieważ modelu, którego nie możesz pobrać, nie można wdrożyć.
Jeśli zależy Ci na najsilniejszym wyniku agentowym dostępnym za dolara za milion tokenów wejściowych, Step 5 Preview prowadzi w jedynym rankingu, który zmierzył oba, i jest lepszym domyślnym wyborem do pracy metodą prób i błędów, która wypełnia większość pętli agenta — ekstrakcja, klasyfikacja, tworzenie szkieletów testów, rutynowe wywołania między tymi dwoma, które mają znaczenie. Jego 99,8 tokena na sekundę pozwala też kończyć generowanie szybciej niż DeepSeek V4 Pro ze swoimi 88,8, co skraca samą pętlę, a nie tylko rachunek.
Niewygodny przypadek to ten, w którym faktycznie znajduje się większość zespołów: chcesz liczby ze Step 5 Preview, ale nie możesz umieścić endpointu preview, który otworzył się w dniu premiery, bez opublikowanego limitu wyjścia, na ścieżce produkcyjnej. To problem routingu i to na nim kończy się to porównanie. DeepSeek V4 Pro jest dostępny przez OrcaRouter za 0,66 USD i 1,98 USD za milion tokenów, czyli za połowę stawki poza szczytem z cennika DeepSeek wynoszącego 1,32 USD i 3,96 USD, a obok tego także otaczające modele tekstowe — za jednym kluczem dla ponad 200 modeli z 0% marży, więc zmiana cennika DeepSeek trafia na Twój rachunek tego samego dnia, a nie dopiero przy odnowieniu. Skieruj eksploracyjną część ruchu na preview, a ścieżkę produkcyjną utrzymaj na modelu z licencją za nim, a automatyczne przełączanie awaryjne między dostawcami niech wykonuje pracę, którą krzywa przepustowości endpointu preview czyni konieczną.

Co by to rozstrzygnęło
Trzy rzeczy, i wszystkie trzy są sprawdzalne, a nie dyskusyjne.
Pierwsza kwestia to licencja. Gdy pojawi się checkpoint BF16, co repozytorium mówi o tym, co firma może z nim zrobić? Permisywna licencja sama zamyka większość tej luki, ponieważ sprawia, że ośmiopunktowa przewaga staje się czymś, co można mieć na własność, a nie wynajmować. Restrykcyjna sprawia, że DeepSeek V4 Pro pozostaje jedynym modelem z tej pary, na którym można faktycznie zbudować produkt.
Drugą kwestią jest pułap wyjściowy. DeepSeek podaje 384 000 tokenów. Ogłoszenie StepFun mówi o kontekście 1M i nie wspomina o limicie wyjściowym, a oddzielna konfiguracja strony trzeciej, która krążyła podczas przecieku, podawała kontekst 350 000 z maksymalnym limitem wyjściowym 64 000. W przypadku pracy agentowej o długim horyzoncie, dla której sprzedaje się oba modele, ta liczba nie jest przypisem.
Trzecia kwestia to, czy cena się utrzyma, gdy zniknie sufiks „preview”. Cena wersji preview to liczba służąca pozyskaniu klientów; cena wersji produkcyjnej to model biznesowy. Dolna granica DeepSeek V4 Pro jest wyznaczana przez konkurencyjny rynek usług i nie może się znacznie zmienić. Dolna granica Step 5 Preview może się zmienić choćby we wtorek.
Dopóki nie zostaną rozstrzygnięte pierwsze dwie kwestie, praktyczny wniosek jest taki, że DeepSeek V4 Pro to model, który wdrażasz, a Step 5 Preview to model, względem którego robisz benchmark — z zastrzeżeniem, że kilkudniowy endpoint w wersji preview, plasujący się osiem punktów powyżej dojrzałego flagowego modelu na licencji MIT, jest realnym wynikiem i powodem, dla którego 15 października jest wart wpisu w kalendarzu, a nie wzruszenia ramionami.
Porównane w tym artykule2
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
