Wygenerowana karta tytułowa zatytułowana „Step 5 Preview vs DeepSeek V4 Pro — co możesz pobrać” z dwiema kolumnami: Step 5 Preview przy AA Index 44, łącznie 600B / 27B aktywnych, wagi obiecane na 15 października i repozytorium zawierające jeden plik .gitattributes; DeepSeek V4 Pro przy AA Index 36, łącznie 1.6T / 49B aktywnych, wagi na licencji MIT i dostępne do pobrania teraz oraz pełny checkpoint na Hugging Face. W stopce widnieje napis „Obie wartości indeksu według Artificial Analysis Intelligence Index v4.3.2 przy maksymalnym wysiłku rozumowania”.
Guides & Insights

Step 5 Preview kontra DeepSeek V4 Pro: jedno to obietnica, drugie to licencja MIT

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

W tym zestawieniu wszystko sprowadza się do pytania, które nie ma nic wspólnego z benchmarkami: co tak naprawdę możesz pobrać? DeepSeek V4 Pro — kompilacja, którą dostawca wydał jako DeepSeek-V4-Pro-0813 13 sierpnia 2026 r. — to model typu mixture-of-experts o 1,6 biliona parametrów na licencji MIT, którego wagi są już teraz dostępne na Hugging Face. Step 5 Preview, który StepFun ogłosił 20 września 2026 r., to rzadki model MoE o 600 miliardach parametrów, zdobywający o osiem punktów więcej na tej samej niezależnej liście rankingowej, a jego repozytorium na Hugging Face zawiera dokładnie jeden plik, .gitattributes. StepFun twierdzi, że checkpoint BF16 pojawi się 15 października. Uczciwy kształt tego porównania nie brzmi więc: „który model jest lepszy”, lecz: „na którym z tych dwóch możesz budować w tym kwartale, a na który jeszcze czekasz”.

Takie ujęcie jest mniej ekscytujące niż starcie benchmarków i znacznie bardziej użyteczne, ponieważ ośmiopunktowa różnica i dwudziestopięciodniowe oczekiwanie to nie fakty tego samego rodzaju. Jedno z nich możesz już dziś uwzględnić w swoich planach.

Osiem punktów i cztery, które mają znaczenie

Artificial Analysis przepuszcza oba modele przez Intelligence Index v4.3.2 — dziesięć ewaluacji — i jest to jedyne miejsce, w którym te dwa zostały zmierzone tą samą ręką.

• Indeks Inteligencji — Step 5 Preview 44 vs DeepSeek V4 Pro 36

• Miejsce w tym rankingu — Step 5 Preview 24. na 200 vs DeepSeek V4 Pro 7. na 113 w swojej klasie

• Terminal-Bench 4.0 — Step 5 Preview 33,3%; DeepSeek V4 Pro nie znajduje się na tej samej tablicy, więc nie ma porównywalnego wiersza agentowego, który można by przytoczyć

• Szybkość generowania — Step 5 Preview 99,8 tokenów/s vs DeepSeek V4 Pro 88,8 tokenów/s

• Czas do pierwszego tokenu — Step 5 Preview 2,96 s vs DeepSeek V4 Pro 1,69 s

• Cena za 1 mln tokenów — Step 5 Preview 1,00 USD za wejście / 2,70 USD za wyjście w porównaniu z DeepSeek V4 Pro 1,32 USD za wejście / 3,96 USD za wyjście przy szczytowej stawce DeepSeek, spadając o połowę do 0,66 USD / 1,98 USD poza szczytem

• Rabat za cache — Step 5 Preview 95% vs DeepSeek V4 Pro 97%

• Kontekst — oba mają 1 mln tokenów; DeepSeek publikuje limit wyjściowy 384 000 tokenów, StepFun nie opublikował takiego.

• Wagi — Step 5 Preview zamknięty, checkpoint BF16 zaplanowany na 15 października; DeepSeek V4 Pro MIT, dostępny do pobrania już teraz

Dwa wiersze przeczą nagłówkowi. DeepSeek V4 Pro odpowiada pierwszym tokenem w 1,69 sekundy wobec 2,96 w Step 5 Preview — 43% przewagi na starcie przy każdym wywołaniu, co w długiej pętli agenta kumuluje się w rzeczywisty czas zegarowy. A jego rabat za cache jest o dwa punkty lepszy, co ma największe znaczenie dokładnie w przypadku obciążenia, dla którego sprzedawane są oba te modele: agent, który przy każdej turze ponownie wysyła ten sam prompt systemowy i kontekst repozytorium, w niemal całości mieści się w tym rabacie.

Ośmiopunktowa luka w wyniku zagregowanym jest realna, a jednocześnie mniejsza, niż sugeruje liczba osiem punktów. Indeks to złożenie dziesięciu ocen, a właśnie w tej kompozycji dwa modele się rozchodzą. Wynik 33,3% Step 5 Preview w Terminal-Bench 4.0 to autentyczny rezultat agentowy; sztandarową zaletą samego DeepSeek V4 Pro jest rozumowanie w długim horyzoncie w cenie, której nic innego w segmencie otwartych wag nie dorównuje. Żadna z tablic wyników nie publikuje wiersza, w którym te dwa modele są bezpośrednio przeciwstawione, i to jest uczciwy powód, dla którego tego porównania nie da się rozstrzygnąć jednym numerem.

Screenshot of the Artificial Analysis model page for Step 5 Preview, showing StepFun as the creator and a September 2026 release date, an Intelligence Index of 44 at rank 24 of 200, output speed 99.8 tokens per second, cost per Intelligence Index task $0.71, verbosity 160M output tokens, pricing of $1.00 per million input tokens and $2.70 per million output tokens with a 95% cache discount, and technical specifications listing reasoning, text and image input, and a 1M-token context window.

Co daje ci „open”, gdy dostawca zmienia zdanie

Oto ta część tego pojedynku, której nie odda żadna karta specyfikacji, i warto podać ją wraz z konkretnymi datami, ponieważ miała miejsce jedenaście dni przed ogłoszeniem Step 5 Preview.

DeepSeek poinformował użytkowników, że wycofuje V4 Pro. 9 września firma podała, że żądania będą kierowane do nowszego DeepSeek V4.1 Flash; 10 września potwierdziła datę na 14 września, godz. 12:00 czasu pekińskiego. 11 września zmieniła jednak decyzję — usługa API V4 Pro będzie kontynuowana po 14 września, a rozliczenia pozostają bez zmian, jak ujął to sam DeepSeek. Identyfikator modelu, kontekst 1 mln tokenów i limit współbieżności 500 żądań wciąż pozostają takie same, a na stronie Models & Pricing firmy DeepSeek zmiana ta figuruje jako przypis przy deepseek-v4-pro, w wierszu tabeli.

Odczytaj to jako demonstrację tego, przed czym otwarte wagi faktycznie cię chronią, oraz tego, przed czym nie. API niemal zostało odebrane przez decyzję o harmonogramie. Wag nie można było. Checkpoint na licencji MIT na twoim własnym sprzęcie nie ma dostawcy, który mógłby ogłosić jego wycofanie, a to inny rodzaj gwarancji niż obietnica cenowa — to w ogóle nie jest obietnica.

To dokładnie ta luka, w której tkwi Step 5 Preview. StepFun zobowiązał się, że checkpoint BF16 pojawi się 15 października, a nazwa repozytorium, którą już zarezerwował — stepfun-ai/Step-5-Preview-BF16 — jest formatem, z którego przeprowadzasz fine-tuning i kwantyzację, nazwanym przy tworzeniu i wypełnionym później. To sygnał dotyczący harmonogramu, a nie artefakt. Dopóki w repozytorium nie ma czegoś innego niż .gitattributes, Step 5 Preview jest modelem, który wynajmujesz, na warunkach jednego dostawcy, bez licencji na czytanie i bez alternatywy, jeśli warunki się zmienią.

Dwa sposoby, by być tanią opcją

Oba te modele znacznie zaniżają cenę względem zamkniętej granicy, a mechanizmy nie są takie same, co ma znaczenie dla trwałości tej ceny.

DeepSeek V4 Pro jest tani, ponieważ laboratorium opublikowało wagi, a konkurencyjny rynek usług inferencji wyeliminował marżę. To strukturalne minimum: każdy może udostępniać ten checkpoint, więc cenę wyznacza koszt godziny GPU, a nie strategia cenowa firmy. Własne API DeepSeek wycenia go w dwóch przedziałach — 1,32 USD i 3,96 USD w godzinach szczytu, o połowę mniej poza nimi — a szczyt jest wąski: kilka godzin rano w dni powszednie czasu UTC, więc większość ruchu trafia na niższą stawkę, a weekendy nigdy nie widzą wyższej.

Step 5 Preview jest tanie, ponieważ StepFun zdecydował się wycenić je w ten sposób. Jest jeden endpoint, jedna lista cen i brak drugiego źródła. To nie jest oskarżenie — model o rzadkiej architekturze 600B/27B naprawdę kosztuje mniej w obsłudze, niż sugeruje liczba jego parametrów, a powodem jest współczynnik aktywowanych parametrów. To po prostu inny rodzaj ceny, a różnica uwidacznia się w dniu, w którym StepFun uzna, że wersja zapoznawcza spełniła swoje zadanie.

Różnica cen między nimi jest na tyle mała, że nie powinna o niczym decydować: $1.00 i $2.70 w porównaniu z $1.32 i $3.96 to 24% różnicy na wejściu i 32% na wyjściu, spokojnie w przedziale, który mogą zniwelować zniżka za cache, różnica długości wyjścia albo wskaźnik ponowień. W kwestii rozwlekłości oba są blisko siebie — Step 5 Preview wygenerował 160 mln tokenów wyjściowych w przebiegu indeksowym wobec mediany 92 mln, a własny przebieg DeepSeek V4 Pro mieści się w tym samym przedziale. Żaden z nich nie jest oszczędnym modelem, a oba sprzedaje się jako tanie w przeliczeniu na token, a nie tanie w przeliczeniu na zadanie.

Generated two-column comparison scoreboard titled 'Step 5 Preview vs DeepSeek V4 Pro — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, parameters 600B total / 27B active, price $1.00 / $2.70, cache discount 95%, TTFT 2.96s, and weights due October 15. The right column gives DeepSeek V4 Pro the rows AA Index 36, parameters 1.6T total / 49B active, price $1.32 / $3.96, cache discount 97%, TTFT 1.69s, and weights MIT-licensed and downloadable now. A footer reads 'Both per Artificial Analysis Intelligence Index v4.3.2 at maximum reasoning effort.'

Gdzie każde z nich ma swoje miejsce w prawdziwym stosie

Jeśli potrzebujesz modelu, który możesz dostroić, skwantyzować, hostować we własnym VPC albo przekazać zespołowi prawnemu wraz z plikiem licencji, który zespół ten może odczytać, to nie jest trudny wybór i nie chodzi tu o benchmarki. DeepSeek V4 Pro jest dziś dostępny na licencji MIT. Step 5 Preview nie ma licencji, konfiguracji ani pliku parametrów, a najwcześniejszy termin, na jaki możesz planować, to połowa października. Ośmiopunktowa różnica w indeksie nie zmienia tej arytmetyki, ponieważ modelu, którego nie możesz pobrać, nie można wdrożyć.

Jeśli zależy Ci na najsilniejszym wyniku agentowym dostępnym za dolara za milion tokenów wejściowych, Step 5 Preview prowadzi w jedynym rankingu, który zmierzył oba, i jest lepszym domyślnym wyborem do pracy metodą prób i błędów, która wypełnia większość pętli agenta — ekstrakcja, klasyfikacja, tworzenie szkieletów testów, rutynowe wywołania między tymi dwoma, które mają znaczenie. Jego 99,8 tokena na sekundę pozwala też kończyć generowanie szybciej niż DeepSeek V4 Pro ze swoimi 88,8, co skraca samą pętlę, a nie tylko rachunek.

Niewygodny przypadek to ten, w którym faktycznie znajduje się większość zespołów: chcesz liczby ze Step 5 Preview, ale nie możesz umieścić endpointu preview, który otworzył się w dniu premiery, bez opublikowanego limitu wyjścia, na ścieżce produkcyjnej. To problem routingu i to na nim kończy się to porównanie. DeepSeek V4 Pro jest dostępny przez OrcaRouter za 0,66 USD i 1,98 USD za milion tokenów, czyli za połowę stawki poza szczytem z cennika DeepSeek wynoszącego 1,32 USD i 3,96 USD, a obok tego także otaczające modele tekstowe — za jednym kluczem dla ponad 200 modeli z 0% marży, więc zmiana cennika DeepSeek trafia na Twój rachunek tego samego dnia, a nie dopiero przy odnowieniu. Skieruj eksploracyjną część ruchu na preview, a ścieżkę produkcyjną utrzymaj na modelu z licencją za nim, a automatyczne przełączanie awaryjne między dostawcami niech wykonuje pracę, którą krzywa przepustowości endpointu preview czyni konieczną.

Screenshot of the OrcaRouter model page for DeepSeek V4 Pro at www.orcarouter.ai/models/deepseek/deepseek-v4-pro, showing the model id deepseek/deepseek-v4-pro, a 1M-token context and 384K max output, input pricing of $0.66 and output pricing of $1.98 per million tokens, a p50 time to first token of 4.01 seconds, 3,730M tokens of traffic over seven days, and the endpoints and SDK snippets behind the OrcaRouter API.

Co by to rozstrzygnęło

Trzy rzeczy, i wszystkie trzy są sprawdzalne, a nie dyskusyjne.

Pierwsza kwestia to licencja. Gdy pojawi się checkpoint BF16, co repozytorium mówi o tym, co firma może z nim zrobić? Permisywna licencja sama zamyka większość tej luki, ponieważ sprawia, że ośmiopunktowa przewaga staje się czymś, co można mieć na własność, a nie wynajmować. Restrykcyjna sprawia, że DeepSeek V4 Pro pozostaje jedynym modelem z tej pary, na którym można faktycznie zbudować produkt.

Drugą kwestią jest pułap wyjściowy. DeepSeek podaje 384 000 tokenów. Ogłoszenie StepFun mówi o kontekście 1M i nie wspomina o limicie wyjściowym, a oddzielna konfiguracja strony trzeciej, która krążyła podczas przecieku, podawała kontekst 350 000 z maksymalnym limitem wyjściowym 64 000. W przypadku pracy agentowej o długim horyzoncie, dla której sprzedaje się oba modele, ta liczba nie jest przypisem.

Trzecia kwestia to, czy cena się utrzyma, gdy zniknie sufiks „preview”. Cena wersji preview to liczba służąca pozyskaniu klientów; cena wersji produkcyjnej to model biznesowy. Dolna granica DeepSeek V4 Pro jest wyznaczana przez konkurencyjny rynek usług i nie może się znacznie zmienić. Dolna granica Step 5 Preview może się zmienić choćby we wtorek.

Dopóki nie zostaną rozstrzygnięte pierwsze dwie kwestie, praktyczny wniosek jest taki, że DeepSeek V4 Pro to model, który wdrażasz, a Step 5 Preview to model, względem którego robisz benchmark — z zastrzeżeniem, że kilkudniowy endpoint w wersji preview, plasujący się osiem punktów powyżej dojrzałego flagowego modelu na licencji MIT, jest realnym wynikiem i powodem, dla którego 15 października jest wart wpisu w kalendarzu, a nie wzruszenia ramionami.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie