
Step 5 Preview kontra Nemotron 3 Ultra: dwadzieścia jeden punktów indeksu za dwadzieścia centów
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 za 1 mln tokenów
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
Jeden z tych modeli możesz pobrać jeszcze dziś po południu, i to właśnie ten, który przegrywa o dwadzieścia jeden punktów. Step 5 Preview, zamknięty flagowy model StepFun, otworzył swoje API 20 września 2026 r. i nie ma pliku licencji, który mógłbyś mieć; NVIDIA Nemotron 3 Ultra 550B A55B jest na Hugging Face od 4 czerwca 2026 r. na licencji permisywnej z dołączonymi przepisami treningowymi. W Artificial Analysis Intelligence Index ta para wypada 44 przeciwko 23. W przypadku ceny za tokeny wyjściowe jest to 2,70 USD przeciwko 2,50 USD za milion tokenów. Dwadzieścia jeden punktów za dwadzieścia centów to nie przepowiednia, która rozstrzyga się jednoznacznie w którąkolwiek stronę, dlatego warto zrobić to porządnie, zamiast tylko przebiec wzrokiem po dwóch nagłówkowych kolumnach i wybrać stronę.
Żadne z nich nie jest premierą w tym tygodniu i ma to znaczenie dla tego, jak odczytujesz poniższe liczby. Oba od miesięcy można wywoływać, oba przeszły przez ten sam niezależny zestaw testowy i w żadnym z nich w tym oknie czasowym nie zmienił się cennik. Zmieniło się coś mniejszego i ciekawszego: indeks, na podstawie którego są oceniane, został przebudowany we wrześniu, a one same są teraz oceniane względem dwóch różnych median wyznaczonych z dwóch różnych populacji. I to właśnie tutaj rozstrzyga się to porównanie.
Dwa bardzo różne rodzaje produktu
Przeczytaj karty specyfikacji jedna obok drugiej, a pierwsze, co rzuca się w oczy, to fakt, że ledwo można je zaliczyć do tej samej kategorii rzeczy.
• Parametry — Step 5 Preview ma według własnej dokumentacji StepFun około 600 miliardów łącznie, z 27 miliardami aktywnymi na token; Nemotron 3 Ultra to 550 miliardów łącznie, z 55 miliardami aktywnymi, zgodnie z liczbą, którą niezależna rada przypisuje jego konfiguracji.
• Architektura — StepFun nie publikuje opisu wewnętrznej budowy dla Step 5 Preview. Karta NVIDIA dokumentuje hybrydę: przeplatane warstwy Mamba-2, wybrane warstwy uwagi, układ LatentMoE i głowice Multi-Token Prediction.
• Okno kontekstowe — 1 mln tokenów w tabeli specyfikacji Step 5 Preview, z maksymalnym wyjściem wynoszącym 64 000 tokenów, co również dokumentuje StepFun. Nemotron 3 Ultra został odnotowany na poziomie 262 144 tokenów przez ewaluatora, który go uruchomił; karta dostawcy reklamuje do 1 mln tokenów, osiągalnych dzięki konfiguracji serwowania, a nie domyślnie.
• Dane wejściowe — tekst, obrazy i wideo w Step 5 Preview, do 60 obrazów na żądanie oraz pliki MP4 poniżej 128 MB. Tylko tekst na Nemotron 3 Ultra.
• Kontrola rozumowania — udokumentowane ustawienie niskiego, średniego i wysokiego wysiłku po stronie StepFun; flaga szablonu czatu po stronie NVIDIA, która włącza lub wyłącza ślad myślenia.
• Wagi — brak opublikowanych dla Step 5 Preview, który jest własnościowy i dostępny wyłącznie przez API, z checkpointem BF16, który według StepFun ma zostać udostępniony 15 października 2026 r. Nemotron 3 Ultra jest udostępniany w wersjach BF16 i NVFP4 oraz z modelem nagrody GenRM na Hugging Face w ramach OpenMDW-1.1.
• Minimalna konfiguracja wdrożenia — nie dotyczy modelu API; w przypadku modelu otwartego: osiem GPU klasy B200 lub GB200 albo szesnaście H100, zgodnie z minimalnymi wymaganiami dostawcy.
• Cennik — 1,00 USD za wejście, 0,10 USD przy trafieniu w pamięć podręczną i 2,70 USD za wyjście dla Step 5 Preview, z angielskiej strony cennika StepFun. Około 0,60 USD za wejście, 0,16 USD przy trafieniu w pamięć podręczną i 2,50 USD za wyjście dla Nemotron 3 Ultra, i zwróć uwagę, skąd pochodzi ta para: NVIDIA nie publikuje cennika, więc są to obserwowane ceny dostawcy odnotowywane przez niezależny panel, a nie liczba od producenta.
Wiersz, który większość ludzi uznaje za rozstrzygający, to pierwszy z nich, a jest on najmniej informatywny z ośmiu. Obie sumy różnią się od siebie o mniej niż dziewięć procent, podczas gdy aktywne parametry różnią się dwukrotnie, a to aktywne parametry decydują o koszcie obliczeniowym każdego generowanego tokenu. Żadna z tych liczb nie zapowiada dwudziestopunktowej różnicy.

Mediana jest wyborem podjętym, zanim odczytasz wynik.
Niezależny panel nie ocenia modeli względem jednego pola. Przydziela je do kategorii — a kategoria, do której trafia model, zmienia zdanie drukowane pod jego wynikiem, nie zmieniając samego wyniku.
Step 5 Preview znajduje się w klasie ogólnego rozumowania, w której ranking uwzględnia 227 modeli, a mediana dla modeli porównywalnych wynosi 26. Nemotron 3 Ultra znajduje się w klasie otwartych wag, liczącej 117 modeli, gdzie mediana wynosi 18. Zatem ten sam ranking opisuje 44 jako „znacznie powyżej średniej”, a 23 jako „powyżej średniej”, i oba te opisy są prawdziwe, ponieważ 44 wyprzedza swoją medianę o osiemnaście punktów, a 23 wyprzedza własną o pięć punktów.
To nie jest sztuczka i nie chodzi o to, że ranking jest niesprawiedliwy. To właściwy sposób prezentowania otwartego modelu — porównujesz checkpoint do pobrania z innymi checkpointami do pobrania, ponieważ zespół, który może tylko pobrać, nie wybiera spośród tych 227. Oznacza to jednak, że każdy, kto cytuje „powyżej średniej” o Nemotron 3 Ultra i „powyżej średniej” o 44, porównuje ze sobą dwa różne zdania. Jeśli chcesz jedną liczbę dla tej pary, użyj surowego wskaźnika i zaakceptuj dwudziestojednopunktową różnicę; jeśli chcesz decyzji, użyj klasy i przyznaj, że już wybrałeś swoje pole.

Co jeden harness zmierzył na obu
Tabel dostawców nie można od siebie odejmować, ponieważ StepFun i NVIDIA przeprowadziły różne zestawy testów w różne dni, a materiały NVIDIA nie zawierają każdego benchmarku, który podaje StepFun. Uczciwą podstawą jest część wspólna: to, co pojedynczy ewaluator przetestował na obu.
W Artificial Analysis Intelligence Index to przecięcie wynosi 44 wobec 23. Jeśli chodzi o koszt na ukończone zadanie indeksu, wynosi on 1,03 USD wobec 0,60 USD. Pod względem szybkości wyjściowej sytuacja się odwraca, i to gwałtownie: 87 tokenów na sekundę dla Step 5 Preview wobec 135,6 dla Nemotron 3 Ultra, więc model, który uzyskuje prawie dwukrotnie wyższy wynik, odpowiada o około pół sekundy generowania na token wolniej.
Najbardziej wymowny pojedynczy wiersz to Terminal-Bench 4.0. Step 5 Preview uzyskuje tam 33,3 procent. Nemotron 3 Ultra uzyskuje 0,5 procent. To nie jest artefakt zaokrągleń po żadnej ze stron i nie jest to subtelna różnica — w tym konkretnym zestawie testów agentowo-terminalowych flagowy model z otwartymi wagami praktycznie nie odnotowuje żadnego wyniku. Pułapka polega na tym, że ta sama tablica wyników podaje też ten sam model z wynikiem 53,9 procent w Terminal-Bench 2.1. Dwa benchmarki o niemal tej samej nazwie, dwie różne generacje tej samej rodziny zadań i jeden model, który ma 53,9 w starszym i 0,5 w nowszym. Jeśli ktoś podawał ci wynik Nemotronu rzędu pięćdziesięciu kilku procent, stąd on pochodzi, i nie dotyczy bieżącego zestawu testów.
Jedna zgodność zasługuje na wzmiankę właśnie dlatego, że jest rzadka. Własna karta NVIDIA podaje 87,0 procent w GPQA bez narzędzi; niezależne uruchomienie zmierzyło 86,7 procent. Liczba producenta i liczba zewnętrzna różniące się o trzy dziesiąte punktu procentowego — tak wygląda wiarygodna tabela ewaluacyjna i sprawia, że 0,5 procent w Terminal-Bench 4.0 łatwiej uznać za rzeczywiste, a nie za błąd ewaluatora.
Gdzie tak naprawdę trafiają pieniądze podczas przebiegu indeksowania
Ceny za token w niewielkim stopniu pozwalają przewidzieć, ile będzie kosztować obciążenie, a ta para ilustruje to lepiej niż większość. Tablica publikuje rozkład kosztów dla pełnego przebiegu indeksu każdego modelu, a w przypadku obu tych pozycji dominującą pozycją nie jest generowanie.
Stawka $1,03 za zadanie w Step 5 Preview dzieli się na $0,85 danych wejściowych i $0,17 danych wyjściowych. W kwocie wejściowej $0,62 to odczyty z pamięci podręcznej, $0,22 to zapisy do pamięci podręcznej, a tylko $0,014 to świeże, niebuforowane wejście. W kwocie wyjściowej $0,12 to ślad rozumowania, a $0,06 to ostateczna odpowiedź.
Koszt 0,60 USD za zadanie w Nemotron 3 Ultra dzieli się na 0,53 USD danych wejściowych i 0,07 USD danych wyjściowych, a struktura w obrębie pozycji wejściowej jest niemal lustrzanym odbiciem — 0,48 USD zapisów do pamięci podręcznej wobec zaledwie 0,04 USD odczytów z pamięci podręcznej.
Wynikają z tego dwa wnioski. Pierwszy: w ewaluacji długoterminowej z intensywnym ponownym wykorzystaniem prefiksu około osiemdziesiąt procent tego, co płacisz, leży po stronie wejściowej rachunku, co sprawia, że liczbami do optymalizacji są raczej wskaźnik trafień pamięci podręcznej i dyscyplina kontekstu niż długość danych wyjściowych. Drugi: oba modele dochodzą do swoich rachunków w różny sposób — Step 5 Preview płaci za ponowne odczytanie dużego współdzielonego prefiksu, podczas gdy Nemotron 3 Ultra płaci za zapisanie odrębnej zawartości do pamięci podręcznej już na starcie. Podobny koszt ogólny, dwie różne faktury — a jeśli Twoje obciążenie bardziej przypomina jeden z tych wzorców niż drugi, kolejność przy $1.03 i $0.60 może się odwrócić.
Liczby dotyczące rozwlekłości wyjaśniają resztę wiersza wyjściowego. Step 5 Preview wygenerował około 160 milionów tokenów wyjściowych w całym zestawie indeksów wobec mediany 82 milionów, co tablica określa wprost jako bardzo rozwlekłe. Nemotron 3 Ultra wygenerował 110 milionów wobec mediany 140 milionów, co tablica nazywa dość zwięzłym. Tańszy model jest tym lakonicznym, a jego lakoniczność idzie w kierunku, który ma znaczenie dla rachunku.

Co daje pobranie i ile kosztuje utrzymanie
Cena Nemotron 3 Ultra nie wynosi 2,50 USD za milion tokenów wyjściowych, jeśli bierzesz checkpoint. To cena wynajęcia cudzego wdrożenia tego modelu. Jeśli zdecydujesz się na pobranie, kupujesz inny zestaw kosztów i inny zestaw praw.
Prawa są konkretne i to jest ta część, której model oparty wyłącznie na API nie może dorównać za żadną cenę. OpenMDW-1.1 jest dostarczany wraz z wagami, a NVIDIA publikuje obok nich zbiory danych do wstępnego i następczego trenowania oraz receptury treningowe. Istnieje wersja NVFP4, która dla tego samego modelu jest w przybliżeniu o połowę mniejsza, a wagi Ultra zostały wstępnie wytrenowane z użyciem receptury NVFP4, a nie skwantyzowane później — dlatego mała wersja jest pełnoprawnym artefaktem na karcie, a nie eksperymentem społeczności. Stanowisko komercyjne jest wyrażone wprost: gotowe do użytku komercyjnego i niekomercyjnego.
Koszty są równie konkretne. Minimalne wdrożenie to osiem GPU klasy B200 albo szesnaście H100 i to jest dolna granica podana na karcie, a nie sugestia. Okno kontekstu, które faktycznie otrzymujesz, zależy od sposobu skonfigurowania serwowania: domyślnie 256K, a 1M dopiero po jawnym ustawieniu. Zespół, który nie może przeznaczyć na to całej szafy, nie wybiera między tymi dwoma modelami przy wejściu po $1.00 i $0.60; wybiera między jednym modelem a zamówieniem zakupowym.
Istnieje wersja tego porównania, w której model otwarty wygrywa w wymiarze, który ludzie deklarują, że jest dla nich ważny, a rzadko go wyceniają — zależności. Step 5 Preview to endpoint, który wywołujesz, i dostawca, któremu ufasz, z checkpointem obiecanym, a nie dostarczonym. Jeśli StepFun zmieni swój cennik, zaostrzy limity, oznaczy ID jako przestarzałe albo będzie mieć zły tydzień, twoją jedyną dźwignią jest własna obsługa błędów. Wagi Nemotron 3 Ultra są już na dysku w czyimś klastrze, a to jest coś realnie wartego, nawet gdy ten sam model przegrywa o dwadzieścia jeden punktów indeksu.
Warto być precyzyjnym co do tego, co po drugiej stronie oznacza „obiecany”, ponieważ obraz jest bardziej zagmatwany, niż przyznaje którakolwiek z frakcji. Wiele kopii lustrzanych kompilacji BF16 od stron trzecich pojawiło się na Hugging Face 20 września, w dniu otwarcia API, a niektóre z nich miały znacznie ponad terabajt safetensors. To ponowne wgrania społeczności, a nie wydanie dostawcy, i StepFun nie opublikowało wraz z nimi żadnej zapowiedzi otwartych wag. To, co ustalają, to że wagi krążą i że obiecany checkpoint z 15 października byłby formalizacją, a nie ujawnieniem.
Liczba, która poruszyła się, gdy ją czytaliśmy
Jedna liczba w tym tekście zmieniła się między dwoma odczytami tej samej strony i warto ją wymienić, bo dokładnie w ten sposób porównanie po cichu traci aktualność.
Niezależny panel wykazał koszt 0,71 USD na zadanie indeksu dla Step 5 Preview w zestawieniu z 9 października 2026 r. Przy ponownym odczycie 10 października ta sama strona podaje 1,03 USD. W tym okresie w modelu nic się nie zmieniło, ponieważ wagi modelu dostępnego wyłącznie przez API nie mogą zmienić się z dnia na dzień. Zmienił się sposób rozliczania ewaluacji: gdy zmienia się cena pamięci podręcznej u dostawcy, gdy ewaluator zmienia założenia dotyczące odczytu z pamięci podręcznej albo gdy przebieg jest przeliczany przy innym miksie tokenów, wartość na zadanie się zmienia, a wynik indeksu nie.
Traktuj więc koszt na zadanie jako wartość bieżącą z oznaczoną datą, a nie jako właściwość modelu. Każda wartość na zadanie w tym artykule pochodzi z odczytu z 10 października i jest tak oznaczona. Jeśli tworzysz budżet na podstawie tej strony, oprzyj go na wartości, którą samodzielnie pobierzesz w dniu podjęcia decyzji — a jeśli porównujesz dwa opisy z różnych tygodni, sprawdź daty pozyskania danych, zanim uznasz, że model potaniał.
Które z nich tak naprawdę byś wywołał?
Powiedzmy najpierw tę niewygodną część: OrcaRouter nie kieruje ruchu do żadnego z tych dwóch modeli. Step 5 Preview jest dostępny przez własne API StepFun oraz kilka platform firm trzecich, a Nemotron 3 Ultra jest udostępniany z własnych punktów końcowych NVIDIA oraz przez kilku dostawców, a oba te twierdzenia możesz sprawdzić w naszym katalogu w tej samej minucie, w której je czytasz.
To, co pozostaje, to kształt zależności, a nie wybór modelu — i to jest jedyne miejsce, w którym warstwa routingu naprawdę na siebie zarabia. Podgląd dostępny wyłącznie przez API na ścieżce jednego dostawcy to dokładnie taki układ, w którym gorszy dzień u dostawcy staje się twoją awarią, a tanim ubezpieczeniem jest płaszczyzna sterowania, która potrafi przełączyć żądanie na kwalifikowaną opcję zapasową w momencie, gdy ścieżka dostawcy zaczyna zawodzić. Właśnie temu służy automatyczne przełączanie awaryjne: nie jako zamiennik Step 5 Preview, lecz jako coś, co stawiasz przed modelami, które faktycznie możesz wywołać, tak aby endpoint konkretnego dostawcy nigdy nie był jedyną drogą na produkcję. Ten sam katalog, który to umożliwia, zawiera ponad 200 modeli pod jednym kluczem i na jednym rachunku, z cenami katalogowymi dostawców przekazywanymi bez marży (0 proc.) — a to druga połowa argumentu, bo zmiana cennika gdziekolwiek wyżej w łańcuchu obowiązuje po naszej stronie już tego samego dnia, a nie dopiero przy kolejnym odnowieniu umowy.
Jeśli żaden z tych modeli nie jest tym, który wywołasz, krótka wersja brzmi tak. Wybierz Step 5 Preview, gdy chcesz wynik, wejście wideo i obrazu oraz 90-procentowy rabat na cache, i pogódź się z tym, że wynajmujesz podgląd bez licencji do wag i z październikowym checkpointem, którego jeszcze nie widziałeś. Wybierz Nemotron 3 Ultra, gdy wagi znaczą więcej niż wynik — ze względu na ograniczenia on-premise, dostrajanie, licencję, którą możesz przeczytać — i zaplanuj budżet na sprzęt, zanim zaplanujesz budżet na tokeny, bo przy 0,60 USD za milion tokenów wejściowych wdrożenie o 550 miliardach parametrów jest tanie tylko wtedy, gdy ktoś inny już płaci za GPU.
Kluczowa data to 15 października. Jeśli StepFun opublikuje obiecany checkpoint BF16, kluczowa asymetria tego artykułu — że tylko jeden z tych dwóch jest do pobrania — przestaje być prawdą, a dwadzieścia jeden punktów indeksu staje się znacznie trudniejszych do odparcia. Jeśli data się przesunie, argument za modelem z otwartymi wagami wzmacnia się domyślnie, co jest dziwnym sposobem zamykania luki w możliwościach — i bardzo powszechnym.
