
Krok 5 Podgląd kontra A.X-K2: model API o parametrach 600B przeciwko pobieraniu o rozmiarze 690B
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 za 1 mln tokenów
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
Step 5 Preview i A.X-K2 to dwie strony decyzji, która wciąż powraca tej jesieni: wynająć model klasy frontier z API czy zabrać do domu flagowy model o otwartych wagach i uruchomić go samodzielnie. Step 5 Preview od StepFun to opcja wynajmu — ogłoszony 20 września 2026 r., można go wywołać tego samego dnia w cenie 1,00 USD za milion tokenów wejściowych i 2,70 USD za milion tokenów wyjściowych, około 600 miliardów parametrów całkowitych, z 27 miliardami aktywnymi, kontekst 1 mln tokenów oraz niezależny wynik 44 w Artificial Analysis Intelligence Index. A.X-K2 od SK Telecom to opcja pobrania — udostępniony 12 sierpnia 2026 r. na licencji Apache 2.0, około 688 do 692 miliardów parametrów całkowitych, z 33 miliardami aktywnymi, kontekst 262 tys. tokenów oraz wynik 21 w tym indeksie. Jeden jest większy, jeden ma cenę, a ten, który ma cenę, osiąga znacznie wyższy wynik. Ta odwrotność to całe porównanie i warto ją zrozumieć, zanim z zasady opowiesz się po którejś stronie.
Zwykłe ujęcie tych dwóch modeli ma charakter narodowy: koreański flagowiec suwerennej AI przeciwko jednemu z najbardziej agresywnych laboratoriów Chin. To ujęcie nie jest przydatne przy podejmowaniu decyzji o wdrożeniu. Przydatne jest to, że A.X-K2 to jedyny z tej pary, który możesz mieć u siebie, a Step 5 Preview to jedyny z tej pary, który możesz kupić, płacąc za każdy token. Wszystko inne wynika z tego podziału.
Liczby, przypisane do swoich źródeł
Jedynym pomiarem „jabłko do jabłka” jest Intelligence Index i jest on niezależny w obu przypadkach: 44 dla Step 5 Preview wobec mediany 26 wśród porównywalnych modeli oraz 21 dla A.X-K2 wobec mediany 18 w jego klasie porównawczej modeli z otwartymi wagami — oba zmierzone przez tę samą stronę trzecią i w tej samej skali. Odczytane w chwili pisania, to dzisiejsze liczby — wyniki w tym indeksie zmieniają się, gdy ewaluator dokonuje rekalibracji, a wcześniejszy odczyt tej samej strony A.X-K2 pokazywał wyższą liczbę. Wszystko inne w tym zestawieniu wiąże się z atrybucją, którą trzeba ze sobą nosić.
• Niezależna inteligencja — Step 5 Preview: 44 w Artificial Analysis Intelligence Index vs A.X-K2: 21 w tym samym indeksie, mierzone niezależnie.
• Łączne / aktywne parametry — Step 5 Preview: około 600 mld łącznie, 27 mld aktywnych według StepFun vs A.X-K2: około 688–692 mld łącznie, 33 mld aktywnych według materiałów SK Telecom i karty indeksowej.
• Okno kontekstowe — Step 5 Preview: 1 mln tokenów dla StepFun vs A.X-K2: 262 tys. tokenów.
• Modalność — Step 5 Preview obsługuje tekst i obraz; A.X-K2 obsługuje wyłącznie tekst.
• Cena — Step 5 Preview: 1,00 USD za milion tokenów wejściowych i 2,70 USD za milion tokenów wyjściowych, opublikowana przez dostawcę, w porównaniu z A.X-K2: brak jakiejkolwiek opublikowanej ceny komercyjnego API.
• Gdzie działa — Step 5 Preview: własne API i Studio StepFun oraz powierzchnie partnerskie w okresach promocyjnych vs A.X-K2: twój sprzęt, po pobraniu.
• Wydanie — Step 5 Preview ogłoszono 20 września 2026 vs A.X-K2 wydano 12 sierpnia 2026.
• Licencja — Step 5 Preview: zamknięta wersja zapoznawcza z wagami BF16 obiecanymi na 15 października 2026 r. vs A.X-K2: Apache 2.0.
A.X-K2: cięższy instrument, z uboższymi dowodami
SK Telecom zbudował A.X-K2 jako następcę A.X K1, a architektura jest wymierzona dokładnie w koszt długiego kontekstu: układ mixture-of-experts z 256 ekspertami i 8 aktywnymi na token, trenowany natywnie w FP8, z mechanizmem, który firma nazywa Sparse Gated Attention. To poważne osiągnięcie inżynieryjne i to jest powód, dla którego model z prawie 700 miliardami całkowitych parametrów może być w ogóle serwowany przez organizację, która nie jest hiperskalerem.
Czego mu brakuje, to niezależnego potwierdzenia. SK Telecom podaje średni wzrost o 32,2 punktu w czternastu benchmarkach względem A.X K1, skok o około 83,9 punktu w ewaluacjach długiego kontekstu i agentowych, 97,1 w AIME 2026, 80,5 w koreańskim benchmarku wiedzy KMMLU-Pro i 91,6 w CLIcK, i twierdzi, że dorównuje lub przewyższa najnowsze wydania Qwen i DeepSeek w matematyce i zadaniach związanych z językiem koreańskim. Każda z tych liczb to dane samego dostawcy. Niezależny wynik — 21 w Intelligence Index — przekracza medianę 18 w swojej klasie porównawczej modeli z otwartymi wagami, ale plasuje się dwadzieścia trzy punkty poniżej Step 5 Preview, a zestaw mocnych stron A.X-K2 to obszar, do którego ten konkretny indeks nie przywiązuje dużej wagi: jego dziewięć ewaluacji jest w większości angielskojęzycznych, skoncentrowanych na rozumowaniu i agentach, i ani jedna z nich nie jest benchmarkiem języka koreańskiego.
Nic z tego nie czyni A.X-K2 modelem gorszym, niż sugeruje jego wynik. To czyni jego wynik dolną granicą tego, co potrafi w przypadku obciążenia koreańskojęzycznego lub mocno matematycznego, na słowo dostawcy, dopóki niezależne laboratorium nie opublikuje tych ewaluacji. Kwestia kosztów jest bardziej konkretna: referencyjne wdrożenie tej klasy wagowej wymaga czterech GPU klasy B300 i około 656 GiB w FP8. To cena pobrania, a w przeciwieństwie do rachunku za tokeny nie maleje z powrotem, gdy eksperyment się kończy.
Podgląd kroku 5: ten, który możesz dziś wypróbować przez HTTP
Zaletą Step 5 Preview nie jest to, że jest większy lub bardziej otwarty — nie jest ani jednym, ani drugim — ale to, że ma ustaloną cenę, można go wywoływać i jest niezależnie oceniany, a w październiku można go było bezpłatnie wypróbować w trzech powierzchniach partnerskich. Dla zespołu, który raczej ocenia, niż hostuje samodzielnie, ta kombinacja jest warta więcej niż licencja Apache 2.0, ponieważ zamienia decyzję sprzętową w wywołanie API. Dziennik StepFun na temat tego modelu jest jednak ubogi w typowych miejscach: para parametrów 600B/27B oraz kontekst 1M tokenów to własne liczby dostawcy, obiecane wagi nie zostały wydane, a najbardziej użyteczną wartością niezależnego rankingu na jego temat jest prawdopodobnie nie wynik 44, lecz gadatliwość — około 160 milionów tokenów wyjściowych wygenerowanych w całym zestawie zadań indeksu wobec mediany blisko 82 milionów, a A.X-K2 wypada jeszcze dalej, na poziomie około 230 milionów wobec mediany 140 milionów. W przypadku modelu, który pobiera 2,70 USD za milion tokenów wyjściowych, ta luka to różnica między tanią oceną a kosztownym nawykiem produkcyjnym.
Dlaczego większy model uzyskuje niższy wynik
Liczby parametrów to nie punkty, a to zestawienie pokazuje to wyraźnie. Dodatkowe ~300 miliardów parametrów całkowitych A.X-K2 dają gęstość, która ujawnia się tam, gdzie własny zestaw ewaluacyjny tego modelu ją nagradza — głębia języka koreańskiego, matematyka, szeroka wiedza — podczas gdy indeks, w którym pojawiają się oba modele, jest w większości angielskojęzyczny, zdominowany przez rozumowanie i zorientowany na agentów, gdzie twórcy Step 5 Preview najwyraźniej dostrajali go celowo. Konstrukcja z 27 mld aktywnych parametrów sprawia też, że model StepFun jest znacznie tańszy w obsłudze przy dowolnej przepustowości, dlatego w ogóle istnieje cena hostowanej wersji.
Istnieje drugi, mniej pochlebny odczyt, który działa w przeciwną stronę. A.X-K2 jest na rynku od 12 sierpnia, a Step 5 Preview od 20 września; nowszy model ma za sobą mniej tygodni niezależnej weryfikacji, a jego 44 może się jeszcze zmienić, gdy napłynie więcej ocen. Obie liczby są tymczasowe w tym sensie, w jakim tymczasowe są wyniki za pierwszy kwartał w przypadku każdego modelu. Różnica polega na tym, że tymczasowy wynik A.X-K2 to najlepszy dowód, jaki ma ktokolwiek poza SK Telecom, podczas gdy tymczasowy wynik Step 5 Preview opiera się na karcie specyfikacji producenta, którą strona trzecia przynajmniej częściowo odtworzyła.
Ekonomia serwowania — to tam tak naprawdę tkwi decyzja
Jeśli możesz go wywołać, płacisz 1,00 USD za wejście i 2,70 USD za wyjście za milion tokenów i po sprawie — bez zakupów, bez GPU, bez ops. Jeśli go pobierzesz, płacisz za sprzęt, energię, pracę nad kwantyzacją i zestaw do ewaluacji, a swoje prompty i dane możesz zachować we własnym perymetrze. A.X-K2 przy 33B aktywnych parametrów nie jest modelem na laptopa; konfiguracja referencyjna to mały klaster. Zamknięta wersja zapoznawcza Step 5 Preview nie daje żadnego perymetru aż do 15 października, kiedy obiecane są wagi BF16 — a dopóki te pliki nie pojawią się w repozytorium, ta data jest zobowiązaniem, a nie opcją.

To jest moment, w którym warstwa routingu zasługuje na swoje miejsce, a nie tylko reklamuje samą siebie. Większość zespołów nie chce raz na zawsze odpowiadać na pytanie „wynajmować czy mieć własne”; chce wiedzieć, jak model sprawdza się na ich ruchu, zanim kupi pod niego sprzęt, a potem zachować możliwość przeniesienia się, jeśli odpowiedź się zmieni. OrcaRouter nie kieruje ruchu do Step 5 Preview ani do A.X-K2 — oba te modele są dziś poza naszym katalogiem. Robi natomiast to, że umieszcza ponad 200 modeli za jednym kluczem API i jedną fakturą z 0% narzutu, z przekazywaną ceną katalogową dostawcy, więc zestaw porównawczy, względem którego testujesz którykolwiek z nowych flagowców, to ten sam zestaw, który możesz wywołać jeszcze dziś po południu, a automatyczny failover utrzymuje ścieżkę produkcyjną przy życiu, gdy wciąż podejmujesz decyzję.


Który wybrać
Wybierz Step 5 Preview, jeśli Twoje obciążenie to ogólne rozumowanie, kodowanie agentowe czy cokolwiek z długim kontekstem, jeśli chcesz płacić za token, a nie kupować krzem, oraz jeśli liczy się dla Ciebie wejście obrazowe — wygrywa w niezależnym wyniku, w długości kontekstu, w opóźnieniu do pierwszej odpowiedzi i w różnorodności modalności, a jest jedynym z tych dwóch, który w tym miesiącu możesz uruchomić w pilotażu bez procedury zakupowej.
Wybierz A.X-K2, jeśli Twoim językiem jest koreański, jeśli Twoje obciążenie jest intensywnie matematyczne, albo jeśli dane po prostu nie mogą opuścić Twojej infrastruktury — i miej świadomość, że przyjmujesz tabelę wyników SK Telecom na wiarę, że rachunek za sprzęt jest realny, a niezależny wynik, na który możesz się powołać, jest o dwadzieścia trzy punkty niższy. Jeśli ten kompromis wydaje się niewłaściwy, uczciwa odpowiedź nie polega na wybraniu innego flagowca; polega na przetestowaniu obu na własnym ruchu, co jest jedynym porównaniem, którego liczby żadnego z dostawców nie mogą zastąpić.
Żaden z modeli nie jest bezpiecznym domyślnym wyborem. Step 5 Preview to tania, przemyślana, wywoływalna opcja, której wagi wciąż są w drodze; A.X-K2 to cięższa, suwerenna, pobierana opcja, której dowody wciąż są do przedstawienia. Wybierz ograniczenie, które faktycznie wiąże twój zespół — perymetr czy rachunek — i odpuść to drugie.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
