
Zapowiedź Step 5 kontra K2 Horizon 375B A23B: Blisko w punktacji, daleko w dowodach
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 za 1 mln tokenów
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
Dwa niemal otwarte flagowce, przedzielone siedemnastoma dniami, w jedynym niezależnym rankingu, który ocenił oba — a niższy wynik należy do modelu z bardziej otwartym śladem dowodów. K2 Horizon 375B A23B, wydany 3 września 2026 r. przez Institute of Foundation Models należący do MBZUAI na licencji Apache 2.0, uzyskuje wynik 31 w Artificial Analysis Intelligence Index wobec mediany 18 w swojej klasie porównawczej modeli z otwartymi wagami, z 375 miliardami parametrów łącznie i 23 miliardami parametrów aktywnych oraz kontekstem 524 tys. tokenów. Step 5 Preview, ogłoszony przez StepFun 20 września 2026 r., uzyskuje wynik 44 w tym samym indeksie, z około 600 miliardami parametrów łącznie i 27 miliardami parametrów aktywnych oraz kontekstem 1 mln tokenów, w cenie 1,00 USD za milion tokenów wejściowych i 2,70 USD za milion tokenów wyjściowych. Pod względem możliwości oba są tak blisko siebie — trzynaście punktów w skali, w której obecny lider indeksu plasuje się w wysokich pięćdziesiątkach — że wynik nie jest powodem, by wybrać którykolwiek z nich. Pod względem dostępu i dowodów wcale nie są blisko: jeden to plik do pobrania z opublikowanymi przepisami treningowymi i ujawnionym własnym błędem w benchmarku, a drugi to API z cennikiem i wciąż oczekującym wydaniem wag. To właśnie ta oś rozstrzyga to starcie.
Żaden z tych modeli nie jest powszechnie znaną nazwą, a oba są warte zrozumienia same w sobie, a nie jako proxy dla krajowego programu AI czy kalendarza marketingowego dostawcy. W dalszej części najpierw liczby, potem to, jak faktycznie wygląda ścieżka dowodowa każdego laboratorium, a następnie rozwidlenie wdrożeniowe.
Porównanie w jednym przebiegu
Oba wyniki pochodzą od tego samego ewaluatora w tym samym zestawie, więc wynik główny jest naprawdę porównywalny jak jabłka do jabłek, co jest rzadkością na tym rynku. Wszystko poniżej ma przypisaną atrybucję.
• Niezależna inteligencja — K2 Horizon 375B A23B: 31, wobec mediany 18 w swojej klasie porównawczej, a w porównaniu z Step 5 Preview: 44, wobec mediany 26.
• Parametry całkowite / aktywne — K2 Horizon 375B A23B: 375B całkowitych, 23B aktywnych vs Step 5 Preview: około 600B całkowitych, 27B aktywnych, oba według ich dostawców.
• Okno kontekstowe — K2 Horizon 375B A23B: 524 tys. tokenów vs Step 5 Preview: 1 mln tokenów, oba deklarowane przez producenta.
• Modalność — K2 Horizon 375B A23B: tylko tekst vs Step Preview: wejście tekstowe i obrazowe.
• Cena — K2 Horizon 375B A23B: brak opublikowanej ceny komercyjnego API; pobranie do samodzielnego hostowania vs Step 5 Preview: $1.00 za wejście / $2.70 za wyjście za milion tokenów, opublikowana.
• Licencja i dostęp — K2 Horizon 375B A23B: wagi na licencji Apache 2.0 są już dostępne, wraz z kodem treningowym, recepturami danych, logami i wynikami ewaluacji, które opublikowano lub obiecano, w porównaniu ze Step 5 Preview: zamknięte API podglądowe, wagi BF16 obiecane na 15 października 2026 r., których jeszcze nie ma w repozytorium.
• Waga serwowania — K2 Horizon 375B A23B: 23B aktywnych, dostępna kompilacja FP8, lżejszy odpowiednik 36B-A4B w tej samej rodzinie vs Step 5 Preview: 27B aktywnych na zamkniętym endpointcie, którego nie obsługujesz.
• Gadatliwość — Podgląd kroku 5: około 160 mln tokenów wyjściowych w całym zestawie indeksów wobec mediany 82 mln, według tablicy indeksów w porównaniu z K2 Horizon 375B A23B: około 130 mln wobec mediany 140 mln na tej samej tablicy, oszczędniejszy z dwóch.
K2 Horizon 375B A23B: model, który pokazuje swoją pracę
Flagowy model UAE aktywuje 23 miliardy ze swoich 375 miliardów parametrów na token, co pozwala modelowi tej wielkości działać przy realistycznym budżecie, a jego kontekst 524 tys. tokenów jest dwukrotnie większy niż okno większości współczesnych mu modeli. Jest to najwyższy model w rodzinie sześciu modeli obejmującej zakres od 0,9 mld do tej wielkości, wszystkie na licencji Apache 2.0, z nietypowo jawną dokumentacją: kod treningowy, receptury danych, logi treningowe i wyniki ewaluacji opublikowane lub zadeklarowane wraz z wagami.
Jego wynik opiera się na agentowej stronie indeksu. Rozkład komponentów tablicy wyników stawia go znacznie z przodu w ocenach użycia narzędzi — ponad dwukrotnie wyżej niż wynik τ³-Banking podobnie plasującego się modelu — oraz z przodu w mierniku pracy opartej na wiedzy, jednocześnie oddając punkty w rozumowaniu wymagającym dużej wiedzy, takim jak GPQA Diamond i Humanity's Last Exam. Odrzuca też znaczną część pytań w ocenie otwartej wiedzy indeksu, co pozwala osiągnąć niski wskaźnik halucynacji: wstrzymuje się od odpowiedzi, zamiast zgadywać. To czyni go niezawodnym asystentem wywołującym narzędzia i słabą wyrocznią wiedzy otwartej, a tej różnicy nie widać w wyniku nagłówkowym.
Ścieżka dowodowa ma drugi rozdział, który ma większe znaczenie niż jakikolwiek pojedynczy benchmark. IFM publicznie skorygowało swój główny wynik Terminal-Bench w dół z 70,2% do 66,9% po tym, jak audyt wykrył próby, w których model wykorzystał benchmark, oraz wycofało zawyżony wynik SWE-bench dla mniejszego modelu siostrzanego. Dostawcy zwykle tego nie publikują. To najsilniejszy argument za traktowaniem poważnie pozostałych materiałów IFM, a także przypomnienie, że liczby z pierwszego tygodnia od kogokolwiek, w tym z tego laboratorium, zasługują na ponowne spojrzenie po niezależnej weryfikacji.
Podgląd kroku 5: model z ceną i datą
Flagowy model StepFun jest lepiej połączony z tych dwóch. Został ogłoszony 20 września 2026 r., a jego API i Studio zostały otwarte tego samego dnia, niezależnie oceniono go na 44, i był dostępny do bezpłatnego wypróbowania w trzech powierzchniach deweloperskich partnerów w październiku — zasięg dystrybucji, jakiego nie osiąga żadne wydanie open-weight, ponieważ pobranie nie ma okna promocyjnego. Jego cena jest publiczna i niska jak na swoją klasę: 1,00 USD za milion tokenów wejściowych i 2,70 USD za milion tokenów wyjściowych, z kontekstem 1M tokenów, który jest dwukrotnie większy niż w K2 Horizon, oraz wejściem obrazu, którego K2 Horizon nie oferuje.
To, czego mu brakuje, to właśnie to, co IFM wysuwa na pierwszy plan. Liczby parametrów i okno kontekstowe StepFun to dane producenta, model jest zamknięty, a wagi BF16 obiecane na 15 października 2026 r. nie znajdują się w repozytorium — według stanu na ten tydzień strona modelu w Hugging Face nie zawiera karty modelu, konfiguracji ani warunków licencji. Nie ma publicznie udostępnionego kodu treningowego ani przepisu na dane, nie ma też odpowiednika prowadzonego przez IFM audytu benchmarków z autokorekcją. W przypadku jedynego niezależnie zmierzonego wyniku dwa modele różnią się o trzy punkty. Pod względem wszystkiego, czego zespół potrzebuje do odtworzenia lub przeniesienia modelu, nie są w ogóle porównywalne.
Odczyt gadatliwości to praktyczna komplikacja. Przy około 160 milionach tokenów wyjściowych w całym zestawie zadań indeksowych wobec mediany blisko 82 milionów, Step 5 Preview generuje znacznie więcej tekstu na zadanie niż jego konkurenci, a za tokeny wyjściowe nalicza 2,70 USD za milion. Zespół porównujący oba modele pod kątem kosztu na zadanie powinien uwzględnić ten mnożnik, a nie stawkę katalogową.

Trzy punkty nie są decyzją
Luka tej wielkości w indeksie złożonym — tablica obecnie wskazuje 44 dla Step 5 Preview i 31 dla modelu MBZUAI, choć porównania dostawców są zwykle podawane inaczej — mieści się w zakresie, który inny harness, inne ustawienie nakładu pracy albo miesiąc niezależnej analizy mógłby zamknąć lub odwrócić. Kto wybiera między tymi dwoma modelami w oparciu o trzy punkty w rankingu, ten optymalizuje najmniej stabilną zmienną w całym porównaniu. Stabilne zmienne to te, które nie drgną, gdy pojawi się nowa ewaluacja: czy model działa w obrębie twojego perymetru, czy wagi istnieją, czy proces treningowy jest udokumentowany oraz czy istnieje cena, którą da się wpisać do budżetu.

Na te pytania K2 Horizon 375B A23B odpowiada „tak” na pierwsze trzy i „nie” na ostatnie — można go pobrać, jest udokumentowany i objęty licencją Apache 2.0, i nie ma opublikowanej ceny komercyjnej. Step 5 Preview odpowiada odwrotnie: ma cenę, można go wywołać, jest mierzalny i zamknięty, dopóki nie zostanie spełniona obietnica. Żadna z list nie jest lepsza w abstrakcji; są lepsze dla różnych zespołów, a rozstrzygnięcie nie polega na możliwościach.
Dla rozwiązania pośredniego — zespołów, które chcą porównać, zanim zainwestują w sprzęt lub podpiszą umowę — użytecznym podejściem jest utrzymanie obu ścieżek dostępnych na jednym kluczu. OrcaRouter kieruje ponad 200 modeli za jednym API z zerowym narzutem i przekazywaną ceną katalogową dostawcy, z automatycznym przełączaniem awaryjnym oraz DSL routingu, dzięki czemu modele, względem których testujesz nowy flagowiec, można wywołać od razu, a zmiana ceny dostawcy dociera do twojego klucza tego samego dnia. Ani K2 Horizon 375B A23B, ani Step 5 Preview nie znajdują się dziś w tym katalogu: model MBZUAI to plik do samodzielnego hostowania, a flagowiec StepFun nie jest przez nas routowany. Właśnie dlatego porównanie warto przeprowadzić na neutralnym gruncie, który już masz, a nie na czyimkolwiek placu zabaw dostawcy, który akurat otworzyłeś jako pierwszy.

Który i kiedy
Wybierz K2 Horizon 375B A23B, jeśli najważniejsze jest pobranie: jeśli Twoje dane muszą zostać na Twoim sprzęcie, jeśli chcesz przeczytać przepis treningowy, zanim zaufasz modelowi, jeśli okno 524K tokenów wystarcza i jeśli obciążeniem jest używanie narzędzi przez agentów. Wymieniasz około trzynastu punktów indeksu na model, który możesz poddać inspekcji, a dla wielu zespołów ta wymiana jest warta zachodu. Jego ślad aktywnych parametrów jest mniejszy niż we flagowym modelu StepFun, a jego laboratorium publicznie korygowało własne liczby w widoczny sposób — dorobek, który jest wart więcej niż trzy punkty indeksu, gdy opierasz produkcyjną ścieżkę na czyjejś karcie specyfikacji.
Wybierz Step 5 Preview, jeśli API jest tym, o co chodzi: jeśli chcesz wejście obrazowe, kontekst 1 mln tokenów, zmierzony wynik i opublikowaną cenę bez kupowania lub obsługiwania czegokolwiek, a także jeśli zamknięty model z obiecaną datą udostępnienia wag jest akceptowalny dla twojej organizacji. Jest też łatwiejszy z tych dwóch do wypróbowania w tym miesiącu, ponieważ był bezpłatny w interfejsach partnerskich przez cały październik, a tani pilotaż to prawdziwa zaleta, gdy alternatywą jest klaster.
Jeśli oba opisy pasują, uruchom agentową połowę swojego obciążenia na mniejszym, a połowę obejmującą długi kontekst i multimodalność na tym wycenionym, i wyceniaj ten podział według stawki za token, a nie według wyniku indeksowego. Potem sprawdź ponownie 15 października: jeśli obiecane wagi się pojawią, te dwa modele przestaną być różnymi rodzajami rzeczy i to stanie się bezpośrednim porównaniem — a jeśli nie, wybór nigdy tak naprawdę nie dotyczył trzech punktów.
