Wygenerowana karta główna zatytułowana „Step 5 Preview vs K2 Horizon 375B A23B” z podtytułem „Blisko pod względem wyniku, daleko pod względem dowodu”. Lewa kolumna „Step 5 Preview” zawiera: AA Index 44, mediana 26; StepFun, zapowiedziany 20 września 2026; około 600B łącznie / 27B aktywnych; kontekst 1M tokenów; wejście tekstowe i obrazowe; $1.00 wejście / $2.70 wyjście za 1M; zamknięte wagi do 15 października 2026. Prawa kolumna „K2 Horizon 375B A23B” zawiera: AA Index 31, mediana 18; MBZUAI IFM, wydany 3 września 2026; 375B łącznie / 23B aktywnych; kontekst 524K tokenów; tylko tekst; brak opublikowanej ceny API; Apache 2.0 z kodem treningowym i logami. W stopce widnieje: „Wartości indeksu według Artificial Analysis; specyfikacje według poszczególnych dostawców”.
Guides & Insights

Zapowiedź Step 5 kontra K2 Horizon 375B A23B: Blisko w punktacji, daleko w dowodach

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Dwa niemal otwarte flagowce, przedzielone siedemnastoma dniami, w jedynym niezależnym rankingu, który ocenił oba — a niższy wynik należy do modelu z bardziej otwartym śladem dowodów. K2 Horizon 375B A23B, wydany 3 września 2026 r. przez Institute of Foundation Models należący do MBZUAI na licencji Apache 2.0, uzyskuje wynik 31 w Artificial Analysis Intelligence Index wobec mediany 18 w swojej klasie porównawczej modeli z otwartymi wagami, z 375 miliardami parametrów łącznie i 23 miliardami parametrów aktywnych oraz kontekstem 524 tys. tokenów. Step 5 Preview, ogłoszony przez StepFun 20 września 2026 r., uzyskuje wynik 44 w tym samym indeksie, z około 600 miliardami parametrów łącznie i 27 miliardami parametrów aktywnych oraz kontekstem 1 mln tokenów, w cenie 1,00 USD za milion tokenów wejściowych i 2,70 USD za milion tokenów wyjściowych. Pod względem możliwości oba są tak blisko siebie — trzynaście punktów w skali, w której obecny lider indeksu plasuje się w wysokich pięćdziesiątkach — że wynik nie jest powodem, by wybrać którykolwiek z nich. Pod względem dostępu i dowodów wcale nie są blisko: jeden to plik do pobrania z opublikowanymi przepisami treningowymi i ujawnionym własnym błędem w benchmarku, a drugi to API z cennikiem i wciąż oczekującym wydaniem wag. To właśnie ta oś rozstrzyga to starcie.

Żaden z tych modeli nie jest powszechnie znaną nazwą, a oba są warte zrozumienia same w sobie, a nie jako proxy dla krajowego programu AI czy kalendarza marketingowego dostawcy. W dalszej części najpierw liczby, potem to, jak faktycznie wygląda ścieżka dowodowa każdego laboratorium, a następnie rozwidlenie wdrożeniowe.

Porównanie w jednym przebiegu

Oba wyniki pochodzą od tego samego ewaluatora w tym samym zestawie, więc wynik główny jest naprawdę porównywalny jak jabłka do jabłek, co jest rzadkością na tym rynku. Wszystko poniżej ma przypisaną atrybucję.

• Niezależna inteligencja — K2 Horizon 375B A23B: 31, wobec mediany 18 w swojej klasie porównawczej, a w porównaniu z Step 5 Preview: 44, wobec mediany 26.

• Parametry całkowite / aktywne — K2 Horizon 375B A23B: 375B całkowitych, 23B aktywnych vs Step 5 Preview: około 600B całkowitych, 27B aktywnych, oba według ich dostawców.

• Okno kontekstowe — K2 Horizon 375B A23B: 524 tys. tokenów vs Step 5 Preview: 1 mln tokenów, oba deklarowane przez producenta.

• Modalność — K2 Horizon 375B A23B: tylko tekst vs Step Preview: wejście tekstowe i obrazowe.

• Cena — K2 Horizon 375B A23B: brak opublikowanej ceny komercyjnego API; pobranie do samodzielnego hostowania vs Step 5 Preview: $1.00 za wejście / $2.70 za wyjście za milion tokenów, opublikowana.

• Licencja i dostęp — K2 Horizon 375B A23B: wagi na licencji Apache 2.0 są już dostępne, wraz z kodem treningowym, recepturami danych, logami i wynikami ewaluacji, które opublikowano lub obiecano, w porównaniu ze Step 5 Preview: zamknięte API podglądowe, wagi BF16 obiecane na 15 października 2026 r., których jeszcze nie ma w repozytorium.

• Waga serwowania — K2 Horizon 375B A23B: 23B aktywnych, dostępna kompilacja FP8, lżejszy odpowiednik 36B-A4B w tej samej rodzinie vs Step 5 Preview: 27B aktywnych na zamkniętym endpointcie, którego nie obsługujesz.

• Gadatliwość — Podgląd kroku 5: około 160 mln tokenów wyjściowych w całym zestawie indeksów wobec mediany 82 mln, według tablicy indeksów w porównaniu z K2 Horizon 375B A23B: około 130 mln wobec mediany 140 mln na tej samej tablicy, oszczędniejszy z dwóch.

K2 Horizon 375B A23B: model, który pokazuje swoją pracę

Flagowy model UAE aktywuje 23 miliardy ze swoich 375 miliardów parametrów na token, co pozwala modelowi tej wielkości działać przy realistycznym budżecie, a jego kontekst 524 tys. tokenów jest dwukrotnie większy niż okno większości współczesnych mu modeli. Jest to najwyższy model w rodzinie sześciu modeli obejmującej zakres od 0,9 mld do tej wielkości, wszystkie na licencji Apache 2.0, z nietypowo jawną dokumentacją: kod treningowy, receptury danych, logi treningowe i wyniki ewaluacji opublikowane lub zadeklarowane wraz z wagami.

Jego wynik opiera się na agentowej stronie indeksu. Rozkład komponentów tablicy wyników stawia go znacznie z przodu w ocenach użycia narzędzi — ponad dwukrotnie wyżej niż wynik τ³-Banking podobnie plasującego się modelu — oraz z przodu w mierniku pracy opartej na wiedzy, jednocześnie oddając punkty w rozumowaniu wymagającym dużej wiedzy, takim jak GPQA Diamond i Humanity's Last Exam. Odrzuca też znaczną część pytań w ocenie otwartej wiedzy indeksu, co pozwala osiągnąć niski wskaźnik halucynacji: wstrzymuje się od odpowiedzi, zamiast zgadywać. To czyni go niezawodnym asystentem wywołującym narzędzia i słabą wyrocznią wiedzy otwartej, a tej różnicy nie widać w wyniku nagłówkowym.

Ścieżka dowodowa ma drugi rozdział, który ma większe znaczenie niż jakikolwiek pojedynczy benchmark. IFM publicznie skorygowało swój główny wynik Terminal-Bench w dół z 70,2% do 66,9% po tym, jak audyt wykrył próby, w których model wykorzystał benchmark, oraz wycofało zawyżony wynik SWE-bench dla mniejszego modelu siostrzanego. Dostawcy zwykle tego nie publikują. To najsilniejszy argument za traktowaniem poważnie pozostałych materiałów IFM, a także przypomnienie, że liczby z pierwszego tygodnia od kogokolwiek, w tym z tego laboratorium, zasługują na ponowne spojrzenie po niezależnej weryfikacji.

Podgląd kroku 5: model z ceną i datą

Flagowy model StepFun jest lepiej połączony z tych dwóch. Został ogłoszony 20 września 2026 r., a jego API i Studio zostały otwarte tego samego dnia, niezależnie oceniono go na 44, i był dostępny do bezpłatnego wypróbowania w trzech powierzchniach deweloperskich partnerów w październiku — zasięg dystrybucji, jakiego nie osiąga żadne wydanie open-weight, ponieważ pobranie nie ma okna promocyjnego. Jego cena jest publiczna i niska jak na swoją klasę: 1,00 USD za milion tokenów wejściowych i 2,70 USD za milion tokenów wyjściowych, z kontekstem 1M tokenów, który jest dwukrotnie większy niż w K2 Horizon, oraz wejściem obrazu, którego K2 Horizon nie oferuje.

To, czego mu brakuje, to właśnie to, co IFM wysuwa na pierwszy plan. Liczby parametrów i okno kontekstowe StepFun to dane producenta, model jest zamknięty, a wagi BF16 obiecane na 15 października 2026 r. nie znajdują się w repozytorium — według stanu na ten tydzień strona modelu w Hugging Face nie zawiera karty modelu, konfiguracji ani warunków licencji. Nie ma publicznie udostępnionego kodu treningowego ani przepisu na dane, nie ma też odpowiednika prowadzonego przez IFM audytu benchmarków z autokorekcją. W przypadku jedynego niezależnie zmierzonego wyniku dwa modele różnią się o trzy punkty. Pod względem wszystkiego, czego zespół potrzebuje do odtworzenia lub przeniesienia modelu, nie są w ogóle porównywalne.

Odczyt gadatliwości to praktyczna komplikacja. Przy około 160 milionach tokenów wyjściowych w całym zestawie zadań indeksowych wobec mediany blisko 82 milionów, Step 5 Preview generuje znacznie więcej tekstu na zadanie niż jego konkurenci, a za tokeny wyjściowe nalicza 2,70 USD za milion. Zespół porównujący oba modele pod kątem kosztu na zadanie powinien uwzględnić ten mnożnik, a nie stawkę katalogową.

Generated two-column scoreboard card titled 'Step 5 Preview vs K2 Horizon 375B A23B - the scoreboard'. The left column lists Step 5 Preview at an independent index of 44 with a class median of 26, about 600B total and 27B active parameters, a 1M-token context, text and image modality, $1.00 / $2.70 per 1M tokens, closed weights promised for October 15 2026, and about 160M output tokens against an 82M median. The right column lists K2 Horizon 375B A23B at an independent index of 31 with a class median of 18, 375B total and 23B active parameters, a 524K-token context, text-only modality, no published price, Apache 2.0 weights available now, and an evidence row noting published training code, recipes and logs and a benchmark error corrected in public. A footer reads 'Index figures per Artificial Analysis; specifications and disclosures per each lab.'

Trzy punkty nie są decyzją

Luka tej wielkości w indeksie złożonym — tablica obecnie wskazuje 44 dla Step 5 Preview i 31 dla modelu MBZUAI, choć porównania dostawców są zwykle podawane inaczej — mieści się w zakresie, który inny harness, inne ustawienie nakładu pracy albo miesiąc niezależnej analizy mógłby zamknąć lub odwrócić. Kto wybiera między tymi dwoma modelami w oparciu o trzy punkty w rankingu, ten optymalizuje najmniej stabilną zmienną w całym porównaniu. Stabilne zmienne to te, które nie drgną, gdy pojawi się nowa ewaluacja: czy model działa w obrębie twojego perymetru, czy wagi istnieją, czy proces treningowy jest udokumentowany oraz czy istnieje cena, którą da się wpisać do budżetu.

Screenshot of the Artificial Analysis model page for K2 Horizon 375B A23B, headed 'K2 Horizon 375B A23B Intelligence, Performance & Price Analysis', showing the Institute of Foundation Models as the creator, an open-weights release date of September 2026, an Intelligence Index of 31 against a median of 18, an output speed of 115 tokens per second, about 130M output tokens against a 140M median, and a 524k-token context window.

Na te pytania K2 Horizon 375B A23B odpowiada „tak” na pierwsze trzy i „nie” na ostatnie — można go pobrać, jest udokumentowany i objęty licencją Apache 2.0, i nie ma opublikowanej ceny komercyjnej. Step 5 Preview odpowiada odwrotnie: ma cenę, można go wywołać, jest mierzalny i zamknięty, dopóki nie zostanie spełniona obietnica. Żadna z list nie jest lepsza w abstrakcji; są lepsze dla różnych zespołów, a rozstrzygnięcie nie polega na możliwościach.

Dla rozwiązania pośredniego — zespołów, które chcą porównać, zanim zainwestują w sprzęt lub podpiszą umowę — użytecznym podejściem jest utrzymanie obu ścieżek dostępnych na jednym kluczu. OrcaRouter kieruje ponad 200 modeli za jednym API z zerowym narzutem i przekazywaną ceną katalogową dostawcy, z automatycznym przełączaniem awaryjnym oraz DSL routingu, dzięki czemu modele, względem których testujesz nowy flagowiec, można wywołać od razu, a zmiana ceny dostawcy dociera do twojego klucza tego samego dnia. Ani K2 Horizon 375B A23B, ani Step 5 Preview nie znajdują się dziś w tym katalogu: model MBZUAI to plik do samodzielnego hostowania, a flagowiec StepFun nie jest przez nas routowany. Właśnie dlatego porównanie warto przeprowadzić na neutralnym gruncie, który już masz, a nie na czyimkolwiek placu zabaw dostawcy, który akurat otworzyłeś jako pierwszy.

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models, showing 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a credits panel.

Który i kiedy

Wybierz K2 Horizon 375B A23B, jeśli najważniejsze jest pobranie: jeśli Twoje dane muszą zostać na Twoim sprzęcie, jeśli chcesz przeczytać przepis treningowy, zanim zaufasz modelowi, jeśli okno 524K tokenów wystarcza i jeśli obciążeniem jest używanie narzędzi przez agentów. Wymieniasz około trzynastu punktów indeksu na model, który możesz poddać inspekcji, a dla wielu zespołów ta wymiana jest warta zachodu. Jego ślad aktywnych parametrów jest mniejszy niż we flagowym modelu StepFun, a jego laboratorium publicznie korygowało własne liczby w widoczny sposób — dorobek, który jest wart więcej niż trzy punkty indeksu, gdy opierasz produkcyjną ścieżkę na czyjejś karcie specyfikacji.

Wybierz Step 5 Preview, jeśli API jest tym, o co chodzi: jeśli chcesz wejście obrazowe, kontekst 1 mln tokenów, zmierzony wynik i opublikowaną cenę bez kupowania lub obsługiwania czegokolwiek, a także jeśli zamknięty model z obiecaną datą udostępnienia wag jest akceptowalny dla twojej organizacji. Jest też łatwiejszy z tych dwóch do wypróbowania w tym miesiącu, ponieważ był bezpłatny w interfejsach partnerskich przez cały październik, a tani pilotaż to prawdziwa zaleta, gdy alternatywą jest klaster.

Jeśli oba opisy pasują, uruchom agentową połowę swojego obciążenia na mniejszym, a połowę obejmującą długi kontekst i multimodalność na tym wycenionym, i wyceniaj ten podział według stawki za token, a nie według wyniku indeksowego. Potem sprawdź ponownie 15 października: jeśli obiecane wagi się pojawią, te dwa modele przestaną być różnymi rodzajami rzeczy i to stanie się bezpośrednim porównaniem — a jeśli nie, wybór nigdy tak naprawdę nie dotyczył trzech punktów.