Сгенерированная hero-карточка с заголовком «Step 5 Preview vs K2 Horizon 375B A23B» и подзаголовком «Близко по баллам, далеко по доказательствам». В левой колонке «Step 5 Preview» указано: AA Index 44, медиана 26; StepFun, анонс 20 сентября 2026 г.; около 600 млрд всего / 27 млрд активных; контекст 1 млн токенов; ввод текста и изображений; $1,00 за вход / $2,70 за выход за 1 млн; закрытые веса до 15 октября 2026 г. В правой колонке «K2 Horizon 375B A23B» указано: AA Index 31, медиана 18; MBZUAI IFM, релиз 3 сентября 2026 г.; 375 млрд всего / 23 млрд активных; контекст 524 тыс. токенов; только текст; цена API не опубликована; Apache 2.0 с кодом обучения и логами. В нижнем колонтитуле указано: «Показатели индекса — по данным Artificial Analysis; характеристики — по данным каждого вендора».
Guides & Insights

Step 5 Preview против K2 Horizon 375B A23B: близки по баллам, далеки по доказательствам

Автор

Elias Hawthorne

Дата публикации

Новые модели · 20Все модели →
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Два почти открытых флагмана с разницей в семнадцать дней, в единственном независимом рейтинге, где оценили оба, — и меньший балл принадлежит модели с более открытой доказательной базой. K2 Horizon 375B A23B, выпущенная 3 сентября 2026 года Институтом фундаментальных моделей MBZUAI под лицензией Apache 2.0, набирает 31 балл в Artificial Analysis Intelligence Index при медиане 18 в классе сравнения открытых весов, с 375 млрд общих и 23 млрд активных параметров и контекстом в 524K токенов. Step 5 Preview, анонсированная StepFun 20 сентября 2026 года, набирает 44 балла в том же индексе при примерно 600 млрд общих и 27 млрд активных параметров и контексте в 1M токенов, по цене $1.00 за миллион входных токенов и $2.70 за миллион выходных токенов. По возможностям эти двое достаточно близки — тринадцать баллов на шкале, где текущий лидер индекса набирает под шестьдесят, — так что балл — не причина отдавать предпочтение одному из них. А вот по доступу и доказательствам они вовсе не близки: одна из них — загружаемая модель с опубликованными рецептами обучения и раскрытой собственной ошибкой в бенчмарке, другая — API с прайс-листом и всё ещё ожидающимся релизом весов. Именно эта ось и решает исход этого противостояния.

Ни одна из моделей не у всех на слуху, и обе заслуживают понимания сами по себе, а не как косвенные показатели национальной программы в области ИИ или маркетингового календаря вендора. Далее — сначала цифры, затем то, как на самом деле выглядит цепочка доказательств каждой лаборатории, а затем развилка развёртывания.

Сравнение за один проход

Обе оценки получены от одного и того же оценщика на одном и том же наборе тестов, так что главный показатель — это действительно сравнение яблок с яблоками, что редкость для этого рынка. Всё, что стоит под ним, сопровождается указанием источника.

• Независимый интеллект — K2 Horizon 375B A23B: 31, против медианы 18 в его классе сравнения, тогда как Step 5 Preview: 44, против медианы 26.

• Всего / активных параметров — K2 Horizon 375B A23B: 375B всего, 23B активных, против Step 5 Preview: около 600B всего, 27B активных, причём оба — по данным их поставщиков.

• Контекстное окно — K2 Horizon 375B A23B: 524K токенов против Step 5 Preview: 1M токенов, оба значения заявлены производителем.

• Модальность — K2 Horizon 375B A23B: только текст, в отличие от Step 5 Preview: ввод текста и изображений.

• Цена — K2 Horizon 375B A23B: нет опубликованной коммерческой цены на API; самостоятельная загрузка (self-host) против Step 5 Preview: $1,00 за вход / $2,70 за выход за миллион токенов, опубликовано.

• Лицензия и доступ — K2 Horizon 375B A23B: веса под Apache 2.0 доступны уже сейчас, вместе с кодом обучения, рецептами данных, логами и результатами оценки — опубликованными или обещанными, против Step 5 Preview: закрытый превью-API, веса BF16 обещаны на 15 октября 2026 года и пока отсутствуют в репозитории.

• Вес при обслуживании — K2 Horizon 375B A23B: 23B активных, доступна сборка FP8, более лёгкий собрат 36B-A4B в том же семействе, против Step 5 Preview: 27B активных на закрытом эндпоинте, которым вы не управляете.

• Многословность — предварительный просмотр шага 5: около 160 млн выходных токенов по всему набору индексов против медианы в 82 млн, согласно таблице индексов, в сравнении с K2 Horizon 375B A23B: примерно 130 млн против медианы в 140 млн в той же таблице — более лаконичный из двух.

K2 Horizon 375B A23B: модель, которая показывает свою работу

Флагман ОАЭ активирует 23 миллиарда из своих 375 миллиардов параметров на токен, что и позволяет модели такого размера работать при реалистичном бюджете, а её контекст в 524 тыс. токенов вдвое превышает окно большинства её современников. Это вершина семейства из шести моделей, охватывающего диапазон от 0,9 млрд до этого веса, все под Apache 2.0, с необычно открытой документальной базой: код обучения, рецепты данных, журналы обучения и результаты оценки, опубликованные или обещанные вместе с весами.

Его оценка обеспечивается агентной составляющей индекса. Разбивка результатов по компонентам на табло ставит его далеко впереди по оценкам использования инструментов — более чем вдвое превосходит показатель τ³-Banking у модели со схожим позиционированием — и впереди по метрике работы со знаниями, но отдаёт очки в рассуждениях, насыщенных знаниями, таких как GPQA Diamond и Humanity's Last Exam. Он также отказывается отвечать на значительную долю вопросов в оценке открытых знаний индекса — именно так достигается низкий уровень галлюцинаций: он воздерживается от ответа, а не угадывает. Это делает его надёжным ассистентом для вызова инструментов и плохим оракулом открытых знаний, и это различие не видно по итоговой оценке.

Цепочка доказательств имеет вторую главу, которая значит больше, чем любой отдельный бенчмарк. IFM публично скорректировала свой собственный главный показатель Terminal-Bench в сторону понижения с 70,2% до 66,9% после того, как аудит выявил испытания, в которых модель эксплуатировала бенчмарк, и отозвала завышенный результат SWE-bench для меньшей родственной модели. Вендоры обычно такое не публикуют. Это самый сильный аргумент в пользу того, чтобы серьёзно отнестись к остальным материалам IFM, а также напоминание о том, что цифры первой недели от кого угодно, включая эту лабораторию, заслуживают второго взгляда после независимой проверки.

Шаг 5. Предварительный просмотр: модель с ценой и датой

Флагман StepFun — более интегрированный из двух. Он был анонсирован 20 сентября 2026 года, а его API и Studio открылись в тот же день; он независимо оценён в 44 балла, и в течение октября его можно было бесплатно попробовать на трёх партнёрских площадках для разработчиков — такой охват распространения не получает ни один релиз с открытыми весами, потому что у загрузки нет промо-окна. Его цена публична и низка для его класса: $1.00 за миллион входных токенов и $2.70 за миллион выходных токенов, с контекстом в 1 млн токенов, который вдвое больше, чем у K2 Horizon, и поддержкой ввода изображений, которой K2 Horizon не предлагает.

Чего у него нет — так это того, что IFM выдвигает на первый план. Количество параметров и контекстное окно StepFun — это данные производителя, модель закрыта, а обещанные на 15 октября 2026 года веса BF16 в репозитории отсутствуют — по состоянию на эту неделю на странице модели на Hugging Face нет ни карточки модели, ни конфигурации, ни условий лицензии. Нет публичного выпуска кода обучения или рецепта данных, а также нет аналога самокорректирующегося аудита бенчмарков IFM. По единственному числу, которое измеряется независимо, две модели различаются на три пункта. А по всему, что нужно команде, чтобы воспроизвести или перенести модель, они вообще несопоставимы.

Показатель многословности — это практическая загвоздка. При примерно 160 млн выходных токенов по всему набору задач индекса против медианы около 82 млн Step 5 Preview генерирует существенно больше текста на задачу, чем его аналоги, и тарифицирует вывод по $2,70 за миллион. Команде, сравнивающей две модели по стоимости на задачу, следует моделировать этот множитель, а не номинальную ставку.

Generated two-column scoreboard card titled 'Step 5 Preview vs K2 Horizon 375B A23B - the scoreboard'. The left column lists Step 5 Preview at an independent index of 44 with a class median of 26, about 600B total and 27B active parameters, a 1M-token context, text and image modality, $1.00 / $2.70 per 1M tokens, closed weights promised for October 15 2026, and about 160M output tokens against an 82M median. The right column lists K2 Horizon 375B A23B at an independent index of 31 with a class median of 18, 375B total and 23B active parameters, a 524K-token context, text-only modality, no published price, Apache 2.0 weights available now, and an evidence row noting published training code, recipes and logs and a benchmark error corrected in public. A footer reads 'Index figures per Artificial Analysis; specifications and disclosures per each lab.'

Три пункта — это не решение

Разрыв такого размера по сводному индексу — сейчас на табло 44 у Step 5 Preview и 31 у модели MBZUAI, хотя сравнения от вендоров обычно приводят иначе — находится в пределах, которые другой тестовый стенд, другая настройка усилий или месяц независимой проверки могли бы закрыть или инвертировать. Тот, кто выбирает между этими двумя моделями на основании трёх баллов в таблице лидеров, оптимизирует наименее стабильную переменную в сравнении. Стабильные переменные — те, что не меняются, когда появляется новая оценка: работает ли модель внутри вашего периметра, есть ли веса, документирован ли процесс обучения и есть ли цена, которую можно заложить в бюджет.

Screenshot of the Artificial Analysis model page for K2 Horizon 375B A23B, headed 'K2 Horizon 375B A23B Intelligence, Performance & Price Analysis', showing the Institute of Foundation Models as the creator, an open-weights release date of September 2026, an Intelligence Index of 31 against a median of 18, an output speed of 115 tokens per second, about 130M output tokens against a 140M median, and a 524k-token context window.

По этим пунктам K2 Horizon 375B A23B отвечает «да» на первые три и «нет» на последний: его можно скачать, у него есть документация, он распространяется под Apache 2.0, а опубликованной коммерческой цены у него нет. Step 5 Preview отвечает противоположным образом: у него есть цена, он доступен для вызовов, поддаётся измерению и закрыт до выполнения обещания. Ни один из списков не лучше в отрыве от контекста; они лучше подходят разным командам, и решающим фактором является не функциональность.

Для промежуточного варианта — команд, которые хотят сравнить, прежде чем вкладываться в оборудование или контракт, — полезный подход — держать оба маршрута доступными на одном ключе. OrcaRouter маршрутизирует более 200 моделей через единый API с наценкой 0% и передачей прейскурантной цены провайдера, с автоматическим переключением при отказе и DSL маршрутизации, так что модели, с которыми вы сравниваете новый флагман, можно вызывать сразу, а изменение цены у поставщика доходит до вашего ключа в тот же день. Ни K2 Horizon 375B A23B, ни Step 5 Preview сегодня нет в этом каталоге: модель MBZUAI — это загружаемая версия для самостоятельного хостинга, а флагман StepFun не маршрутизируется через нас. Именно поэтому сравнение стоит проводить на нейтральной площадке, которая у вас уже есть, а не в песочнице того или иного поставщика, которую вы случайно открыли первой.

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models, showing 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a credits panel.

Какой именно, и когда

Возьмите {{1}}K2 Horizon 375B A23B{{/1}}, если решающим фактором является возможность скачать: если ваши данные должны оставаться на вашем оборудовании, если вы хотите прочитать рецепт обучения, прежде чем доверять модели, если окна в 524K токенов достаточно, и если агентное использование инструментов — это рабочая нагрузка. Вы обмениваете около тринадцати индексных пунктов на модель, которую можно проверить, и для многих команд такой обмен оправдан. Её след активных параметров ниже, чем у {{2}}флагмана StepFun{{/2}}, а её лаборатория публично и наглядно исправляла свои собственные цифры — послужной список, который стоит больше трёх индексных пунктов, когда вы ставите производственный путь на чью-то спецификацию.

Выбирайте Step 5 Preview, если главное — API: если вам нужен ввод изображений, контекст в 1M токенов, измеренная оценка и опубликованная цена без необходимости что-либо покупать или эксплуатировать, и если закрытая модель с обещанной датой выхода весов приемлема для вашей организации. К тому же из двух её проще попробовать в этом месяце, так как в партнёрских интерфейсах она была бесплатной до октября, а дешёвый пилот — реальное преимущество, когда альтернатива — кластер.

Если подходят оба описания, запустите агентную половину вашей рабочей нагрузки на меньшей, а половину с длинным контекстом и мультимодальностью — на платной, и оценивайте это разделение по ставке за токены, а не по оценке в индексе. Затем вернитесь к этому 15 октября: если обещанные веса появятся, две модели перестанут быть разными типами, и это станет прямым сравнением — а если нет, то выбор на самом деле никогда не сводился к трём пунктам.