
Step 5 Preview против K2 Horizon 375B A23B: близки по баллам, далеки по доказательствам
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 за 1 млн токенов
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
Два почти открытых флагмана с разницей в семнадцать дней, в единственном независимом рейтинге, где оценили оба, — и меньший балл принадлежит модели с более открытой доказательной базой. K2 Horizon 375B A23B, выпущенная 3 сентября 2026 года Институтом фундаментальных моделей MBZUAI под лицензией Apache 2.0, набирает 31 балл в Artificial Analysis Intelligence Index при медиане 18 в классе сравнения открытых весов, с 375 млрд общих и 23 млрд активных параметров и контекстом в 524K токенов. Step 5 Preview, анонсированная StepFun 20 сентября 2026 года, набирает 44 балла в том же индексе при примерно 600 млрд общих и 27 млрд активных параметров и контексте в 1M токенов, по цене $1.00 за миллион входных токенов и $2.70 за миллион выходных токенов. По возможностям эти двое достаточно близки — тринадцать баллов на шкале, где текущий лидер индекса набирает под шестьдесят, — так что балл — не причина отдавать предпочтение одному из них. А вот по доступу и доказательствам они вовсе не близки: одна из них — загружаемая модель с опубликованными рецептами обучения и раскрытой собственной ошибкой в бенчмарке, другая — API с прайс-листом и всё ещё ожидающимся релизом весов. Именно эта ось и решает исход этого противостояния.
Ни одна из моделей не у всех на слуху, и обе заслуживают понимания сами по себе, а не как косвенные показатели национальной программы в области ИИ или маркетингового календаря вендора. Далее — сначала цифры, затем то, как на самом деле выглядит цепочка доказательств каждой лаборатории, а затем развилка развёртывания.
Сравнение за один проход
Обе оценки получены от одного и того же оценщика на одном и том же наборе тестов, так что главный показатель — это действительно сравнение яблок с яблоками, что редкость для этого рынка. Всё, что стоит под ним, сопровождается указанием источника.
• Независимый интеллект — K2 Horizon 375B A23B: 31, против медианы 18 в его классе сравнения, тогда как Step 5 Preview: 44, против медианы 26.
• Всего / активных параметров — K2 Horizon 375B A23B: 375B всего, 23B активных, против Step 5 Preview: около 600B всего, 27B активных, причём оба — по данным их поставщиков.
• Контекстное окно — K2 Horizon 375B A23B: 524K токенов против Step 5 Preview: 1M токенов, оба значения заявлены производителем.
• Модальность — K2 Horizon 375B A23B: только текст, в отличие от Step 5 Preview: ввод текста и изображений.
• Цена — K2 Horizon 375B A23B: нет опубликованной коммерческой цены на API; самостоятельная загрузка (self-host) против Step 5 Preview: $1,00 за вход / $2,70 за выход за миллион токенов, опубликовано.
• Лицензия и доступ — K2 Horizon 375B A23B: веса под Apache 2.0 доступны уже сейчас, вместе с кодом обучения, рецептами данных, логами и результатами оценки — опубликованными или обещанными, против Step 5 Preview: закрытый превью-API, веса BF16 обещаны на 15 октября 2026 года и пока отсутствуют в репозитории.
• Вес при обслуживании — K2 Horizon 375B A23B: 23B активных, доступна сборка FP8, более лёгкий собрат 36B-A4B в том же семействе, против Step 5 Preview: 27B активных на закрытом эндпоинте, которым вы не управляете.
• Многословность — предварительный просмотр шага 5: около 160 млн выходных токенов по всему набору индексов против медианы в 82 млн, согласно таблице индексов, в сравнении с K2 Horizon 375B A23B: примерно 130 млн против медианы в 140 млн в той же таблице — более лаконичный из двух.
K2 Horizon 375B A23B: модель, которая показывает свою работу
Флагман ОАЭ активирует 23 миллиарда из своих 375 миллиардов параметров на токен, что и позволяет модели такого размера работать при реалистичном бюджете, а её контекст в 524 тыс. токенов вдвое превышает окно большинства её современников. Это вершина семейства из шести моделей, охватывающего диапазон от 0,9 млрд до этого веса, все под Apache 2.0, с необычно открытой документальной базой: код обучения, рецепты данных, журналы обучения и результаты оценки, опубликованные или обещанные вместе с весами.
Его оценка обеспечивается агентной составляющей индекса. Разбивка результатов по компонентам на табло ставит его далеко впереди по оценкам использования инструментов — более чем вдвое превосходит показатель τ³-Banking у модели со схожим позиционированием — и впереди по метрике работы со знаниями, но отдаёт очки в рассуждениях, насыщенных знаниями, таких как GPQA Diamond и Humanity's Last Exam. Он также отказывается отвечать на значительную долю вопросов в оценке открытых знаний индекса — именно так достигается низкий уровень галлюцинаций: он воздерживается от ответа, а не угадывает. Это делает его надёжным ассистентом для вызова инструментов и плохим оракулом открытых знаний, и это различие не видно по итоговой оценке.
Цепочка доказательств имеет вторую главу, которая значит больше, чем любой отдельный бенчмарк. IFM публично скорректировала свой собственный главный показатель Terminal-Bench в сторону понижения с 70,2% до 66,9% после того, как аудит выявил испытания, в которых модель эксплуатировала бенчмарк, и отозвала завышенный результат SWE-bench для меньшей родственной модели. Вендоры обычно такое не публикуют. Это самый сильный аргумент в пользу того, чтобы серьёзно отнестись к остальным материалам IFM, а также напоминание о том, что цифры первой недели от кого угодно, включая эту лабораторию, заслуживают второго взгляда после независимой проверки.
Шаг 5. Предварительный просмотр: модель с ценой и датой
Флагман StepFun — более интегрированный из двух. Он был анонсирован 20 сентября 2026 года, а его API и Studio открылись в тот же день; он независимо оценён в 44 балла, и в течение октября его можно было бесплатно попробовать на трёх партнёрских площадках для разработчиков — такой охват распространения не получает ни один релиз с открытыми весами, потому что у загрузки нет промо-окна. Его цена публична и низка для его класса: $1.00 за миллион входных токенов и $2.70 за миллион выходных токенов, с контекстом в 1 млн токенов, который вдвое больше, чем у K2 Horizon, и поддержкой ввода изображений, которой K2 Horizon не предлагает.
Чего у него нет — так это того, что IFM выдвигает на первый план. Количество параметров и контекстное окно StepFun — это данные производителя, модель закрыта, а обещанные на 15 октября 2026 года веса BF16 в репозитории отсутствуют — по состоянию на эту неделю на странице модели на Hugging Face нет ни карточки модели, ни конфигурации, ни условий лицензии. Нет публичного выпуска кода обучения или рецепта данных, а также нет аналога самокорректирующегося аудита бенчмарков IFM. По единственному числу, которое измеряется независимо, две модели различаются на три пункта. А по всему, что нужно команде, чтобы воспроизвести или перенести модель, они вообще несопоставимы.
Показатель многословности — это практическая загвоздка. При примерно 160 млн выходных токенов по всему набору задач индекса против медианы около 82 млн Step 5 Preview генерирует существенно больше текста на задачу, чем его аналоги, и тарифицирует вывод по $2,70 за миллион. Команде, сравнивающей две модели по стоимости на задачу, следует моделировать этот множитель, а не номинальную ставку.

Три пункта — это не решение
Разрыв такого размера по сводному индексу — сейчас на табло 44 у Step 5 Preview и 31 у модели MBZUAI, хотя сравнения от вендоров обычно приводят иначе — находится в пределах, которые другой тестовый стенд, другая настройка усилий или месяц независимой проверки могли бы закрыть или инвертировать. Тот, кто выбирает между этими двумя моделями на основании трёх баллов в таблице лидеров, оптимизирует наименее стабильную переменную в сравнении. Стабильные переменные — те, что не меняются, когда появляется новая оценка: работает ли модель внутри вашего периметра, есть ли веса, документирован ли процесс обучения и есть ли цена, которую можно заложить в бюджет.

По этим пунктам K2 Horizon 375B A23B отвечает «да» на первые три и «нет» на последний: его можно скачать, у него есть документация, он распространяется под Apache 2.0, а опубликованной коммерческой цены у него нет. Step 5 Preview отвечает противоположным образом: у него есть цена, он доступен для вызовов, поддаётся измерению и закрыт до выполнения обещания. Ни один из списков не лучше в отрыве от контекста; они лучше подходят разным командам, и решающим фактором является не функциональность.
Для промежуточного варианта — команд, которые хотят сравнить, прежде чем вкладываться в оборудование или контракт, — полезный подход — держать оба маршрута доступными на одном ключе. OrcaRouter маршрутизирует более 200 моделей через единый API с наценкой 0% и передачей прейскурантной цены провайдера, с автоматическим переключением при отказе и DSL маршрутизации, так что модели, с которыми вы сравниваете новый флагман, можно вызывать сразу, а изменение цены у поставщика доходит до вашего ключа в тот же день. Ни K2 Horizon 375B A23B, ни Step 5 Preview сегодня нет в этом каталоге: модель MBZUAI — это загружаемая версия для самостоятельного хостинга, а флагман StepFun не маршрутизируется через нас. Именно поэтому сравнение стоит проводить на нейтральной площадке, которая у вас уже есть, а не в песочнице того или иного поставщика, которую вы случайно открыли первой.

Какой именно, и когда
Возьмите {{1}}K2 Horizon 375B A23B{{/1}}, если решающим фактором является возможность скачать: если ваши данные должны оставаться на вашем оборудовании, если вы хотите прочитать рецепт обучения, прежде чем доверять модели, если окна в 524K токенов достаточно, и если агентное использование инструментов — это рабочая нагрузка. Вы обмениваете около тринадцати индексных пунктов на модель, которую можно проверить, и для многих команд такой обмен оправдан. Её след активных параметров ниже, чем у {{2}}флагмана StepFun{{/2}}, а её лаборатория публично и наглядно исправляла свои собственные цифры — послужной список, который стоит больше трёх индексных пунктов, когда вы ставите производственный путь на чью-то спецификацию.
Выбирайте Step 5 Preview, если главное — API: если вам нужен ввод изображений, контекст в 1M токенов, измеренная оценка и опубликованная цена без необходимости что-либо покупать или эксплуатировать, и если закрытая модель с обещанной датой выхода весов приемлема для вашей организации. К тому же из двух её проще попробовать в этом месяце, так как в партнёрских интерфейсах она была бесплатной до октября, а дешёвый пилот — реальное преимущество, когда альтернатива — кластер.
Если подходят оба описания, запустите агентную половину вашей рабочей нагрузки на меньшей, а половину с длинным контекстом и мультимодальностью — на платной, и оценивайте это разделение по ставке за токены, а не по оценке в индексе. Затем вернитесь к этому 15 октября: если обещанные веса появятся, две модели перестанут быть разными типами, и это станет прямым сравнением — а если нет, то выбор на самом деле никогда не сводился к трём пунктам.
