
Step 5 Preview против Intern-S2 Mobius: нужен ли вам 600B-флагман или быстрый 35B-ризонер?
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 за 1 млн токенов
- openaiНОВИНКАOpenAI: GPT-6.1 Sol2026-09-2952Интеллект
- anthropicНОВИНКАAnthropic: Claude Sonnet 5.52026-09-2856Интеллект
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 за 1 млн токенов · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Интеллект
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Интеллект
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Интеллект
- xAIGrok 4.72026-09-2146Интеллект
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 за 1 млн токенов · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 за 1 млн токенов · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
Честная причина сравнивать Step 5 Preview с Intern-S2 Mobius не в том, что они похожи. Она в том, что это ответы на два разных вопроса от одного и того же покупателя — команды, которой нужно выполнять рабочую нагрузку рассуждений и у которой нет желания покупать кластер. У StepFun Step 5 Preview, анонсированная 20 сентября 2026 года, — это крупный ответ: примерно 600 миллиардов общих параметров при 27 миллиардах активных, контекст на 1 млн токенов, независимо измеренная оценка Artificial Analysis Intelligence Index — 44, и опубликованная цена $1.00 за миллион входных токенов и $2.70 за миллион выходных токенов. У InternLM Intern-S2 Mobius, выпущенная 29 июля 2026 года, — это маленький ответ: открытая по весам модель на 35 миллиардов параметров, построенная на архитектуре Mobius-v0, прошедшая continual-pretraining на базе Qwen3.5-35B, чья главная заявка — не способности, а скорость: примерно 4-кратное ускорение сквозной работы на бенчмарках рассуждений относительно базовой модели, на которой она обучалась, при полном отсутствии независимых оценок по бенчмаркам. Один — это флагман, который вы арендуете; другой — небольшая модель, которую вы запускаете. Сравнение на самом деле о том, оправдывает ли стоящая перед вами рабочая нагрузка флагман вообще.
Один организационный момент перед цифрами, потому что это отнимает у людей реальное время: InternLM выпустила несколько моделей под именем Intern-S2, и это не одно и то же. Intern-S2-397B — научный мультимодальный флагман; Intern-S2 Mobius — обсуждаемая здесь эффективная 35B-модель рассуждений; более ранний выпуск Intern-S2 — снова отдельная модель. Если вы ищете «Intern-S2» и попадаете на таблицы бенчмарков для модели 397B, вы читаете о другой контрольной точке.
Что на самом деле утверждает каждая модель
Заявленные характеристики Step 5 Preview — это стандартный набор для флагмана 2026 года, и одно из этих утверждений проверено независимо. StepFun указывает около 600 млрд общих параметров при 27 млрд активных, ввод текста и изображений, контекстное окно на 1 млн токенов и цену $1,00/$2,70 за миллион входных и выходных токенов. Artificial Analysis оценивает модель в 44 балла по своему Intelligence Index, что выше медианы 26 для сопоставимых моделей, при этом скорость вывода составляет 87 токенов в секунду против среднего значения 78, а объём сгенерированных выходных токенов по всему набору задач индекса — около 160 млн против медианы 82 млн, то есть примерно вдвое превышает типичный «многословный след», что важно для модели с оплатой по выходным токенам.
Утверждение Intern-S2 Mobius носит архитектурный и более узкий характер. Его дизайн отделяет знания от вычислений: глобально разделяемая Memory хранит векторы знаний, а несколько Reasoners итеративно запрашивают и уточняют скрытые состояния относительно неё, вместо того чтобы связывать хранение и вычисления слой за слоем, как это делает обычный трансформер. Заявленный выигрыш InternLM — примерно 4-кратное ускорение сквозной работы на бенчмарках рассуждений по сравнению с Qwen3.5-35B, от которого она происходит, при сопоставимых или более высоких оценках рассуждений, а также более коротких видимых цепочках рассуждений. Модель распространяется под Apache 2.0, принимает текстовый и графический ввод, и её можно скачать.
• Масштаб — Step 5 Preview: около 600B всего, 27B активных по данным StepFun против Intern-S2 Mobius: 35B всего.
• Независимая оценка — Step 5 Preview: 44 в индексе Artificial Analysis Intelligence Index против Intern-S2 Mobius: ни один не опубликован третьей стороной.
• Скорость — Step 5 Preview: 87 выходных токенов в секунду против среднего значения 78, по данным индексного табло в сравнении с Intern-S2 Mobius: «почти в 4 раза» относительно его собственного базового уровня Qwen3.5-35B, заявлено поставщиком и не воспроизведено.
• Контекстное окно — Step 5 Preview: 1 млн токенов у StepFun против Intern-S2 Mobius: независимые данные о размере контекста не опубликованы.
• Цена — Step 5 Preview: $1.00 за вход / $2.70 за выход за миллион токенов против Intern-S2 Mobius: API-цена отсутствует; вы платите за оборудование.
• Лицензия и доступ — Step 5 Preview: закрытое превью через API вендора, веса BF16 обещаны на 15 октября 2026 г. против Intern-S2 Mobius: веса под Apache 2.0 доступны уже сейчас.
• Многословность — Step 5 Preview: около 160 млн выходных токенов по всему набору индексов против медианы в 82 млн, согласно таблице индексов в сравнении с Intern-S2 Mobius: более короткие видимые цепочки рассуждений, заявленные InternLM, никем больше не измеренные.
Утверждение о 4x — и почему именно это число здесь интересно
Сравните показатели двух вендоров бок о бок — и несоответствие очевидно: у StepFun в заголовке стоит оценка возможностей, у InternLM — множитель пропускной способности. Это не совпадение, и это самое полезное в данном сравнении. Четырёхкратное ускорение сквозного выполнения задач рассуждения, если оно выдержит проверку в чужом испытательном стенде, для высоконагруженного развёртывания ценнее, чем несколько пунктов в индексе — оно меняет саму арифметику запуска этой нагрузки. Intern-S2 Mobius нацелена на команды, чьё узкое место — токены в секунду на доллар, а не предельные возможности.
Оговорка: множитель измеряется относительно Qwen3.5-35B — модели, из которой Intern-S2 Mobius была получена путём непрерывного предобучения и которая никогда не проходила обучение Mobius. Это сравнение с собственной отправной точкой, а не с конкурентом. Нет независимого воспроизведения заявленной пропускной способности, нет сторонней оценки по индексам, и никто, кроме самого производителя, не публиковал окно контекста. Воспринимайте «почти 4x» как интересный архитектурный сигнал и гипотезу, которую стоит проверить на собственном стенде, а не как спецификацию.
У Step 5 Preview противоположный профиль доказательности. Его показатель возможностей измеряется независимо; слабое место — история его эффективности. Показатель многословности индексной панели — около 160 миллионов выходных токенов, тогда как медианная модель выдаёт около 82 миллионов, — служит честным противовесом цене вывода в 2,70 доллара, и это означает, что рабочая нагрузка, опирающаяся на длинные структурированные генерации, будет тратить существенно больше, чем предполагает ценник. А вот что у неё есть, а у Intern-S2 Mobius нет, — так это вообще опубликованная цена API, и именно это в первую очередь делает её сопоставимой.
Репозиторий Hugging Face для обещанной вендорской сборки рассказывает вторую половину истории: вот как выглядит релиз с открытыми весами, когда о нём уже объявили, но ещё не выпустили.

Где вопрос о следе действительно встаёт ребром
Настоящее преимущество Intern-S2 Mobius заключается не в его оценке, которую никто не измерял, а в том, во сколько обходится ошибка в отношении него. Тридцать пять миллиардов параметров — это размер, который команда может обслуживать на уже имеющемся у неё оборудовании, оценивать без закупочного заказа и бросить, ничего не списывая. Это структурное преимущество, которое флагман не может повторить, сколько бы баллов он ни набрал, и именно поэтому это сравнение стоит проводить, а не отмахиваться от него как от неравного сопоставления.

Преимущество флагмана — зеркальное отражение. Контекст Step 5 Preview в 1 млн токенов, ввод изображений и измеренная способность к общим рассуждениям покрывают задачи, которые 35B-модель вряд ли сможет хорошо покрыть, а попробовать ничего не стоит на протяжении бесплатного окна — в октябре модель была бесплатной на трёх отдельных площадках для разработчиков. Ни один из этих фактов недоступен для self-hosted-модели: нет бесплатной недели для запуска собственных GPU, и нет прайс-листа, который превращает решение в отдельную статью расходов.
Если вы хотите, чтобы сравнение пережило промо-окно, строить нужно не предпочтение, а испытательный стенд. OrcaRouter маршрутизирует более 200 моделей за одним API-ключом и одним счётом с наценкой 0% и ценой из прайс-листа провайдера, передаваемой без изменений, с автоматическим переключением при сбое и DSL-маршрутизацией для управления трафиком по стоимости, задержке или возможностям. Ни Step 5 Preview, ни Intern-S2 Mobius нет в этом каталоге — флагман StepFun не маршрутизируется нами, а Intern-S2 Mobius — это загрузка для самостоятельного развёртывания, — поэтому ценность здесь не в доступе ни к одному из них. Она в том, что модели, с которыми вы будете их сравнивать, находятся на расстоянии одного ключа, а решение, принятое по измерениям, движется вместе с доказательствами, а не с постом о запуске в блоге.

Как решить
Если ваша рабочая нагрузка агентная, мультимодальная, с длинным контекстом или открытая — такая, где вы не можете заранее перечислить задачи, — флагман и есть ответ, а Step 5 Preview — разумный её экземпляр: измеренный, с ценой, дешёвый для пилотного запуска и обратимый по токенам. Просто закладывайте бюджет на многословность, а не на заявленную ставку.
Если ваша рабочая нагрузка — это узкие, повторяющиеся, высокообъёмные рассуждения по данным, которые должны оставаться внутри вашего периметра, то ответ — небольшая модель, и Intern-S2 Mobius — реальный кандидат именно потому, что она небольшая: она работает на имеющемся у вас оборудовании, распространяется под Apache 2.0, а заявление о скорости, если оно подтвердится, — это как раз то, что решает вопрос юнит-экономики. Приступайте к делу, понимая, что вы проверяете заявление поставщика, а не наследуете чужой вердикт.
Ошибка — считать этот выбор окончательным. Сначала купите оценку малой модели, потому что это дешёвый эксперимент; арендуйте флагманскую модель для задач, с которыми малая не справляется, потому что это дешёвый ремонт. Команды, которые сохраняют оба варианта доступными на одном ключе и в одном и том же стенде, в итоге принимают это решение на основе собственных данных, и только такая версия этого решения выдерживает проверку, когда любой из поставщиков выпускает преемника.
