Сгенерированная главная карточка, сравнивающая Intern-S2-397B и Grok 4.6, показывающая слева научную модель с открытыми весами с переключателем режима рассуждений, помеченным enable_thinking, и графиком временного ряда, а справа — закрытую облачную конечную точку с регулятором усилия рассуждений и иконками серверных инструментов, помеченную контрастом между контролем при самостоятельном хостинге Apache-2.0 и тарифицируемым API за $2 / $6, с логотипом OrcaRouter в правом нижнем углу.
Guides & Insights

Intern-S2-397B против Grok 4.6: кому крутить ручки

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Intern-S2-397B и Grok 4.6 вышли примерно с разницей в месяц и отвечают на один и тот же глубинный вопрос противоположными способами: кому достаётся контроль над рассуждениями. Grok 4.6, флагман xAI, запущенный 12 августа 2026 года, продаёт вам ручку настройки — настраиваемый регулятор усилия рассуждений в закрытом API по цене $2,00 за миллион входных токенов и $6,00 за миллион выходных токенов, с окном в 500 000 токенов и серверными инструментами xAI, тарифицируемыми дополнительно. Intern-S2-397B, научная мультимодальная модель с 403 миллиардами параметров, которую команда InternLM Шанхайской лаборатории искусственного интеллекта выпустила под лицензией Apache-2.0 13 сентября, передаёт вам всю машину — веса, переключатель режима размышления, визуальный тракт, голову для временных рядов — и предполагает, что запускать её будете вы сами. Одна из них сдаётся в аренду вместе с ручками настройки; другая — в полной вашей собственности. Важное здесь сравнение не в том, кто набирает больше баллов в таблице бенчмарков; оно в том, какой тип контроля действительно нужен вашей нагрузке и сколько стоит каждый из них.

Два разных циферблата

Самый чистый способ увидеть разницу между этими двумя — посмотреть, где находятся средства управления рассуждениями. Grok 4.6 предоставляет настройку уровня усилий для рассуждений через API xAI, а вокруг неё располагается набор серверных инструментов — вызов функций, веб-поиск, поиск по X, выполнение кода — которые xAI обслуживает и тарифицирует отдельно. Вы настраиваете уровень усилий, выстраиваете в цепочку предоставленные вам инструменты и никогда не касаетесь ни одного веса. Поведение модели — это собственность xAI и проблема xAI; ваш рычаг — параметр в запросе.

Intern-S2-397B даёт вам другой набор рычагов, и они находятся ниже в стеке. По умолчанию мышление включено, и вы отключаете его для каждого запроса с помощью enable_thinking=False. Поскольку модель распространяется под лицензией Apache-2.0, вы также можете взять веса и дообучить само поведение рассуждения на своих данных, а затем запускать результат на LMDeploy, vLLM или SGLang. Набор её входных данных шире, чем у API для текста и изображений: она принимает сигналы временных рядов и выдаёт прогнозы — возможность, которая сейчас реализована только через LMDeploy, — и она обучалась для долгосрочной работы агентов в изолированных средах. Компромисс столь же очевиден — такой уровень контроля имеет смысл, только если вы готовы эксплуатировать оборудование и стек обслуживания, которые идут с ним.

• Управление рассуждениями — Grok 4.6: регулятор усилий рассуждения в закрытом API против Intern-S2-397B: переключатель enable_thinking плюс полный контроль на уровне весов под Apache-2.0.

• Инструменты — Grok 4.6: серверный веб-поиск, поиск по X и выполнение кода от xAI, тарифицируемые отдельно, в отличие от Intern-S2-397B: вызов инструментов, который вы подключаете сами, плюс путь прогнозирования временных рядов через LMDeploy.

• Входные данные — Grok 4.6: текст, изображение, файл против Intern-S2-397B: текст, изображение, временные ряды.

• Контекст — Grok 4.6: 500 000 токенов против Intern-S2-397B: 256K для текстовых рассуждений, 64K для мультимодальных данных, обе цифры взяты из карточки модели.

• Цена — Grok 4.6: $2.00 / $6.00 за 1 млн токенов, с повышением до $4.00 / $12.00 после 200 тыс. токенов; в сравнении с Intern-S2-397B: тарифной сетки нет; собственный хостинг или официальный API Intern.

Что на самом деле охватывают эти цифры

Каждый приведённый ниже показатель Intern-S2-397B — собственный показатель InternLM, полученный через OpenCompass, VLMEvalKit и AgentCompass и опубликованный вместе с весами без независимого воспроизведения. Числа Grok 4.6 — это совсем другое: они накапливались в публичной арене и Artificial Analysis после запуска модели, поэтому несут ярлык третьей стороны.

На стороне независимых измерений Grok 4.6 находится на отметке 44 в текущем Индексе интеллекта Artificial Analysis, с показателями GPQA Diamond 94.9, Humanity's Last Exam 61.0 и оценкой за программирование 76.8, а Artificial Analysis оценивает его результат TerminalBench 2.1 почти в 80.3. На стороне производителя карточка Intern-S2-397B сообщает о 89.77 в MMLU Pro, 93.56 в HMMT-2026, 81.68 в MMMU Pro и 68.54 в SWE-bench-Pro, а также о научных строках, где он выглядит как представитель другого вида: 55.71 в Biology-Instructions, 63.28 в SciReasoner 1.5, 53.95 в Mol-Instructions, 62.35 в MolecularIQ. Единственное число в таблице производителя, которое должно заставить разработчика агентов вздрогнуть, — это TerminalBench 2.1 с 64.04: показатель, по которому, как сообщают сами создатели модели, она с большим отрывом проигрывает более старому закрытому поколению — именно в той нише терминальной работы, где особенно сильна арендуемая фронтирная модель вроде Grok 4.6.

Воспринимайте это расхождение как портрет, а не как рейтинг. Intern-S2-397B — научный специалист, который при этом является компетентной универсальной моделью; Grok 4.6 — универсал, проявляющий мимолётный интерес к науке. Перекос в научных строках ожидаем — ни одна флагманская универсальная модель не предобучалась на необработанных страницах научной литературы, где вместе присутствуют иллюстрации, вёрстка и символьные обозначения, и именно вокруг этой парадигмы построена Intern-S2-397B. Ничто ни в одной из двух доказательных баз не поддерживает утверждение, что «Intern-S2-397B так же хороша, как Grok 4.6, в произвольных рассуждениях», и ничто в доказательствах Grok 4.6 не указывает на то, что эту модель настраивали для анализа мультиомных последовательностей.

Цена контроля

У Grok 4.6 есть цена, которую можно занести в таблицу: $2,00 за миллион входных токенов и $6,00 за миллион выходных, причём тариф растёт до $4,00 / $12,00, как только запрос превышает 200 000 токенов, плюс опциональный приоритетный уровень для более быстрых ответов. Он доступен через OrcaRouter по прайс-листовой цене x​AI, передаваемой с наценкой 0%, так что изменение тарифа у x​AI отражается здесь в тот же день без посреднической дельты — цена того, что вы арендуете, остаётся такой, какой её устанавливает поставщик.

У Intern-S2-397B вообще нет опубликованного тарифа за токен. В карточке модели упоминается официальный Intern API, но экономика, которую люди на самом деле хотят сравнить, — это экономика самостоятельного хостинга: чекпоинт с 403 млрд параметров, примерно 807 ГБ весов, разбитых на 188 шардов в BF16, то есть серьёзный узел с несколькими GPU, при этом сборка FP8 примерно вдвое уменьшает занимаемый объём. Если такая мощность у вас уже есть, предельная стоимость следующего научного запроса приближается к стоимости электроэнергии, и в этом весь смысл позиции Apache-2.0. Если её у вас нет, «бесплатная» модель — это пилот по капитальным затратам, а не статья расходов.

Что роутер даёт в этом конкретном противостоянии — это стык, а не цена. Grok 4.6 работает по ключу, который у вас уже есть для общего продакшн-трафика; Intern-S2-397B не маршрутизируется через OrcaRouter — это совершенно новый чекпойнт, и путь к нему лежит через собственный API производителя или развёртывание на своих серверах. Направьте общие рассуждения, чувствительные к задержке, на тарифицируемую модель, оставьте научную пакетную работу на модели, которую вы запускаете сами, и пусть автоматическое переключение при сбое подстрахует вас, когда конечная точка любой из сторон недоступна. Граница между ними становится правилом маршрутизации, а не второй интеграцией.

A generated two-column scoreboard titled Intern-S2-397B vs Grok 4.6 — the scoreboard. Left column Intern-S2-397B: Weights Apache-2.0 open; Reasoning control toggle plus full weight control; Inputs text, image, time series; Context 256K text / 64K multimodal; Independent score none yet; TerminalBench 2.1 64.04 vendor-reported. Right column Grok 4.6: Weights closed API only; Reasoning control effort dial; Inputs text, image, file; Context 500K tokens; Independent score AA Index 44, GPQA 94.9; TerminalBench 2.1 80.3 per Artificial Analysis. Footer reads Intern-S2-397B figures are InternLM's own, unreproduced; Grok 4.6 figures per Artificial Analysis and the vendor.

Какой выбрать?

Выбирайте Grok 4.6, когда задача общая, рассуждения должны возвращаться быстро и корректно, а владеть стеком, который их производит, вам не хочется. Его окно в 500K, измеренный результат GPQA Diamond на уровне 94.9 и набор инструментов — это продакшен-возможности, а тариф $2/$6 — это плата за то, что вам не нужно ничего эксплуатировать.

Выбирайте Intern-S2-397B, когда входные данные научные — статья с множеством рисунков, молекулярная диаграмма, сигнал временного ряда — и когда рассуждения должны происходить на данных, которые не могут покинуть вашу среду, или на поведении, которое вы хотите дообучить сами. Apache-2.0 делает это возможным; ни один арендованный API этого не может. Заложите бюджет на оборудование, не рассчитывайте какое-то время на независимую таблицу результатов и относитесь к каждому числу в его карточке как к утверждению, пока кто-нибудь за пределами InternLM не воспроизведёт хотя бы одно.

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence, the description of Intern-S2-397B as a 403-billion-parameter multimodal foundation model for scientific intelligence and long-horizon agents, and the note that text reasoning benchmarks use a 256K inference length while multimodal benchmarks use 64K.A screenshot of the OrcaRouter model page for Grok 4.6 at orcarouter.ai/models/grok/grok-4.6, captured September 13, 2026, showing the model listing with its provider SpaceXAI, 500,000-token context window, and $2.00 / $6.00 per-million-token pricing displayed alongside the surrounding catalogue.