
Intern-S2-397B против Grok 4.6: кому крутить ручки
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0240Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0340Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2134Интеллект69Кодинг
Intern-S2-397B и Grok 4.6 вышли примерно с разницей в месяц и отвечают на один и тот же глубинный вопрос противоположными способами: кому достаётся контроль над рассуждениями. Grok 4.6, флагман xAI, запущенный 12 августа 2026 года, продаёт вам ручку настройки — настраиваемый регулятор усилия рассуждений в закрытом API по цене $2,00 за миллион входных токенов и $6,00 за миллион выходных токенов, с окном в 500 000 токенов и серверными инструментами xAI, тарифицируемыми дополнительно. Intern-S2-397B, научная мультимодальная модель с 403 миллиардами параметров, которую команда InternLM Шанхайской лаборатории искусственного интеллекта выпустила под лицензией Apache-2.0 13 сентября, передаёт вам всю машину — веса, переключатель режима размышления, визуальный тракт, голову для временных рядов — и предполагает, что запускать её будете вы сами. Одна из них сдаётся в аренду вместе с ручками настройки; другая — в полной вашей собственности. Важное здесь сравнение не в том, кто набирает больше баллов в таблице бенчмарков; оно в том, какой тип контроля действительно нужен вашей нагрузке и сколько стоит каждый из них.
Два разных циферблата
Самый чистый способ увидеть разницу между этими двумя — посмотреть, где находятся средства управления рассуждениями. Grok 4.6 предоставляет настройку уровня усилий для рассуждений через API xAI, а вокруг неё располагается набор серверных инструментов — вызов функций, веб-поиск, поиск по X, выполнение кода — которые xAI обслуживает и тарифицирует отдельно. Вы настраиваете уровень усилий, выстраиваете в цепочку предоставленные вам инструменты и никогда не касаетесь ни одного веса. Поведение модели — это собственность xAI и проблема xAI; ваш рычаг — параметр в запросе.
Intern-S2-397B даёт вам другой набор рычагов, и они находятся ниже в стеке. По умолчанию мышление включено, и вы отключаете его для каждого запроса с помощью enable_thinking=False. Поскольку модель распространяется под лицензией Apache-2.0, вы также можете взять веса и дообучить само поведение рассуждения на своих данных, а затем запускать результат на LMDeploy, vLLM или SGLang. Набор её входных данных шире, чем у API для текста и изображений: она принимает сигналы временных рядов и выдаёт прогнозы — возможность, которая сейчас реализована только через LMDeploy, — и она обучалась для долгосрочной работы агентов в изолированных средах. Компромисс столь же очевиден — такой уровень контроля имеет смысл, только если вы готовы эксплуатировать оборудование и стек обслуживания, которые идут с ним.
• Управление рассуждениями — Grok 4.6: регулятор усилий рассуждения в закрытом API против Intern-S2-397B: переключатель enable_thinking плюс полный контроль на уровне весов под Apache-2.0.
• Инструменты — Grok 4.6: серверный веб-поиск, поиск по X и выполнение кода от xAI, тарифицируемые отдельно, в отличие от Intern-S2-397B: вызов инструментов, который вы подключаете сами, плюс путь прогнозирования временных рядов через LMDeploy.
• Входные данные — Grok 4.6: текст, изображение, файл против Intern-S2-397B: текст, изображение, временные ряды.
• Контекст — Grok 4.6: 500 000 токенов против Intern-S2-397B: 256K для текстовых рассуждений, 64K для мультимодальных данных, обе цифры взяты из карточки модели.
• Цена — Grok 4.6: $2.00 / $6.00 за 1 млн токенов, с повышением до $4.00 / $12.00 после 200 тыс. токенов; в сравнении с Intern-S2-397B: тарифной сетки нет; собственный хостинг или официальный API Intern.
Что на самом деле охватывают эти цифры
Каждый приведённый ниже показатель Intern-S2-397B — собственный показатель InternLM, полученный через OpenCompass, VLMEvalKit и AgentCompass и опубликованный вместе с весами без независимого воспроизведения. Числа Grok 4.6 — это совсем другое: они накапливались в публичной арене и Artificial Analysis после запуска модели, поэтому несут ярлык третьей стороны.
На стороне независимых измерений Grok 4.6 находится на отметке 44 в текущем Индексе интеллекта Artificial Analysis, с показателями GPQA Diamond 94.9, Humanity's Last Exam 61.0 и оценкой за программирование 76.8, а Artificial Analysis оценивает его результат TerminalBench 2.1 почти в 80.3. На стороне производителя карточка Intern-S2-397B сообщает о 89.77 в MMLU Pro, 93.56 в HMMT-2026, 81.68 в MMMU Pro и 68.54 в SWE-bench-Pro, а также о научных строках, где он выглядит как представитель другого вида: 55.71 в Biology-Instructions, 63.28 в SciReasoner 1.5, 53.95 в Mol-Instructions, 62.35 в MolecularIQ. Единственное число в таблице производителя, которое должно заставить разработчика агентов вздрогнуть, — это TerminalBench 2.1 с 64.04: показатель, по которому, как сообщают сами создатели модели, она с большим отрывом проигрывает более старому закрытому поколению — именно в той нише терминальной работы, где особенно сильна арендуемая фронтирная модель вроде Grok 4.6.
Воспринимайте это расхождение как портрет, а не как рейтинг. Intern-S2-397B — научный специалист, который при этом является компетентной универсальной моделью; Grok 4.6 — универсал, проявляющий мимолётный интерес к науке. Перекос в научных строках ожидаем — ни одна флагманская универсальная модель не предобучалась на необработанных страницах научной литературы, где вместе присутствуют иллюстрации, вёрстка и символьные обозначения, и именно вокруг этой парадигмы построена Intern-S2-397B. Ничто ни в одной из двух доказательных баз не поддерживает утверждение, что «Intern-S2-397B так же хороша, как Grok 4.6, в произвольных рассуждениях», и ничто в доказательствах Grok 4.6 не указывает на то, что эту модель настраивали для анализа мультиомных последовательностей.
Цена контроля
У Grok 4.6 есть цена, которую можно занести в таблицу: $2,00 за миллион входных токенов и $6,00 за миллион выходных, причём тариф растёт до $4,00 / $12,00, как только запрос превышает 200 000 токенов, плюс опциональный приоритетный уровень для более быстрых ответов. Он доступен через OrcaRouter по прайс-листовой цене xAI, передаваемой с наценкой 0%, так что изменение тарифа у xAI отражается здесь в тот же день без посреднической дельты — цена того, что вы арендуете, остаётся такой, какой её устанавливает поставщик.
У Intern-S2-397B вообще нет опубликованного тарифа за токен. В карточке модели упоминается официальный Intern API, но экономика, которую люди на самом деле хотят сравнить, — это экономика самостоятельного хостинга: чекпоинт с 403 млрд параметров, примерно 807 ГБ весов, разбитых на 188 шардов в BF16, то есть серьёзный узел с несколькими GPU, при этом сборка FP8 примерно вдвое уменьшает занимаемый объём. Если такая мощность у вас уже есть, предельная стоимость следующего научного запроса приближается к стоимости электроэнергии, и в этом весь смысл позиции Apache-2.0. Если её у вас нет, «бесплатная» модель — это пилот по капитальным затратам, а не статья расходов.
Что роутер даёт в этом конкретном противостоянии — это стык, а не цена. Grok 4.6 работает по ключу, который у вас уже есть для общего продакшн-трафика; Intern-S2-397B не маршрутизируется через OrcaRouter — это совершенно новый чекпойнт, и путь к нему лежит через собственный API производителя или развёртывание на своих серверах. Направьте общие рассуждения, чувствительные к задержке, на тарифицируемую модель, оставьте научную пакетную работу на модели, которую вы запускаете сами, и пусть автоматическое переключение при сбое подстрахует вас, когда конечная точка любой из сторон недоступна. Граница между ними становится правилом маршрутизации, а не второй интеграцией.

Какой выбрать?
Выбирайте Grok 4.6, когда задача общая, рассуждения должны возвращаться быстро и корректно, а владеть стеком, который их производит, вам не хочется. Его окно в 500K, измеренный результат GPQA Diamond на уровне 94.9 и набор инструментов — это продакшен-возможности, а тариф $2/$6 — это плата за то, что вам не нужно ничего эксплуатировать.
Выбирайте Intern-S2-397B, когда входные данные научные — статья с множеством рисунков, молекулярная диаграмма, сигнал временного ряда — и когда рассуждения должны происходить на данных, которые не могут покинуть вашу среду, или на поведении, которое вы хотите дообучить сами. Apache-2.0 делает это возможным; ни один арендованный API этого не может. Заложите бюджет на оборудование, не рассчитывайте какое-то время на независимую таблицу результатов и относитесь к каждому числу в его карточке как к утверждению, пока кто-нибудь за пределами InternLM не воспроизведёт хотя бы одно.


