Сгенерированная hero-карточка, сравнивающая Intern-S2 и Gemini 3.1 Pro: слева показаны страница научного рисунка и график, подаваемые на вход мультимодальной модели, а справа — четыре иконки ввода для изображения, аудио, видео и текста вокруг закрытой карточки API; подпись отражает контраст между научной мультимодальностью Apache-2.0 и закрытым универсальным мультимодальным флагманом с контекстом 1M, а в правом нижнем углу расположен логотип OrcaRouter.
Guides & Insights

Intern-S2 против Gemini 3.1 Pro: мультимодальное противостояние, которое InternLM действительно измерила

Автор

Rowan Sterling

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Большинство сравнений в этой серии требуют сшивания воедино заявлений двух вендоров. Это — нет. Intern-S2, выпущенная сегодня компанией InternLM мультимодальная модель с 397 миллиардами параметров под лицензией Apache-2.0, и Gemini 3.1 Pro, флагманская модель рассуждений от Google, обе фигурируют в виде измеренных столбцов в одной и той же таблице бенчмарка — что делает это противостояние самым честным очным поединком в наборе и, что отнюдь не случайно, тем, в котором открытой модели больше всего есть за что отвечать. Gemini 3.1 Pro понимает текст, изображения, аудио и видео, держит контекст в 1 млн токенов и с момента выхода в предварительную версию 19 февраля 2026 года была разобрана по косточкам независимыми лабораториями и продакшн-нагрузкой. Intern-S2 понимает текст, изображения и временные ряды, была загружена на Hugging Face сегодня утром и не имеет ни одной сторонней оценки. В тех строках, где измерялись обе, модель Google выигрывает чаще, чем нет.

Оба читают изображения. На этом сходство заканчивается.

Слово «мультимодальный» заставляет эти модели звучать как равные. Они не равны, и разница в том, на что каждая из них была создана смотреть.

Визуальный компонент Intern-S2 обучали обрабатывать необработанные страницы научной литературы — иллюстрации, уравнения, структурные схемы, вёрстку — как единое общее представление, а не сначала извлекать из них текст. Его мультимодальные бенчмарки относятся к научной области: VQA по биологической микроскопии, дистанционное зондирование, ответы на вопросы по научным графикам. Он также принимает данные временных рядов и может строить прогнозы — тип входных данных, с которым почти не работает ни одна универсальная флагманская модель.

Мультимодальность Gemini 3.1 Pro универсальна и шире по типам: текст, изображения, аудио и видео — в одной модели, нацеленной на весь спектр рабочих задач, где вы направляете модель на файл и задаёте вопрос. Запись встречи, скриншот интерфейса, диаграмма в PDF, видеоклип — всё допустимо, и за каждым из них стоят шесть месяцев публичной оценки.

Если на входе у вас научная иллюстрация, Intern-S2 был специально для этого создан и располагает цифрами от производителя, чтобы приводить аргументы в свою пользу. Если на входе что-либо иное, Gemini 3.1 Pro принимает аудио и видео, а Intern-S2 не принимает ни то, ни другое. Это снимает значительную часть вопросов «что мне использовать» ещё до того, как в дело вступают цена или бенчмарки, а любой, кто говорит, что эти двое взаимозаменяемы, не читал список входных данных.

Что показывает общая таблица, если читать её честно

Поскольку InternLM прогнала бенчмарки для обоих, это одно из немногих мест, где прямое сравнение правомерно, а не собрано по частям. Оговорка не изменилась, и её стоит сформулировать один раз: каждый показатель Intern-S2 заявлен вендором — он получен InternLM на собственном стенде с использованием OpenCompass, VLMEvalKit и AgentCompass, без независимого воспроизведения. Показатели Gemin​i в этой таблице также взяты из прогона сравнения, выполненного InternLM, хотя за пределами этой таблицы у Gemin​i есть обширная независимая история.

• Мультимодальные знания — Gemini 3.1 Pro 83,99 в MMMU Pro против Intern-S2 81,68.

• QA по научным диаграммам — Gemini 3.1 Pro 71,18 на ChartQAPro против Intern-S2 71,12. Практически ничья — разница лишь во втором знаке после запятой.

• Дистанционное зондирование — Gemini 3.1 Pro 54.27 на XLRS-Bench против Intern-S2 51.38.

• Микроскопия VQA — Gemini 3.1 Pro 71.02 на MicroVQA против Intern-S2 69.67.

• Научные мультимодальные задачи — Intern-S2 60,74 на SFE против Gemini 3.1 Pro 59,57. Единственная мультимодальная победа Intern-S2.

• Общие знания — Gemini 3.1 Pro 91.00 на MMLU Pro против Intern-S2 89.77.

• Математика уровня старшей школы — Gemini 3.1 Pro 94,70 на HMMT-2026 против Intern-S2 93,56.

• Рассуждения по научной литературе — Intern-S2 55,71 на Biology-Instructions против Gemini 3.1 Pro 13,87, и 53,95 против 38,84 на Mol-Instructions.

• Задачи научных олимпиад — Intern-S2 87,00 на FrontierScience-Olympiad против Gemini 3.1 Pro 79,00.

• Мастерство работы с терминалом — Gemini 3.1 Pro 73,80 в TerminalBench 2.1 против Intern-S2 64,04.

Честное прочтение: Gemini 3.1 Pro побеждает в широких мультимодальных строках с небольшим отрывом, Intern-S2 побеждает в строках по глубокой научной литературе с огромным, и ни один из результатов не удивителен, учитывая, на чём обучали каждый из них. Узость отставания в мультимодальных показателях, пожалуй, является более интересной находкой — открытый чекпойнт, выпущенный в тот же день и отстающий всего на два пункта от шестимесячного закрытого флагмана на MMMU Pro и ChartQAPro, — более сильный результат для InternLM, чем любые его ошеломляющие научные цифры.

Контекст, вывод и вопрос предварительного просмотра

История с длинным вводом чётко распадается на две части. Gemini 3.1 Pro имеет контекстное окно на 1M токенов с потолком вывода 64K — этого достаточно для длинного набора документов и содержательного ответа. Intern-S2 оценивается при объёме до 256K токенов для текстовых рассуждений и 64K для мультимодальных задач, а потолок вывода не публикует; считайте его доступное окно меньшим, чем у Gemini, пока кто-нибудь не измерит его независимо.

На стороне Goog​le есть один эксплуатационный нюанс, который должен присутствовать в любом честном сравнении. Gemini 3.1 Pro — всё ещё preview-модель, а не GA-релиз. Preview-модели предполагают более низкие ожидания по надёжности, и панель частоты ошибок за 7 дней на странице модели служит постоянным напоминанием о том, что нестабильность нужно обходить стороной, а не строить критический путь на её основе. Intern-S2 — это полноценный релиз под Apache-2.0 с весами, которые можно зафиксировать, — что, вопреки интуиции, делает новейшую открытую модель более операционно стабильной из этих двух в самом важном смысле: никто не может изменить её за вашей спиной.

• Контекст — Intern-S2 256K текста / 64K мультимодальных данных в сравнении с Gemini 3.1 Pro 1M токенов.

• Входные данные — Intern-S2: текст, изображение, временные ряды против Gemini 3.1 Pro: текст, изображение, аудио, видео.

• Веса — Intern-S2 Apache-2.0, доступны для скачивания, в отличие от закрытой Gemini 3.1 Pro.

• Зрелость — Intern-S2 существует всего несколько часов, нет независимой оценки в сравнении с Gemini 3.1 Pro preview с февраля 2026 года, интенсивно и независимо протестирован.

• Цена — у Intern-S2 нет публичной тарифной сетки; самостоятельный хостинг или официальный Intern API против Gemini 3.1 Pro: $2,00 за вход / $12,00 за выход за миллион, с ростом до $4,00/$18,00 при превышении 200 тыс. входных токенов.

A generated two-column scoreboard titled 'Intern-S2 vs Gemini 3.1 Pro — the scoreboard.' Left column Intern-S2-397B lists Weights Apache-2.0, Context 256K text / 64K multimodal, Inputs text image time series, Independent score none yet, Price self-host or Intern API, MMMU Pro 81.68. Right column Gemini 3.1 Pro lists Weights closed, Context 1M in / 64K out, Inputs text image audio video, Independent score 57 at launch on the then-current scale, Price $2.00 / $12.00 per 1M, MMMU Pro 83.99. Footer reads 'Intern-S2 figures are InternLM's own, unreproduced; both MMMU Pro rows as measured in InternLM's comparison table. Gemini 3.1 Pro figures per Google and independent trackers.'

Цена и где живёт каждый из них.

Gemini 3.1 Pro стоит $2,00 за миллион входных токенов и $12,00 за миллион выходных токенов на стандартном тарифе, а при превышении 200K входных токенов в запросе цена поднимается до $4,00/$18,00 — надбавка за длинный контекст, которая бьёт именно тогда, когда вы используете окно в 1M, ради которого и выбрали эту модель. Он маршрутизируется через OrcaRouter по той же каталожной цене, передаваемой с наценкой 0%, на ключе, который также обслуживает более 200 других моделей; сквозная передача здесь важна потому, что изменение цен Google отражается на нашей стороне в тот же день, а не после цикла пересмотра цен. DSL маршрутизации — самое полезное для этого конкретного сопоставления: вы можете отправлять работу с изображениями и видео в Gemini 3.1 Pro, а пакеты научных документов — в самостоятельно размещённый Intern-S2, и держать оба за одним эндпоинтом без второго контракта или изменения кода.

У Intern-S2 нет опубликованной цены API. Самостоятельный хостинг весов Apache-2.0 — это путь, которым на практике пойдёт большинство команд, а при 403 млрд параметров это серьёзные требования к оборудованию. Официальный API Intern существует для команд, которые предпочли бы не запускать GPU, но без публичного прайс-листа сравнение стоимости с $2/$12 у Gemini нельзя сделать на бумаге — придётся запросить квоту и самому произвести расчёты.

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence badge, the tags image-text-to-text and qwen3_5_moe, the model size of 403B parameters in BF16/F32, the Intern-S2-397B heading, an inference providers panel reading 'This model isn't deployed by any Inference Provider,' and the collection listing nine items.

Звонок

Выбирайте Gemini 3.1 Pro, если вам нужна универсальная мультимодальная модель, которая принимает аудио и видео, вмещает миллион токенов, имеет за плечами месяцы независимой проверки и уже сегодня доступна в аренду с оплатой за токены. Это модель с лучшей доказательной базой и более широкими возможностями, а значок предварительной версии — это оговорка о надёжности, а не о возможностях.

Выбирайте Intern-S2, если ваши мультимодальные входные данные относятся к научной сфере, а данные не могут покидать вашу инфраструктуру. Это единственный из двух, который нативно читает исходные страницы научной литературы, строит прогнозы по сигналам временных рядов и может дообучаться на проприетарных экспериментальных данных по разрешительной лицензии. Примите тот факт, что вы первый, кто его запускает, и что таблицу бенчмарков в его пользу составили его создатели.

A screenshot of the OrcaRouter model page for Gemini 3.1 Pro at orcarouter.ai/models/google/gemini-3.1-pro-preview, captured September 13, 2026, showing the model tagged FLAGSHIP and FEATURED by Google dated 2026-02-19 with Vision, Audio, Tools, JSON and Reasoning tags, a 1M-token context window and 65K max output, and pricing tiles reading input $2.00 and output $12.00 per 1M tokens.

Ни одна из моделей не выигрывает здесь безоговорочно, и таблица доказывает это лучше, чем мог бы вердикт. Одна — универсал, который, как оказалось, хорош в науке; другая — научный инструмент, который, как оказалось, конкурентоспособен в общей мультимодальной работе, — а в случае открытого релиза, вышедшего в тот же день, «конкурентоспособность» — более удивительный результат.

Чтобы охватить обе половины этого сравнения без второго контракта: один API-ключ, покрывающий более 200 моделей делает закрытый мультимодальный флагман и все альтернативы доступными через один эндпоинт, так что вы можете направлять работу с изображениями и видео по одному маршруту, а пакетную обработку документов — по другому.