Intern-S2とGemini 3.1 Proを比較する生成ヒーローカード。左側には科学的図版のページとチャートがマルチモーダルモデルへ入力される様子、右側には閉じたAPIカードの周囲に画像・音声・動画・テキストの4つの入力アイコンが配置され、Apache-2.0の科学的マルチモーダル性と、閉じた100万コンテキストの汎用マルチモーダルフラッグシップとの対比がラベル付けされ、右下隅にOrcaRouterのロゴがある。
Guides & Insights

Intern-S2 対 Gemini 3.1 Pro:InternLM が実際に測定したマルチモーダル対決

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

このシリーズのほとんどの比較対決は、2社の主張を寄せ集めて突き合わせる必要がある。しかし、この対決は違う。InternLMが本日公開した3970億パラメータのApache-2.0マルチモーダルモデル「Intern-S2」と、Goog​leのフラッグシップ推論モデル「Gemini 3.1 Pro」は、どちらも同じベンチマーク表に実測値の列として登場している。だからこそ、これはこのセットの中で最も公平な一騎打ちであり、偶然ではなく、オープンモデル側が最も説明を求められる対決でもある。Gemini 3.1 Proはテキスト、画像、音声、動画を読み取り、100万トークンのコンテキストを備え、2026年2月19日にプレビュー版が公開されて以来、独立系ラボや本番トラフィックによって徹底的に検証されてきた。Intern-S2はテキスト、画像、時系列データを読み取り、今朝Hugging Faceにアップロードされたばかりで、第三者によるスコアは一切存在しない。両方が測定されている行では、Goog​leのモデルが過半数の行で勝っている。

どちらも画像を読み取ります。しかし、似ているのはそこまでです。

「マルチモーダル」という言葉は、これらのモデルをまるで同格の存在のように思わせる。だが同格ではない。その違いは、それぞれが何を見るために作られたかにある。

Intern-S2の視覚経路は、科学文献の生のページ(図、数式、構造図、レイアウト)を、まずテキストを解析して取り出すのではなく、単一の共有表現として消費するように訓練された。そのマルチモーダルベンチマークは科学的なもので、生物顕微鏡VQA、リモートセンシング、科学チャートの質問応答などがある。また時系列データも受け付け、予測を生成できる。これは、一般的なフラッグシップモデルではほとんどまったく扱えない入力タイプである。

Gemini 3.1 Pro のマルチモーダル性は汎用目的で、その種類もより広範です。テキスト、画像、音声、動画を1つのモデルで扱い、モデルにファイルを指定して質問するあらゆる実務タスクを対象としています。会議の録音、UI のスクリーンショット、PDF 内のグラフ、動画クリップ——どれも対象であり、そのすべてに6か月にわたる公開評価の裏付けがあります。

入力が科学図表であれば、Intern-S2 はそのために専用設計されており、自らの正当性を主張できるベンダー公表の数値も備えている。入力がそれ以外なら、Gemini 3.1 Pro は音声と動画を扱えるが、Intern-S2 はどちらも扱えない。このことは、価格やベンチマークが登場する前に、「どちらを使うべきか」という疑問の大部分を解決してくれる。両者が互換可能だと言う人は、入力リストを読んでいないのだ。

共有の食卓が示すもの、正直に読み解けば

InternLM が両方をベンチマークしているため、これは直接比較が寄せ集めではなく正当に行える数少ない場面の一つです。注意点は変わっておらず、一度だけ述べておく価値があります。Intern-S2 の数値はすべてベンダー報告で、InternLM が自社のハーネス上で OpenCompass、VLMEvalKit、AgentCompass を通じて実行したものであり、独立した再現はありません。その表の Gemini の数値も、InternLM によるこの比較の実行から得られたものですが、Gemini にはそれとは別に広範な独立記録があります。

• マルチモーダル知識 — MMMU Pro における Gemini 3.1 Pro は 83.99、Intern-S2 は 81.68。

• 科学的なチャートQA — Gemini 3.1 Pro は ChartQAPro で 71.18、Intern-S2 は 71.12。小数点以下2桁までまったくの互角。

• リモートセンシング — XLRS-BenchにおいてGemini 3.1 Proは54.27、Intern-S2は51.38。

• 顕微鏡VQA — MicroVQAにおいてGemini 3.1 Proは71.02、Intern-S2は69.67。

• 科学的マルチモーダルタスク — SFE における Intern-S2 が 60.74、Gemini 3.1 Pro が 59.57。Intern-S2 にとって唯一のマルチモーダルでの勝利。

• 一般知識 — MMLU ProにおけるGemini 3.1 Proの91.00対Intern-S2の89.77。

• 高校数学 — HMMT-2026でGemini 3.1 Proが94.70、Intern-S2が93.56。

• 科学文献の推論 — Intern-S2 は Biology-Instructions で 55.71、Gemini 3.1 Pro は 13.87、Mol-Instructions では 53.95 対 38.84。

• 科学オリンピック問題 — FrontierScience-Olympiad において Intern-S2 は 87.00、Gemini 3.1 Pro は 79.00。

• ターミナル操作の習熟度 — Gemini 3.1 Pro は TerminalBench 2.1 で 73.80、Intern-S2 は 64.04。

正直に読めば、Gemini 3.1 Proは幅広いマルチモーダル系の項目では僅差で勝利し、Intern-S2は深い科学文献系の項目では圧倒的な差で勝利しており、どちらの結果も、それぞれが何で訓練されたかを考えれば驚くには当たらない。マルチモーダルでの敗北の差が小さいことこそ、おそらくより興味深い発見だ——同日公開のオープンチェックポイントが、MMMU ProとChartQAProで6か月前のクローズドなフラッグシップから2ポイント以内に収まっていることは、InternLMにとって、そのけた外れな科学系スコアのどれよりも強い結果である。

コンテキスト、出力、プレビューの質問

長い入力に関する状況は明確に分かれる。Gemini 3.1 Pro は 100万トークンのコンテキストウィンドウと 64K の出力上限を備えており、長い文書セットと十分な内容の回答に対応できる。Intern-S2 はテキスト推論で最大 256K トークン、マルチモーダルで 64K と評価されており、出力上限は公表していない。誰かが独立に測定するまでは、その使用可能なウィンドウは Gemini より小さいものとして扱う。

Google側には、どんな誠実な比較にも含めるべき運用上の注意点が1つある。Gemini 3.1 Proはまだプレビューモデルであり、GAリリースではない。プレビューモデルにはより低い信頼性しか期待できず、モデルページの7日間エラー率パネルは、その上にクリティカルパスを構築するのではなく、不安定さを迂回せよという常設のリマインダーである。Intern-S2は完全なApache-2.0リリースで、重みをピン留めできる——逆説的だが、最も重要な意味において、この真新しいオープンモデルのほうが2つの中で運用上より安定している。誰にも、あなたに気づかれないうちにそれを変更されることがないからだ。

• コンテキスト — Intern-S2 256K テキスト / 64K マルチモーダルを Gemini 3.1 Pro 1M トークンと比較評価。

• 入力 — Intern-S2 のテキスト、画像、時系列 vs Gemini 3.1 Pro のテキスト、画像、音声、動画。

• ウェイト — Intern-S2 Apache-2.0、ダウンロード可能 対 Gemini 3.1 Pro クローズド。

• 成熟度 — Intern-S2 はリリースからわずか数時間、Gemini 3.1 Pro プレビューに対する独立したスコアはなし、2026年2月以降、徹底的かつ独立にテスト済み。

• 価格 — Intern-S2には公開料金表なし。セルフホストまたは公式Intern APIに対し、Gemini 3.1 Proは100万トークンあたり入力$2.00/出力$12.00で、入力トークンが200Kを超えると$4.00/$18.00に上昇。

A generated two-column scoreboard titled 'Intern-S2 vs Gemini 3.1 Pro — the scoreboard.' Left column Intern-S2-397B lists Weights Apache-2.0, Context 256K text / 64K multimodal, Inputs text image time series, Independent score none yet, Price self-host or Intern API, MMMU Pro 81.68. Right column Gemini 3.1 Pro lists Weights closed, Context 1M in / 64K out, Inputs text image audio video, Independent score 57 at launch on the then-current scale, Price $2.00 / $12.00 per 1M, MMMU Pro 83.99. Footer reads 'Intern-S2 figures are InternLM's own, unreproduced; both MMMU Pro rows as measured in InternLM's comparison table. Gemini 3.1 Pro figures per Google and independent trackers.'

価格と、それぞれがどこに住んでいるのか

Gemini 3.1 Proは標準ティアで入力100万トークンあたり$2.00、出力100万トークンあたり$12.00を課金し、リクエストが入力200Kトークンを超えると$4.00/$18.00に跳ね上がる——まさにそれを選ぶ根拠となる1Mウィンドウを使うときに効いてくる、長コンテキスト向けのプレミアムだ。OrcaRouterでは同じ定価でルーティング可能で、0%のマークアップでパススルー、しかも200以上の他のモデルも載るキー上で。ここでパススルーが重要になるのは、Googleの価格改定が再価格設定サイクルを待たずに当日中にこちら側へ反映されるからだ。この特定の組み合わせで役立つのはルーティングDSLの部分だ。画像・動画の処理はGemini 3.1 Proへ、科学文書のバッチはセルフホストのIntern-S2へ送り、2つ目の契約やコード変更なしに両方を1つのエンドポイントの背後に置ける。

Intern-S2には公開されたAPI価格がない。Apache-2.0の重みをセルフホストするのが、ほとんどのチームが実際に取る道であり、403Bパラメータともなると本格的なハードウェア投資となる。GPUを動かしたくないチーム向けに公式のIntern APIは存在するが、公開された料金表がなければ、Gemin​iの$2/$12とのコスト比較を紙の上で行うことはできない——自分でクォータを申請して計算するしかない。

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence badge, the tags image-text-to-text and qwen3_5_moe, the model size of 403B parameters in BF16/F32, the Intern-S2-397B heading, an inference providers panel reading 'This model isn't deployed by any Inference Provider,' and the collection listing nine items.

電話

音声と動画を扱い、100万トークンを保持し、数か月にわたる独立した検証を経ており、今日からトークン単位で利用できる汎用マルチモーダルモデルが必要なら、Gemini 3.1 Pro を選んでください。より裏付けがしっかりしており、より広範な能力を備えたモデルであり、プレビューバッジは能力面ではなく信頼性面の注意事項です。

マルチモーダル入力が科学的なもので、データを自社インフラの外に出せないなら、Intern-S2 を選びなさい。2つの中で、生の文献ページをネイティブに読み、時系列シグナルから予測し、寛容なライセンスの下で独自の実験データを使ってファインチューニングできるのは、これだけです。あなたがそれを実行する最初の人物であり、それを支持するベンチマーク表はそれを作った人々によって書かれたのだと、受け入れなさい。

A screenshot of the OrcaRouter model page for Gemini 3.1 Pro at orcarouter.ai/models/google/gemini-3.1-pro-preview, captured September 13, 2026, showing the model tagged FLAGSHIP and FEATURED by Google dated 2026-02-19 with Vision, Audio, Tools, JSON and Reasoning tags, a 1M-token context window and 65K max output, and pricing tiles reading input $2.00 and output $12.00 per 1M tokens.

どちらのモデルもこれを完全に制したわけではなく、そのことは判決文よりもこの表のほうがよく証明している。一方はたまたま科学が得意な汎用モデルであり、もう一方はたまたま一般的なマルチモーダル作業でも競争力を持つ科学用の計器だ——そして同日のオープンリリースにおいては、「競争力がある」ということのほうがより意外な結果である。

この比較の両方を、2つ目の契約なしで押さえるには:200以上のモデルをカバーする1つのAPIキーが、クローズドなマルチモーダル・フラッグシップとあらゆる代替モデルを1つのエンドポイントの背後に置くので、画像と動画の作業を一方に、ドキュメントのバッチ処理を他方に振り分けられます。