
Intern-S2 vs GPT-5.6 Sol:無料のチェックポイントと30ドルのフラッグシップ
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240知能72コーディング
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0340知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2134知能69コーディング
この対決の価格設定は、一見すると馬鹿げて見える。3970億パラメータのマルチモーダルモデルIntern-S2は、InternLMが本日Apache-2.0の下で公開したもので、ダウンロードは無料、実行するハードウェアさえ持っていればクエリごとの費用もかからない。OpenAIのフラッグシップ推論ティアであるGPT-5.6 Solは、OpenAIのベースティアでは入力100万トークンあたり$5.00、出力100万トークンあたり$30.00と表示されている — ただし、OpenAIが7月下旬から実施しているプロモーション料金(当社自身のモデルページに現在表示されているもの)は、入力$4.00、出力$20.00だ。それは実際の差であり、誰もがまず気づく点だ — そしてまた、この比較で最も役に立たない事実でもある。なぜなら、$30のモデルと無料のモデルは同じ仕事を巡って競合しているわけではないからだ。GPT-5.6 Solは、アプリケーションが試みる最も難しい推論が必ず正しい結果で返ってこなければならないときに、OpenAIが指し示すティアだ。Intern-S2は、生の文献ページで訓練された視覚経路と、時系列シグナル向けの予測ヘッドを備えた科学的計器だ。問題は、どちらが安いかではない。あなたのワークロードが実際に必要としているのはどちらか、そして「無料」のほうが本当に無料なのかどうかだ。
ベンダー表が教えてくれることと、教えてくれないこと
InternLMがIntern-S2をベンチマークした相手はGPT-5.5であり、GPT-5.6 Solではありません。これは何よりも先に述べておく価値があります。なぜなら、出回っている「Intern-S2はGPTを上回る」という主張はすべて、前世代のOpenAIとの比較であり、それをSolの結果として示すページは外挿していることになるからです。GPT-5.6ファミリーも3つの階層にまたがっています——最も難度の高い作業向けのSol、バランスの取れた本番運用向けのTerra、大量処理向けのLuna——そしてOpenAIはこれらの価格を積極的に改定しているため、9月の記事から引用されたSolの数値は、すでに古くなっている可能性があります。
ベンダーの比較が確かに示しているのは、すべての Intern-S2 の数値は InternLM 自身によるもので再現されていないという、常につきまとう但し書き付きではあるが、次の点である:
• 分子構造推論 — MolecularIQ において Intern-S2 は 62.35 で、GPT-5.5 の 76.41 に対して劣っている。Intern-S2 の敗北。
• 科学的ツール利用 — TOMG-Bench における Intern-S2 の 66.76 対 GPT-5.5 の 69.89。僅差の敗北。
• 生体分子指示 — Intern-S2 53.95 対 40.49。明らかな Intern-S2 の勝利。
• 高校数学 — HMMT-2026 で Intern-S2 は 93.56、GPT-5.5 は 97.06。Intern-S2 の負け。
• 一般知識 — MMLU Pro で Intern-S2 が 89.77 対 88.20。Intern-S2 の僅差の勝利。
• マルチモーダル知識 — MMMU Pro で 81.68 の水準。
• ターミナル操作の熟練度 — TerminalBench 2.1 において GPT-5.5 は 79.40、Intern-S2 は 64.04。15ポイントの差。
一世代前の OpenAI モデルに対しても、Intern-S2 は一般的な項目では勝ちより負けが多く、科学系の項目では勝っている。最も難しい推論向けに GPT-5.5 より上のティアとして明確に位置づけられている Sol に対しては、一般的な能力の差はほぼ確実に広がる。無料のチェックポイントが一般能力で有料のフラッグシップと競合できるという考えを支持する証拠は何もなく、正直に位置づけるなら、Intern-S2 は一般領域ではそれなりに評価でき、その専門分野では卓越したスペシャリストである。
「無料」は割引ではなく、設備投資である。
Intern-S2のゼロのライセンス費用は現実だが、無料の推論と同じではない。ここが、この比較が実践的になるところだ。4030億パラメータのチェックポイントを提供するには、本格的なマルチGPUノードが必要になる。すでにそのキャパシティを所有していて、それが十分に活用されていないなら、次の科学的クエリの限界費用は電気代に近い——これは真に強力な経済的地位であり、オープンウェイトが存在する理由でもある。そのキャパシティを所有していないなら、「無料」とはハードウェアを購入またはレンタルすることを意味し、計算はまったく変わってくる。
GPT-5.6 Sol の経済性は正反対です。購入すべきハードウェアも、運用すべきモデルもありません。支払うのは従量課金です — ベースティアでは入力100万トークンあたり5.00ドル、出力100万トークンあたり30.00ドル、あるいは現在モデルページで実施中の4.00ドル/20.00ドルのプロモーション料金 — そしてこのモデルには、1.05Mトークンのコンテキストウィンドウ、128Kの出力上限、ビジョン、ツール、そして2026年7月9日にAPIがローンチされて以来本番運用されてきたフラッグシップとしての積み重ねられた信頼性が備わっています。Ultrafast プレビューは、Sol をウェハスケールのハードウェア上で最大毎秒750出力トークンで実行するもので、同じモデルをレイテンシーが重視される用途へと押し広げますが、限られた顧客グループに限定されており、価格は公開されていません。30ドルで買っているのは能力だけではありません — 運用チームが不要であるということです。
• 重み — Intern-S2 Apache-2.0、ダウンロード可能。対して GPT-5.6 Sol はクローズドでAPI専用。
• コスト構造 — 403BチェックポイントへのIntern-S2の設備投資、または従量制の公式Intern API 対 GPT-5.6 Sol は100万トークンあたりリスト価格$5.00 / $30.00、プロモーション価格$4.00 / $20.00。
• コンテキスト / 出力 — Intern-S2 は最大 256K のテキスト、64K のマルチモーダルを評価済み。出力は未公開であるのに対し、GPT-5.6 Sol は約 1.05M のコンテキスト、128K の出力。
• 入力 — Intern-S2 のテキスト、画像、時系列 対 GPT-5.6 Sol のテキスト、画像。
• 独立系スコア — Intern-S2 はまだなし 対 GPT-5.6 Sol は長い公開評価実績を持つトップティアのフラッグシップ。
• スピードティア — {{1}}Intern-S2 ハードウェア律速{{/1}} 対 {{2}}GPT-5.6 Sol Ultrafast プレビュー{{/2}}、最大毎秒750出力トークン、ベンダー公称。

無料のチェックポイントが真に優位に立つのはどこか
ベンチマークが関与することなくIntern-S2がSolを上回る3つの状況がある。
第一の点はデータレジデンシーです。{{1}}GPT-5.6 SolはクローズドAPIです — すべてのリクエストはあなたのインフラストラクチャを離れ、OpenAIのコンテンツポリシーの下でOpenAIのシステムを経由します。Apache-2.0のIntern-S2は、規制環境内でエアギャップ状態で実行でき、法的に第三者エンドポイントへ送信できないデータを扱えます。{{/1}} 製薬研究所、病院システム、防衛請負業者にとって、その特性は機能ではありません。{{2}}それは調達判断のすべてであり、どれほどのSolの能力もそれに代わることはできません。{{/2}}
2点目はモダリティです。Intern-S2は時系列入力を受け付けて予測を生成します。また、生の科学文献ページを、抽出されたテキストとしてではなく、ネイティブな視覚表現として読み取ります。Solはテキストと画像を扱います。あなたのデータが地震計のトレース、負荷曲線、あるいは図表の多いスキャン論文であるなら、Intern-S2にはSolにはない経路があり、ベンダーのBiology-Instructions行(GPT-5.5の10.52に対して55.71)がそれを反映する数値です。
三つ目はファインチューニングです。Intern-S2の重みを取得し、自社独自の実験データで訓練し、そのモデルを永久に保持できます。Solでは、いくら払ってもそれはできません。競争優位性が特化したデータセットにあるチームにとって、適応可能なオープンチェックポイントは、より強力な凍結モデルよりも価値がある場合があります。

選ばずに両方を実行
この組み合わせから最大の成果を引き出しているチームは、それを二者択一とは捉えていません。一般的でレイテンシに敏感な、重要な推論はGPT-5.6 Solにルーティングします。これはOrcaRouter上でOpenAIの定価、マークアップ0%で提供されており、200以上の他のモデルと同じキーで使えるため、Solの価格変更は同日に反映され、プロバイダーの不調時には自動フェイルオーバーでカバーされます。そして科学的なバッチ処理は、どこで実行するにせよIntern-S2に任せます。ルーティングDSLがその境界を明確にします。難しい汎用推論は一方へ、文書とシグナルの分析はもう一方へ。この振り分けは設定事項であり、二つ目の統合ではないのです。
Intern-S2 は OrcaRouter 上にはなく、同日公開の Apache-2.0 チェックポイントであり、それへの経路はベンダー自身の API かセルフホスト型デプロイだ。Sol はそのキーで利用できる。この2つを踏まえると、科学色の強いアプリケーションにとって実用的なアーキテクチャは、フロンティア向け呼び出し用のエンドポイントを1つ、スペシャリスト用のデプロイを1つにする形であり、後からどちらか一方を移行できる選択肢も残せる。

評決
アプリケーションが試みる中で最も難しい推論が必要で、それを1回のAPI呼び出しで得たいと考え、そのための従量制フラッグシップ料金を支払う用意があるなら、答えはGPT-5.6 Solであり、同日公開のオープンチェックポイントがあってもそれは変わりません。InternLM自身の表の中に、Intern-S2が現在のOpenAIフラッグシップと汎用能力で匹敵することを示すものは何もありません。比較は前世代に対して行われ、それでもオープンモデルは汎用の行の大半で負けていました。
ワークロードが科学用途である場合、データを自社インフラの外に出せない場合、あるいは独自の実験結果でファインチューニングする必要がある場合、Intern-S2 はそうしたことをそもそも実行できるモデルです — そしてその Apache-2.0 ライセンスは、あなたが検証したバージョンが、そのままあなたが保持し続けるバージョンであることを意味します。ハードウェアの予算を確保し、自前の評価を実行することを想定し、InternLM の外部の誰かが再現するまでは、それについて公表されたあらゆる数値を主張として扱ってください。
セルフホストしているものと並行してフロンティアの呼び出しを行う場合は:200以上の他のモデルが、クローズドなフラッグシップをプロバイダー定価のまま1つのキーで利用できるようにし、専門特化したデプロイと従量課金モデルをルーティングルールで切り替えられます。
