生成されたヒーローカードは Intern-S2-397B と Grok 4.6 を比較しており、左側には enable_thinking とラベル付けされた推論トグルと時系列波形を備えたオープンウェイトの科学モデル、右側には推論エフォートのダイヤルとサーバーサイドツールのアイコンを備えたクローズドなクラウドエンドポイントを示し、Apache-2.0 のセルフホスト制御と $2 / $6 の従量課金 API の対比がラベル付けされ、右下隅に OrcaRouter のロゴが配置されている。
Guides & Insights

Intern-S2-397B vs Grok 4.6:つまみを回すのはどちらか

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Intern-S2-397B と Grok 4.6 は約1か月違いで登場し、同じ根本的な問いに対して正反対の答え方をしている。推論を誰が制御するのか、という問いだ。2026年8月12日に稼働開始した xAI の旗艦モデル Grok 4.6 は、あなたにダイヤルを売る。クローズドAPI上で設定可能な推論エフォート制御であり、価格は入力トークン100万個あたり2.00ドル、出力トークン100万個あたり6.00ドル、コンテキストウィンドウは50万トークン、xAIのサーバーサイドツールは別途課金される。Intern-S2-397B は、上海AI研究所のInternLMチームが9月13日にApache-2.0で公開した4030億パラメータの科学向けマルチモーダルモデルで、マシン全体をあなたに手渡す。重み、思考トグル、視覚経路、時系列ヘッドまで。そして自分で動かすことを期待している。一方はノブ付きでレンタルされ、もう一方は丸ごと所有される。ここで重要な比較は、ベンチマーク表でどちらが高いスコアを取るかではない。あなたのワークロードが実際に必要とするのはどちらの種類の制御か、そしてそれぞれの種類にいくらかかるのかだ。

2つの異なるダイヤル

この2つを最も明快に見分ける方法は、推論制御がどこにあるかに目を向けることだ。Grok 4.6はxAIのAPIを通じて推論エフォート設定を公開しており、その周囲にはサーバーサイドツール群——関数呼び出し、ウェブ検索、X検索、コード実行——があり、これらはxAIが運用し、別途課金する。あなたはエフォートを調整し、与えられたツールをつなぎ、重みには一切触れない。モデルの振る舞いはxAIの資産でありxAIの問題である。あなたのレバーはリクエスト内の1つのパラメータだ。

Intern-S2-397Bは、まったく異なるレバー一式を提供します。しかもそれらはスタックのより下層に位置します。思考はデフォルトで有効で、リクエストごとにenable_thinking=Falseで無効にできます。モデルがApache-2.0であるため、重みを取得して推論動作そのものを自社データでファインチューニングし、その結果をLMDeploy、vLLM、SGLangで配信することもできます。その入力サーフェスはテキストと画像のAPIより広く、時系列信号を受け取って予測を生成します。この機能は現在LMDeploy経由でのみ接続されており、またサンドボックス環境での長期的なエージェント作業向けにトレーニングされています。トレードオフも同じくらい明白です — そのレベルの制御は、それに付随するハードウェアと配信スタックを運用する覚悟がある場合にのみ意味を持ちます。

• 推論制御 — Grok 4.6:クローズドAPI上の推論努力ダイヤル 対 Intern-S2-397B:enable_thinkingトグルに加え、Apache-2.0下での完全な重みレベルの制御。

• ツール — Grok 4.6:xAIのサーバーサイドWeb検索、X検索、コード実行は別途課金。対 Intern-S2-397B:自分で接続するツール呼び出しに加え、LMDeploy を介した時系列予測の経路。

• 入力 — Grok 4.6: テキスト、画像、ファイル 対 Intern-S2-397B: テキスト、画像、時系列。

• コンテキスト — Grok 4.6:500,000トークン 対 Intern-S2-397B:テキスト推論256K、マルチモーダル64K、いずれもモデルカードによる数値。

• 価格 — Grok 4.6:100万トークンあたり$2.00 / $6.00、20万トークン超過時は$4.00 / $12.00へ段階制 対 Intern-S2-397B:料金表なし。セルフホストまたは公式Intern API。

数字が実際にカバーする範囲

以下の Intern-S2-397B の数値はすべて InternLM 自身のもので、OpenCompass、VLMEvalKit、AgentCompass を通して実行され、重みとともに公開されたものであり、独立した再現はありません。Grok 4.6 の数値は別種のものです。モデル公開後、公開アリーナと Artificial Analysis を通じて蓄積されたため、サードパーティのラベルが付いています。

独立測定側では、Grok 4.6は現在のArtificial Analysis Intelligence Indexで44に位置し、GPQA Diamondは94.9、Humanity's Last Examは61.0、コーディングスコアは76.8で、Artificial AnalysisはTerminalBench 2.1の数値を80.3近辺としている。ベンダー側では、Intern-S2-397BのカードがMMLU Proで89.77、HMMT-2026で93.56、MMMU Proで81.68、SWE-bench-Proで68.54を報告し、さらに科学系の行では別種のように見える。Biology-Instructionsで55.71、SciReasoner 1.5で63.28、Mol-Instructionsで53.95、MolecularIQで62.35だ。ベンダー表の中でエージェント開発者をたじろがせるはずの唯一の数字は、TerminalBench 2.1の64.04である——まさにGrok 4.6のようなレンタル型フロンティアモデルが最も強いターミナル作業の領域で、モデル自身の製作者が旧世代のクローズドモデルに大差で負けていると報告している数値だ。

その分け方はランキングではなく、人物像として読むべきだ。Intern-S2-397B は、有能な汎用モデルでもある科学分野の専門家であり、Grok 4.6 は、科学にちょっとした関心を持つ汎用モデルだ。科学系の行が偏っているのは想定内だ——図表、レイアウト、記号表記が一体になった科学文献の生ページで事前学習された汎用のフラッグシップなど存在せず、まさにそれが Intern-S2-397B の土台となっているパラダイムなのだ。どちらの証拠基盤にも「Intern-S2-397B は任意の推論において Grok 4.6 と同等に優れている」を支持するものは何もなく、Grok 4.6 の証拠にも、それがマルチオミクス配列解析向けに調整されたことを示唆するものは何もない。

支配の代償

Grok 4.6には、スプレッドシートにそのまま記入できる価格があります。入力トークン100万あたり$2.00、出力トークン100万あたり$6.00で、プロンプトが200,000トークンを超えると料金は$4.00/$12.00に上がり、さらに高速な応答のためのオプションの優先ティアもあります。OrcaRouterを通じて、xAIの定価を0%のマークアップでそのまま利用できます。そのためxAIでの料金改定は、中間業者の差分なしに同日中にここへ反映されます——あなたが借りているつまみは、ベンダーが値付けしたとおりの価格に保たれます。

Intern-S2-397Bには、公開されたトークン単価が一切ない。モデルカードは公式のIntern APIに言及しているが、人々が実際に比較したい経済性はセルフホストのものだ。403Bパラメータのチェックポイントで、BF16では188シャードにまたがる約807 GBの重みがあるため、本格的なマルチGPUノードが必要になり、FP8ビルドではフットプリントがほぼ半減する。すでにそのキャパシティを所有していれば、次の科学クエリの限界費用は電気代に近づき、それこそがApache-2.0の立場の狙いそのものだ。所有していなければ、その「無料」モデルは設備投資のパイロットであり、経費項目ではない。

この特定の組み合わせでルーターがもたらすのは、価格ではなく継ぎ目です。Grok 4.6 は、一般的な本番トラフィック用にすでにお持ちのキーで利用できます。Intern-S2-397B は OrcaRouter ではルーティングされません。まったく新しいチェックポイントであり、そこへの経路はベンダー自身の API か、セルフホスト型デプロイメントです。一般的でレイテンシに敏感な推論は従量課金モデルにルーティングし、科学関連のバッチ処理はご自身で運用するモデルに残し、どちらかのエンドポイントが異常なときは自動フェイルオーバーにカバーさせましょう。両者の境界は、2つ目の統合ではなくルーティングルールになります。

A generated two-column scoreboard titled Intern-S2-397B vs Grok 4.6 — the scoreboard. Left column Intern-S2-397B: Weights Apache-2.0 open; Reasoning control toggle plus full weight control; Inputs text, image, time series; Context 256K text / 64K multimodal; Independent score none yet; TerminalBench 2.1 64.04 vendor-reported. Right column Grok 4.6: Weights closed API only; Reasoning control effort dial; Inputs text, image, file; Context 500K tokens; Independent score AA Index 44, GPQA 94.9; TerminalBench 2.1 80.3 per Artificial Analysis. Footer reads Intern-S2-397B figures are InternLM's own, unreproduced; Grok 4.6 figures per Artificial Analysis and the vendor.

どちらを選ぶべきですか

汎用的な仕事で、推論が速く正確に返ってくる必要があり、それを生み出すスタックを自分で抱えたくないなら、Grok 4.6 を選ぼう。その 500K ウィンドウ、実測 GPQA Diamond 94.9、ツール群は本番運用向けの機能であり、$2/$6 の課金メーターは、何も運用しないことに対して支払うものだ。

入力が科学系のもの——図表の多い論文、分子構造図、時系列信号——であり、かつ、あなたの環境から外に出せないデータ上で、あるいは自分でファインチューニングしたい振る舞い上で推論を行う必要があるときは、Intern-S2-397Bを選ぼう。Apache-2.0ならそれが可能になる。レンタルAPIではできない。ハードウェアの予算を見込み、しばらくは独立したスコアボードは期待できないと心得て、InternLMの外部の誰かが再現するまでは、そのカードに載るあらゆる数値を主張として扱え。

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence, the description of Intern-S2-397B as a 403-billion-parameter multimodal foundation model for scientific intelligence and long-horizon agents, and the note that text reasoning benchmarks use a 256K inference length while multimodal benchmarks use 64K.A screenshot of the OrcaRouter model page for Grok 4.6 at orcarouter.ai/models/grok/grok-4.6, captured September 13, 2026, showing the model listing with its provider SpaceXAI, 500,000-token context window, and $2.00 / $6.00 per-million-token pricing displayed alongside the surrounding catalogue.