
Intern-S2-Mobius: 知識と推論を分離する35Bモデル
- qwenNEWQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 100万トークンあたり · 56 tok/s
- deepseekNEWDeepSeek: DeepSeek V4 Flash 07312026-07-3150知能69コーディング
- qwenNEWQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり · 201 tok/s
- orcaNEWOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNEWAnthropic: Claude Opus 52026-07-2461知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2150知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1651知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1557知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0951知能71コーディング
- openaiOpenAI: GPT-5.6 Terra2026-07-0955知能77コーディング
- openaiOpenAI: GPT-5.6 Sol2026-07-0959知能77コーディング
- grokxAI: Grok 4.52026-07-0854知能72コーディング
- tencentTencent: Hy32026-07-0641知能59コーディング
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232知能42コーディング
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226知能39コーディング
- anthropicAnthropic: Claude Sonnet 52026-06-3053知能72コーディング
- klingKling: Kling 3.0 Turbo2026-06-1757知能52コーディング57数学
- z-aiZ.ai: GLM 5.22026-06-1651知能69コーディング60数学
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242知能61コーディング61数学
Shanghai AI LaboratoryのInternLMチームがひっそりと公開したIntern-S2-Mobiusという35Bのオープンウェイト基盤モデルで、他の公開済みモデルがほとんどやらないことをします。つまり、知識をその層の中に保存するのをやめます。標準的なTransformer構成(各層が記憶した事実で満たされた独自のフィードフォワードブロックを持つ)の代わりに、Mobiusはその知識をすべて単一のグローバルに共有されたMemoryに引き出し、少数のReasonersがそれを繰り返しクエリできるようにします。主張されている利点は、より高いベンチマークスコアではありません。速度です。同じ答えが、およそ3分の1から5分の1の推論トークンで得られ、リクエストスループットは最大4.6倍になります。このガイドでは、Mobiusが実際に何であるか、モデルカードが明かしていない設定ファイルの内容、公開されているベンチマークが行ごとに示す結果(それが負ける2つの行を含む)、「4倍高速」という主張がどこで成立しどこで消えるのか、そして誰が現実的に気にするべきかについて説明します。
正確性に関する注記: 以下のすべての数値は、InternLM自身のモデルカード、公開されている性能・効率の数値、デプロイガイド、およびHugging Face上のモデル設定ファイルに基づいています。本稿執筆時点で、Intern-S2-Mobiusに対する独立した第三者による評価は存在しません。独立したリーダーボードに掲載されておらず、推論プロバイダーによるデプロイもなく、ダウンロード数もまだゼロのままです。比較数値はすべて、誰かが再現するまではベンダー報告値として扱ってください。このように新しいモデルの仕様やコードは急速に変更されます。構築する前に検証してください。
TL;DR。Intern-S2-Mobiusは、35Bパラメータ・Apache 2.0ライセンスのマルチモーダル基盤モデルであり、Qwen3.5-35Bから継続事前学習され、その後SFTと強化学習でポストトレーニングされています。その新規性はアーキテクチャにあります。Mobius-v0設計は、層に束縛されたフィードフォワード知識ストレージを、2,560エキスパートからなる単一のグローバル共有メモリに置き換え、4つの積み重ねられたReasonerブロックが照会します。これらのブロックは、自身の深さの外にある知識に到達でき(バックワード残差接続)、デコード前に反復的な潜在反復を通じて隠れ状態を洗練します(動的潜在推論)。InternLM自身の評価では、このモデルは構築元のQwen3.5-35Bベースラインを9つの一般ベンチマーク中7つで上回り(平均67.88対65.05)、科学タスクでは圧倒的な差をつけます(52.14対18.20)。一方、推論トレースは平均で約1.5倍短く、MMLU Proでは4.6倍、GPQA Diamondでは5.0倍短くなります。このトレース圧縮がスループット向上の源泉であり、バッチ16では2.9倍、バッチ256では4.6倍に達します。ただし、課題は確かに存在します。最も難しい2つの推論ベンチマーク(HLEとUGD hard)では劣り、競技数学ではスループットの利点がほぼ消失します。さらに、実験室外では誰もこれらの結果を検証していません。
重要なポイント
• アーキテクチャ優先のリリース: Mobius-v0 は知識ベクトルを推論オペレータから分離する — 各層がそれぞれ独自のFFN知識を抱える40レイヤーではなく、4つのReasonerブロックにサービスを提供する2,560エキスパートからなる共有メモリを1つ使用する。
売りはインテリジェンスではなく効率性だ。Transformerベースラインと比較して、平均出力長は約1.5分の1に減少し、リクエストスループットはバッチサイズ16で2.9倍、バッチサイズ256で4.6倍に向上する。
• 実際に自社のベースモデルを上回っています。一般的なタスクの平均は67.88対65.05で、MMLU Pro(89.05対85.31)、AIME 2026(95.31対92.08)、HMMT 2026(85.51対78.50)に勝利しています。
• しかし、熟慮が最も重要となる場面では劣る: HLE 19.11 vs 22.40、UGD hard 73.02 vs 78.02 — このセットで最も困難な2つの評価であり、どちらもプレーンなTransformerが勝利した。
科学分野の飛躍が最大の成果です:Biology-Instructions は 51.40 対 3.77、Mol-Instructions は 45.73 対 21.70、MolecularIQ は 59.29 対 29.13。
• オープンだが利用不可:Hugging Face上のApache 2.0ウェイト、ホストする推論プロバイダーなし、約73GBのbfloat16ウェイト — 現時点で実行する唯一の方法はセルフホスティングである。
Intern-S2-Mobiusが実際に何であるか
Intern-S2-Mobiusは、上海AI研究所のInternシリーズを手がけるHugging Face組織であるinternlmが公開した35Bパラメータの基盤モデルです。重みは2026年7月29日にHugging Face上に公開され、付随するGitHubリポジトリ(README、導入ガイド、完全なテクニカルレポートPDF)は2026年8月5日に公開されました。Apache 2.0の下でリリースされており、これはオープンウェイトとしてはほぼ最大限に寛容なライセンスで、商用利用、改変、再配布がすべて許可されています。
これはファインチューニングではありません。これはアーキテクチャ改造を伴う継続事前学習です。InternLMは、アリババが2026年3月4日に公開したオープンウェイトの35B混合専門家モデルであるQwen3.5-35Bを基に、モデルが知識を保存・アクセスする方法を再構築し、その結果に対して継続事前学習を実行し、さらにその上に教師ありファインチューニングと強化学習を適用しました。この出自はベンチマークを解釈する上で重要です。InternLMが公開するすべての比較は、Mobiusがその成長元となった正確なモデルとの比較であり、これはアーキテクチャ変更の最もクリーンなアブレーションであると同時に、都合よく、最も好意的に見える可能性が高い比較でもあります。
このモデルはマルチモーダルです。Hugging Faceはこれをimage-text-to-textに分類しており、設定からは完全なビジョンエンコーダとビデオトークン処理が確認できます。また、重みとともに提供される内容から判断すると、このモデルは明確に科学分野を対象としています。詳細は後述します。
メビウスアーキテクチャを平易な英語で
従来のTransformerは、すべての層で2つの仕事を交互に行う。アテンションはトークン間で情報を移動させ、フィードフォワードネットワーク(または mixture-of-experts モデルでは、エキスパートFFNの集合)が知識を格納する。FFNは層の内部に存在するため、FFNが保持する知識にアクセスできるのはその深さだけである。層30に学習された事実は、層5で行われている推論から参照することはできない。情報は層ごとに前方へ流れる。それが唯一の経路である。
Mobiusはその束縛を断ち切る。InternLMは3つの結果を説明する。
知識と推論の分離。層に紐づいたFFNストレージは、グローバルに共有されるMemoryに置き換えられる。40層がそれぞれモデルの知識の一部を所有するのではなく、すべての推論段階がアクセスできる単一のプールが存在する。InternLMの主張は、これにより知識の圧縮が向上する——同じ事実を複数の深さで冗長に再学習する必要がなくなる——そして各Reasonerに、単一層のFFNが提供できるよりもはるかに広い知識空間を与える、というものである。
後方残差接続。 メモリが共有されているため、浅い推論段階と深い推論段階の両方が同じリポジトリに到達します。知識へのアクセスはもはや厳密に前方へ流れるだけではありません。浅い段階は、標準的なスタックでは30層後になって初めて利用可能になるものを引き出すことができます。InternLMの主張は、これによりモデルが深さをまたいで知識をより柔軟に構成でき、そして重要なことに、より少ない推論ステップで有用な情報を合成できるということです。この最後の節が今回のリリースの主張の核心です。
動的潜在推論。 Mobiusは、推論の各ステップを可視化された思考連鎖トークンとして外部化する代わりに、何かをデコードする前に、リカレントな潜在反復を通じて連続的な隠れ状態を洗練させます。「思考」の一部は生成されたテキストではなくモデルの内部表現空間で行われ、その内部計算の量はトークンごとに動的に割り当てられます。実際の効果として、モデルは同じ結論に達するために書く語数を減らせます。生成は自己回帰的で直列化されているため、書く語数を減らすことは、推論モデルを高速化する最も直接的な方法なのです。
まとめると、そのピッチは、より考え、より少なくタイプする推論モデルです。

設定ファイルが明らかにすること
モデルカードはアーキテクチャについて文章で説明しています。code>config.json/code> がそれを具体化しており、知っておくべき数値がいくつか含まれています。
• 40層にわたる4つのReasoner。 テキスト設定では40の隠れ層が宣言されているが、ブロックは4つだけである。40の層は、40個の独立した知識+注意ユニットではなく、共有メモリに対して反復処理を行う4つのReasonerステージに編成されている。
• 2,560エキスパート。 これは共有メモリを文字通り具現化したものです。Mobiusは、トークンごとに8つがアクティブになる2,560のエキスパートを持ち、エキスパートごとの中間サイズはわずか512で、さらに1つの共有エキスパートを備えています。規模の参考までに、その姉妹モデルであるIntern-S2-Previewは256エキスパートを使用します。10倍多い、はるかに小さなエキスパートのプールは、「レイヤーごとのFFNの代わりに1つのグローバル知識ストア」を設定として書き下したときに、まさに目にする姿です。
• 箱には35B、ディスク上では約36B、アクティブは約3B。モデルカードは35Bと記載されています。Hugging Face の safetensors リーダーは36Bパラメータと報告し、重みインデックスはbfloat16で合計72.96GB、これはおよそ36.5Bに相当します。デプロイメントガイドが最も正確で、このリリースを30B-A3Bモデルと呼んでいます — トークンあたり約3Bのパラメータがアクティブです。他のスパースMoEと同様に、メモリ上では全重みセットを保持しつつ、トークンごとに小さなモデル相当の計算量になります。
• ハイブリッド・アテンション、3:1。層構成は、線形アテンション層3つにつき完全アテンション層1つの割合で交互に配置され、これを全層にわたって繰り返します。40層のうち完全アテンション層は10層です。線形アテンションは、長いコンテキストのメモリと計算量の爆発を抑えます。定期的に挟まれる完全アテンション層は、純粋な線形アテンションでは犠牲になる正確な想起を保持します。線形層は、幅4の畳み込みカーネルとfloat32のSSM状態を使用します。これは現在標準となっているgated-delta方式のレシピです。
• 256Kコンテキスト。最大位置埋め込みは262,144です。アーキテクチャがサポートしていることと、評価された方法の間のギャップに注意してください:InternLMはテキストベンチマークを128Kで、MMLU Pro、SimpleQA、HLEでは64Kで実行しました。256Kという上限は、検証済みの品質が256Kであることと同じではありません。
• 組み込みのマルチトークン予測ヘッド。1層のMTPモジュールがあり、独自の256エキスパートを備えています。これは飾りではありません。デプロイメントガイドでは、MTP投機的デコードと4つのドラフトトークンを使用した実行を推奨しています。つまり、実際の速度向上の一部は投機的デコードによるものであり、アーキテクチャだけによるものではありません。
• 本物のビジョンタワー。27層・1152隠れユニットのビジョンエンコーダで、パッチサイズ16、2x2空間マージ、動画用の時間パッチングを備え、インターリーブ型マルチモーダルRoPEを用いて2048次元のテキストストリームに投影します。画像と動画を入力し、テキストを出力します。
• 興味のある方のためのその他の詳細: ヘッド次元256の16個のアテンションヘッド、2個のキー・バリューヘッド(アグレッシブなグループ化クエリアテンション)、ゲート付きアテンション出力、部分的なロータリー係数0.25、RoPE theta 1,000万、そして251,392トークンの語彙。
ベンチマーク、一行ずつ
InternLMはOpenCompassを用いて評価し、単一の比較結果を公開した:Intern-S2-Mobius-35Bと、その継続事前学習の基となったモデルであるQwen3.5-35Bとの比較である。一般ベンチマークは9つ、科学ベンチマークは3つ。
一般的なタスクでは、Mobiusが9勝中7勝を挙げています。MMLU Proは、オリジナルのMMLUより難しいディストラクタを持つ広範なマルチドメイン知識ベンチマークであり、89.05対85.31と3.7ポイントの差をつけ、このセットで最も明確な知識性能の結果となりました。GPQA Diamondは、Google検索では答えにたどり着けないように作られた大学院レベルの科学問題であり、80.81対80.24ではほぼ互角です。IMO Benchは、数学オリンピックレベルの問題であり、81.25対77.50となっています。AIME 2026は、アメリカ数学招待試験であり、95.31対92.08となっています。HMMT 2026は、ハーバード・MIT数学トーナメントであり、85.51対78.50と数学系で最大の差がつきました。AMOは58.00対50.00です。そしてSimpleQAは、モデルが実際に知識を持っているかを最も直接的に測る短答形式の事実想起ベンチマークであり、21.39から28.90へと跳ね上がりました。これは35%の相対改善であり、InternLMの「共有メモリは知識をより良く圧縮する」という主張を裏付ける最も有力な証拠です。
次に、その2つの敗北が興味深い行です。UGD hardは逆の結果です。Mobiusが73.02、ベースラインが78.02で、5ポイントの差です。そしてHLE(Humanity's Last Exam、広く使われている中で最も難しい一般的な評価で、最先端モデルでも10点台から20点台のスコアしか取れない)は19.11対22.40です。この最も推論を必要とするよう特別に設計されたベンチマークでは、通常のTransformerが3.3ポイント差で勝っています。
そのパターンはノイズでもなければ、隠されているわけでもない。InternLMが公開しているのだ。最も妥当な解釈は、潜在推論は圧縮であり、圧縮は末尾で損失を伴うというものだ。検索中心の推論や、よく知られた形に従う推論——MMLU Pro、SimpleQA、そしてほとんどの競技数学が該当する——では、思考を連続的な隠れ状態に内面化することが見事に機能する。しかし、真に長く、探索的で、誤りを訂正していく思考の連鎖を必要とする問題では、明示的なトークン単位のトレースは依然としてそのコストに見合うと思われる。全体の平均——67.88対65.05——は確かな勝利だが、その平均は一様な改善ではなくトレードオフを隠しているのだ。
科学的な結果は、桁違いの差です。Biology-Instructionsは3.77から51.40へと上昇しています。Mol-Instructionsは、分子の理解と生成を扱い、21.70から45.73へと上昇しています。MolecularIQは29.13から59.29へと上昇しています。平均は18.20に対して52.14です。3.77が51.40に上昇するような数字は、アーキテクチャの勝利ではありません。それらは、ベースラインがそもそも教えられていなかったタスクに対する、ターゲットを絞ったドメイン学習の特徴です。Qwen3.5-35BがBiology-Instructionsで4%未満のスコアであることは、生物学が苦手だという意味ではなく、タスク形式を理解していないことを意味します。これら3つの行は、「InternLMは科学特化を追加した」と読むべきです。これは本当に価値があり、Intern-Sラインの存在意義そのものです。ただし、それをMobiusアーキテクチャの功績と見なしてはいけません。
「4倍速い」が現実に当てはまるケースと、当てはまらないケース
効率性に関する主張はこのモデルが存在する理由であるため、慎重に読む価値がある。InternLMの見出しは「エンドツーエンドの推論速度が約4倍」である。公表されているスループットの数値は、見出しよりも有益であり、より正直である。
バッチサイズに対するリクエストスループットとして、ベンチマーク全体で平均すると、MobiusがTransformerベースラインを上回る幅はバッチ16では2.9倍、バッチ256では4.6倍です。その差はバッチサイズが大きくなるほど広がります。これは、1リクエストあたりの生成トークン数が少ないことに起因しており、詰め込むリクエストが多いほど、節約されたデコードステップが積み重なるためです。「約4倍」という見出しは範囲の中間点であり、一定の値ではありません。
ベンチマークごとに分解すると、状況はより明確になります。それでは、MMLU ProとGPQA Diamondでは、Mobiusはあらゆるバッチサイズで劇的に高速です。スループット曲線はすぐに分離し、さらに乖離し続けます。それでは、IMO Benchでは、それは一貫して控えめにリードします。それでは、AIME 2026とHMMT 2026では、ベースラインのTransformerが実際により高速なのは中間のバッチサイズであり、Mobiusが先行するのはバッチ256でのみです。最も難しい競技数学では、スループットの利点は実用範囲の大部分で互角かそれ以下です。
なぜなら、スループットはトレース圧縮とほぼ完全に追従するからです。ベンチマーク全体の平均出力長は、約20,400トークンから約13,200トークンへと約1.5倍短くなります。しかし、その平均は非常に広い範囲に及びます:MMLU Proでは4.6倍短く(約1,100トークン対5,150トークン)であり、GPQA Diamondでは5.0倍短く(約2,600対12,900)であり、一方わずかIMO Benchでは1.4倍、AIME 2026では1.5倍、そしてHMMT 2026では1.2倍です。モデルが思考を圧縮できる場合、それは非常に高速です。しかし、問題がどうしても24,000トークンの導出を必要とする場合、それは不可能で、代わりにアーキテクチャのオーバーヘッドが現れます。
実用的に言い換えると、あなたのワークロードが知識検索、多肢選択、技術的なQ&A、または分類のようなものであれば、高速化は大きく、すぐに実感できます。難しい数学的・科学的導出が中心のワークロードであれば、ほぼ同等の性能と見込んでおき、嬉しい驚きがある程度に考えてください。「4x faster」をモデルの一律の特性として引用する人は、非常に異なる2つの挙動の平均値を引用しているにすぎません。

ファイルリストに隠れたサイエンススタック
このリリースについて最も示唆に富む点の1つは、モデルカードにはまったくありません。リポジトリのファイル一覧にあります。通常のトークナイザファイルに加えて、Intern-S2-Mobiusには3つの追加ドメイントークナイザが含まれています:code>tokenizer_PROT.model/code>(プロテイン配列用)、code>tokenizer_SMILES.model/code>(SMILES表記の分子構造用)、およびcode>tokenizer_XNA.model/code>(核酸配列用)。また、リポジトリには地震データのNumPy配列が一つぽつんと置かれています。
タンパク質、分子、DNA/RNA専用のトークナイザーは、安易に追加できるものではない。それらが存在するということは、モデルがそうした配列タイプを、たまたま文字を含むだけの通常のテキストとしてではなく、第一級の入力として読み取るよう訓練されたことを意味する。それがBiology-Instructionsのスコアを3.77から51.40へと変えた要因であり、Mobiusを、時系列データとビジョンのモダリティを追加した姉妹モデルIntern-S2-Previewと同じファミリーに位置づける。InternLMによれば、Intern-S2-Previewは材料結晶構造生成機能を備えた初のオープンソースモデルである。
{{1}}一般的な開発者にとって、これは些末な話題に過ぎないでしょう。{{/1}} {{2}}計算生物学、ケモインフォマティクス、または材料科学に携わっているなら、これはこの記事で最も重要な一文かもしれません。つまり、SMILESとタンパク質配列をネイティブに解釈できる、小規模でApache-2.0ライセンスのセルフホスト可能なモデルです。{{/2}}
Intern ファミリー内での位置付け
Intern-S シリーズは、上海AI研究所の科学系マルチモーダルシリーズです。Intern-S1がその形式を確立し、Intern-S1-Proがそれを1兆パラメータ規模へと拡大しました。Mobiusの直前にリリースされたIntern-S2-Previewは、効率性を重視したモデルです。合計36B・アクティブ3Bのパラメータを持ち、256のエキスパートと262Kのコンテキストを備え、InternLMは中核的な専門科学タスクにおいて1兆規模のS1-Proに匹敵すると主張しています。これは、同等の科学的能力に対して約30倍のパラメータ削減を実現したことになります。
Intern-S2-Mobiusは第三のもの、つまり一つのアーキテクチャリリースで、Intern-S2の名を冠しています。Mobius-v0の「v0」はそのラベルで実際の役割を担っています。これは設計の最初の公開イテレーションであり、成熟した製品ラインではありません。接続先はArchSpace、InternLMのオープンプラットフォームであり、LLMアーキテクチャの革新を検証するためのものです。その目標は「LLMアーキテクチャの探求をコミュニティの再利用可能な知識に変えること」であり、ピアレビューと否定的な結果を含む公開された結果を伴っています。Mobiusは、提案が1B規模のプローブから実際にダウンロード可能な35Bモデルへと卒業するときの、そのプログラムの姿です。導出を必要とする人のために、完全なテクニカルレポートがGitHubリポジトリに同梱されています。
その観点で見れば、2つのベンチマークでの性能低下は、今回のリリースの特徴であって、不名誉なことではない。これは、ある研究所がアーキテクチャ実験の結果を、退行した部分も含めて正直に公開しているという意味だ。
実行方法
Intern-S2-Mobiusは3つの推論スタックによってサポートされており、デプロイメントガイドにはそれぞれの動作する呼び出し方法が記載されています。
LMDeployは、シングルGPUでガイドが示す推奨経路であり、唯一の方法です。PyTorchバックエンドでサーブし、code>--trust-remote-code/code>、テンソル並列度1、そして4つのドラフトトークンを備えたqwen3_5_mtp投機的アルゴリズムによるMTP投機的デコードを有効にします。vLLMは、テンソル並列度2、qwen3推論パーサー、qwen3_coderツール呼び出しパーサー、自動ツール選択、そして4つの投機トークンによるMTP投機的デコードを使用して示されています。Transformersは、基本的な推論にはcode>AutoModelForImageTextToText/code>を使用し、code>trust_remote_code=True/code>およびbfloat16で動作します。なお、モデルにはカスタムモデリングコードが同梱されているため、リモートコードの実行が必須であり、configはTransformers 5.2を対象としています。
InternLMの推奨サンプリングパラメータは、temperature 0.8、top-p 0.95、top-k 50、min-p 0.0です。これは、ほとんどの推論モデルが求めるニアグリーディな設定よりも温度が高く、習慣的に上書きするのではなく、尊重する価値があります。
ハードウェアについて:bfloat16の重みだけで約73GB、さらにKVキャッシュとアクティベーションを加えると、80GBのアクセラレータ1枚ではぎりぎりであり、141GBのカード1枚なら余裕があります。これはおそらく、vLLMの例が2つのGPUを使用する一方、LMDeployの例が1つの大型GPUを想定している理由でしょう。長いコンテキストを扱う作業では、さらに必要量が増えます。MTPを有効にしてください。ガイドでは明示的に推奨されており、宣伝されている高速化の相当部分はベースアーキテクチャではなくそこにあります。
最も重要な実用的な注意点:現在、このモデルをホストしている推論プロバイダーはありません。 Hugging Faceのプロバイダーパネルにもそれが明確に記載されており、執筆時点でのダウンロード数はまだゼロでした。APIエンドポイントもなく、100万トークンあたりの価格もなく、管理された方法で試すこともできません。今日において、セルフホスティングが唯一の選択肢です。

実際に気にするべきなのは誰か
1. 高ボリュームの検索型推論ワークロードを実行するチーム
これこそ、このアーキテクチャが構築されたプロファイルです。推論モデルを通じて技術系Q&A、文書分析、構造化抽出、多肢選択式分類の大規模バッチを処理しており、かつ請求額の大半がユーザーに決して表示されない推論トークンで占められているなら、同じ回答に5分の1のトークンで到達するモデルは、直接的なコスト削減となります。MMLU ProとGPQAの数値——トレースが4.6倍・5.0倍短く、精度は同等以上——は、まさにこのパターンを示しています。鵜呑みにする前に、自社のトラフィックでベンチマークしてください。ただし、この仕組みは理にかなっており、インセンティブは大きいです。
2. 計算科学グループ
ネイティブなタンパク質・SMILES・核酸トークナイザーを備え、生物学および分子ベンチマークで大きな測定上の向上を達成し、1~2個のGPUで動作するApache 2.0モデルです。データをオンプレミスに保持する必要があり、分子構造を商用APIに送信できないラボにとって、その組み合わせは稀です。Intern-Sシリーズはこれを目指して構築されてきており、Mobiusはこれまでのところ、その中で最も手頃な入門点です。
3. 研究者とアーキテクチャウォッチャー
知識と推論の分離と潜在推論は、しばらく前から活発な研究テーマですが、35B規模で検証され、失敗事例をそのまま含めてオープンに公開されたものはごくわずかです。ポストTransformerアーキテクチャが次にどこへ向かうのかに関心があるなら、技術レポートと、負けた2つの行は、平均スコアよりも興味深いものです。ArchSpaceは、この種の結果を再利用可能にするために明示的に構築されています。
少なくとも今のところ気にしなくてよいのは、本番運用できる汎用アシスタントを探している人たちだ。ホスト型エンドポイントも、独立した評価も、エコシステムツールも、実績もない。それはモデルへの批判ではなく、発表から1週間の研究リリースの説明である。
本番スタックにどう適合するか
Intern-S2-Mobiusの今日の正直な位置づけは、評価候補であり、デフォルトモデルではありません。これは、ホストされておらず、未検証で、1週間前に作られた研究用アーティファクトであり、実に興味深いアーキテクチャと、1つの非常に具体的な強み——検索型タスクにおけるトークン効率的な推論——を持ち、さらに科学シーケンスデータにおける真の専門性を備えています。
賢明なパターンは、本番トラフィックをOrcaRouterのようなベンダーニュートラルなエンドポイントに置くことです。OrcaRouterは多数のモデルにわたって単一のOpenAI互換APIを提供します。そして、Mobiusが勝つ可能性のある狭い領域に限り、自前のGPU上でMobiusを別途立ち上げます。このモデルにとって実際に重要なことを測定してください:精度だけではなく、正解あたりに費やされるトークンです。それがMobiusが最適化されている軸であり、ほとんどの評価ハーネスが無視している軸でもあります。あなたのワークロードでそれが有効なら、運用コストが安く、法的にも制約のないセルフホストの選択肢が得られます。もし有効でなければ、GPU時間の1日を失うだけで、本番パスは一切変更されません。
同じ論理が逆方向にも当てはまります。プロバイダーが最終的にそれをホストする場合、ルーターを使えば既存モデルに対して新モデルを何も書き換えずにA/Bテストでき、これは誰も独立に検証していないアーキテクチャを採用するためのまさに正しい方法です。
制限事項と注意事項
一番大きなものから始めよう:この記事の数字には、独立した検証が一切存在しない。あらゆるベンチマーク、あらゆるスループット曲線、そしてあらゆるトークン長の比較は、InternLM から得られたものだ。この比較は構造的にも有利である——Mobius は、継続事前学習の基となった特定のベースラインとのみ比較されており、現在の最先端モデルとは比較されていない。さらに、追加の SFT と RL によるポストトレーニングが施されているため、この比較は、そう提示されてはいるものの、クリーンなアーキテクチャのアブレーション研究ではない。性能向上の一部は Mobius によるものであり、一部は単にトレーニング量の増加によるものだ。
回帰は現実のものであり、最も困難なタスクで発生しています。HLEで3.3ポイント、UGDハードで5ポイント失い、ほぼすべてのより易しいタスクで勝利しているというのは、推論効率を売りにするモデルにとって、一貫性があり、やや懸念すべき兆候です。
運用上、この摩擦は大きいものです。カスタムモデリングコードは code>trust_remote_code/code> と最先端のTransformersバージョンを意味します。それをサポートするフレームワークは、code>interns2_mobius/code> が何であるかを知るのに十分新しいものでなければなりません。また、InternLM自身のガイドは、これらが活発に開発中の参照構成であると警告しています。約73GBのウェイトはノートパソコン向けモデルではありません。ホスト型APIも、価格も、レート制限も、SLAもありません——サービスが存在しないからです。
最後に、公開されていない点に注意したい。完全なビジョンエンコーダーを搭載しているにもかかわらずマルチモーダルベンチマークの結果がなく、256Kの上限があるにもかかわらずロングコンテキスト評価がなく、コーディングベンチマークは全くなく、安全性やアライメント評価もなく、Qwen3.5-35B以外のモデルとの比較もない。汎用デプロイメントを考えれば、これらは大きな空白部分である。一方、重み付きのアーキテクチャ論文としては、これらは単に範囲外である——このリリースはそう読むのが正しい。
よくある質問
Intern-S2-Mobiusとは何ですか?
上海AI研究所のInternLMチームによる、35Bパラメータ、Apache 2.0ライセンスのマルチモーダル基盤モデル。知識の保存と推論計算を分離するMobius-v0アーキテクチャに基づいて構築されている。Qwen3.5-35Bから継続事前学習され、SFTと強化学習によるポストトレーニングが施され、2026年7月29日にHugging Faceで公開された。
モビウスアーキテクチャの違いは何ですか?
従来のTransformerは、各層の内部にあるフィードフォワード・ブロックに知識を格納しているため、知識はそれが存在する深さでのみアクセス可能です。Mobiusはこれを、グローバルに共有される単一のMemory(公開設定では2,560のエキスパート)に置き換え、4つのReasonerブロックが繰り返しクエリします。これにより、深さをまたいだ知識アクセスが可能になり、思考の一部を生成されるチェーン・オブ・ソート・トークンではなく、連続的な隠れ状態で行うことができます。
Intern-S2-Mobiusは本当に4倍速いのですか?
平均的には、また大きなバッチサイズでは、おおむねその通りです。InternLMはバッチサイズ16でリクエストスループットが2.9倍高く、バッチサイズ256では4.6倍に上昇します。ただし、タスクによって大きく異なります。MMLU ProとGPQA Diamondでは、どのバッチサイズでも改善幅は大きいですが、AIMEやHMMTのような競技数学では、中間のバッチサイズではベースラインのTransformerの方が実際には高速です。高速化の度合いは、モデルが推論トレースをどれだけ短縮できるかに応じて変わります。
Qwen3.5-35Bと比べてどうですか?
9つの一般的なベンチマークのうち7つで勝利し、平均は65.05に対して67.88となり、MMLU Pro(89.05対85.31)、AIME 2026(95.31対92.08)、HMMT 2026(85.51対78.50)、SimpleQA(28.90対21.39)が含まれます。UGD hard(73.02対78.02)とHLE(19.11対22.40)では敗れています。科学的なタスクでは大きくリードしており、平均は18.20に対して52.14です。
Intern-S2-Mobius は API 経由で使用できますか?
現在はありません。{{1}}推論プロバイダーはどこもホストしておらず、公開された料金もなく、Hugging Faceにもデプロイの記載はありません。{{/1}}{{2}}今日このモデルを実行する唯一の方法は、LMDeploy、vLLM、またはTransformersを使ったセルフホスティングです。{{/2}}
それを実行するにはどのハードウェアが必要ですか?
The weights are about 73 GB in bfloat16, so plan on one 141 GB-class accelerator or two 80 GB GPUs, plus headroom for KV cache. InternLM's LMDeploy example uses tensor parallelism of 1; its vLLM example uses 2. Enabling MTP speculative decoding with four draft tokens is recommended.
そのコンテキスト長はどれくらいですか?
この構成は262,144トークン(256K)をサポートしています。InternLMはほとんどのテキストベンチマークでは128K、MMLU Pro、SimpleQA、HLEでは64Kで評価されていることに注意してください。そのため、フル256Kでの検証済みの品質は実証されていません。
マルチモーダル対応ですか?
はい。Hugging Face はこれを image-text-to-text として分類しており、設定にはビデオトークン処理を備えた27層のビジョンエンコーダーが含まれています。しかし、InternLM は今回のリリースでマルチモーダルベンチマークの結果を公開していないため、実際のところ視覚機能は未文書化の状態です。
なぜタンパク質とSMILESトークナイザーを同梱しているのですか?
Intern-S ラインは科学モデルファミリーだからです。タンパク質配列、SMILES分子表記、核酸に特化したトークナイザーを備えているため、モデルはそれらの形式をネイティブな入力タイプとして読み取ります。そのため、ベースラインが3.77を記録するBiology-Instructionsにおいて、51.40を獲得しています。
ライセンスは本当にApache 2.0ですか?
はい — Apache 2.0 で、リポジトリにライセンスファイルが含まれています。商用利用、改変、再配布が許可されており、大手研究所による多くのオープンウェイト公開よりも際立って寛容な条件です。
本番環境で使用すべきですか?
まだです。これは登場から1週間で、ホスティングされておらず、第三者による検証もなく、コーディング、マルチモーダル、長文コンテキスト、安全性の評価が欠けています。トークン効率的な推論や科学的シーケンス作業の評価候補として扱い、本番トラフィックは確立されたモデルにベンダーニュートラルなエンドポイント経由で維持し、独立した数値が存在する時点で再検討してください。
結論
Intern-S2-Mobiusは、今年のモデルリリースの中でも本当に興味深いもののひとつであり、その理由のほとんどはスコアとは関係がない。InternLMは、本物のアーキテクチャ上のアイデア——知識をレイヤーに紐づけるのをやめ、単一の共有Memoryに置き、モデルが思考の一部をトークンではなく潜在空間で行えるようにする——を35Bにスケールし、適切にトレーニングし、Apache 2.0のもとで重みを技術レポートと、期待どおりにはならなかった結果とともに公開した。効率性のメカニズムは明確であり、その根拠は内部的に一貫している。トレースは平均で1.5倍、知識集約的なタスクでは最大5倍短くなり、スループットはまさにそこから予測される比率で向上する。
注意点も同様に明確だ。上海AI研究所の外部で、ひとつの数字すら検証した者はいない。比較対象はモデル自身のベースであり、追加のポストトレーニングを含むため、見た目ほどのクリーンなアブレーションではない。高速化は難しい数学ではほぼ消えてしまう。モデルは自社の表の中で、最も要求の厳しい2つの推論ベンチマークで負けている。そして、GPUをレンタルしなければ試す方法はない。
つまり、今週デプロイすべきモデルではないが、非常に注目に値するモデルであり、特定の2つのオーディエンスにとっては真に魅力的な選択肢だ。すなわち、推論費用の大半を誰も読まないトークンが占めているチームと、タンパク質や分子をネイティブに扱える、小型でパーミッシブライセンスのモデルを必要とする科学グループである。本番スタックは OrcaRouter のようなベンダー中立のエンドポイントを通じて実績のあるモデルに据え置き、Mobius は限定的なユースケース向けに自社ハードウェアで稼働させ、精度だけではなく正解あたりのトークン数を測定すべきだ。このアーキテクチャが独立した精査に耐えられれば、Mobius-v0 は35Bモデルとしてではなく、重要だったバージョンの直前のバージョン番号として記憶されるだろう。
