一張生成的導覽卡片,比較 Intern-S2-397B 與 Intern-S2 Mobius,左側展示一個具備 4,030 億參數的大型科學多模態 MoE,並帶有標示為旗艦 397B 的文獻頁面輸入;右側則是一個精簡的 350 億參數推理器,具備共享記憶區塊與迭代迴圈,標示為 Mobius-v0,右下角則有 OrcaRouter 標誌。
Guides & Insights

Intern-S2-397B vs Intern-S2 Mobius:397B 旗艦與 35B 推理模型

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Intern-S2-397B 與 Intern-S2 Mobius 都是 InternLM 的模型,兩者皆採用 Apache-2.0,也都叫 Intern-S2,但在這個名稱之下,它們可說截然不同。Intern-S2-397B 是旗艦款:一個擁有 4030 億參數的專家混合模型,鎖定科學智慧與長時程代理人應用,由 InternLM 於 2026 年 9 月 13 日發布。Intern-S2 Mobius 則是一項 350 億參數的推理實驗,於 2026 年 7 月 29 日問世,建構在 Mobius-v0 架構上,具備全域共享記憶體與迭代推理器,並以 Qwen3.5-35B 進行持續預訓練。名稱衝突正是這篇比較必須存在的全部原因,因為搜尋「Intern-S2 評測」會同時出現這兩款模型,而這兩者在任何一個方向上都不是彼此的替代品。

兩種架構,兩項任務

Intern-S2-397B 是一款傳統的 transformer MoE,在關鍵之處做寬:60 層、512 個專家、每個 token 啟用 10 個、256K 的文字推理上下文與 64K 的多模態上下文,以及可接收文字、影像與時間序列的輸入介面。其預訓練範式閱讀科學文獻的原始頁面——圖表、版面、符號標記與散文一併處理——而其強化學習橫跨二十多個科學領域,外加在沙箱環境中的長時程代理訓練。它是專家模型,同時也是通用模型:在其自家成績單上,MMLU Pro 89.77、MMMU Pro 81.68、SWE-bench-Pro 68.54,全為 InternLM 所報告且未經重現。

Intern-S2 Mobius 是對一個不同問題的不同押注。Mobius-v0 架構不是逐層綁定知識儲存與推理計算,而是保留一個全域共享的知識向量 Memory,並讓多個 Reasoners 對其進行迭代,在高密度連續表徵上精煉隱藏狀態。其賣點是推理效率:相較於它所衍生自的 Qwen3.5-35B 基線,端到端速度提升近 4 倍,同時推理分數相當或更強。這是關於特定基線的吞吐量主張——而且是供應商主張,沒有獨立重現——但這正是該模型存在的原因。

架構 — Intern-S2-397B:標準 transformer MoE,60 層,512 個專家/10 個啟用,對比 Intern-S2 Mobius:Mobius-v0,共享記憶 + 迭代推理器。

• 規模 — Intern-S2-397B:總計 403B,BF16 格式的權重約 807 GB;相較之下,Intern-S2 Mobius:總計 35B。

• 譜系 — Intern-S2-397B:原始科學預訓練範式 vs Intern-S2 Mobius:從 Qwen3.5-35B 持續預訓練。

• 輸入 — Intern-S2-397B:文字、圖像、時間序列,對比 Intern-S2 Mobius:文字、圖像。

• 上下文 — Intern-S2-397B:256K 文字 / 64K 多模態,對比 Intern-S2 Mobius:尚無獨立公布的上下文數值。

• 速度宣稱 — Intern-S2-397B:未宣稱 vs Intern-S2 Mobius:相較於 Qwen3.5-35B 基準,端到端推理速度幾乎提升 4 倍,據廠商報告。

• 獨立證據——兩個模型皆無第三方評分。

哪個號碼屬於哪個型號?

名稱衝突在你讀到一篇評測的那一刻,就成了實實在在的危險。一則關於「Intern-S2」的基準測試宣稱——MMLU Pro 89.77、HMMT-2026 93.56、Biology-Instructions 55.71——講的是 397B 的旗艦模型,因為那正是發布表格所屬的模型。一則關於「Intern-S2」的輸送量宣稱——將近 4 倍的加速——講的是 Mobius,因為那正是架構著眼於推論效率的模型。引用任何一個數字之前,先查一下參數量。一篇說「Intern-S2 快 4 倍」的評測,和一篇說「Intern-S2 在 TerminalBench 上擊敗 Grok 4.6」的評測,談的是不同的模型,而第二個宣稱甚至連它自家廠商的表格都撐不過。

就證據而言,這兩個模型都未曾被 InternLM 以外的任何人測試過。旗艦模型的說明卡是一份廠商跑過 OpenCompass、VLMEvalKit 與 AgentCompass 的基準測試表;Mobius 的說明卡則是一段描述,外加一項相對於該模型微調所依據之基線的加速宣稱。缺乏獨立驗證在這裡比在大多數比較中更要緊,因為這兩個模型最強的主張落在完全不同的軸線上——一個是能力,另一個是吞吐量——而這兩個軸線至今都還沒有外部量測。

要執行哪一個?

當任務屬於科學理解時,就執行 Intern-S2-397B:閱讀圖表密集的論文、分析分子結構圖、根據時間序列訊號進行預測,或執行一個必須持續推進研究任務的長時間代理。它正是本週專題報導所談的模型,而且它的一般項目表現相當體面,讓你不會覺得自己買到的只是個只會一招的模型。代價在於硬體:403B 檢查點需要一台夠力的多 GPU 節點,如果你沒有這種機器,官方 Intern API 就是替代方案。

當工作是在你已經擁有的硬體上進行大量推理,而你對每 token 成本的在意程度高於基準測試分數的一、兩分時,可以考慮 Intern-S2 Mobius。一個 35B 模型若能比其基準版本具備看似合理的 4 倍吞吐量優勢,確實是相當有意思的服務方案——但在圍繞它建置之前,請先在你自己的追蹤資料上驗證這項加速效果,因為目前 InternLM 以外還沒有人重現過。無論如何,在每一份書面說明中都請明確標示模型,因為單憑名稱已無法表達你指的是哪一個。

A generated two-column scoreboard titled 'Intern-S2-397B vs Intern-S2 Mobius — the scoreboard.' Left column 'Intern-S2-397B': Weights Apache-2.0; Scale 403B total MoE, 512 experts / 10 active; Context 256K text / 64K multimodal; Inputs text, image, time series; Purpose scientific intelligence + long-horizon agents; Independent score none yet. Right column 'Intern-S2 Mobius': Weights Apache-2.0; Scale 35B; Context not yet independently stated; Inputs text, image; Purpose efficient reasoning, ~4x speedup claim; Independent score none yet. Footer reads 'Both models' figures are InternLM's own, unreproduced.'A screenshot of the Hugging Face collection page for internlm's Intern-S2, captured September 13, 2026, listing internlm/Intern-S2 and internlm/Intern-S2-Mobius alongside the Intern-S2-Preview-397B and FP8 variants, showing the family lineage and that the collection was updated within the last 24 hours.A screenshot of the Hugging Face model card for internlm/Intern-S2-Mobius, captured September 13, 2026, showing the model as a 35B foundation model on the Mobius-v0 architecture with Apache-2.0 licence, the description of its globally shared Memory and iterating Reasoners, and the note that it was continual-pretrained from Qwen3.5-35B with a nearly 4x inference speedup reported.