
Intern-S2-397B vs Intern-S2 Mobius:397B 旗艦與 35B 推理模型
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77程式
- google新Google: Gemini 3.8 Flash2026-09-0241智能76程式
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72程式
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82程式
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69程式
- grokSpaceXAI: Grok 4.62026-08-1244智能77程式
- metaMeta: Muse Spark 1.22026-08-0540智能72程式
- qwenQwen: Qwen3.8 Max2026-08-0340智能72程式
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69程式
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69程式
Intern-S2-397B 與 Intern-S2 Mobius 都是 InternLM 的模型,兩者皆採用 Apache-2.0,也都叫 Intern-S2,但在這個名稱之下,它們可說截然不同。Intern-S2-397B 是旗艦款:一個擁有 4030 億參數的專家混合模型,鎖定科學智慧與長時程代理人應用,由 InternLM 於 2026 年 9 月 13 日發布。Intern-S2 Mobius 則是一項 350 億參數的推理實驗,於 2026 年 7 月 29 日問世,建構在 Mobius-v0 架構上,具備全域共享記憶體與迭代推理器,並以 Qwen3.5-35B 進行持續預訓練。名稱衝突正是這篇比較必須存在的全部原因,因為搜尋「Intern-S2 評測」會同時出現這兩款模型,而這兩者在任何一個方向上都不是彼此的替代品。
兩種架構,兩項任務
Intern-S2-397B 是一款傳統的 transformer MoE,在關鍵之處做寬:60 層、512 個專家、每個 token 啟用 10 個、256K 的文字推理上下文與 64K 的多模態上下文,以及可接收文字、影像與時間序列的輸入介面。其預訓練範式閱讀科學文獻的原始頁面——圖表、版面、符號標記與散文一併處理——而其強化學習橫跨二十多個科學領域,外加在沙箱環境中的長時程代理訓練。它是專家模型,同時也是通用模型:在其自家成績單上,MMLU Pro 89.77、MMMU Pro 81.68、SWE-bench-Pro 68.54,全為 InternLM 所報告且未經重現。
Intern-S2 Mobius 是對一個不同問題的不同押注。Mobius-v0 架構不是逐層綁定知識儲存與推理計算,而是保留一個全域共享的知識向量 Memory,並讓多個 Reasoners 對其進行迭代,在高密度連續表徵上精煉隱藏狀態。其賣點是推理效率:相較於它所衍生自的 Qwen3.5-35B 基線,端到端速度提升近 4 倍,同時推理分數相當或更強。這是關於特定基線的吞吐量主張——而且是供應商主張,沒有獨立重現——但這正是該模型存在的原因。
架構 — Intern-S2-397B:標準 transformer MoE,60 層,512 個專家/10 個啟用,對比 Intern-S2 Mobius:Mobius-v0,共享記憶 + 迭代推理器。
• 規模 — Intern-S2-397B:總計 403B,BF16 格式的權重約 807 GB;相較之下,Intern-S2 Mobius:總計 35B。
• 譜系 — Intern-S2-397B:原始科學預訓練範式 vs Intern-S2 Mobius:從 Qwen3.5-35B 持續預訓練。
• 輸入 — Intern-S2-397B:文字、圖像、時間序列,對比 Intern-S2 Mobius:文字、圖像。
• 上下文 — Intern-S2-397B:256K 文字 / 64K 多模態,對比 Intern-S2 Mobius:尚無獨立公布的上下文數值。
• 速度宣稱 — Intern-S2-397B:未宣稱 vs Intern-S2 Mobius:相較於 Qwen3.5-35B 基準,端到端推理速度幾乎提升 4 倍,據廠商報告。
• 獨立證據——兩個模型皆無第三方評分。
哪個號碼屬於哪個型號?
名稱衝突在你讀到一篇評測的那一刻,就成了實實在在的危險。一則關於「Intern-S2」的基準測試宣稱——MMLU Pro 89.77、HMMT-2026 93.56、Biology-Instructions 55.71——講的是 397B 的旗艦模型,因為那正是發布表格所屬的模型。一則關於「Intern-S2」的輸送量宣稱——將近 4 倍的加速——講的是 Mobius,因為那正是架構著眼於推論效率的模型。引用任何一個數字之前,先查一下參數量。一篇說「Intern-S2 快 4 倍」的評測,和一篇說「Intern-S2 在 TerminalBench 上擊敗 Grok 4.6」的評測,談的是不同的模型,而第二個宣稱甚至連它自家廠商的表格都撐不過。
就證據而言,這兩個模型都未曾被 InternLM 以外的任何人測試過。旗艦模型的說明卡是一份廠商跑過 OpenCompass、VLMEvalKit 與 AgentCompass 的基準測試表;Mobius 的說明卡則是一段描述,外加一項相對於該模型微調所依據之基線的加速宣稱。缺乏獨立驗證在這裡比在大多數比較中更要緊,因為這兩個模型最強的主張落在完全不同的軸線上——一個是能力,另一個是吞吐量——而這兩個軸線至今都還沒有外部量測。
要執行哪一個?
當任務屬於科學理解時,就執行 Intern-S2-397B:閱讀圖表密集的論文、分析分子結構圖、根據時間序列訊號進行預測,或執行一個必須持續推進研究任務的長時間代理。它正是本週專題報導所談的模型,而且它的一般項目表現相當體面,讓你不會覺得自己買到的只是個只會一招的模型。代價在於硬體:403B 檢查點需要一台夠力的多 GPU 節點,如果你沒有這種機器,官方 Intern API 就是替代方案。
當工作是在你已經擁有的硬體上進行大量推理,而你對每 token 成本的在意程度高於基準測試分數的一、兩分時,可以考慮 Intern-S2 Mobius。一個 35B 模型若能比其基準版本具備看似合理的 4 倍吞吐量優勢,確實是相當有意思的服務方案——但在圍繞它建置之前,請先在你自己的追蹤資料上驗證這項加速效果,因為目前 InternLM 以外還沒有人重現過。無論如何,在每一份書面說明中都請明確標示模型,因為單憑名稱已無法表達你指的是哪一個。



