一张生成的主视觉卡片,对比 Intern-S2-397B 与 Intern-S2 Mobius:左侧展示一个拥有 4030 亿参数的大型科学多模态 MoE,带有标注为旗舰 397B 的文献页面输入;右侧展示一个紧凑的 350 亿参数推理器,包含共享内存块和迭代循环,标注为 Mobius-v0;右下角是 OrcaRouter 标志。
Guides & Insights

Intern-S2-397B 对比 Intern-S2 Mobius:397B 旗舰与 35B 推理器

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Intern-S2-397B 和 Intern-S2 Mobius 都是 InternLM 模型,都采用 Apache-2.0 许可,都叫 Intern-S2,但在同名之下,二者几乎截然不同。Intern-S2-397B 是旗舰型号:一个 4030 亿参数的混合专家模型,面向科学智能和长时程智能体,由 InternLM 于 2026 年 9 月 13 日发布。Intern-S2 Mobius 则是一个 350 亿参数的推理实验,于 2026 年 7 月 29 日问世,基于 Mobius-v0 架构构建,具有全局共享记忆和迭代推理器,并从 Qwen3.5-35B 持续预训练而来。名称冲突正是这项对比有必要存在的全部原因,因为搜索“Intern-S2 review”会同时出现这两个模型,而二者无论从哪个方向来说都不能互相替代。

两种架构,两项任务

Intern-S2-397B 是一个常规的 Transformer MoE,在关键之处做得足够宽:60 层,512 个专家,每个 token 激活其中 10 个,拥有 256K 文本推理上下文和 64K 多模态上下文,输入层可接受文本、图像和时间序列。其预训练范式会读取科学文献的原始页面——图表、版式、符号记法和行文一并纳入——其强化学习覆盖二十多个科学领域,此外还包括在沙盒环境中的长时程智能体训练。它是一个专才模型,同时也是一个通用模型:MMLU Pro 89.77、MMMU Pro 81.68、SWE-bench-Pro 68.54(按其自身模型卡所示),均为 InternLM 自报且未经复现。

Intern-S2 Mobius 是对另一个问题的一次不同押注。Mobius-v0 架构不是逐层绑定知识存储和推理计算,而是保留一个全局共享的知识向量记忆,并让多个推理器对其进行迭代,在高密度连续表示上细化隐藏状态。其卖点是推理效率:相比它所源自的 Qwen3.5-35B 基线,端到端速度提升近 4 倍,推理得分相当或更强。这是关于特定基线的吞吐量声明——而且是厂商声明,没有独立复现——但这就是该模型存在的原因。

• 架构 — Intern-S2-397B:标准 transformer MoE,60 层,512 个专家 / 10 个激活;对比 Intern-S2 Mobius:Mobius-v0,共享 Memory + 迭代式 Reasoners。

• 规模 — Intern-S2-397B:总计 403B,BF16 权重约 807 GB,而 Intern-S2 Mobius:总计 35B。

• 传承 — Intern-S2-397B:原始科学预训练范式 vs Intern-S2 Mobius:从 Qwen3.5-35B 持续预训练。

• 输入 — Intern-S2-397B:文本、图像、时间序列 vs Intern-S2 Mobius:文本、图像。

• 上下文 — Intern-S2-397B:256K 文本 / 64K 多模态,对比 Intern-S2 Mobius:尚无独立给出的上下文数值。

• 速度宣称 — Intern-S2-397B:未宣传;对比 Intern-S2 Mobius:相较 Qwen3.5-35B 基线,端到端推理速度提升近 4 倍,为厂商报告数据。

• 独立证据——两个模型都没有第三方评分。

哪个编号属于哪个型号

这个名称冲突在你读到一篇评测的那一刻,就变成了一个实际隐患。一项关于“Intern-S2”的基准测试说法——MMLU Pro 89.77、HMMT-2026 93.56、Biology-Instructions 55.71——指的是 397B 旗舰模型,因为发布表格对应的正是那个模型。一项关于“Intern-S2”的吞吐量说法——近 4 倍加速——指的是 Mobius,因为那才是其架构围绕推理效率设计的模型。在引用这两个数字中的任何一个之前,先核对参数量。一篇说“Intern-S2 快 4 倍”的评测,和一篇说“Intern-S2 在 TerminalBench 上击败 Grok 4.6”的评测,谈论的是不同的模型,而后一个说法甚至经不起它自己厂商表格的检验。

在证据方面,这两个模型都没有被 InternLM 以外的任何人测试过。旗舰模型的卡片是一张由厂商提供的基准测试表,通过 OpenCompass、VLMEvalKit 和 AgentCompass 运行得出;Mobius 的卡片则是一段描述,外加一项相对于该模型微调所基于的基线模型的加速声明。在这里,缺乏独立验证比在大多数对比中更为重要,因为这两个模型最强的声明处在完全不同的维度上——一个在能力上,另一个在吞吐量上——而这两个维度都还没有外部测量。

该运行哪一个

当任务属于科学理解时,就运行 Intern-S2-397B:阅读图表密集的论文、分析分子图、根据时间序列信号进行预测,或运行一个必须持续推进研究任务的长时间代理。它就是本周报道所关注的模型,其通用能力项也足够拿得出手,因此你买的并不是一个只会一招的模型。代价在于硬件:一个 403B 检查点需要一台够强劲的多 GPU 节点,如果你没有,官方 Intern API 就是替代方案。

在任务是在你已有的硬件上做大批量推理,且相比基准测试分数高出一两个点,你更在意每 token 成本时,可以考虑 Intern-S2 Mobius。一个 35B 模型若能相对其基线取得看似可信的 4 倍吞吐优势,那确实是个很有意思的部署方案——但在围绕它做建设之前,请先用自己的 trace 验证这一加速,因为 InternLM 之外还没有人复现过。无论如何,在每一份文档里都要明确标注所用模型,因为光凭这个名字已经无法说明你指的是哪一个了。

A generated two-column scoreboard titled 'Intern-S2-397B vs Intern-S2 Mobius — the scoreboard.' Left column 'Intern-S2-397B': Weights Apache-2.0; Scale 403B total MoE, 512 experts / 10 active; Context 256K text / 64K multimodal; Inputs text, image, time series; Purpose scientific intelligence + long-horizon agents; Independent score none yet. Right column 'Intern-S2 Mobius': Weights Apache-2.0; Scale 35B; Context not yet independently stated; Inputs text, image; Purpose efficient reasoning, ~4x speedup claim; Independent score none yet. Footer reads 'Both models' figures are InternLM's own, unreproduced.'A screenshot of the Hugging Face collection page for internlm's Intern-S2, captured September 13, 2026, listing internlm/Intern-S2 and internlm/Intern-S2-Mobius alongside the Intern-S2-Preview-397B and FP8 variants, showing the family lineage and that the collection was updated within the last 24 hours.A screenshot of the Hugging Face model card for internlm/Intern-S2-Mobius, captured September 13, 2026, showing the model as a 35B foundation model on the Mobius-v0 architecture with Apache-2.0 licence, the description of its globally shared Memory and iterating Reasoners, and the note that it was continual-pretrained from Qwen3.5-35B with a nearly 4x inference speedup reported.