
Intern-S2-397B 对比 Intern-S2 Mobius:397B 旗舰与 35B 推理器
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openai新OpenAI: GPT-6 Astra2026-09-0453智能77代码
- google新Google: Gemini 3.8 Flash2026-09-0241智能76代码
- qwen新Qwen: Qwen3.8 Max (0902)2026-09-0240智能72代码
- anthropic新Anthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0340智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2134智能69代码
Intern-S2-397B 和 Intern-S2 Mobius 都是 InternLM 模型,都采用 Apache-2.0 许可,都叫 Intern-S2,但在同名之下,二者几乎截然不同。Intern-S2-397B 是旗舰型号:一个 4030 亿参数的混合专家模型,面向科学智能和长时程智能体,由 InternLM 于 2026 年 9 月 13 日发布。Intern-S2 Mobius 则是一个 350 亿参数的推理实验,于 2026 年 7 月 29 日问世,基于 Mobius-v0 架构构建,具有全局共享记忆和迭代推理器,并从 Qwen3.5-35B 持续预训练而来。名称冲突正是这项对比有必要存在的全部原因,因为搜索“Intern-S2 review”会同时出现这两个模型,而二者无论从哪个方向来说都不能互相替代。
两种架构,两项任务
Intern-S2-397B 是一个常规的 Transformer MoE,在关键之处做得足够宽:60 层,512 个专家,每个 token 激活其中 10 个,拥有 256K 文本推理上下文和 64K 多模态上下文,输入层可接受文本、图像和时间序列。其预训练范式会读取科学文献的原始页面——图表、版式、符号记法和行文一并纳入——其强化学习覆盖二十多个科学领域,此外还包括在沙盒环境中的长时程智能体训练。它是一个专才模型,同时也是一个通用模型:MMLU Pro 89.77、MMMU Pro 81.68、SWE-bench-Pro 68.54(按其自身模型卡所示),均为 InternLM 自报且未经复现。
Intern-S2 Mobius 是对另一个问题的一次不同押注。Mobius-v0 架构不是逐层绑定知识存储和推理计算,而是保留一个全局共享的知识向量记忆,并让多个推理器对其进行迭代,在高密度连续表示上细化隐藏状态。其卖点是推理效率:相比它所源自的 Qwen3.5-35B 基线,端到端速度提升近 4 倍,推理得分相当或更强。这是关于特定基线的吞吐量声明——而且是厂商声明,没有独立复现——但这就是该模型存在的原因。
• 架构 — Intern-S2-397B:标准 transformer MoE,60 层,512 个专家 / 10 个激活;对比 Intern-S2 Mobius:Mobius-v0,共享 Memory + 迭代式 Reasoners。
• 规模 — Intern-S2-397B:总计 403B,BF16 权重约 807 GB,而 Intern-S2 Mobius:总计 35B。
• 传承 — Intern-S2-397B:原始科学预训练范式 vs Intern-S2 Mobius:从 Qwen3.5-35B 持续预训练。
• 输入 — Intern-S2-397B:文本、图像、时间序列 vs Intern-S2 Mobius:文本、图像。
• 上下文 — Intern-S2-397B:256K 文本 / 64K 多模态,对比 Intern-S2 Mobius:尚无独立给出的上下文数值。
• 速度宣称 — Intern-S2-397B:未宣传;对比 Intern-S2 Mobius:相较 Qwen3.5-35B 基线,端到端推理速度提升近 4 倍,为厂商报告数据。
• 独立证据——两个模型都没有第三方评分。
哪个编号属于哪个型号
这个名称冲突在你读到一篇评测的那一刻,就变成了一个实际隐患。一项关于“Intern-S2”的基准测试说法——MMLU Pro 89.77、HMMT-2026 93.56、Biology-Instructions 55.71——指的是 397B 旗舰模型,因为发布表格对应的正是那个模型。一项关于“Intern-S2”的吞吐量说法——近 4 倍加速——指的是 Mobius,因为那才是其架构围绕推理效率设计的模型。在引用这两个数字中的任何一个之前,先核对参数量。一篇说“Intern-S2 快 4 倍”的评测,和一篇说“Intern-S2 在 TerminalBench 上击败 Grok 4.6”的评测,谈论的是不同的模型,而后一个说法甚至经不起它自己厂商表格的检验。
在证据方面,这两个模型都没有被 InternLM 以外的任何人测试过。旗舰模型的卡片是一张由厂商提供的基准测试表,通过 OpenCompass、VLMEvalKit 和 AgentCompass 运行得出;Mobius 的卡片则是一段描述,外加一项相对于该模型微调所基于的基线模型的加速声明。在这里,缺乏独立验证比在大多数对比中更为重要,因为这两个模型最强的声明处在完全不同的维度上——一个在能力上,另一个在吞吐量上——而这两个维度都还没有外部测量。
该运行哪一个
当任务属于科学理解时,就运行 Intern-S2-397B:阅读图表密集的论文、分析分子图、根据时间序列信号进行预测,或运行一个必须持续推进研究任务的长时间代理。它就是本周报道所关注的模型,其通用能力项也足够拿得出手,因此你买的并不是一个只会一招的模型。代价在于硬件:一个 403B 检查点需要一台够强劲的多 GPU 节点,如果你没有,官方 Intern API 就是替代方案。
在任务是在你已有的硬件上做大批量推理,且相比基准测试分数高出一两个点,你更在意每 token 成本时,可以考虑 Intern-S2 Mobius。一个 35B 模型若能相对其基线取得看似可信的 4 倍吞吐优势,那确实是个很有意思的部署方案——但在围绕它做建设之前,请先用自己的 trace 验证这一加速,因为 InternLM 之外还没有人复现过。无论如何,在每一份文档里都要明确标注所用模型,因为光凭这个名字已经无法说明你指的是哪一个了。



