Intern-S2-Mobius-1
Engineering & Research

Intern-S2-Mobius:将知识与推理分离的35B模型

作者

Jim Song

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

上海人工智能实验室的 InternLM 团队悄然发布了Intern-S2-Mobius,这是一个 35B 参数的开源权重基础模型,它做到了几乎其他已发布模型都做不到的事情:不再把知识存储在各层内部。与标准的 Transformer 结构不同——标准结构中每一层都自带一个塞满记忆化事实的前馈模块——Mobius 将所有这些知识抽取到一个全局共享的 Memory 中,并让少数几个 Reasoner 反复查询它。其宣称的收益不是更高的基准分数,而是速度:用大约三分之一到五分之一的推理 token 得到同样的答案,请求吞吐量最高可提升 4.6 倍。本指南将说明 Mobius 到底是什么、它的配置文件揭示了哪些模型卡上没有的信息、已发布的基准测试逐行呈现了什么——包括它落败的那两行——"4 倍更快"的说法在哪些场景下成立、在哪些场景下不成立,以及谁应该真正关注它。

准确性说明:以下所有数字均来自 InternLM 自家的模型卡、其公布的性能与效率数据、其部署指南,以及该模型在 Hugging Face 上的配置文件。截至撰写本文时,尚无任何独立第三方对 Intern-S2-Mobius 进行评估——它未被列入任何独立排行榜,未被任何推理服务商部署,其下载计数仍为零。在有人复现这些数据之前,所有对比数字均应视为厂商自报数据。如此新的模型,其规格与代码变化很快;构建之前请先核实。

TL;DR. {{1}}Intern-S2-Mobius{{/1}} 是一个拥有 350 亿参数、采用 Apache 2.0 许可的多模态基础模型,从 Qwen3.5-35B 持续预训练而来,随后通过 SFT 和强化学习进行后训练。其新颖之处在于架构:{{2}}Mobius-v0{{/2}} 设计将原本与层绑定的前馈知识存储替换为一个全局共享的、包含 2,560 个专家的 Memory,由四个堆叠的 Reasoner 块查询;这些块能够访问超出自身深度的知识({{3}}反向残差连接{{/3}}),并在解码前通过循环潜在迭代来细化隐藏状态({{4}}动态潜在推理{{/4}})。在 {{5}}InternLM{{/5}} 自己的评测中,它在九个通用基准中的七个上击败了它所基于的 {{6}}Qwen3.5-35B{{/6}} 基线(平均 67.88 对 65.05),并在科学任务上将其碾压(52.14 对 18.20),同时生成的推理轨迹平均短约 1.5 倍——在 {{7}}MMLU Pro{{/7}} 上短 4.6 倍,在 {{8}}GPQA Diamond{{/8}} 上短 5.0 倍。这种推理轨迹压缩正是吞吐量提升的来源:在 batch 16 时提升 2.9 倍,在 batch 256 时提升至 4.6 倍。这些隐患确实存在:它在两个最难的推理基准({{9}}HLE{{/9}} 与 {{10}}UGD{{/10}} hard)上会落败,吞吐量优势在竞赛数学任务上基本消失,而且实验室之外还没有人验证过其中任何结果。

关键要点

• 架构优先的发布:Mobius-v0 将知识向量与推理算子解耦——由 2,560 个专家组成的共享记忆服务于四个推理块,而不是 40 层各自囤积自己的 FFN 知识。

• 卖点在于效率而非智能:与Transformer基线相比,平均输出长度减少约1.5倍,请求吞吐量在批次16时提升2.9倍,在批次256时提升4.6倍。

• 它确实胜过其基础模型:常规任务平均分67.88对65.05,在MMLU Pro(89.05对85.31)、AIME 2026(95.31对92.08)和HMMT 2026(85.51对78.50)中获胜。

• 但在最需要深思熟虑的地方,它却落败了:HLE 19.11 对 22.40,以及 UGD hard 73.02 对 78.02 —— 这是该评测集中最难的两项,均胜出的是普通 Transformer。

• 科学领域的跃升是最大的单项成果:Biology-Instructions 51.40 对比 3.77,Mol-Instructions 45.73 对比 21.70,MolecularIQ 59.29 对比 29.13。

• 开放但不可用:Hugging Face 上提供 Apache 2.0 权重,无任何推理服务商托管,约 73 GB 的 bfloat16 权重——目前自托管是运行它的唯一方式。

Intern-S2-Mobius 到底是什么

Intern-S2-Mobius 是 internlm 发布的 35B 基础模型,internlm 是上海人工智能实验室 Intern 系列背后的 Hugging Face 组织。权重于 2026 年 7 月 29 日上线 Hugging Face,同时配套的 GitHub 仓库——包括 README、部署指南和完整技术报告 PDF——于 2026 年 8 月 5 日公开。它基于 Apache 2.0 许可发布,这几乎是最宽松的开源权重许可:允许商业使用、修改和再分发。

这不是微调。这是一次带架构改造的持续预训练。InternLM 以 Qwen3.5-35B——阿里巴巴于 2026 年 3 月 4 日发布的开放权重 35B 混合专家模型——为基础,重构了模型存储和访问知识的方式,并对结果继续预训练,然后在其之上应用监督式微调和强化学习。这一谱系对解读基准测试至关重要:InternLM 发布的每一项对比都是 Mobius 与其所源自的模型之间的对比,这是对架构变化最干净的消融,同时也恰是最可能美化它的对比。

该模型是多模态的。Hugging Face 将其归类为图像-文本到文本(image-text-to-text),配置确认了完整的视觉编码器以及视频令牌处理。此外,从权重附带的内容来看,它明确面向科学领域——下文将详细说明。

用大白话讲 Mobius 架构

传统Transformer在每一层中都交错执行两项任务:注意力在词元之间传递信息;前馈网络(在混合专家模型中,则是一组专家FFN)存储知识。由于前馈网络位于层内部,它所持有的知识只能在该深度访问。在第30层学到的事实无法被第5层进行的推理所查阅。信息逐层向前流动,这是唯一的路径。

Mobius 打破了这种绑定。InternLM 描述了三个后果。

知识-推理分离。逐层绑定的 FFN 存储被全局共享的记忆所取代。与其让 40 层各自拥有模型知识的一部分,不如设一个所有推理阶段都可以访问的共享池。InternLM 认为,这能提升知识压缩——相同的事实无需在多个深度被重复学习——并且让每个 Reasoner 拥有比单层 FFN 所能提供的更广阔的知识空间。

反向残差连接。由于记忆是共享的,浅层和深层推理阶段都能访问同一个存储库。知识访问不再严格地前向流动。浅层阶段可以获取到在标准堆栈中原本要等三十层之后才能获得的信息。InternLM的论断是,这能让模型跨深度更灵活地组合知识,并且关键在于,用更少的推理步骤综合有用信息。最后这个从句正是本次发布的核心论点。

动态潜在推理。与将每个思考步骤外化为可见思维链token的做法不同,Mobius在解码任何内容之前,通过循环潜在迭代优化其连续的隐藏状态。部分"思考"发生在模型的内部表征空间中,而不是在生成的文本中,并且这种内部计算的数量是按token动态分配的。实际效果是,模型需要用更少的词来得出相同的结论——而由于生成是自回归且串行的,写更少的词是让推理模型变快的最直接方式。

总的来说,这个卖点是一个思考更多、打字更少的推理模型。

Intern-S2-Mobius-2

配置文件所揭示的内容

模型卡片以文字形式描述了架构。这个 code>config.json/code> 使其具体化,其中包含几个值得了解的数字。

跨越 40 层的四个 Reasoner。 文本配置声明了 40 个隐藏层,但只有四个块。这 40 层被组织为四个 Reasoner 阶段,它们针对共享的 Memory 进行迭代,而不是四十个独立的知识加注意力单元。

2,560 位专家。这就是共享 Memory 的具象化。Mobius 搭载 2,560 位专家,每个 token 激活 8 位,每位专家的中间层尺寸仅为 512,外加一位共享专家。作为规模参照,其兄弟模型 Intern-S2-Preview 使用 256 位专家。一个规模大十倍、但专家体量小得多的专家池,正是“用一个全局知识库取代逐层 FFN”写成配置时的样子。

包装盒上标的是35B,磁盘上约36B,活跃参数约3B。模型卡上写的是35B;Hugging Face的safetensors读取器报告有36B参数;权重索引在bfloat16下总计72.96 GB,折算下来约为36.5B。部署指南最精确:它把这个版本称为30B-A3B模型——每个token大约有3B参数处于激活状态。和任何稀疏MoE一样,内存中必须容纳完整的权重集,但每个token的计算量只相当于一个小型模型。

混合注意力,3:1。层列表按三个线性注意力层对一个全注意力层的比例交替排列,一路向下——40 层中有 10 个全注意力层。线性注意力可防止长上下文记忆和计算量爆炸;周期性的全注意力层则保留了纯线性注意力所放弃的精确召回能力。线性层使用宽度为 4 的卷积核,以及 float32 格式的 SSM 状态,这是目前标准的门控 delta 风格配方。

256K 上下文。最大位置嵌入为 262,144。请注意架构支持的能力与评估方式之间存在差距:InternLM 在 128K 下运行其文本基准测试,在 MMLU Pro、SimpleQA 和 HLE 上则以 64K 运行。256K 的上限并不等同于经过验证的 256K 质量。

内置多 token 预测头。这里有一个单层 MTP 模块,自带 256 个专家。这并非装饰——部署指南建议使用 MTP 投机解码和四个草稿 token 运行,因此实际速度的一部分来自投机解码,而非仅靠架构本身。

一座真正的视觉塔。一个 27 层、隐藏维度为 1152 的视觉编码器,patch size 为 16,采用 2x2 空间合并并对视频进行时间分块,投影到带有交错多模态 RoPE 的 2048 维文本流中。图像和视频输入,文本输出。

• 其他供好奇者参考的细节:16 个注意力头,头维度为 256;2 个键值头(激进的分组查询注意力);门控注意力输出;部分旋转因子 0.25;RoPE theta 为 1000 万;以及 251,392 个 token 的词表。

基准测试,逐行解析

InternLM 使用 OpenCompass 进行了评估,并发布了一项对比结果:Intern-S2-Mobius-35B 对比其持续预训练的源模型 Qwen3.5-35B。九个通用基准,三个科学基准。

在通用任务上,Mobius 九战七胜。MMLU Pro——涵盖广泛的多领域知识,干扰项比原始 MMLU 更难——以 89.05 对 85.31 胜出,领先 3.7 分,是本组中最明确的知识类成绩。GPQA Diamond,即研究生级别的科学问题,刻意设计为无法通过谷歌搜索作答,基本打平:80.81 对 80.24。IMO Bench,奥林匹克级别的数学,以 81.25 对 77.50 胜出。AIME 2026,即美国数学邀请赛,以 95.31 对 92.08 胜出。HMMT 2026,即哈佛-麻省理工数学锦标赛,是数学类中差距最大的一项:85.51 对 78.50。AMO以 58.00 对 50.00 胜出。而SimpleQA——即简短的事实回忆,也是最直接衡量模型是否真正掌握知识的基准——从 21.39 跃升至 28.90,相对提升 35%,这是支持 InternLM“共享记忆能更好地压缩知识”论点最有力的单项证据。

然后是这两项失利,而它们才是那些有趣的行。UGD hard则方向相反:Mobius 为 73.02,基线为 78.02,落后五分。而HLE——Humanity's Last Exam,一种广泛使用的最难通用评测,前沿模型在其中仍只能拿到十几二十分——结果是 19.11 对 22.40。在这个专门设计为需要最多推理的基准上,普通 Transformer 以 3.3 分胜出。

这种模式不是噪声,也并非隐藏:InternLM 已将其公开。最合理的解读是,潜在推理是一种压缩,而压缩在尾部是有损的。当推理以检索为主或遵循熟悉的模式时,将推理过程内化到连续的隐藏状态中效果极佳——MMLU Pro、SimpleQA 以及大多数竞赛数学题正是如此。而对于真正需要漫长、探索性、纠错式思维链的问题,逐 token 的显式轨迹似乎仍然值得其成本。总体平均值——67.88 对 65.05——是实打实的胜利,但这一平均值掩盖的是一种权衡,而非全面改进。

科学结果是另一种量级的差异。Biology-Instructions从3.77提升到51.40。Mol-Instructions涵盖分子理解与生成,从21.70提升到45.73。MolecularIQ从29.13提升到59.29。平均值是52.14对18.20。像3.77提升到51.40这样的数字并不是架构的胜利;它们是在基线模型从未被教导过的任务上进行针对性领域训练的印记。Qwen3.5-35B在Biology-Instructions上得分不足4%,意味着它不理解任务格式,而不是它在生物学方面表现不佳。将这三行理解为“InternLM增加了科学专项能力”,这确实很有价值,也正是Intern-S系列的全部意义——只是不要将其归功于Mobius架构。

“快4倍”在哪里是真的,哪里不是

效率声明是这个模型存在的原因,因此值得仔细阅读。InternLM 的宣传语是“近 4 倍端到端推理加速”。公布的吞吐量数据比宣传语更有信息量,也更诚实。

以请求吞吐量随批处理大小的变化来衡量(跨基准取平均值),Mobius 比 Transformer 基线快2.9 倍(批处理大小 16)和 4.6 倍(批处理大小 256)。差距随批处理大小扩大而增大,这正是预期中的表现:当优势来自每个请求生成的 token 更少时,打包的请求越多,节省的解码步骤就越能累积。“接近 4 倍”的标题数字只是一个区间的中点,而非常数。

按基准逐项分析,情况会变得更加清晰。在MMLU ProGPQA Diamond上,Mobius 在每个批次大小下都显著更快——吞吐量曲线立即分离并持续拉大差距。在IMO Bench上,它持续领先但优势不大。在AIME 2026HMMT 2026上,基线 Transformer 实际上更快——在中等批次大小下,Mobius 仅在批次 256 时才反超。在最难的竞赛数学上,吞吐量优势在大部分有效运行范围内基本持平甚至更差。

为什么?因为吞吐量几乎完美地跟随轨迹压缩。各基准测试的平均输出长度下降了约1.5倍,从大约20,400个token降至约13,200个。但这一平均值覆盖了巨大的范围:在MMLU Pro上缩短4.6倍(约1,100个token对比5,150个)以及在GPQA Diamond上缩短5.0倍(约2,600对比12,900),而仅仅在IMO Bench上缩短1.4倍在AIME 2026上缩短1.5倍以及在HMMT 2026上缩短1.2倍。在模型能够压缩其思考的地方,它飞速前进;而在问题无论怎样都要求24,000个token的推导过程时,它无法压缩,架构的开销反而显现出来。

实际的含义是:如果你的工作负载涉及知识检索、选择题、技术问答或分类任务,加速效果会非常显著且立竿见影。如果你的工作负载是繁重的数学或科学推导,那么请预期性能大致持平,并做好收获惊喜的准备。任何将“快4倍”作为该模型普遍特性来引用的人,其实是在引用两种截然不同行为表现的平均值。

Intern-S2-Mobius-3

隐藏在文件列表中的科学栈

关于这个版本,最能说明问题的一点根本不在模型卡中,而是在仓库的文件列表中。除了常见的tokenizer文件,Intern-S2-Mobius还附带了三个额外的领域tokenizer:code>tokenizer_PROT.model/code> 用于蛋白质序列,code>tokenizer_SMILES.model/code> 用于SMILES符号的分子结构,以及code>tokenizer_XNA.model/code> 用于核酸序列。此外,仓库中还有一个多余的地震数据NumPy数组。

专为蛋白质、分子和 DNA/RNA 设计的专用分词器并非可以随意添加的功能。这意味着模型被训练为将这些序列类型作为一等输入来读取,而不是作为恰好包含字母的普通文本。正是这一点让 Biology-Instructions 上的得分从 3.77 提升到 51.40,并使 Mobius 与其姊妹模型 Intern-S2-Preview 归入同一家族——后者增加了时间序列和视觉模态,并且据 InternLM 称,是首个具备材料晶体结构生成能力的开源模型。

如果你是一名通用开发者,这不过是冷知识。但如果你从事计算生物学、化学信息学或材料科学工作,它可能是本文中最重要的一句话:这是一个小巧的、基于Apache-2.0许可、可自行托管的模型,原生支持SMILES和蛋白质序列。

它在Intern家族中的位置

Intern-S 系列是上海人工智能实验室推出的科学多模态模型系列。Intern-S1 确立了该系列的基本形态。Intern-S1-Pro 将其扩展至万亿参数级别。Intern-S2-Preview 在 Mobius 发布前不久推出,主打效率优势:这是一个总参数 36B、激活参数仅 3B 的模型,配备 256 个专家和 262K 上下文窗口,InternLM 声称其在核心专业科学任务上可与万亿规模的 S1-Pro 相媲美——以约 30 倍的参数缩减实现了相当的科学能力。

Intern-S2-Mobius 是第三种事物:一个架构发布版本,冠以 Intern-S2 之名。Mobius-v0 中的“v0”承载着实实在在的含义——这是该设计的首个公开迭代,而非成熟的产品线。它连接到ArchSpace,即 InternLM 用于验证 LLM 架构创新的开放平台,其既定目标是“将 LLM 架构探索转化为社区可复用的知识”,并提供同行评审与公开发布的结果(包括负面结果)。当一项提案从 1B 规模的探针模型蜕变为实际可下载的 35B 模型时,Mobius 就是该计划最终呈现的形态。完整的技术报告随 GitHub 仓库一同发布,供任何想了解推导过程的人查阅。

从这个角度来看,两项基准测试的回落其实是这次发布的一个特性,而非尴尬之处。这是一个实验室在诚实地公开一项架构实验的结果,包括它在哪些方面出现了退化。

如何运行它

Intern-S2-Mobius 由三个推理栈支持,部署指南为每个推理栈提供了可用的调用方式。

LMDeploy是推荐路径,也是指南中在单个 GPU 上展示的唯一方式:使用 PyTorch 后端提供服务,code>--trust-remote-code/code>、张量并行为 1,并通过 qwen3_5_mtp 推测算法启用 MTP 推测解码,带有四个草稿 token。 vLLM展示了张量并行为 2、qwen3 推理解析器、qwen3_coder 工具调用解析器、自动工具选择,以及带有四个推测 token 的 MTP 推测解码。 Transformers可用于基本推理,通过 code>AutoModelForImageTextToText/code> 与 code>trust_remote_code=True/code> 以及 bfloat16——注意,该模型自带自定义建模代码,因此必须执行远程代码,且配置面向 Transformers 5.2。

InternLM 推荐的采样参数为 temperature 0.8、top-p 0.95、top-k 50 和 min-p 0.0——这比大多数推理模型所期望的近似贪心设置更“暖”,值得尊重而不是出于习惯覆盖掉。

在硬件方面:约 73 GB 的 bfloat16 权重,再加上 KV 缓存和激活值,意味着单块 80 GB 加速器会捉襟见肘,而单块 141 GB 显卡则游刃有余——这大概就是为什么 vLLM 示例使用两块 GPU,而 LMDeploy 示例假设使用一块大显存显卡。长上下文任务会进一步推高这一需求。启用 MTP——指南明确推荐这样做,而且宣称的加速效果中有相当一部分来自 MTP,而非基础架构。

最重要的实际注意事项:目前没有任何推理提供商托管此模型。Hugging Face 的提供商面板明确说明了这一点,而且在撰写本文时下载计数器仍为零。没有 API 端点,没有每百万 token 的价格,也没有托管方式来试用它。目前自托管是唯一的选择。

Intern-S2-Mobius-4

究竟谁应该在乎

1. 运行大规模、检索形态推理工作负载的团队

这就是该架构所针对的使用场景。如果你通过推理模型处理大批量的技术问答、文档分析、结构化提取或多选题式分类任务,而账单主要被那些从未展示给用户的推理token所占据,那么一个用五分之一token就能达到相同答案的模型,直接就是成本削减。MMLU Pro和GPQA的数字——4.6倍和5.0倍更短的推理轨迹,且准确率持平或更优——恰好符合这一情形。在相信之前,先用你自己的流量对它做基准测试,但这个机制是可靠的,收益空间也很大。

2. 计算科学小组

原生蛋白质、SMILES 和核酸分词器,加上在生物学和分子基准上测得的大幅提升,打包在一个可装入一到两块 GPU 的 Apache 2.0 模型中。对于需要数据留在本地、无法将分子结构发送到商业 API 的实验室而言,这种组合实属罕见。Intern-S 系列一直在为此蓄力,而 Mobius 是迄今为止进入该系列最便宜的切入点。

3. 研究人员和建筑观察者

知识-推理解耦和潜在推理作为研究课题已经活跃了一段时间;但很少有成果在35B规模上得到验证,并连同失败案例一起开源发布。如果你关心后Transformer架构的下一步走向,技术报告和那两行落选结果比平均分数更有看头。ArchSpace在设计上就是为了让这类结果可以被复用。

谁现在还不应关注(至少暂时不应):任何想要生产级通用助手的人。没有托管端点,没有独立评估,没有生态系统工具,也没有过往记录。这不是对该模型的批评——而是对一个发布仅一周的研究版本所做的描述。

它如何融入生产技术栈

今天对 Intern-S2-Mobius 的诚实定位是评估候选,而非默认模型。它是一个未托管、未经验证、诞生仅一周的研究产物,其架构确实很有意思,并且有一个非常具体的优势——在检索类任务上进行 token 高效推理——此外在科学序列数据方面也有真正的专长。

一个明智的模式是,将您的生产流量保留在像 OrcaRouter 这样的厂商中立端点上,让您通过一个 OpenAI 兼容 API 访问多种模型;同时,针对 Mobius 可能胜出的狭窄场景,在您自己的 GPU 上单独部署它。衡量这个模型真正重要的指标:不是单纯的准确性,而是每个正确答案所花费的 token 数量。这正是 Mobius 优化的维度,也是大多数评估框架忽略的维度。如果它在您的工作负载上表现可靠,您就拥有一条运行成本低廉且在法律上无负担的自托管通道。如果表现不佳,您只是损失了一天的 GPU 时间,而生产路径从未改变。

同样的逻辑反过来也适用:如果某个提供商最终托管了它,路由器让你可以在不重写任何内容的情况下,将新模型与现有模型进行A/B对比,而这正是采用一种尚未被独立测试过的架构的正确方式。

限制与注意事项

先从最大的问题说起:这篇文章中的每一个数字都没有经过独立验证。每一个基准测试、每一条吞吐量曲线、每一次词元长度对比,都来自 InternLM。这种对比在结构上也有利于 Mobius——它只与持续预训练所基于的特定基线进行比较,而非与当前最前沿的模型比较;额外的 SFT 和 RL 后训练还意味着,尽管这一对比被呈现为一次干净的架构消融,实际上却并非如此。一部分提升来自 Mobius,另一部分则仅仅来自更多的训练。

这些回退是真实存在的,而且发生在最困难的任务上。在HLE上下降3.3个百分点、在UGD hard上下降5个百分点,同时几乎赢得所有较简单的任务,这对一款以推理效率为卖点的模型来说,是一个连贯且略令人担忧的信号。

从操作层面看,阻力相当大。自定义建模代码意味着 code>trust_remote_code/code> 以及前沿的 Transformers 版本。支持它的框架需要足够新,才能识别 code>interns2_mobius/code> 是什么,而且 InternLM 自己的指南也警告说,这些是正在积极开发中的参考配置。约 73 GB 的权重意味着这不是一个能在笔记本电脑上运行的模型。没有托管 API,没有定价,没有速率限制,也没有 SLA——因为没有服务。

最后,请注意尚未发布的内容:尽管配备了完整的视觉编码器,却没有多模态基准测试结果;尽管上下文窗口高达256K,却没有长上下文评估;完全没有编程基准测试;没有安全性或对齐性评估;也没有与除Qwen3.5-35B以外的任何模型进行对比。对于通用部署而言,这些都是巨大的空白。对于附带权重的架构论文来说,这些内容本就不在范围内——这才是解读本次发布的正确方式。

常见问题

Intern-S2-Mobius 是什么?

一个350亿参数、Apache 2.0许可的多模态基础模型,来自上海人工智能实验室InternLM团队,基于Mobius-v0架构构建,该架构将知识存储与推理计算相分离。模型由Qwen3.5-35B持续预训练而来,并经过SFT和强化学习的后训练,于2026年7月29日发布在Hugging Face平台上。

是什么让 Mobius 架构与众不同?

传统Transformer将知识存储在每个层内的前馈块中,因此知识只能在其所在的深度被访问。Mobius用一个全局共享的Memory取而代之——发布配置中有2,560个专家——四个Reasoner块反复查询该Memory,从而实现跨深度知识访问,并让部分推理发生在连续隐藏状态中,而不是生成的思维链token中。

Intern-S2-Mobius 真的快 4 倍吗?

平均而言,在大批大小下,大致如此:InternLM 在批大小为 16 时的请求吞吐量高出 2.9 倍,到批大小为 256 时升至 4.6 倍。但这因任务不同而差异巨大。在 MMLU Pro 和 GPQA Diamond 上,各种批大小下增益都很大;在 AIME 和 HMMT 竞赛数学题上,基线 Transformer 在中间批大小下实际上更快。加速幅度取决于模型能在多大程度上缩短其推理轨迹。

它与 Qwen3.5-35B 相比如何?

它在九个通用基准测试中赢得七项,平均得分67.88对65.05,包括MMLU Pro(89.05对85.31)、AIME 2026(95.31对92.08)、HMMT 2026(85.51对78.50)和SimpleQA(28.90对21.39)。它在UGD hard(73.02对78.02)和HLE(19.11对22.40)上落败。在科学任务上它遥遥领先——平均52.14对18.20。

我能通过 API 使用 Intern-S2-Mobius 吗?

目前还没有。没有推理提供商托管它,也没有公布的定价,Hugging Face 上也没有部署信息。目前,使用 LMDeploy、vLLM 或 Transformers 进行自托管是运行它的唯一方式。

运行它需要什么硬件?

权重约为 73 GB(bfloat16 格式),因此请规划一个 141 GB 级别的加速器或两块 80 GB GPU,并为 KV 缓存预留余量。InternLM 的 LMDeploy 示例使用张量并行度为 1;其 vLLM 示例使用 2。建议启用 MTP 推测解码,并设置四个草稿 token。

它的上下文长度是多少?

该配置支持262,144个token(256K)。请注意,InternLM在大多数文本基准上评估的是128K,在MMLU Pro、SimpleQA和HLE上评估的是64K,因此完整的256K质量尚未得到验证。

它是多模态的吗?

是的。Hugging Face 将其归类为图像-文本到文本(image-text-to-text),配置中包含一个 27 层的视觉编码器,并支持视频令牌处理。然而,InternLM 在此次发布中未公布任何多模态基准测试结果,因此其视觉能力在实践中并没有文档说明。

为什么它要附带蛋白质和SMILES分词器?

因为 Intern-S 系列是一个科学模型家族。针对蛋白质序列、SMILES 分子表示法和核酸的专用分词器,意味着模型将这些格式作为原生输入类型读取,这就是为什么它在 Biology-Instructions 上获得 51.40 分,而基线仅获得 3.77 分。

这个许可证真的是 Apache 2.0 吗?

是的——Apache 2.0,许可证文件在代码仓库中。允许商业使用、修改和再分发,这明显比许多大型实验室发布的开放权重版本更为宽松。

我应该在生产环境中使用它吗?

还没有。它才发布一周,尚未托管,未经任何第三方验证,并且缺少编码、多模态、长上下文和安全性评估。将其视为用于 token 高效推理或科学序列工作的评估候选,通过厂商中立端点将生产流量保留在成熟模型上,待有独立数据后再重新评估。

底线

Intern-S2-Mobius 是今年真正值得关注的模型发布之一,而这一点几乎与它的分数无关。InternLM 采用了一个真正的架构构想——不再把知识绑定到各层,而是将其集中放入一个共享的 Memory,让模型在潜在空间而非词元中完成部分思考——并将其扩展到 35B 参数规模,进行了妥善训练,随后以 Apache 2.0 许可发布了权重,连同技术报告和那些不尽如人意的结果。这一效率机制清晰可辨,其证据也内部自洽:推理轨迹平均缩短 1.5 倍,在知识密集型任务上最多缩短 5 倍,而吞吐量的提升与你据此预测的比例完全吻合。

这些注意事项也同样明确。{{1}}上海人工智能实验室之外,没有任何人验证过哪怕一个数字。{{/1}}这一比较针对的是模型自身的基础版本,并且包含了额外的后训练,因此它并非表面上看起来的那种干净的消融实验。在困难的数学问题上,加速效果基本消失。{{2}}在模型自己的表格中,它在两项最具挑战性的推理基准上落败。{{/2}}而且,除非租用GPU,否则没有其他办法可以试用它。

所以说:这不是本周就要部署的模型,但绝对值得关注;对于两个特定受众群体而言,它也确实是一个很有吸引力的选择——一类是推理成本主要由无人阅读的 token 构成的团队,另一类是需要一个体积小、许可宽松、原生通晓蛋白质和分子语言的科研团队。生产环境的技术栈继续保留在经过验证的模型上,通过 OrcaRouter 这样的供应商中立端点接入;为这一窄场景在自有硬件上部署 Mobius;并衡量每个正确答案所消耗的 token 数,而不是只看准确率。如果该架构经得起独立审查,Mobius-v0 被人记住的将更多是那个重要版本之前的版本号,而非一个 35B 模型。

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

联系我们

加入我们的社区

DiscordEmailXGitHubYouTube