
Step 5 Preview 对比 Intern-S2 Mobius:你需要 600B 旗舰,还是快速的 35B 推理器?
- Orca新Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 每百万 tokens
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
诚实地讲,将 Step 5 Preview与 Intern-S2 Mobius加以比较的理由,并不是二者相似,而是它们是同一个买家对两个不同问题的回答——这个团队手里有推理负载要跑,却没有购买一整个集群的意愿。StepFun 于 2026 年 9 月 20 日发布的 Step 5 Preview是那个“大”答案:总参数量约 6000 亿、激活参数 270 亿,1M token 上下文,独立测得的 Artificial Analysis Intelligence Index 得分为 44,公布的定价为每百万输入 token 1.00 美元、每百万输出 token 2.70 美元。InternLM 于 2026 年 7 月 29 日发布的 Intern-S2 Mobius则是那个“小”答案:一个基于 Mobius-v0 架构、从 Qwen3.5-35B 持续预训练而来的 350 亿参数开放权重模型,其核心主张不是能力而是速度——相较于它所训练所依的基线模型,在推理基准上端到端约有 4 倍加速,且没有任何独立基准分数。一个是租用的旗舰,一个是自己运行的小模型。这场比较的真正意义在于:你面前的负载究竟值不值得动用旗舰。
在谈数字之前,先说一件琐事,因为它确实会浪费人们的时间:InternLM 在 Intern-S2 这个名号下发布了多个模型,而它们并不是同一个东西。Intern-S2-397B 是科学多模态旗舰模型;Intern-S2 Mobius 是这里讨论的 35B 高效推理模型;而更早发布的 Intern-S2 又完全是另一个独立的模型。如果你搜的是“Intern-S2”,却看到某个 397B 模型的基准测试表格,那你读到的其实是另一个检查点。
每个模型实际声称的内容
Step 5 Preview 的说法是 2026 年旗舰机型的常规配置,其中一项还经过了独立验证。StepFun 列出约 6000 亿总参数、270 亿激活参数、文本和图像输入、100 万 token 上下文窗口,以及每百万输入和输出 token 分别为 1.00 美元/2.70 美元的价格。Artificial Analysis 在其智能指数上测得 44,高于同类模型 26 的中位数,输出速度为每秒 87 个 token,而平均值为 78,并且在整个指数任务套件中生成约 1.6 亿输出 token,而中位数为 8200 万——约为典型冗长输出量的两倍,这对按输出计费的模型来说很重要。
Intern-S2 Mobius 的主张是架构层面的,而且范围更窄。它的设计把知识与计算分离开来:一个全局共享的 Memory 存放知识向量,多个 Reasoner 迭代地向其查询并据此精炼隐藏状态,而不是像传统 Transformer 那样逐层将存储与计算绑定在一起。InternLM 宣称的收益是:在推理基准测试上,相比它所源自的 Qwen3.5-35B,端到端速度大约提升 4 倍,推理得分相当或更强,而且可见的思维链更短。该模型采用 Apache 2.0 许可,支持文本和图像输入,并且可以直接下载。
• 规模 — Step 5 Preview:总计约 600B,StepFun 每步激活 27B,对比 Intern-S2 Mobius:总计 35B。
• 独立评分 — Step 5 Preview:在 Artificial Analysis 智能指数上得分 44,对比 Intern-S2 Mobius:无任何第三方公布的数据。
• 速度 — Step 5 Preview:每秒 87 个输出 token,对比 78 的平均值,由该指数榜单实测,对比 Intern-S2 Mobius:相对其自家 Qwen3.5-35B 基线"接近 4 倍",为厂商自报且未经复现。
• 上下文窗口 — Step 5 Preview:据 StepFun 称 1M tokens,对比 Intern-S2 Mobius:未公布独立的上下文数据。
• 价格 — Step 5 Preview:每百万 tokens 输入 $1.00 / 输出 $2.70,相比之下 Intern-S2 Mobius:无 API 价格;你需要为硬件付费。
• 许可与访问——Step 5 Preview:通过供应商 API 提供封闭预览,承诺于 2026 年 10 月 15 日提供 BF16 权重;相比之下,Intern-S2 Mobius:Apache 2.0 权重现已可用。
• 冗长度 —— Step 5 Preview:在整个指数套件中,输出 token 约 1.6 亿,而中位数为 8200 万;根据指数榜单,与 Intern-S2 Mobius 相比:InternLM 声称可见推理轨迹更短,其他任何人都未测量。
4 倍这一说法,以及为什么它是这里有趣的数字
把两家厂商的数字并排放在一起看,错位就一目了然:StepFun 的标题数字是能力得分,而 InternLM 的是吞吐量倍数。这并非巧合,而是这份对比中最有价值的一点。推理任务上 4 倍的端到端提速,如果换到别人的测试框架里依然成立,对高吞吐部署而言,其价值要高于榜单上的几分——它改变的是这套工作负载能否跑起来的根本账目。Intern-S2 Mobius 瞄准的是那些瓶颈在于每美元每秒 token 数、而非能力上限的团队。
需要注意的是,这个倍数是与 Qwen3.5-35B 对比衡量的,而 Intern-S2 Mobius 正是在该模型基础上进行持续预训练的,但 Qwen3.5-35B 从未接受过 Mobius 训练。这是与它自己的起点作比较,而不是与竞争对手作比较。目前没有对吞吐量声明的独立复现,没有第三方指数评分,也没有除厂商之外任何人公布的上下文窗口。应把“接近 4 倍”视为一个有趣的架构信号和一项可在你自己的测试框架中验证的假设,而不是一项规格说明。
第 5 步预览有着相反的证据特征。它的能力数值是独立测量的;它的效率表现则是薄弱环节。指数榜单的冗长度读数——约 1.6 亿输出 token,而中位模型约输出 8200 万——是对 2.70 美元输出价格的诚实制衡,这也意味着依赖长结构化生成的工作负载将花费显著高于标价所暗示的水平。它确实拥有而 Intern-S2 Mobius 没有的,是公开的 API 价格,而这正是它首先具备可比性的原因。
承诺的厂商构建版本对应的 Hugging Face 仓库则讲述了故事的另一半:这就是一次开放权重发布在已宣布但尚未交付时的样子。

足迹问题真正产生影响的地方
Intern-S2 Mobius 的真正优势不在于它的分数——没有人测量过——而在于它判断错了要付出什么代价。三百五十亿参数是一个团队可以在自己已有的硬件上部署、无需采购订单就能评估、并且可以放弃而不必核销任何资产的规模。这是旗舰模型无论得多少分都无法匹敌的结构性优势,也正是这次比较值得进行、而不应被当作不对等较量而一笔带过的原因。

旗舰模型的优势恰恰是镜像的另一面。Step 5 Preview 的 100 万 token 上下文、图像输入以及经实测的通用推理能力,覆盖了 35B 模型不太可能处理好的工作,而且在免费窗口期内试用不花一分钱——10 月期间,该模型已在三个不同的开发者平台上免费开放。这两点对自托管模型而言都不成立:运行自己的 GPU 没有免费周,也没有任何价目表能把这个决定变成一项明细支出。
如果你想让这次对比在推广窗口结束后依然成立,要打造的是一套测试框架,而不是一个偏好设置。OrcaRouter 将200 多个模型路由到一个 API 密钥和一张账单之后,0% 加价,供应商标价原样透传,并具备自动故障转移以及一套可按成本、延迟或能力来调度流量的路由 DSL。Step 5 Preview 和 Intern-S2 Mobius 都不在该目录中——StepFun 的旗舰模型不由我们路由,而 Intern-S2 Mobius 是需要自行托管的下载——所以这里的价值不在于能访问其中任何一个,而在于你用来与它们做基准对比的那些模型只需一个密钥就能触及,而由实测做出的决策会随证据而动,而不是随发布博客文章而动。

如何决定
如果你的工作负载是智能体式、多模态、长上下文或开放式的——那种你无法提前枚举任务的类型——旗舰版就是答案,而 Step 5 Preview 是它一个合理的实例:可衡量、有定价、试运行成本低,并且按 token 可回退。只需按啰嗦程度做预算,而不是按宣传的名义费率。
如果你的工作负载是狭窄、重复、大批量的推理任务,并且数据必须留在你的边界内,那么小模型就是答案;而 Intern-S2 Mobius 之所以是一个真正的候选方案,恰恰因为它小:它能在你已有的硬件上运行,采用 Apache 2.0 许可,而且其速度声称如果站得住脚,正是那种能决定单位经济效益问题的因素。入手时就要明白,你是在检验厂商的说法,而不是继承别人的结论。
错误在于把这一选择当成永久性的。先购买小模型的评测,因为那是廉价的实验;对小模型失败的任务租用旗舰模型,因为那是廉价的补救。让两种选项在同一个密钥和同一套评测框架下都保持可用的团队,最终会用自己的数据做出这个决定,而当任一供应商发布后继者时,这是唯一站得住脚的版本。
