
Step 5 Preview 对决 Nemotron 3 Ultra:二十美分换来二十一个指数点
- Orca新Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 每百万 tokens
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238智能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248智能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百万 tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77代码
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百万 tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
这些模型中的一个今天下午就能下载,而它恰恰是落后二十一分的那一款。Step 5 Preview,StepFun 的闭源旗舰模型,于 2026 年 9 月 20 日开放了 API,而且没有一份你能拿在手里的许可证文件;NVIDIA Nemotron 3 Ultra 550B A55B则自 2026 年 6 月 4 日起就挂在 Hugging Face 上,采用宽松许可证,并附带了训练配方。在 Artificial Analysis Intelligence Index 上,两者分别是 44 对 23。在输出价格上,则是每百万 token 2.70 美元对 2.50 美元。二十分钱换二十一分,这个比较并不能干净利落地倒向任何一边,这正是为什么值得认真去做,而不是只扫两眼那两个头条栏目就选边站。
这两个模型都不是本周才发布的,这一点会影响你如何解读下面的数字。两者都已可调用数月,都经过了同一套独立测试框架,而且在统计窗口内都没有费率卡变动。真正发生变化的地方更小,也更有意思:它们被打分的那个指数在9月被重建了,而如今这两个模型正被拿来与来自两个不同总体的两个不同中位数作比较。这场对比的胜负,其实就取决于这里。
两种截然不同的产品
把规格表并排放在一起看,最先注意到的是它们几乎算不上是同一类东西。
• 参数 — 根据 StepFun 自家文档,Step 5 Preview 总量约 6000 亿,每个 token 激活 270 亿;Nemotron 3 Ultra 总量为 5500 亿,激活 550 亿,这一数字来自独立委员会针对其配置所记录的数据。
• 架构 — StepFun 未公开 Step 3 Preview 的内部实现。NVIDIA 的模型卡记录了一种混合架构:交错的 Mamba-2 层、部分注意力层、LatentMoE 布局以及 Multi-Token Prediction 头。
• 上下文窗口 — Step 5 Preview 的规格表中为 1M tokens,最大输出为 64,000 tokens,StepFun 的文档中亦有记载。Nemotron 3 Ultra 由运行它的评估方记录为 262,144 tokens;厂商卡片宣称最高可达 1M,但这需要通过服务配置实现,而非默认值。
• 输入 — Step 5 Preview 支持文本、图像和视频,每次请求最多 60 张图像,以及小于 128MB 的 MP4 文件。Nemotron 3 Ultra 仅支持文本。
• 推理控制——StepFun 侧提供有文档记录的低、中、高三档努力程度设置;NVIDIA 侧则是一个聊天模板标志,用于开启或关闭思考轨迹。
• 权重 — Step 5 Preview 未公布任何权重,该模型为专有模型,仅通过 API 提供,StepFun 表示将于 2026 年 10 月 15 日跟进发布 BF16 检查点。Nemotron 3 Ultra 在 Hugging Face 上以 OpenMDW-1.1 许可发布 BF16 和 NVFP4 版本以及一个 GenRM 奖励模型。
• 部署下限 —— 对 API 模型不适用;而对于开放模型,按厂商的最低配置要求,需配备八块 B200 级或 GB200 级 GPU,或十六块 H100。
• 价目表 — $1.00 输入,缓存命中 $0.10,输出 $2.70,适用于 Step 5 Preview,来自 StepFun 的英文定价页面。Nemotron 3 Ultra 约为 $0.60 输入、缓存命中 $0.16、输出 $2.50;请仔细注意这组数据的来源:NVIDIA 并未发布价目表,因此这是独立委员会所记录的观测到的供应商定价,而非厂商提供的数字。
大多数人视为决定性的那一行是第一行,而在八行之中,它的信息量最少。两个总数彼此相差不到百分之九,而活跃参数却相差一倍,而每个生成 token 的计算成本恰恰由活跃参数决定。这两个数字都无法预示二十一个百分点的差距。

中位数是在你读取分数之前做出的选择
独立委员会并不是把各模型放在单一赛道上打分,而是将它们分档归类——而模型落入哪一档,会改变印在其分数下方的那句话,却不会改变分数本身。
Step 5 Preview 被归入通用推理类别,该榜单在此类别中统计了 227 个模型,其同类模型的中位数为 26。Nemotron 3 Ultra 被归入开放权重类别,该类别统计了 117 个模型,中位数为 18。因此,同一个榜单将 44 描述为"远高于平均水平",将 23 描述为"高于平均水平",而这两种描述都属实,因为 44 比其所在类别中位数高出十八分,23 也比自身类别中位数高出五分。
这不是什么花招,也不是排行榜不公平。这才是展示一个开放模型的正确方式——你要把一个可下载的检查点与其他可下载的检查点进行比较,因为一个只能拿下载模型的团队并不是在从 227 中挑选。但这确实意味着,任何一边引用 Nemotron 3 Ultra 的“高于平均水平”、一边引用一个 44 的“高于平均水平”的人,都是在把两个不同的句子相互比较。如果你想为这一对给出一个数字,就用原始指数,并接受这二十一分的差距;如果你想要的是决策,就用类别,并承认你已经选好了自己的领域。

一个测试框架在两者上测量了什么
厂商表格不能相互相减,因为 StepFun 和 NVIDIA 在不同日期运行了不同的测试套件,而且 NVIDIA 的材料并不包含 StepFun 报告的每一项基准测试。诚实的立足点是两者交集:同一个评测者针对两者运行过的内容。
在 Artificial Analysis 智能指数上,这一交点为 44 对 23。在每完成一项指数任务的成本上,它是 1.03 美元对 0.60 美元。而在输出速度上,情况则发生逆转,且反差鲜明:Step 5 Preview 为每秒 87 个 token,Nemotron 3 Ultra 则为每秒 135.6 个,因此得分几乎高出一倍的那个模型,恰恰是每生成一个 token 大约慢半秒的那个。
最刺眼的单行是 Terminal-Bench 4.0。Step 5 Preview 在该项上得分为 33.3%。Nemotron 3 Ultra 得分为 0.5%。这既不是任何一方四舍五入造成的假象,也不是一个细微差距——在那个特定的 agentic 终端套件上,这个开放权重旗舰模型实际上等于没有成绩。陷阱在于,同一榜单还把同一模型在 Terminal-Bench 2.1 上列为 53.9%。两个名称几乎相同的基准测试,同一任务家族的两个不同代际,而一个模型在较旧的那个上是 53.9,在较新的那个上是 0.5。如果你曾看到有人拿 Nemotron 五十多的数字来引述,那就是它的来源,而那不是当前这套测试。
有一处一致值得特别一提,恰恰因为它很罕见。NVIDIA 自家的模型卡声称,在无工具条件下 GPQA 达到 87.0%;独立运行测得 86.7%。厂商数字和外部数字仅相差 0.3 个百分点,这才是一张可信评测表该有的样子,也让人更容易接受 Terminal-Bench 4.0 上的 0.5% 是真实结果,而不是评测方出错。
在指数运行中,资金实际流向了哪里
按 token 计价的价格几乎无法预测一个工作负载的成本,而这一对模型比大多数例子都更能说明这一点。榜单会公布每个模型完整索引运行的成本分解,而对于这两者来说,占主导的明细项都不是生成。
Step 5 Preview 的每任务 $1.03 分为 $0.85 的输入和 $0.17 的输出。在输入金额中,$0.62 是缓存读取,$0.22 是缓存写入,而只有 $0.014 是全新的、未缓存的输入。在输出金额中,$0.12 是推理轨迹,$0.06 是最终答案。
Nemotron 3 Ultra 每项任务的 0.60 美元可拆分为 0.53 美元的输入和 0.07 美元的输出,而输入这一项内部的构成几乎正好相反——0.48 美元的缓存写入,对应仅 0.04 美元的缓存读取。
由此得出两个结论。第一个是,在带有大量前缀复用的长周期评估中,你支付的费用大约有 80% 落在账本的输入一侧,这使得缓存命中率和上下文管理纪律成为需要优化的指标,而不是输出长度。第二个是,这两个模型形成账单的方式不同:Step 5 Preview 是在为重新读取一大段共享前缀付费,而 Nemotron 3 Ultra 则是在为一开始就把不同内容写入缓存付费。表面成本相近,账单却不同——如果你的工作负载更像其中一种模式而非另一种,那么 $1.03 和 $0.60 的高低顺序就可能翻转。
冗长度数据解释了输出行的其余部分。Step 5 Preview 在整个索引套件中生成了约 1.6 亿个输出 token,而中位数为 8200 万,董事会直白地将其描述为非常冗长。Nemotron 3 Ultra 生成了 1.1 亿个,而中位数为 1.4 亿,董事会称其相当简洁。更便宜的那个模型反倒更简洁,而且它的简洁正朝着对账单至关重要的方向。

下载能换来什么,以及保有它需要付出什么代价
如果你拿的是 checkpoint,Nemotron 3 Ultra 的价格就不是每百万输出 token 2.50 美元。那是租用别人部署版本的价格。选择下载,你买到的就是另一套成本和另一套权利。
这些权利是实实在在的,而且是纯 API 模型无论出多高的价都无法企及的部分。OpenMDW-1.1 随权重一同提供,NVIDIA 还一并发布了预训练和后训练数据集合以及训练配方。同一模型还有一个 NVFP4 版本,体积大约只有一半;Ultra 权重是用 NVFP4 配方预训练而成的,而不是事后再量化——正因如此,这个小体积版本是显卡上的一等公民产物,而非社区实验。其商业立场表述得很直白:可用于商业和非商业用途。
这些成本同样具体。最低部署是八块 B200 级 GPU 或十六块 H100,这是该卡写明的下限,而非建议。你实际获得多大的上下文窗口,取决于你如何配置服务,默认是 256K,而 1M 则需通过显式设置开启。一个无法投入一个机架的团队,并不是在输入价格为 $1.00 和 $0.60 的这两个模型之间做选择;它是在一个模型和一份采购订单之间做选择。
这种比较存在一个版本,在这个版本中,开源模型在人们声称关心却很少定价的轴——依赖性——上胜出。Step 5 Preview 是一个你调用的端点,一个你信任的供应商,其检查点只是被承诺而非实际交付。如果 StepFun 修改其费率卡、收紧限制、弃用该 ID 或经历糟糕的一周,你唯一的杠杆就是你自己的错误处理。Nemotron 3 Ultra 的权重已经存在于某人的集群磁盘上,这具有真实的价值,即使同一模型正以二十一个指数点之差落败。
说到做到"承诺"到底指什么,值得较个真,因为实际情况比双方阵营所承认的都要混乱。9月20日,也就是API开放当天,Hugging Face上出现了多个BF16构建的第三方镜像,其中一些safetensors文件远超1TB。这些属于社区重新上传,并非厂商发布,而且StepFun也没有随之发布任何开放权重公告。它们所能证明的是,权重正在流通,而承诺中的10月15日检查点将是一种正式化,而非首次披露。
一个在我们读它时移动了的数字
这篇文章里有一个数字在同一页的两次读取之间发生了变化,值得指出来,因为对比正是这样悄无声息地变得过时的。
在日期为 2026 年 10 月 9 日的覆盖报告中,独立评测机构给出的 Step 5 Preview 每个索引任务成本为 $0.71。10 月 10 日再次查看,同一页面显示为 $1.03。在这段时间里,模型本身没有任何变化,因为一个纯 API 模型的权重不可能在一夜之间发生任何改变。真正变化的是评测的核算方式:当供应商的缓存价格发生变动、当评测方修订其缓存读取假设,或者当某次运行按不同的 token 组合重新计算时,每个任务的成本数字就会变化,而指数得分不会变。
所以,要把每任务成本视为一个带有日期戳的实时数字,而不是模型的固有属性。本文中的每一个每任务数字都是10月10日的读数,并且都标注为当日的读数。如果你要依据本页来编制预算,那就用你在作出承诺当天自己拉取的数字来编——而如果你在比较来自不同周的两份报告,先核对采集日期,再断定某个模型变便宜了。
哪一个你实际上会称作
先把不舒服的部分说出来:OrcaRouter 这两个模型都不路由。Step 5 Preview 可以通过阶跃星辰自家的 API 和少数第三方平台访问,而 Nemotron 3 Ultra 由 NVIDIA 自家端点以及多家服务商提供,读完这两句话的同一分钟里,你就能拿我们的目录去核对这两种说法。
剩下的就是依赖关系的形态,而非模型的选择,而这正是路由层在这里体现自身价值的地方。单一供应商路径上的纯 API 预览,恰恰是那种供应商那边一个糟糕的下午就会演变成你的故障的布局,而廉价的保险就是一个控制平面:一旦某条供应商路径出现性能劣化,它就能立刻把请求切换到合格的备用方案上。这正是 自动故障转移的用途所在:它不是用来替代 Step 5 Preview,而是用来挡在你实际能够调用的模型前面,让某个特定供应商的端点永远不会成为通往生产的唯一道路。实现这一点的同一个目录还承载着 一个密钥、一张账单背后的 200 多个模型,并以 0% 的加价透传供应商标价——这正是论证的另一半,因为上游任何环节的价格表一有变动,我们这边当天即生效,而不必等到下一次合同续约。
如果这两个模型都不是你要调用的那个,简短版本是这样的。当你想要分数、视频和图像输入以及 90% 的缓存折扣时,就选 Step 5 Preview,并接受你租的是一个预览版,没有权重许可,还有一个你尚未见过的 10 月检查点。当权重比分数更重要时——因为要满足本地部署的约束、要做微调、要一份你能读懂的许可——就选 Nemotron 3 Ultra,并且在为 token 做预算之前先为机架做预算,因为在每百万输入 token 0.60 美元的价格下,一个 5500 亿参数的部署只有在别人已经在为 GPU 买单时才显得便宜。
值得关注的是 10 月 15 日。如果 StepFun 按承诺发布 BF16 检查点,那么本文的核心不对称——这两者中只有一个可供下载——就不再成立,而那二十一个指数点也就明显更难被搪塞过去。如果这个日期推迟,开放权重模型的理由就会自动增强,这是一种能力差距弥合的奇怪方式,也是一种非常常见的方式。
