
Step 5 Preview 对比 MiniMax M3:每 Token 更便宜,每分更贵
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
单价对 MiniMax M3 极为有利。以每百万输入 $0.30、每百万输出 $1.20 的价格,这家厂商的 428B 稀疏模型在两个维度上均不到 Step 5 Preview 的 $1.00 和 $2.70 的一半。但对于一个用来回答问题的模型来说,单价是错误的除数;一旦除以每个模型实际交付的能力,排名就会翻转。Step 5 Preview 在得分 44 时,每个 Intelligence Index 任务花费 $0.71。MiniMax M3 在得分 29 时,每个 index 任务花费 $0.51。按每一点测得的能力来算,标价更高的模型反而更便宜——原因是 15 分的指数差距,再大的折扣也抹不平。
两种截然不同的“可用”
MiniMax M3 自2026 年 6 月 1 日起正式全面可用,当天 MiniMax 通过 MiniMax Code、其 Token Plan 和 API 将其开放——发布中没有任何预览标签。权重随后于6 月 12 日在十一天后如期发布。仓库MiniMaxAI/MiniMax-M3包含约 4280 亿总参数,每个 token 约 230 亿激活参数,基于 MiniMax Sparse Attention 构建,另有单独的 MXFP8 量化版本。
Step 5 Preview 于 2026年9月20日开放了其 API。其权重尚未发布——Hugging Face 仓库 stepfun-ai/Step-5-Preview-BF16只是一个空壳——而 StepFun 承诺的发布日期为 2026年10月15日。因此,实际的区别在于:M3 是一个你可以下载、自行托管并加以检查的模型,而 Step 5 Preview 则是一个已公布意图的托管端点。
值得注意:MiniMax 自家的模型页面仍写着 M3「即将完全开源」,这与它 6 月发布的代码仓库相矛盾。应把这视为厂商页面信息陈旧,而非权重缺失的证据。
价格故事不是成本故事
Artificial Analysis 通过让每个模型运行同一套评估集,并汇总 token 的花费,计算出一个每索引任务成本的数值。对于固定量的工作而言,这是该领域最接近总拥有成本的数字,并且它纳入了 token 价格所掩盖的两项影响:模型有多啰嗦,以及它进行多少思考。
Step 5 Preview 为每个索引任务 $0.71,索引运行总成本为 $922.84。MiniMax M3 为$0.51,运行总成本为 $537.98。就任务的原始吞吐量而言,M3 约便宜 28%。除以索引分数——44 对 29——Step 5 Preview 算下来约为每个索引点 1.6 美分,而 M3 为 1.8 美分。
这里正该有一条提醒:每个模型只跑一次索引,而一次索引运行只是一个小样本。逐点计算是对每任务数值的合理性检查,本身并不是一项基准测试。但其方向与每任务数字一致,而这些数字正是两家供应商自己的价目表无法展示的。
• Intelligence Index — Step 5 Preview 44(200 个中排第 24)对比 MiniMax M3 29(113 个中排第 15),两者均基于当前指数版本
• 输入价格 — 每百万 $1.00 对比每百万 $0.30
• 输出价格 — 每百万 2.70 美元 vs 每百万 1.20 美元
• 每个索引任务的成本 — $0.71 vs $0.51
• 激活参数 — 27B 与 23B
• 上下文窗口 — 1M tokens 对比 1M tokens
• 输出速度 — 99.8 tokens/s 对比 210.4 tokens/s
• 权重——承诺于 2026 年 10 月 15 日发布,而实际自 2026 年 6 月 12 日起已可用

让这件事变得令人困惑的索引版本陷阱
阅读 M3 的数字确实存在真正的风险,值得用一段话说明,因为它几乎让所有第三方对比页面都犯错。Artificial Analysis 于2026年9月7日重新校准了其 Intelligence Index,而这次重新校准全面压缩了分数。在当前评分标准下,M3 测得29。在九月前的评分标准下,它测得 44 到 45——而且不少追踪机构仍然公布其分数为 44.4 或 45.4。
这种撞车在这里比平时更要紧,因为 Step 5 Preview 的当前得分同样是 44。一个把过时的 M3 数值与 Step 5 Preview 的当前数值并列放在一起的页面,看上去会像是两个模型打成了平手,而当前的差距是 15 分。本文中的两个数值都来自当前版本的指数,彼此之间可以相互比较;任何在 9 月 7 日之前发布的内容则不能。
MiniMax M3 真正难以被超越的地方
M3有两项指标差距悬殊。第一项是速度:每秒210.4个输出token,在Artificial Analysis追踪的113个模型中排名第四快,而中位数为76.3。Step 5 Preview的每秒99.8个token表现不俗,却还不到它的一半。M3的首token时间为1.01秒,同样更快,相比之下为2.96秒。
第二点是输入模态。M3 接受文本、图像和视频,并返回文本,而 MiniMax 则记录了桌面和计算机使用操作。Step 5 Preview 接受文本和图像。如果你的流水线把屏幕录制或视频帧输入模型,那就不是偏好问题——而是能力差异。
价格差距同时强化了这两点。在标价 $0.60 和 $2.40 的基础上,永久性 50% 折扣使其变为 $0.30 和 $1.20,再加上将缓存读取降至每百万 $0.06 的 80% 缓存折扣,M3 是让大量 token 以较低成本通过一款能力出众的模型的最便宜途径之一。请注意分层计价:超过 512K token 的输入会使整个请求的费用翻倍,而优先服务层级的费用则是 1.5 倍。
它在哪里破碎
MiniMax 为 M3 提供的自家评测集表现强劲,但应视为厂商自报数据:SWE-bench Verified 为 80.5%,SWE-bench Pro 为 59.0%,Terminal-Bench 2.1 为 66.0%,MCP Atlas 为 74.2%,BrowseComp 为 83.5,OSWorld-Verified 为 70.06%。这些测试是 MiniMax 在自家基础设施上、以 Claude Code 作为脚手架运行的,取四次运行的平均值,且评分设置并未公开——因此在目前情况下,第三方无法复现这些结果。
独立测量的结果对智能体工作要严苛得多。Artificial Analysis 记录的Terminal-Bench 4.0 为 2%,是 M3 的成绩——该基准版本与厂商 Terminal-Bench 2.1 的数字不同,两者不可直接比较,但无论如何都令人触目惊心。SciCode 为 47%,AutomationBench-AA 为 21%,CritPt 为 4%。M3 最强的独立结果出现在长上下文与知识类工作上:AA-LCR v1.1 为 83%,Humanity's Last Exam 为 39%。
Step 5 Preview 则颠覆了这一情况。在同一测试框架下,Terminal-Bench 4.0 达到 33.3%,而 M3 仅为 2%;SciCode 上为 59%,对比 47%。如果任务属于智能体性质或代码形态,这就不是一场势均力敌的比较,价格优势也无法弥补这一差距。

大多数对比都会跳过的许可条款
MiniMax M3 是开放权重的,但从 OSI 的意义上说,它并非开源,而且条款比“开放权重”这一说法所暗示的更为严格。该代码仓库采用 MiniMax 社区许可证:非商业用途免费,商业用途则以显著展示“Built with MiniMax M3”为条件——并且,任何年收入超过 2000 万美元的产品,都需事先获得 MiniMax 的书面授权。它既不是 MIT,也不是 Apache,更不是那种法律团队会直接放行的许可证。
Step 5 Preview 目前还完全无法在这个维度上进行评估,因为没有任何许可证可供阅读。StepFun 已承诺于 10 月 15 日发布权重,但尚未公布将约束它的条款。任何计划基于它进行构建的人,都应把许可证视为一个悬而未决的问题,而不是想当然地认为它会与 Moonshot 或 DeepSeek 的类似。
这就是两者之间真实的不对称:M3 的条款限制严格,但为人所知;Step 5 Preview 的条款则未知。一份你能围绕其规划的严格许可证,胜过一份你无法围绕其规划的未公布许可证。
调用其中任意一个
MiniMax M3 已在我们的目录中,地址为 /models/minimax/minimax-m3,可通过与我们路由的其余 200 多个模型相同的密钥和请求格式访问,供应商标价以 0% 加价原样传递——因此 MiniMax 已应用的永久 50% 折扣就是您看到的价格,并且 MiniMax 调整它的当天,它也会随之变动。自动故障转移是这件事的另一半:M3 每秒 210 个 token 的速度对高吞吐量工作很有吸引力,而高吞吐量工作正是单个性能下降的端点造成最大损害的地方。
Step 5 Preview 不在我们的目录中。StepFun 的文本模型不在我们提供服务的范围内,因此它可通过 StepFun 自家的 API 以及若干第三方平台使用——而使用你在 M3 上所用的那个密钥则无法访问它。

裁决
当吞吐量、延迟或视频输入成为约束条件时,当你想要一个今天就能下载的模型时,以及当你能安于社区许可证的框架之内——包括2000万美元的收入门槛——就选择 MiniMax M3。同时也要接受:在独立智能体评测中它远远落后,而且其厂商基准测试从未在 MiniMax 自有基础设施之外得到复现。
当工作是智能体式的或代码密集型时,当你想要的是每美元能力而不是每美元 token 时,当你愿意成为某个托管端点的早期客户——其权重下个月才会发布——这时就选择 Step 5 Preview。接受你无法在动手构建之前检查许可证,也接受 2% 对 33.3% 的 Terminal-Bench 4.0 差距正是那种能决定项目成败的鸿沟。
折扣是真实的。只不过它不是你所购买的东西。
MiniMax M3 是我们路由的模型之一0% 加价,支持自动故障转移,因此供应商一调价,当天就能在同一密钥上生效。
