
MiniMax M3.1 Flash Preview vs MiniMax M3:当更新的模型反而是风险更高的那一个
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 468 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 192 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1329 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
厂商自家文档如今把 MiniMax-M3.1-Flash-Preview 列在 MiniMax-M3 之上,而这种排序本身就有很强的说服效果。它是该系列中最新的文本模型,具备相同的百万 token 上下文窗口,还增加了旧模型所没有的思考深度控制。但表格没有显示的是,在这两者中,只有旧模型可以下载、按 token 定价、与任何对象进行基准比较,或在无需订阅的情况下调用——而且较新的那个还移除了 MiniMax-M3 曾提供给你的一个开关。
这不是一个关于某个模型被取代的故事。这是一个关于厂商将自己的产品线拆分为一个按量计费的主力干将和一个需订阅才能使用的预览版的故事,而这两者无论朝哪个方向都不可互换。以下是它们各自实际是什么。
这两份规格表,并排放置
先从厂商自家页面针对这两者所陈述的内容入手,因为差异的形态正是在这里显现,而非在基准测试表格中。
• 发布——MiniMax-M3 于 2026 年 6 月 1 日发布,附有架构说明、基准测试表和费率卡;MiniMax-M3.1-Flash-Preview 于 2026 年 9 月 27 日发布,附有文档条目和 MiniMax 的 Agent 账号上的一篇帖子 • 上下文窗口——两者均为 1,000,000 tokens,依据 MiniMax 自己的模型表 • 最大输出——我们目录条目中的 MiniMax-M3 为 512,000 tokens,这一数字 MiniMax 自己并未公布;MiniMax-M3.1-Flash-Preview 则未在任何地方公布 • 输入模态——两者均为文本、图像和视频输入,文本输出 • 思考控制——一个 MiniMax-M3 可被指示跳过的思考参数,且可将其分离到 reasoning_details 字段中(通过 reasoning_split);在 MiniMax-M3.1-Flash-Preview 上,思考是强制性的,且 reasoning_split 无法关闭 • 思考深度——MiniMax-M3 上不可用;effort 阶梯包含 low、medium、high、xhigh 和 max,默认值为 max,适用于 MiniMax-M3.1-Flash-Preview • 已公布的输出速度——根据 MiniMax 自己的模型表,MiniMax-M3 约为每秒 100+ tokens;MiniMax-M3.1-Flash-Preview 未公布任何数据 • 权重——MiniMax-M3 为开放权重,并有公开仓库;MiniMax-M3.1-Flash-Preview 则没有 • 定价——按提供商费率,MiniMax-M3 为每百万输入 tokens 0.30 美元、每百万输出 tokens 1.20 美元;MiniMax-M3.1-Flash-Preview 不存在按 token 计费的价格 • 访问——MiniMax-M3 支持按量付费和 Token Plan,并可通过第三方平台路由;MiniMax-M3.1-Flash-Preview 仅支持 Token Plan 和 MiniMax Code
那里有两行属于与其余行不同的类别。公布的输出速度只是旧型号的厂商数据,因此较新的型号被当作更快的那款来卖,却没有附上任何数字。而思考控制的发展方向与营销宣传正好相反:较新的型号能更精细地控制它思考多少,同时却剥夺了你让它完全停止思考的能力。
MiniMax取消的切换
这是最容易让人栽跟头的细节,而且它是有文档记载的,并非隐藏起来。使用 MiniMax-M3 时,在 OpenAI 兼容端点上发送 thinking: {"type": "disabled"} 会跳过思考并直接返回答案;而在 Anthropic 兼容端点上,思考默认关闭,可通过 adaptive 启用。在 MiniMax-M3.1-Flash-Preview 上,同样的请求会返回 HTTP 400,并附带消息 requires adaptive thinking。没有任何受支持的方式可以获得非推理响应。
实际上,这意味着一个曾将 MiniMax-M3 用作廉价、快速的分类器或路由器的工作负载——输入短提示,输出简短的结构化答案,没有思维链——没有直接升级到较新模型的路径。你可以降低 effort 至 low,而 MiniMax 的指南明确指出,降低 effort 是减少思考延迟和 token 的预期方式,而不是禁用它。但 token 和延迟不会降为零,而且对于每次调用写入四个字段的大批量提取任务,“总是先思考”与“按需思考”是两种不同的成本形态。

每个上实际测量的是什么?
这个对比中,一侧有数字,另一侧则是空白的列,因此有必要准确说明哪些数字属于哪一方。
MiniMax-M3 的独立记录是真实的:Artificial Analysis 在 Intelligence Index 上给它打出 29.2 分——在 145 个模型中位列第 60——Coding Index 为 58.6,其 Math 指数为 59.18,同一指数体系下 GPQA Diamond 达 92.9%,长上下文召回率为 83%,IFBench 上为 82.9%。这些都是第三方评估,任何人都可以下载该模型并重新运行。MiniMax 自己公布的 M3 发布数据——BrowseComp 83.5%、SWE-Bench Pro 59.0%、Terminal-Bench 2.1 66.0%、MCP Atlas 74.2%、OSWorld-Verified 70%——属于厂商数据,我们尚未看到它们被复现。
MiniMax-M3.1-Flash-Preview 两者皆无。MiniMax 没有发布任何基准测试表,该模型也没有收录进 Artificial Analysis 的指数,因此没有独立评分,没有编程指数,没有长上下文召回率数字,也没有幻觉测量。流传中关于它的每一种描述——“快速”“可靠”“为日常开发而打造”——都是厂商自己在发布文章中使用的形容词。这种缺失值得直白说明,因为它是一把双刃剑:没有任何东西被证明更差,也没有任何东西被证明更好。
这种不对称性正是整个决策的关键。你今天下午就可以下载 MiniMax-M3 或直接调用它来评估,并且能把评估结果与公开排行榜进行对比。而 MiniMax-M3.1-Flash-Preview,你只能用,然后形成自己的私人看法。
较新型号真正胜出的地方
很容易把上述内容解读为支持忽视新模型的论点,而那也不是正确的结论。有三件事是真实的,并且是它特有的。
努力阶梯是一项实打实的能力,而不是一个开关。五个级别——low 到 max——让同一个模型以不同的计算成本,既能应付一次常规重命名,也能承担一场仓库级重构,而文档中记载它仅对 MiniMax-M3.1-Flash-Preview 有效。在 MiniMax-M3 上,你的选择只有两种。如果你面临的难题是无法预测每个任务的延迟,那么可调的深度恰恰就是你想要的那种控制手段。
它是该厂商当前最顶级的型号,这意味着它继承了 M 系列自 6 月以来所学到的一切,并且 MiniMax 明确表示,它是用于智能体推理、工具使用、编码和长上下文任务的最新模型。M3 引入的交错思考工具使用机制也延续了下来,包括必须将完整响应——包括思考块及其他所有内容——追加回消息历史中这一要求。
而且它支持视频输入,价格处于 Flash 档位,还包含在订阅之内。MiniMax-M3 同样如此,采用按 token 计费的方式。如果你已经在为 Token Plan 席位付费,而阻碍你使用视频输入的唯一障碍只是每次调用的边际成本,那么 M3.1-Flash-Preview 消除了这一障碍。
在旧款机型仍是首选的情况下
三种情况,全都关乎可预测性而非质量。
当你需要对成本建模时。MiniMax-M3 有一张价目表:每百万输入 token 0.30 美元,每百万输出 token 1.20 美元,而在我们的价目表上,缓存读取费率为每百万 token 0.06 美元。你可以在实际运行某项工作负载之前,就把它每月的账单估算到美分。MiniMax-M3.1-Flash-Preview 在 MiniMax 的各页面上都没有任何按 token 计费的价格,所以它的成本等于你的订阅费除以你的使用量——对于固定预算来说没问题,但对于单位经济性毫无用处。
当你需要模型始终就是那个模型时。MiniMax-M3 采用开放权重:你可以把它下载下来,在自己的硬件上运行,并且确信半年后响应你调用的产物,与今天响应调用的完全是同一个。MiniMax-M3.1-Flash-Preview 没有检查点,而预览级访问意味着服务栈、配额构成和可用性全部由厂商掌控,并明确可能随时变更。
当你需要一个非推理型答案时。如上所述——这是对比中唯一的能力退化,也是最令人意外的一点,因为一个更新的模型做不到旧模型能做的事,这并不是任何人会预先考虑的情况。

从一个地方调用两者
这里的尴尬之处在于,这两个模型的购买方式不同——一个按用量计费,一个按订阅付费——而人的本能反应是选边站队。更有用的做法是按任务形态在两者之间分流,而这只有在按用量计费的一侧能与其他所有东西从同一入口访问时才成立。
OrcaRouter 上的 MiniMax-M3按 MiniMax 的标价计费,加价幅度为 0%,因此费率卡上的 $0.30 和 $1.20 就是一次调用的实际费用,平台不在此基础上再加任何利润。它与 MiniMax M2.7 位于同一个 OpenAI 兼容端点——同样是 200,000 token 窗口下的 $0.30/$1.20 标价,同样开放权重——也与其他 200 多个模型共用同一端点,只需一个 API 密钥即可访问,并在提供商之间自动故障转移,某个端点出现波动时即可生效。对照我们自己的遥测数据——这与厂商给出的数字是两回事:过去七天里,M3 在 OrcaRouter 试验场上的实测输出速度约为每秒 238 个 token,首 token 的 p50 约为 4.1 秒,错误率接近 0.15%。如果你想把 MiniMax-M3 当作流水线中可靠的那一半,把 MiniMax-M3.1-Flash-Preview 当作实验性的那一半,那么可靠的那一半只需一行配置,而不必再建立第二家供应商关系。MiniMax-M3.1-Flash-Preview 本身并不在我们的目录中;通往它的途径是厂商自己的 Token Plan 与编程产品。
能改变这篇文章的,是具体且容易观察的东西。为 MiniMax-M3.1-Flash-Preview 公布一份价目表,会瓦解人们在经济性上更青睐 M3 的主要理由。一组独立评分会让那空白列填上可比较的内容。可下载的检查点会消除可复现性方面的反对意见。在至少其中一项出现之前,MiniMax-M3 仍是这对模型中你可以问责的那一个——而较新的那个,仍是更快、控制更好、却未经测量的预览版,MiniMax 决定按月而非按 token 对它收费。

