一张生成的 hero 卡片,标题为 MiniMax M3.1 Flash Preview,副标题为“2026 年 9 月 27 日在 Token Plan 上线”。三个标签分别写着“100 万 token 上下文”“文本 + 图像 + 视频输入”以及“仅限 Token Plan —— 不支持按量付费”。左侧卡片写着“厂商已确认:与 M3 和 M2.7 使用相同的 Subscription Key,默认开启思考,effort 支持从 low 到 max”;右侧卡片写着“未公布:每 token 价格、模型卡、基准测试、权重、独立评测”。OrcaRouter 标志位于右下角。
Guides & Insights

MiniMax M3.1 Flash Preview 已在 Token Plan 上线:你的订阅究竟能解锁什么

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

MiniMax-M3.1-Flash-Preview 于 2026 年 9 月 27 日上线,而它的上线方式本身就是故事。它不是一个按量付费的模型。厂商将其最新的文本模型置于同一个 Token Plan Subscription Key 之下,而该密钥已经覆盖 MiniMax-M3、MiniMax M2.7 以及 M2.7-highspeed 变体,所以如果你持有席位,就无需申请新密钥,也无需再签一份合同。截至今天,同样不存在的还有:按 token 计费的价格、模型卡、已发布的基准测试,或任何关闭该模型思考功能的方法。

这种组合——无摩擦的访问,配上完全未公开的经济账——实在不寻常,值得在任何人把生产流水线接入它之前好好拆解一番。本文的其余部分,就是厂商自家文档实际说了什么、它明显没说什么,以及那一行代码——它能在一分钟内告诉你,这个模型是否契合你的工作方式。

9月27日究竟发生了什么

MiniMax 的开发者文档现在带有一条常驻说明,在每个文本模型页面上都会重复出现:MiniMax-M3.1-Flash-Preview 目前仅通过 Token Plan 和 MiniMax Code 提供。该模型最先出现在厂商自家的模型表中,位于 MiniMax-M3 之上,被描述为一款前沿多模态编程模型,拥有 1M 上下文窗口和可调节的思考深度。

• 上下文窗口 — 1,000,000 个 token,与 MiniMax-M3 相同的上限
• 输入模态 — 文本、图像和视频,返回文本
• 思考深度 — 一个 effort 设置,接受 low、medium、high、xhigh 和 max,默认为 max(省略时)
• 协议支持 — 相同的模型 id 可在 MiniMax 的 Anthropic 兼容端点、其 OpenAI 兼容端点及其 OpenAI Responses 端点上使用
• 可用性 — 仅限 Token Plan 和 MiniMax Code;不适用于按量付费
• 价格 — 任何地方均未公布每 token 费率
• 权重 — 无;MiniMaxAI 组织最近的两个公开仓库仍是 MiniMax-Music3 和 MiniMax-H3
• 独立基准 — 无;该模型在 Artificial Analysis 的模型索引中没有条目

该公司同一天在其 MiniMaxAgent 账号上宣布了这一消息,并将其定位为面向日常开发而非前沿工作:快速且可靠,从快速修复 bug 到完整的功能开发皆能胜任。这是 Flash 级别的定位,而非旗舰级。来自 PANews 和 KuCoin 的第三方通讯社报道也采用了同样的措辞,并指出开发者在该公司确认之前,就已在 MiniMax Code 的选择器中发现了这款模型。

A headless Chromium screenshot of MiniMax's own model documentation page, showing the standing note that MiniMax-M3.1-Flash-Preview is available only through Token Plan and MiniMax Code for now, above the vendor's language-model table in which MiniMax-M3.1-Flash-Preview is listed first with a 1,000,000-token context window and the description 'Frontier multimodal coding model with 1M context window and tunable thinking depth', ahead of MiniMax-M3 with the same 1,000,000-token window, captured 28 September 2026.

你使用哪个按键,比平时更重要。

这正是最容易让人栽跟头的地方。MiniMax 运行着两套相互独立的凭证类型,而 M3.1-Flash-Preview 只认其中一种。Token Plan Subscription Key 来自 Billing > Token Plan,涵盖订阅用量和已购买的 Credits。pay-as-you-go API Key 则覆盖按 token 计费的各类模型。厂商文档明确指出,两者不可互换,并且 Subscription Key 可能在任何付费资源与之绑定之前就已存在——这种情况下,它是一把有效的密钥,背后却空无一物。

因此,实际的判断标准不是“我有没有 MiniMax API key”,而是“我有没有 Token Plan 席位”。已有席位均在覆盖范围内。文档指出,Subscription Key 在被分配席位或 Credits 访问权限后才可使用;并且一旦订阅额度用尽,Credits 溢出部分会被自动扣用。

还有一个值得了解的文档不一致问题,因为它会让任何先读定价页面的人感到困惑。Token Plan 定价页面的覆盖范围脚注仍然把适用产品系列列为 M3、M2.7、图像和语音,并将 H3 排除在外——它还没有更新为列出 M3.1-Flash-Preview。而模型页面则说法相反:M3.1-Flash-Preview 可在 Token Plan 上使用,且仅此而已。截至今天,这两个页面都是供应商的在线页面。只有你手里的密钥才能定论。

能告诉你这是什么型号的400

每个 MiniMax M 系列模型在回答前都会先思考,但 M3.1-Flash-Preview 是第一个拒绝停下来的。发送 thinking: {"type": "disabled"} 或 reasoning_effort: "none",API 就会返回 HTTP 400,并附带以下消息:

模型 "MiniMax-M3.1-Flash-Preview" 需要自适应思考;不允许 thinking.type="disabled"(包括 reasoning.effort=none)(2013)

厂商自身的指导是降低 effort,而不是试图禁用思考;而这个阶梯正是延迟的调节杠杆:在 low 下做例行编辑,与在 xhigh 下做全仓库范围的改动,都是同一个模型在做出不同的取舍。还有两个细节是该模型所特有的。reasoning_effort 参数被记载为仅对 MiniMax-M3.1-Flash-Preview 有效——它并非通用的 M 系列控制项。而 reasoning_split 输出开关会将思考内容分离到 reasoning_content 字段中,目前在该模型上无法将其设为 false。

思考文本落在哪里取决于具体协议:Anthropic 兼容端点会将其作为 thinking 内容块返回,OpenAI 兼容端点则通过 reasoning_content 返回,而 Responses 端点会将其作为 reasoning 输出项返回。如果你之前是从 MiniMax-M3 的输出中解析 <think> 标签,那么在较新的模型上这项工作已不再必要——而对于交错进行的工具使用对话,包含思考块的完整响应必须被追加回消息历史中,否则推理链就会断裂。

当前正在进行的促销活动

MiniMax Code 正在 UTC+8 时区的 9 月 28 日至 10 月 7 日期间开展签到活动,将每日登录赠送的免费额度翻倍,并向新用户和现有用户开放。所发放的额度适用于受支持的模型,M3.1-Flash-Preview 和 H3 视频模型被列为示例。另外,公司表示,Token Plan 配额在活动启动时为所有用户重置,并计划在活动期间进一步重置,资格会在应用内显示。

把那两者视为通过发布报道转述的厂商说法——它们是附带日期的促销条款,而非产品行为,而且同一篇报道指出,该公告并未说明每次签到可获得多少积分,也未说明漏签的具体规则。稳态下的经济账更容易说清楚:Token Plan 的标价为 Plus 每月 22 美元、Max 每月 55 美元、Ultra 每月 132 美元,配有 5 小时滚动和每周的配额窗口,厂商给出的规模分别约为三到四个、四到五个和六到七个并发代理。购买的 Credits 按每 1 美元 1,000 积分计算,并按照各模型的按量付费标价扣减。

这个模型仍然没有的四件事

以下内容都不是对模型的批评;每一点都是团队必须提前规划应对的缺口,而且这四点今天都可以验证。

• 没有价格。MiniMax 的任何页面上都没有 M3.1-Flash-Preview 的每 token 费率,因此就每 token 成本而言,它无法与 M3 的每百万输入 $0.30、每百万输出 $1.20 相比,也无法与任何其他模型相比。
• 没有基准测试。MiniMax 在此次发布时未公布任何评测表。其他任何人也没有:该模型未出现在 Artificial Analysis 的指数中,所以它那一列是真正的空白,而不只是尚早。
• 没有权重。MiniMax-M3 以开放权重形式发布;M3.1-Flash-Preview 没有代码仓库,也没有可下载的检查点。
• 没有独立测量。没有任何第三方提供输出速度、延迟或错误率数据,我们自己的路由遥测数据中也没有,因为该模型不在我们的目录中。

相较于2026年6月M3发布时第一天就附带架构说明、基准测试表和价目表的做法,这次是一次刻意低调的发布。一种合理的解读——而且这只是解读,并非明确公布的计划——是MiniMax希望先在自己的产品中获得真实使用数据,然后再决定该模型的定价以及是否开放。

A generated two-column infographic titled 'What the vendor confirms, and what it has not published', for MiniMax M3.1 Flash Preview. The left column, headlined 'Confirmed on day one', lists 'Listed first in MiniMax's own model table, above MiniMax-M3', '1,000,000-token context window', 'Text, image and video input returning text', 'An effort ladder from low to max, defaulting to max', 'Reachable over Anthropic-, OpenAI- and Responses-compatible endpoints', and 'Covered by the existing Token Plan Subscription Key'. The right column, headlined 'Still unpublished', lists 'Per-token price, anywhere on MiniMax's pages', 'A model card or evaluation table', 'Public weights or a downloadable checkpoint', 'Any entry on Artificial Analysis's model index', and 'Output-speed and latency figures from any third party'. A footer reads 'Per platform.minimax.io documentation and the launch announcement, 27 September 2026.'

泄露的预览笔记有哪些地方说对了

发布前四天,一份转录到公开合作伙伴仓库中的预览文档开始流传,其中描述了一个 MiniMax M3.1,具备稀疏注意力、Q8KV4 注意力量化、NVFP4 路由专家、DSpark 投机解码头,以及一个全新的 reasoning_effort字段,取值从 max 一直往下到 low。当时我们将其作为未经证实的内容来写,因为它确实如此:没有权重、没有模型卡、没有定价页,也没有 API 模型 id。

这五项说法中,已有一项被厂商自己的文档所证实,那就是reasoning_effort字段——包括从最高到最低的档位阶梯,与实际发布的取值完全一致。其余四项仍未得到证实。MiniMax 对 M3.1-Flash-Preview 的公开说明仅称其为一款前沿多模态编码模型,具备 1M 上下文窗口和可调的思考深度;并未描述其注意力机制、量化方式或解码头。任何将稀疏注意力和 NVFP4 的说法当作既定规格来复述的人,不过是在转述第三方的文字记录,而这恰恰是该次发布并未确认的内容。

如果你想在不押上整个流水线的情况下试一试

仅提供 Token-Plan 的预览,别扭之处在于:评估一个新模型最自然的方式——从你现有的技术栈中调用它并进行测量——恰恰是你无法干净利落地做到的事。没有可供对照建模的按 token 计费率,没有公开的延迟画像,而且如果该预览出现波动,供应商自家产品内部也没有故障转移方案。

这正是路由层存在的意义所在。你今天能调用的一切都位于一个兼容 OpenAI 的端点和一把 API 密钥之后,而与它相邻的模型早已就位:MiniMax-M3 按服务商的费率为每百万输入 token 0.30 美元、每百万输出 token 1.20 美元,MiniMax M2.7 同样的标价,却拥有 200,000 token 的上下文窗口和开放权重,DeepSeek 和 Qwen Flash 各档位也处在同一价格区间。我们这边的价格,是服务商的标价按 0% 加价率直接透传,因此供应商一旦下调费率,当天就会体现在这里,而不必等上一轮重新议价的周期。自动故障转移意味着预览级别的依赖可以和生产路径并排放置,而不是垫在它下面;当 MiniMax 真的为 MiniMax-M3.1-Flash-Preview 发布价目表和端点时,问题就变成在路由表里加一行,而不是一个迁移项目。MiniMax-M3.1-Flash-Preview 本身并不在我们的目录中,如今要使用它,途径是供应商自家的 Token 计划及其编程产品。

对于在发布日读到这段话的团队,诚实的总结是:模型已经上线,如果你已经为 Token Plan 席位付费,那么边际使用就是免费的,但按其自身标准来看,它完全未定价、也未被衡量。去 MiniMax Code 里试试它,把你依赖的流水线继续留在有价目表和过往记录的模型上,并留意两件将把它从新鲜事物变成一项决策的事——一个公布的价格和首批独立评分。

A generated scorecard infographic titled 'The models you can call today, and what they cost'. Six rows read: 'MiniMax M3 — $0.30 in / $1.20 out per 1M tokens, 1,048,576-token context, open weights', 'MiniMax M2.7 — $0.30 in / $1.20 out per 1M tokens, 204,800-token context, open weights', 'DeepSeek V4 Flash — $0.22 in / $0.66 out per 1M tokens, 1,048,576-token context', 'DeepSeek V4.1 Flash — routed on the same key in the same price band', 'MiniMax M3.1 Flash Preview — no per-token rate published; Token Plan and MiniMax Code only', and 'One OrcaRouter API key reaches 200+ models with 0% markup on the provider's list price and automatic failover across providers'. A footer reads 'Catalogue figures per OrcaRouter's public model API, 28 September 2026; MiniMax M3.1 Flash Preview is not on the OrcaRouter catalogue.'