
MiniMax M3.1 Flash Preview 已在 Token Plan 上线:你的订阅究竟能解锁什么
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 468 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 192 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1329 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
MiniMax-M3.1-Flash-Preview 于 2026 年 9 月 27 日上线,而它的上线方式本身就是故事。它不是一个按量付费的模型。厂商将其最新的文本模型置于同一个 Token Plan Subscription Key 之下,而该密钥已经覆盖 MiniMax-M3、MiniMax M2.7 以及 M2.7-highspeed 变体,所以如果你持有席位,就无需申请新密钥,也无需再签一份合同。截至今天,同样不存在的还有:按 token 计费的价格、模型卡、已发布的基准测试,或任何关闭该模型思考功能的方法。
这种组合——无摩擦的访问,配上完全未公开的经济账——实在不寻常,值得在任何人把生产流水线接入它之前好好拆解一番。本文的其余部分,就是厂商自家文档实际说了什么、它明显没说什么,以及那一行代码——它能在一分钟内告诉你,这个模型是否契合你的工作方式。
9月27日究竟发生了什么
MiniMax 的开发者文档现在带有一条常驻说明,在每个文本模型页面上都会重复出现:MiniMax-M3.1-Flash-Preview 目前仅通过 Token Plan 和 MiniMax Code 提供。该模型最先出现在厂商自家的模型表中,位于 MiniMax-M3 之上,被描述为一款前沿多模态编程模型,拥有 1M 上下文窗口和可调节的思考深度。
• 上下文窗口 — 1,000,000 个 token,与 MiniMax-M3 相同的上限
• 输入模态 — 文本、图像和视频,返回文本
• 思考深度 — 一个 effort 设置,接受 low、medium、high、xhigh 和 max,默认为 max(省略时)
• 协议支持 — 相同的模型 id 可在 MiniMax 的 Anthropic 兼容端点、其 OpenAI 兼容端点及其 OpenAI Responses 端点上使用
• 可用性 — 仅限 Token Plan 和 MiniMax Code;不适用于按量付费
• 价格 — 任何地方均未公布每 token 费率
• 权重 — 无;MiniMaxAI 组织最近的两个公开仓库仍是 MiniMax-Music3 和 MiniMax-H3
• 独立基准 — 无;该模型在 Artificial Analysis 的模型索引中没有条目
该公司同一天在其 MiniMaxAgent 账号上宣布了这一消息,并将其定位为面向日常开发而非前沿工作:快速且可靠,从快速修复 bug 到完整的功能开发皆能胜任。这是 Flash 级别的定位,而非旗舰级。来自 PANews 和 KuCoin 的第三方通讯社报道也采用了同样的措辞,并指出开发者在该公司确认之前,就已在 MiniMax Code 的选择器中发现了这款模型。

你使用哪个按键,比平时更重要。
这正是最容易让人栽跟头的地方。MiniMax 运行着两套相互独立的凭证类型,而 M3.1-Flash-Preview 只认其中一种。Token Plan Subscription Key 来自 Billing > Token Plan,涵盖订阅用量和已购买的 Credits。pay-as-you-go API Key 则覆盖按 token 计费的各类模型。厂商文档明确指出,两者不可互换,并且 Subscription Key 可能在任何付费资源与之绑定之前就已存在——这种情况下,它是一把有效的密钥,背后却空无一物。
因此,实际的判断标准不是“我有没有 MiniMax API key”,而是“我有没有 Token Plan 席位”。已有席位均在覆盖范围内。文档指出,Subscription Key 在被分配席位或 Credits 访问权限后才可使用;并且一旦订阅额度用尽,Credits 溢出部分会被自动扣用。
还有一个值得了解的文档不一致问题,因为它会让任何先读定价页面的人感到困惑。Token Plan 定价页面的覆盖范围脚注仍然把适用产品系列列为 M3、M2.7、图像和语音,并将 H3 排除在外——它还没有更新为列出 M3.1-Flash-Preview。而模型页面则说法相反:M3.1-Flash-Preview 可在 Token Plan 上使用,且仅此而已。截至今天,这两个页面都是供应商的在线页面。只有你手里的密钥才能定论。
能告诉你这是什么型号的400
每个 MiniMax M 系列模型在回答前都会先思考,但 M3.1-Flash-Preview 是第一个拒绝停下来的。发送 thinking: {"type": "disabled"} 或 reasoning_effort: "none",API 就会返回 HTTP 400,并附带以下消息:
模型 "MiniMax-M3.1-Flash-Preview" 需要自适应思考;不允许 thinking.type="disabled"(包括 reasoning.effort=none)(2013)
厂商自身的指导是降低 effort,而不是试图禁用思考;而这个阶梯正是延迟的调节杠杆:在 low 下做例行编辑,与在 xhigh 下做全仓库范围的改动,都是同一个模型在做出不同的取舍。还有两个细节是该模型所特有的。reasoning_effort 参数被记载为仅对 MiniMax-M3.1-Flash-Preview 有效——它并非通用的 M 系列控制项。而 reasoning_split 输出开关会将思考内容分离到 reasoning_content 字段中,目前在该模型上无法将其设为 false。
思考文本落在哪里取决于具体协议:Anthropic 兼容端点会将其作为 thinking 内容块返回,OpenAI 兼容端点则通过 reasoning_content 返回,而 Responses 端点会将其作为 reasoning 输出项返回。如果你之前是从 MiniMax-M3 的输出中解析 <think> 标签,那么在较新的模型上这项工作已不再必要——而对于交错进行的工具使用对话,包含思考块的完整响应必须被追加回消息历史中,否则推理链就会断裂。
当前正在进行的促销活动
MiniMax Code 正在 UTC+8 时区的 9 月 28 日至 10 月 7 日期间开展签到活动,将每日登录赠送的免费额度翻倍,并向新用户和现有用户开放。所发放的额度适用于受支持的模型,M3.1-Flash-Preview 和 H3 视频模型被列为示例。另外,公司表示,Token Plan 配额在活动启动时为所有用户重置,并计划在活动期间进一步重置,资格会在应用内显示。
把那两者视为通过发布报道转述的厂商说法——它们是附带日期的促销条款,而非产品行为,而且同一篇报道指出,该公告并未说明每次签到可获得多少积分,也未说明漏签的具体规则。稳态下的经济账更容易说清楚:Token Plan 的标价为 Plus 每月 22 美元、Max 每月 55 美元、Ultra 每月 132 美元,配有 5 小时滚动和每周的配额窗口,厂商给出的规模分别约为三到四个、四到五个和六到七个并发代理。购买的 Credits 按每 1 美元 1,000 积分计算,并按照各模型的按量付费标价扣减。
这个模型仍然没有的四件事
以下内容都不是对模型的批评;每一点都是团队必须提前规划应对的缺口,而且这四点今天都可以验证。
• 没有价格。MiniMax 的任何页面上都没有 M3.1-Flash-Preview 的每 token 费率,因此就每 token 成本而言,它无法与 M3 的每百万输入 $0.30、每百万输出 $1.20 相比,也无法与任何其他模型相比。
• 没有基准测试。MiniMax 在此次发布时未公布任何评测表。其他任何人也没有:该模型未出现在 Artificial Analysis 的指数中,所以它那一列是真正的空白,而不只是尚早。
• 没有权重。MiniMax-M3 以开放权重形式发布;M3.1-Flash-Preview 没有代码仓库,也没有可下载的检查点。
• 没有独立测量。没有任何第三方提供输出速度、延迟或错误率数据,我们自己的路由遥测数据中也没有,因为该模型不在我们的目录中。
相较于2026年6月M3发布时第一天就附带架构说明、基准测试表和价目表的做法,这次是一次刻意低调的发布。一种合理的解读——而且这只是解读,并非明确公布的计划——是MiniMax希望先在自己的产品中获得真实使用数据,然后再决定该模型的定价以及是否开放。

泄露的预览笔记有哪些地方说对了
发布前四天,一份转录到公开合作伙伴仓库中的预览文档开始流传,其中描述了一个 MiniMax M3.1,具备稀疏注意力、Q8KV4 注意力量化、NVFP4 路由专家、DSpark 投机解码头,以及一个全新的 reasoning_effort字段,取值从 max 一直往下到 low。当时我们将其作为未经证实的内容来写,因为它确实如此:没有权重、没有模型卡、没有定价页,也没有 API 模型 id。
这五项说法中,已有一项被厂商自己的文档所证实,那就是reasoning_effort字段——包括从最高到最低的档位阶梯,与实际发布的取值完全一致。其余四项仍未得到证实。MiniMax 对 M3.1-Flash-Preview 的公开说明仅称其为一款前沿多模态编码模型,具备 1M 上下文窗口和可调的思考深度;并未描述其注意力机制、量化方式或解码头。任何将稀疏注意力和 NVFP4 的说法当作既定规格来复述的人,不过是在转述第三方的文字记录,而这恰恰是该次发布并未确认的内容。
如果你想在不押上整个流水线的情况下试一试
仅提供 Token-Plan 的预览,别扭之处在于:评估一个新模型最自然的方式——从你现有的技术栈中调用它并进行测量——恰恰是你无法干净利落地做到的事。没有可供对照建模的按 token 计费率,没有公开的延迟画像,而且如果该预览出现波动,供应商自家产品内部也没有故障转移方案。
这正是路由层存在的意义所在。你今天能调用的一切都位于一个兼容 OpenAI 的端点和一把 API 密钥之后,而与它相邻的模型早已就位:MiniMax-M3 按服务商的费率为每百万输入 token 0.30 美元、每百万输出 token 1.20 美元,MiniMax M2.7 同样的标价,却拥有 200,000 token 的上下文窗口和开放权重,DeepSeek 和 Qwen Flash 各档位也处在同一价格区间。我们这边的价格,是服务商的标价按 0% 加价率直接透传,因此供应商一旦下调费率,当天就会体现在这里,而不必等上一轮重新议价的周期。自动故障转移意味着预览级别的依赖可以和生产路径并排放置,而不是垫在它下面;当 MiniMax 真的为 MiniMax-M3.1-Flash-Preview 发布价目表和端点时,问题就变成在路由表里加一行,而不是一个迁移项目。MiniMax-M3.1-Flash-Preview 本身并不在我们的目录中,如今要使用它,途径是供应商自家的 Token 计划及其编程产品。
对于在发布日读到这段话的团队,诚实的总结是:模型已经上线,如果你已经为 Token Plan 席位付费,那么边际使用就是免费的,但按其自身标准来看,它完全未定价、也未被衡量。去 MiniMax Code 里试试它,把你依赖的流水线继续留在有价目表和过往记录的模型上,并留意两件将把它从新鲜事物变成一项决策的事——一个公布的价格和首批独立评分。

