
MiniMax M3.1 Flash Preview 对比 DeepSeek V4 Flash:两张廉价的 1M 上下文入场券,一个巨大的星号
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 468 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 192 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1329 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
如果你正在寻找一个百万 token 上下文窗口、且每 token 价格低廉的选项,MiniMax-M3.1-Flash-Preview 和 DeepSeek V4 Flash 是两个不断被提及的名字——而它们其实并不是同一类产品。DeepSeek V4 Flash 是一个已退役的模型,但其标识符仍然会响应,存在于一份你能精确读到美分的供应商费率卡中。MiniMax-M3.1-Flash-Preview 则是一个仍在活跃提供的预览版,完全没有公布任何费率。因此,下面的比较一部分是规格对比,一部分是在展示这两家供应商在销售同一档位时,选择的方式有多么不同。
双方都值得精确陈明,因为决定它的数字分散在一个供应商页面、一棵供应商文档树和我们自己的目录中,而关于 DeepSeek V4 Flash 最常被重复的说法之一——它的价格——正是 DeepSeek 后来已经替换掉的那个。
两份规格表真正匹配的地方
主要规格参数相差无几,因此并非决定性因素,只有一个例外,而这一点没人会宣传。
• 上下文窗口 — MiniMax-M3.1-Flash-Preview 为 1,000,000 tokens,DeepSeek V4 Flash 为 1,048,576 tokens:名义上相同,相差 48,576 个 token
• 最大输出 — MiniMax-M3.1-Flash-Preview 未公布;DeepSeek V4 Flash 为 384,000 tokens,这在该价位上很不寻常,而这个数字应当决定许多采购决策
• 输入模态 — MiniMax-M3.1-Flash-Preview 支持文本、图像和视频;DeepSeek V4 Flash 仅支持文本
• 思考控制 — MiniMax-M3.1-Flash-Preview 提供一个从 effort low 到 max 的阶梯,思考始终开启;DeepSeek V4 Flash 支持思考或非思考模式,其中非思考是真正可用的选项
• 协议支持 — MiniMax-M3.1-Flash-Preview 支持 Anthropic 兼容、OpenAI 兼容以及 OpenAI Responses 端点;DeepSeek V4 Flash 支持同样的三种,外加聊天前缀补全
• 权重 — MiniMax-M3.1-Flash-Preview 未公开;DeepSeek 的 V4 Flash 权重曾公开发布,不过该模型本身已被取代
• 价格 — MiniMax-M3.1-Flash-Preview 未公布;DeepSeek V4 Flash 已公布且价格低廉
把那份清单读两遍,因为输出上限才是那个不声不响的关键。100 万 token 的上下文配 384,000 token 的输出,是一个真正很长的单次生成窗口。100 万 token 的上下文配一个未披露的输出上限,承诺的是读取,而不是写入。如果你的工作负载是“读取一个代码库,输出一份迁移计划”,那么起决定作用的是第二个数字,看任务能否塞进一次调用。
每一项的衡量标准是什么
这是比较中最令人不适的部分,而且篇幅很短。
DeepSeek V4 Flash 有基准测试记录,而且该记录是独立的。Artificial Analysis 在 Intelligence Index 上给它打出 34.3 分——在该指数涵盖的 145 个模型中位列第 42——Coding Index 得分为 69.1,GPQA Diamond 得分为 90.8%。我们自己的产品目录条目中列于首位的 τ²-Bench 95.0 分,与 DeepSeek 发布材料中给出的数字相同,因此它是一个与独立数据并列的厂商数字,而不是经过审计的数字。其长上下文召回率为 79.7%,在 v2.1 harness 上的 terminal-bench 成绩为 78.7%。这些都是对一个已知模型真实且可比的测量结果。
MiniMax-M3.1-Flash-Preview 则一项都没有。MiniMax 在发布时没有公布任何评测表,第三方也没有——该模型根本没有出现在 Artificial Analysis 的指数榜上。这并不是我们调研中的疏漏;这就是公开记录的现状,也意味着目前关于这款较新模型的所有质量说法,都只是厂商自家的形容词。今天谁要是递给你一份 MiniMax-M3.1-Flash-Preview 的基准测试表,那他要么是在引用更早的 MiniMax-M3,要么就是在凭空编造。

DeepSeek V4 Flash 并非以你记忆中的价格出售
陷阱就在这里。被广泛引用的 DeepSeek V4 Flash 价格——每百万输入 token 0.14 美元、每百万输出 token 0.28 美元——是该模型在 2026 年 9 月 10 日之前的价格表。就在那一天,DeepSeek 发布了 DeepSeek-V4.1-Flash,下线了 V4 Flash 和 V4-Flash-Vision-Exp 实验版本,并下调了价格。deepseek-v4-flash 这个标识符仍然可用,但 DeepSeek 的文档指出,它会被临时路由到 V4.1 Flash,并按 Flash 的价格计费。换句话说,你仍然可以输入旧模型名称,但你调用的已不是旧模型。
所以真正要拿来对比的那张价目卡是当前这张,按每 100 万个 token 计算——而低谷时段是其中更便宜的那一半:
• 缓存未命中输入 — 非高峰时段 $0.15,高峰时段 $0.30
• 缓存命中输入 — 非高峰时段 $0.003,高峰时段 $0.006
• 输出 — 非高峰时段 $0.60,高峰时段 $1.20
• 高峰时段 — UTC 01:00–04:00 和 06:00–10:00,周一至周五,中国法定节假日除外;其他所有时间(包括整个周末)均为非高峰时段
相比之下,MiniMax-M3.1-Flash-Preview 没有任何形式的按 token 计费费率。它的成本就是你 Token Plan 席位的费用——Plus、Max 和 Ultra 分别为每月 22 美元、55 美元或 132 美元——这笔额度按照各模型按量付费的标价,通过一个共享配额池逐步消耗,而厂商保留更改该配额池构成的权利。对于用量可预测、月度预算固定的情况,这可能极具性价比。但对于需要按调用归集成本的项目而言,这不过是披着订阅外衣的不透明。
在 DeepSeek 这边,这一点比平常更重要,原因在于高峰倍率。对于在欧洲或亚洲按工作时间运行的团队来说,其相当一部分流量都落在高峰窗口内,并为此支付双倍费用,这会让标称的 $0.15 输入费率在大多数产品最繁忙的那些时段变成 $0.30。除非你的流量确实在 UTC 夜间运行,否则请按高峰一列来做预算。
MiniMax M3.1 Flash Preview 在哪些情况下并非正确之选
有三种情况,前两种很容易被忽略,因为它们是被记录在案的,而不是被排除掉的。
输出上限是未知的。如果你的任务最终会变成一次长篇幅生成——一份完整规范、一次转录重写、一份带注释的报告——那你就是在选择一个自己看不见的输出预算。DeepSeek V4 Flash 公布的是 384,000。这种不对称让较旧的模型在一切写作量大的任务中更占优势。
思考无法关闭。向 thinking: {"type": "disabled"} 发送给 MiniMax-M3.1-Flash-Preview,你会收到 HTTP 400:该模型要求自适应思考。而在 DeepSeek V4 Flash 上,非思考模式确实存在,且是一个受支持的开关。对于高吞吐量的分类、路由或简短结构化抽取任务,一个总是先推理的模型会带来你并未要求的延迟和 token 消耗——而你唯一能动的杠杆,就是把 effort 调到 low,而不是彻底去掉推理。
它在按量付费下不可调用。厂商文档明确说明,MiniMax-M3.1-Flash-Preview 目前只能通过 Token Plan 和 MiniMax Code 使用,并且 Subscription Key 不能与按量付费 API 密钥互换。如果你已经拥有席位,只需改一行。如果没有,评估这个模型就意味着购买订阅。
DeepSeek 的数字在哪些情况下是错误判断
与之相对的情形是:DeepSeek V4 Flash 仅支持文本,而且早已被取代。它从未接受过图像——那项工作需要单独的实验性构建,而该构建如今也已随它一同退役——并且如今这个模型标识符所对应的权重,已与名称所暗示的并不相同。为了可复现性而固定到 deepseek-v4-flash 的流水线,依赖的是一个 DeepSeek 称其为临时的重定向。
MiniMax-M3.1-Flash-Preview 原生支持文本、图像和视频输入,也是该厂商当前最顶级的文本模型。以 Flash 的价位提供视频输入,在这一档位中并不常见。
对于任何运行生产流量的人来说,这两个注意事项都指向同一个方向:账单上的标识符和实际作答的模型,并不保证永远是一回事,而路由层正是用来处理这件事、而不是用来发现这件事的地方。

如何在一个下午内决定这件事
从任务的结尾开始,而不是从开头开始。
如果任务属于长文本生成——任何以写出数万 token 收尾的工作都算——DeepSeek V4 Flash 是两者中唯一公布了足够高的上限、足以对此作出承诺的模型,而且它的价格表足够小,峰值倍率还扛得住。成本要按峰值建模,而不是按非峰值,并且要把那个已退役的标识符当作一项你尚未完成的迁移,而不是一份稳定的契约。
如果任务是在固定月度预算下对多模态输入进行读取和推理——屏幕录制、扫描文档、视频审阅——那么 MiniMax-M3.1-Flash-Preview 是能力更强的形态,而在 Token Plan 席位内,它是在此上下文长度下获得视频输入的最便宜方式。要接受你买的是一个未经测量的模型,并限制影响范围:把关键工作负载留在有公开价目表的东西上,让预览版处理探索性的那一半。
如果这两种描述都符合你的流水线,那这就是路由问题,而不是模型选择问题,而这正是我们存在的意义。OrcaRouter 上的 DeepSeek V4 Flash按供应商原价计费,加价 0%——其目录条目显示每百万输入 token 0.22 美元、每百万输出 0.66 美元,这正是当前 Flash 卡片中的峰值列,原样透传——同时在同一密钥的同一价格区间内还有 MiniMax-M3 和 MiniMax M2.7。一个端点即可访问 200+ 个模型,背后还有自动故障转移,因此工作负载无需第二次集成便可在不同价格区间之间迁移。MiniMax-M3.1-Flash-Preview 不在我们的目录中;要使用它,就得走该厂商的 Token Plan 及其编程产品。
一句话版本:{{1}}DeepSeek V4 Flash{{/1}}是已知量,拥有{{2}}已公布的输出上限{{/2}}、清晰可读的费率表,以及{{3}}一个悄然名副其实的后继者{{/3}};{{4}}MiniMax-M3.1-Flash-Preview{{/4}}则是更新、支持多模态、尚未经过实测的那个,想要试用就得订阅。这两者都不是选择另一方的理由——它们只是你无法从按 token 计价的比较中得到的事实,因为这种比较引用的是 DeepSeek 在 9 月已停用的费率表。

本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
