
什么是 MiniMax M3?MiniMax 的 1M 上下文多模态旗舰
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
MiniMax M3 是一款原生多模态、开放权重的语言模型,来自推出 M 系列文本模型、Hailuo 视频模型和 Music 系列的中国实验室。该实验室于 2026 年 6 月 1 日发布该模型,它从 MiniMax M2.7 手中接过了公司自家模型列表的头把交椅,带来了一百万 token 的上下文窗口、原生文本-图像-视频输入,以及该实验室称为 MSA 的稀疏注意力架构。
本博客的存档中有十四篇文章提到了 MiniMax M3。但直到现在,没有一篇是真正关于它的。这个模型在一次又一次的对比中作为对手出现——成为更新一代的 Gemini、Qwen、Grok 或 GPT 被拿来衡量的开放权重参照点——而这里始终没有一页能让读者落脚,去了解 MiniMax M3 究竟是什么。这一页就是。
规格表
MiniMax M3 是一种混合专家模型,总参数量约为 4280 亿,每个 token 激活约 230 亿参数,这是根据 MiniMax 随权重一同发布的模型卡所述。它原生就是多模态模型,而非在纯文本基础上外挂视觉能力:模型卡描述其从第一步训练起就采用交错模态,并且该模型接受文本、图像和视频输入,返回文本。
• 上下文窗口:1,048,576 tokens,我们自己的目录条目中写明可用上下文保证至少为 512,000 tokens
• 最大输出:我们的目录页上为 512,000 tokens;MiniMax 并未在自己的材料中公布最大输出数值,因此请将 512K 视为我们的数据,而非厂商的数据
• 模态:输入支持文本、图像和视频;输出为文本
• 参数规模:总计约 428B,每个 token 激活约 23B
• 推理控制:一个 thinking 参数,支持 enabled、adaptive 和 disabled 三种模式
• 推荐采样参数:temperature 1.0,top_p 0.95
• 架构:MiniMax 稀疏注意力(MSA),即 arXiv 论文 2606.13392 的主题
• 端点形式:兼容 OpenAI 的聊天补全(chat completions)
最受关注的架构主张关乎长上下文下的注意力成本。MiniMax 表示,在百万 token 窗口下,MSA 的预填充速度比 M2 快 9 倍以上,解码速度快 15 倍以上,并将单 token 计算量削减至上一代的大约二十分之一。这些都是厂商提供的数据,我们尚未看到它们被独立复现。
MiniMax M3 在 MiniMax 自家产品线中的定位
它是语言产品线中的顶配,但值得精确说明这条产品线包含什么,因为 MiniMax 保留的仍在列模型的长尾比大多数实验室都长。厂商自家的模型文档将其分为两类。
• 当前模型:MiniMax M3、MiniMax M2.7、MiniMax M2.7-highspeed
• 旧版模型(仍在列):MiniMax M2.5、MiniMax M2.5-highspeed、MiniMax M2.1、MiniMax M2.1-highspeed、MiniMax M2
• 其中最早的 MiniMax M2 拥有 200,000 个 token 的上下文,以及包含思维链在内的 128,000 个 token 最大输出
• MiniMax 未在同一文档中公布 M2.7 或 M2.1 的上下文或输出限制
代际差距确实存在,但在两个模型都上榜的同一个指数上并不巨大。Artificial Analysis 在 Intelligence Index 修订版 v4.3.2 中给 MiniMax M3 打出 29 分,在同一修订版中给 MiniMax M2.7 打出 23 分——29 分使 M3 在该修订版的榜单中位列 114 个模型中的第 16 名,23 分使 M2.7 位列第 36 名。M2.7 于 2026 年 3 月发布。这次跃升只是一步,而不是一代,而且值得从同一修订版中读取这两个数字:该指数于 2026 年 9 月 7 日重新校准,该日期之前的分数与之后的分数不可比。
费用是多少
MiniMax 在其按量付费价格表中按请求规模为 M3 定价,公布的价格相较于更高的标价享有永久五折优惠。
• 最多 512K 个输入 token:每百万个输入 token 0.30 美元,每百万个输出 token 1.20 美元,每百万次缓存读取 0.06 美元——而标价为 0.60 / 2.40 / 0.12 美元
• 超过 512K 个输入 token:每百万个输入 0.60 美元,每百万个输出 2.40 美元,每百万次缓存读取 0.12 美元——而标价为 1.20 / 4.80 / 0.24 美元
• 优先服务层级:标准费率的 1.5 倍,因此在小请求层级上为 0.45 / 1.80 / 0.09 美元,可通过将 service_tier 设置为 "priority" 来选择
• 未公布:MiniMax 未列出 M3 的缓存写入价格,仅列出缓存读取价格
OrcaRouter 以相同的价格提供 MiniMax M3——输入 $0.30,输出 $1.20——且在提供商费率之上没有任何加价。它是我们目录中的特色模型,流量也绝非微不足道:截至撰写本文时,过去七天路由了 1.537 亿个 token,首 token 延迟 p50 为 4.26 秒,p95 为 10.00 秒。

MiniMax M3 在哪些方面有可衡量的优势
从 MiniMax 自己报告的数字说起,这些数字全部由厂商自行报告,我们尚未见到任何第三方复现过其中任何一个。
• SWE-Bench Pro:59.0%
• Terminal-Bench 2.1:66.0%
• SWE-fficiency:34.8%
• MCP Atlas:74.2%
• BrowseComp:83.5,这是供应商在智能体搜索方面主打的数据
• Video-MME:512 帧下为 84.6,而外部 API 将帧数上限设为 640
• KernelBench Hard:28.8%
• OSWorld-Verified:在最多 100 步时为 68.70%,到 200 步时升至 70.06%
独立评估在方向上也是一致的。Artificial Analysis 在 v4.3.2 修订版上给 MiniMax M3 的 Intelligence Index 打分为 29,在 114 个模型中排名第 16,运行该指数每个模型的成本为 $0.51——在该成本指标上位列 114 个模型中的第 21 位。输出速度为每秒 106.4 个 token,而中位数为 67.1;首个 token 时间为 1.25 秒,而中位数为 2.33 秒。这两项都优于该层级的典型水平,而价格则远低于该层级。
同一指数系列的第三方转载补全了各项子分数:SWE-bench Verified 为 80.5%,tau-squared-bench 为 88.9%,AA-GPQA Diamond 为 92.9%,AA-LCR 为 83.0%,AA-IFBench 为 82.9%,OmniDocBench 1.5 为 91.6%,USAMO 2026 为 85.7%。文档理解与指令遵循看来是货真价实的强项,而长上下文推理得分也与架构层面的说法相吻合。

它在哪些方面可衡量地表现不佳
真正的弱点集中在两个地方,而两者都可以在已公布的数据中看到。
• 智能体差距是最大的问题:在同一份第三方转载中,MiniMax M3 在 AA Coding Index 上得分 58.6,但在 AA Agentic Index 上只有 30.8。它编写代码的能力,远强于其自主推进一项长多步骤任务的能力。
• 知识与幻觉:AA-Omniscience Index 为 1.4,准确率为 16.7%,幻觉率为 18.4%。这是一个会对自己并不知道的事情自信作答的模型。
• OSWorld 2.0:4.6%
• CritPt:3.7%,这是我们在任何地方找到的 M3 已公布得分中最弱的一项
• ResearchClawBench:19.8%
• 冗长度:为完成 Intelligence Index 输出了 1.2 亿个输出 token,在 114 个中排名第 11 —— 这是一个话多的模型,而在推理密集型提示上,这会体现在账单上
• 综合得分下限:一家第三方聚合机构将其评为 100 分中的 55.28 分,在 505 个中排名第 60,不过这基于 481 个基准中 50 个基准的部分覆盖,因此该综合得分是下限而非定论
有几件事根本就没有被测量,而我们宁愿如实说明,也不愿去填补空白。除 MiniMax 之外,没有任何人复现过上文中厂商的基准测试表。Artificial Analysis 并未单独为 M3 发布 Coding Index 或 Agentic Index 的数值——58.6 与 30.8 这一对数字来自第三方对同一指数体系的转载。Artificial Analysis 将 AA-Omniscience 列为自身指数的一个组成部分,却没有发布 M3 的任何 Omniscience 数值分数。MiniMax 没有公布最大输出数值,因此我们自己模型页面上的 512K 是我们给出的。而厂商费率卡上完全没有缓存写入价格。
谁应该选择 MiniMax M3,谁又应该选择其他产品?
当任务同时需要长上下文和多模态时,选择 MiniMax M3。100 万 token 并支持视频输入、可自行下载运行的开放权重,以及每百万 token 0.30 美元的输入价格,这一组合在开放权重领域没有其他方案能与之完全匹敌。长文档分析、视频理解、代码库级代码阅读和文档提取流水线正是其经实测的优势所在——OmniDocBench 上的 91.6% 和 AA-LCR 上的 83.0% 就是支持它的数据。
在三种情况下,请另选其他。如果你不需要上下文窗口或视觉输入,MiniMax M2.7 的价格同样是 $0.30/$1.20,在当前索引修订版上的得分为 23,而 M3 为 29,并且它运行起来更轻量——M3 的优势并非免费,只是标价相同。如果你的工作负载是自主智能体而非编程,那么智能体能力差距就是另寻他处的理由,而 MiniMax 自己的对比表也指向同一处:在 PostTrainBench 上,厂商报告 M3 为 0.37,而 Opus 4.7 为 0.42,GPT-5.5 为 0.39,这是其发布的唯一一项 M3 同时输给两者的基准测试。如果你需要没有附加条件的许可证,那么在做出承诺之前请阅读下一段。
许可证才是许多报道都略过的关键所在。MiniMax M3 以 MiniMax Community License 发布,而非 Apache 或 MIT。非商业用途免费。商业用途是允许的,但你必须显著展示“Built with MiniMax M3”。年收入低于 2000 万美元时,你只需提交一次性通知;高于该门槛时,你需要获得 MiniMax 的事先书面授权,并通过电子邮件提出请求,邮件主题为“M3 licensing - authorization request”。该许可证还附有一份禁止用途附录。如果你要发布产品,这是一项法律审查,而不是走个形式。
实用摘要
MiniMax M3 是 MiniMax 语言模型产品线当前的旗舰:一个约 428B 参数的混合专家模型,每 token 约 23B 激活参数,支持一百万 token 上下文、原生视频与图像输入,以及稀疏注意力——厂商称其在满上下文下将每 token 计算量降低了 20 倍。它于 2026 年 6 月 1 日发布,因此这是一个已经定型的模型,而非新模型——到 2026 年 9 月,有意思的问题不是它好不好,而是它适合你工作负载的哪一半。
经过实测的结论是:它在代码和文档方面很强,在知识方面表现平平,在自主智能体工作方面较弱。就其所做的事情而言,它很便宜,而且它是少有的开放权重模型——其长上下文能力主张经得起独立审视。许可证则是大多数团队需要自己和自己协商的部分。
MiniMax M3 在 OrcaRouter 上以供应商原价运行,零加价,通过与其他所有服务相同的 OpenAI 兼容端点接入:一个 API 密钥即可调用 200 多个模型,端点掉线时自动故障转移,还可使用路由 DSL 来固定或混合路由。若想在确定使用前将它与其他模型目录做个对比,模型页面上有实时费率表、首 token 耗时百分位数和流量数据。

本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
