MiniMax M3 科普图的主视觉卡片,展示一张写着总参数 428B、激活 23B 的卡片,一条写着 100 万 token 上下文的宽幅上下文横幅,以及写着原生多模态和开放权重的徽章,页脚写着 MiniMax M3 - 发布于 2026 年 6 月 1 日 - MiniMax。
Guides & Insights

什么是 MiniMax M3?MiniMax 的 1M 上下文多模态旗舰

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

MiniMax M3 是一款原生多模态、开放权重的语言模型,来自推出 M 系列文本模型、Hailuo 视频模型和 Music 系列的中国实验室。该实验室于 2026 年 6 月 1 日发布该模型,它从 MiniMax M2.7 手中接过了公司自家模型列表的头把交椅,带来了一百万 token 的上下文窗口、原生文本-图像-视频输入,以及该实验室称为 MSA 的稀疏注意力架构。

本博客的存档中有十四篇文章提到了 MiniMax M3。但直到现在,没有一篇是真正关于它的。这个模型在一次又一次的对比中作为对手出现——成为更新一代的 GeminiQwen、Grok 或 GPT 被拿来衡量的开放权重参照点——而这里始终没有一页能让读者落脚,去了解 MiniMax M3 究竟是什么。这一页就是。

规格表

MiniMax M3 是一种混合专家模型,总参数量约为 4280 亿,每个 token 激活约 230 亿参数,这是根据 MiniMax 随权重一同发布的模型卡所述。它原生就是多模态模型,而非在纯文本基础上外挂视觉能力:模型卡描述其从第一步训练起就采用交错模态,并且该模型接受文本、图像和视频输入,返回文本。

• 上下文窗口:1,048,576 tokens,我们自己的目录条目中写明可用上下文保证至少为 512,000 tokens
• 最大输出:我们的目录页上为 512,000 tokens;MiniMax 并未在自己的材料中公布最大输出数值,因此请将 512K 视为我们的数据,而非厂商的数据
• 模态:输入支持文本、图像和视频;输出为文本
• 参数规模:总计约 428B,每个 token 激活约 23B
• 推理控制:一个 thinking 参数,支持 enabled、adaptive 和 disabled 三种模式
• 推荐采样参数:temperature 1.0,top_p 0.95
• 架构:MiniMax 稀疏注意力(MSA),即 arXiv 论文 2606.13392 的主题
• 端点形式:兼容 OpenAI 的聊天补全(chat completions)

最受关注的架构主张关乎长上下文下的注意力成本。MiniMax 表示,在百万 token 窗口下,MSA 的预填充速度比 M2 快 9 倍以上,解码速度快 15 倍以上,并将单 token 计算量削减至上一代的大约二十分之一。这些都是厂商提供的数据,我们尚未看到它们被独立复现。

MiniMax M3 在 MiniMax 自家产品线中的定位

它是语言产品线中的顶配,但值得精确说明这条产品线包含什么,因为 MiniMax 保留的仍在列模型的长尾比大多数实验室都长。厂商自家的模型文档将其分为两类。

• 当前模型:MiniMax M3、MiniMax M2.7、MiniMax M2.7-highspeed
• 旧版模型(仍在列):MiniMax M2.5、MiniMax M2.5-highspeed、MiniMax M2.1、MiniMax M2.1-highspeed、MiniMax M2
• 其中最早的 MiniMax M2 拥有 200,000 个 token 的上下文,以及包含思维链在内的 128,000 个 token 最大输出
• MiniMax 未在同一文档中公布 M2.7 或 M2.1 的上下文或输出限制

代际差距确实存在,但在两个模型都上榜的同一个指数上并不巨大。Artificial Analysis 在 Intelligence Index 修订版 v4.3.2 中给 MiniMax M3 打出 29 分,在同一修订版中给 MiniMax M2.7 打出 23 分——29 分使 M3 在该修订版的榜单中位列 114 个模型中的第 16 名,23 分使 M2.7 位列第 36 名。M2.7 于 2026 年 3 月发布。这次跃升只是一步,而不是一代,而且值得从同一修订版中读取这两个数字:该指数于 2026 年 9 月 7 日重新校准,该日期之前的分数与之后的分数不可比。

费用是多少

MiniMax 在其按量付费价格表中按请求规模为 M3 定价,公布的价格相较于更高的标价享有永久五折优惠。

• 最多 512K 个输入 token:每百万个输入 token 0.30 美元,每百万个输出 token 1.20 美元,每百万次缓存读取 0.06 美元——而标价为 0.60 / 2.40 / 0.12 美元
• 超过 512K 个输入 token:每百万个输入 0.60 美元,每百万个输出 2.40 美元,每百万次缓存读取 0.12 美元——而标价为 1.20 / 4.80 / 0.24 美元
• 优先服务层级:标准费率的 1.5 倍,因此在小请求层级上为 0.45 / 1.80 / 0.09 美元,可通过将 service_tier 设置为 "priority" 来选择
• 未公布:MiniMax 未列出 M3 的缓存写入价格,仅列出缓存读取价格

OrcaRouter 以相同的价格提供 MiniMax M3——输入 $0.30,输出 $1.20——且在提供商费率之上没有任何加价。它是我们目录中的特色模型,流量也绝非微不足道:截至撰写本文时,过去七天路由了 1.537 亿个 token,首 token 延迟 p50 为 4.26 秒,p95 为 10.00 秒。

Screenshot of MiniMax's own M3 announcement page, showing the article title MiniMax M3, a dateline reading 2026-06-01 and the vendor's three headline claims: native multimodality, context scaling via sparse attention, and frontier coding and cowork capability.

MiniMax M3 在哪些方面有可衡量的优势

从 MiniMax 自己报告的数字说起,这些数字全部由厂商自行报告,我们尚未见到任何第三方复现过其中任何一个。

• SWE-Bench Pro:59.0%
• Terminal-Bench 2.1:66.0%
• SWE-fficiency:34.8%
• MCP Atlas:74.2%
• BrowseComp:83.5,这是供应商在智能体搜索方面主打的数据
• Video-MME:512 帧下为 84.6,而外部 API 将帧数上限设为 640
• KernelBench Hard:28.8%
• OSWorld-Verified:在最多 100 步时为 68.70%,到 200 步时升至 70.06%

独立评估在方向上也是一致的。Artificial Analysis 在 v4.3.2 修订版上给 MiniMax M3 的 Intelligence Index 打分为 29,在 114 个模型中排名第 16,运行该指数每个模型的成本为 $0.51——在该成本指标上位列 114 个模型中的第 21 位。输出速度为每秒 106.4 个 token,而中位数为 67.1;首个 token 时间为 1.25 秒,而中位数为 2.33 秒。这两项都优于该层级的典型水平,而价格则远低于该层级。

同一指数系列的第三方转载补全了各项子分数:SWE-bench Verified 为 80.5%,tau-squared-bench 为 88.9%,AA-GPQA Diamond 为 92.9%,AA-LCR 为 83.0%,AA-IFBench 为 82.9%,OmniDocBench 1.5 为 91.6%,USAMO 2026 为 85.7%。文档理解与指令遵循看来是货真价实的强项,而长上下文推理得分也与架构层面的说法相吻合。

Scoreboard graphic comparing independently measured MiniMax M3 figures, showing an Intelligence Index of 29 at rank 16 of 114, output speed of 106.4 tokens per second, a time to first token of 1.25 seconds, and a blended price of 0.22 US dollars per million tokens.

它在哪些方面可衡量地表现不佳

真正的弱点集中在两个地方,而两者都可以在已公布的数据中看到。

• 智能体差距是最大的问题:在同一份第三方转载中,MiniMax M3 在 AA Coding Index 上得分 58.6,但在 AA Agentic Index 上只有 30.8。它编写代码的能力,远强于其自主推进一项长多步骤任务的能力。
• 知识与幻觉:AA-Omniscience Index 为 1.4,准确率为 16.7%,幻觉率为 18.4%。这是一个会对自己并不知道的事情自信作答的模型。
• OSWorld 2.0:4.6%
• CritPt:3.7%,这是我们在任何地方找到的 M3 已公布得分中最弱的一项
• ResearchClawBench:19.8%
• 冗长度:为完成 Intelligence Index 输出了 1.2 亿个输出 token,在 114 个中排名第 11 —— 这是一个话多的模型,而在推理密集型提示上,这会体现在账单上
• 综合得分下限:一家第三方聚合机构将其评为 100 分中的 55.28 分,在 505 个中排名第 60,不过这基于 481 个基准中 50 个基准的部分覆盖,因此该综合得分是下限而非定论

有几件事根本就没有被测量,而我们宁愿如实说明,也不愿去填补空白。除 MiniMax 之外,没有任何人复现过上文中厂商的基准测试表。Artificial Analysis 并未单独为 M3 发布 Coding Index 或 Agentic Index 的数值——58.6 与 30.8 这一对数字来自第三方对同一指数体系的转载。Artificial Analysis 将 AA-Omniscience 列为自身指数的一个组成部分,却没有发布 M3 的任何 Omniscience 数值分数。MiniMax 没有公布最大输出数值,因此我们自己模型页面上的 512K 是我们给出的。而厂商费率卡上完全没有缓存写入价格。

谁应该选择 MiniMax M3,谁又应该选择其他产品?

当任务同时需要长上下文和多模态时,选择 MiniMax M3。100 万 token 并支持视频输入、可自行下载运行的开放权重,以及每百万 token 0.30 美元的输入价格,这一组合在开放权重领域没有其他方案能与之完全匹敌。长文档分析、视频理解、代码库级代码阅读和文档提取流水线正是其经实测的优势所在——OmniDocBench 上的 91.6% 和 AA-LCR 上的 83.0% 就是支持它的数据。

在三种情况下,请另选其他。如果你不需要上下文窗口或视觉输入,MiniMax M2.7 的价格同样是 $0.30/$1.20,在当前索引修订版上的得分为 23,而 M3 为 29,并且它运行起来更轻量——M3 的优势并非免费,只是标价相同。如果你的工作负载是自主智能体而非编程,那么智能体能力差距就是另寻他处的理由,而 MiniMax 自己的对比表也指向同一处:在 PostTrainBench 上,厂商报告 M3 为 0.37,而 Opus 4.7 为 0.42,GPT-5.5 为 0.39,这是其发布的唯一一项 M3 同时输给两者的基准测试。如果你需要没有附加条件的许可证,那么在做出承诺之前请阅读下一段。

许可证才是许多报道都略过的关键所在。MiniMax M3 以 MiniMax Community License 发布,而非 Apache 或 MIT。非商业用途免费。商业用途是允许的,但你必须显著展示“Built with MiniMax M3”。年收入低于 2000 万美元时,你只需提交一次性通知;高于该门槛时,你需要获得 MiniMax 的事先书面授权,并通过电子邮件提出请求,邮件主题为“M3 licensing - authorization request”。该许可证还附有一份禁止用途附录。如果你要发布产品,这是一项法律审查,而不是走个形式。

实用摘要

MiniMax M3 是 MiniMax 语言模型产品线当前的旗舰:一个约 428B 参数的混合专家模型,每 token 约 23B 激活参数,支持一百万 token 上下文、原生视频与图像输入,以及稀疏注意力——厂商称其在满上下文下将每 token 计算量降低了 20 倍。它于 2026 年 6 月 1 日发布,因此这是一个已经定型的模型,而非新模型——到 2026 年 9 月,有意思的问题不是它好不好,而是它适合你工作负载的哪一半。

经过实测的结论是:它在代码和文档方面很强,在知识方面表现平平,在自主智能体工作方面较弱。就其所做的事情而言,它很便宜,而且它是少有的开放权重模型——其长上下文能力主张经得起独立审视。许可证则是大多数团队需要自己和自己协商的部分。

MiniMax M3 在 OrcaRouter 上以供应商原价运行,零加价,通过与其他所有服务相同的 OpenAI 兼容端点接入:一个 API 密钥即可调用 200 多个模型,端点掉线时自动故障转移,还可使用路由 DSL 来固定或混合路由。若想在确定使用前将它与其他模型目录做个对比,模型页面上有实时费率表、首 token 耗时百分位数和流量数据。

Screenshot of the OrcaRouter model page for MiniMax M3, showing a featured badge, the model ID minimax/minimax-m3, a context length of 1,048,576 tokens, input and output prices of 0.30 and 1.20 US dollars per million tokens with 50 percent off badges, the MiniMax provider card showing 153.7 million tokens routed in seven days with a p50 time to first token of 4.26 seconds and a p95 of 10.00 seconds, and the model parameters listed as approximately 428 billion total with 23 billion active.

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新