Xiaomi MiMo-V2.6-Pro 与 MiniMax M3 对比的标题卡,展示两张相对而立的规格卡:Xiaomi MiMo-V2.6-Pro 在 Intelligence Index v4.3.2 中得分 46,输出速度 134.3 tokens/秒,混合价格 $0.18/1M,有 1 家 API 提供商;而 MiniMax M3 在 Index 中得分 29,168.9 tokens/秒,$0.22,有 15 家 API 提供商。
Guides & Insights

Xiaomi MiMo-V2.6-Pro 对比 MiniMax M3:分数更高,路径更精简

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

小米 MiMo-V2.6-Pro 于 2026 年 9 月 22 日正式全面开放使用,并在 Artificial Analysis 智能指数 v4.3.2 上以 46 分拿下开放权重模型的第一名。MiniMax M3 自 2026 年 5 月 31 日发布以来,一直保有这一头衔的某个版本,而如今在同一指数上它得分 29——落后十七分。而这对模型之间,最没意思的恰恰是分数。MiniMax M3 的输出速度为每秒 168.9 个 token,对手为 134.3;响应时间为 0.92 秒,对手为 2.15 秒;每输入 token 的价格更低;并且可通过十五家 API 提供商调用,而小米仅有一家。更新、分数更高的那个模型,反而是实际调用起来更难的那个——这种倒挂正是本文对比的重点。

都是开放权重,都是多模态,相隔十四周

这两个模型在设计意图上是近亲。二者都是来自中国实验室的稀疏专家混合模型,都具备 1M token 的上下文窗口,都能原生接受图像和视频,而非通过外挂式适配器,并且都公开权重。它们的发布相隔十四周,而它们之间的指数差距,就是开放权重前沿在这段时间里走过的距离。

• 总参数量 — Xiaomi MiMo-V2.6-Pro 1.02T;MiniMax M3 约 427B,两者均为稀疏 MoE

• 每 token 激活 — Xiaomi MiMo-V2.6-Pro 42B;MiniMax M3 约 23–25B

• 上下文 — 每个 1M tokens,且 MiniMax M3 保证最低 512K

• 输入模态——两者均支持文本、图像和视频;Xiaomi 额外增加音频输入

• 权重 — Xiaomi MiMo-V2.6-Pro 采用 MIT 许可证;MiniMax M3 依据 MiniMax 社区许可证发布,该许可证并非宽松型,商业使用需另行签订协议

• 发布 — Xiaomi MiMo-V2.6-Pro 2026年9月21–22日;MiniMax M3 2026年5月31日

• 可及性——在 Artificial Analysis 上,Xiaomi MiMo-V2.6-Pro 计有一个 API 提供商;MiniMax M3 则有十五个

最后那一行才是要始终盯住的。表上其余的一切都偏向较新的模型。那一行却不然,而正是这一行决定了某个模型能否进入生产路径。

该指数衡量什么,以及由谁衡量

Artificial Analysis 自行在 v4.3.2 上运行了这两个模型——这是一个涵盖推理、知识、数学和编程的十项评测综合指标,包括 AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience 和 AA-LCR v1.1。46 和 29 都不是厂商自报数字,这一点在这里很关键,因为两家实验室也都发布了自己的基准测试数据,而那些属于厂商自报数字,两类数字绝不可混为一谈。

46分的成绩让小米 MiMo-V2.6-Pro 在该综合指标上位居开放权重领域之首。但它并未使其登上该指数榜首:Claude Fable 5.1GPT-6 Astra 均为53分,Claude Opus 5 为51分。MiniMax M3 的29分使其在114个被测模型中位列第十六,远高于其规模类别的中位数,但距离六月时被拿来比较的前沿水平仍有很大差距。

MiniMax M3 手握小米没有的实锤

这是对比中最常被跳过的一部分,也是买家最应该重点权衡的一部分。MiniMax M3 以官方成绩登上公开的 DeepSWE v1.1 排行榜:20.4% Pass@1 和 48.7% Pass@4,于 2026 年 6 月 8 日发布,此前一次 MiniMax 推理升级修复了异常 token 生成并改进了长上下文缓存行为。该成绩附带了一份效率核算,而这份核算并不好看:中位数为 311 个 agent 步骤、约 91,000 个输出 token,以及每个任务约 5.04 美元。它能通过长时程工程任务,但代价高昂。

小米为其新模型给出的主打基准测试数字是在 DeepSWE v1.1 上的 72.57,高于 58.4 的基线,测量方式是使用 mini-swe-agent、取三次平均、在小米自家测试框架上运行。这不是一个排行榜条目,也未曾作为排行榜条目提交。把 72.57 放在 MiniMax 的 20.4 旁边,就此读出一个 52 分的胜出,是在两种不同测量之间做算术:排行榜发布的是特定配置下的 Pass@1,并附带置信区间和每任务平均成本,第三方可以复现;而厂商给出的数字则没有附带这些。72.57 很可能属实。它只是不是同一类东西。

MiniMax 也公布了自己的一套发布数据,而同样的告诫适用于其中每一项:SWE-Bench Pro 为 59.0,BrowseComp 为 83.5,SVG-Bench 为 63.7,Terminal-Bench 2.1 为 66.0,这些均是在 MiniMax 自己的基础设施上、用其自己的脚手架运行的。要把它们视为关于该模型的宣称,而不是对它的测量。

速度、延迟,以及决定账单的两个数字

吞吐量差距与质量差距方向相反,而且差距之大足以产生影响。MiniMax M3 每秒生成 168.9 个输出 token,而小米 MiMo-V2.6-Pro 为 134.3 个;其 0.92 秒的首 token 时间大约比小米的 2.15 秒快两倍半。对于交互式产品,首 token 延迟是用户能感知到的数字;对于批处理流水线,吞吐量则是决定总运行时长的数字。

在成本上,两者的差距比标称价格所显示的要小,而谁更划算取决于你的流量构成。MiniMax M3 的标价是每百万输入 token 0.30 美元、每百万输出 token 1.20 美元;小米 MiMo-V2.6-Pro 的标价则是 0.43 美元和 0.87 美元。论输入,M3 更便宜;论输出,小米更便宜。在应用缓存折扣之后——M3 为 80%,小米为 99%——按 7:2:1 的缓存命中/输入/输出配比计算,两者的综合价格分别落在每百万 0.22 美元和 0.18 美元。Artificial Analysis 还记录了小米 MiMo-V2.6-Pro 每项 Intelligence Index 任务 0.13 美元的成本,该指标以相同方式对榜单上所有模型进行测算,是这两者之间可获得的、最具可比性的单一成本数据。

A two-column comparison scoreboard for Xiaomi MiMo-V2.6-Pro and MiniMax M3 covering Intelligence Index v4.3.2 (46 vs 29), output speed (134.3 vs 168.9 tokens/second), time to first token (2.15s vs 0.92s), blended rate ($0.18 vs $0.22 per 1M), API providers (1 vs 15) and long-horizon evidence (vendor harness only vs public Pass@1 entry).

十五条路由对一条,以及故障转移有何价值

如果端点宕机,十七个点的指数优势也帮不了你。在撰写本文时,Artificial Analysis 只统计到一家为 Xiaomi MiMo-V2.6-Pro 提供服务的 API 供应商,而这个数字反映的是此次发布的情况,而非模型本身:三天前才发布的检查点还没来得及扩散开来。问世四个月的 MiniMax M3,则有十五家在提供服务。

这种差异正是路由器存在的意义,也是这两个模型在商业上分道扬镳之处。MiniMax M3 在 OrcaRouter 上的标识是 minimax/minimax-m3一个与 OpenAI 兼容的端点,提供商标价原样透传,0% 加价,所以上面提到的 $0.30 和 $1.20 是 MiniMax 自己的定价,而不是我们的;MiniMax 一旦调价,我们这边当天就会生效。它的十五个上游提供商,才让自动故障转移链真正有意义——在某个提供商上卡住的请求,会在响应开始之前重试到另一个提供商上,这和一个只有一处可去的模型所提供的保障截然不同。小米 MiMo-V2.6-Pro 不在 OrcaRouter 上;任何小米模型都不在,如今要用它,只能通过小米自家的平台以及将其收录的第三方目录。

如果你想让两者共处于同一个应用之中,务实的形态是用一个 key 承载你已经确定下来的那些模型,让新来者与它们做对比评估,而不是凭一个三天前出炉的分数就把它采纳。这是一个路由决策,而它有用的地方在于:备用通道在真正救你的那一天到来之前,不产生任何成本。

The OrcaRouter model page for minimax/minimax-m3, showing MiniMax as the vendor, the 2026-05-31 release date, Vision, Tools, JSON and Reasoning capability tags, a 1M-token context window, 512K maximum output, $0.30 per 1M input and $1.20 per 1M output, and a p50 time to first token of 8.49 seconds.

该选哪一个

如果你本周就需要在生产环境中使用一个开放权重、多模态、百万 token 的模型,答案是 MiniMax M3,而且优势毫无悬念——十五家提供商、亚秒级首 token、一条足够宽松的商用路径(前提是你已阅读社区许可证),以及一个你可以查看的官方长时程基准测试条目。效率警告是真实存在的:预算要按每任务 91,000 个输出 token 来算,而不只是看每 token 费率。

如果你正在为下个月启动的工作挑选模型,小米 MiMo-V2.6-Pro 是能力更强的模型,实测优势明显,混合费率更低,并且采用 MIT 许可证,彻底免去了许可方面的讨论。它目前还没有第二个可以运行的地方。值得关注的是提供商数量:当它不再只有一家提供商时,这 17 个百分点的差距就不再只是一项研究结果,而会成为一个部署决策。

在那之前,坦率的总结是:更好的模型是你无法从它做故障转移的那个,而更弱的模型是你今晚就能放到客户面前的那个。

The Artificial Analysis model page showing the Intelligence Index v4.3.2 scores, output speed, latency and per-task cost that both models in this comparison are measured on.

这篇文章中的数字来自哪里

两个模型的指数得分、吞吐量、延迟、缓存折扣和提供商数量均为 Artificial Analysis 在 Intelligence Index v4.3.2 上的测量结果,读取日期为 2026 年 9 月 22 日;MiniMax M3 的 29 分与小米 MiMo-V2.6-Pro 的 46 分基于同一版本的综合指数。MiniMax M3 的 DeepSWE v1.1 数据来自 2026 年 6 月 8 日的公开排行榜条目。DeepSWE 从 58.4 到 72.57 的提升、Pro 运行在三十步内约 262 万美元的强化学习支出,以及 MiniMax M3 的 SWE-Bench Pro、BrowseComp、SVG-Bench 和 Terminal-Bench 数据,均由厂商在各自实验室的自有测试框架上报告,尚未经过独立复现。每 token 费率均为厂商自身的标价。