
Xiaomi MiMo-V2.6-Pro 对比 MiniMax M3:分数更高,路径更精简
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens
- deepseek新DeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0345智能76代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
小米 MiMo-V2.6-Pro 于 2026 年 9 月 22 日正式全面开放使用,并在 Artificial Analysis 智能指数 v4.3.2 上以 46 分拿下开放权重模型的第一名。MiniMax M3 自 2026 年 5 月 31 日发布以来,一直保有这一头衔的某个版本,而如今在同一指数上它得分 29——落后十七分。而这对模型之间,最没意思的恰恰是分数。MiniMax M3 的输出速度为每秒 168.9 个 token,对手为 134.3;响应时间为 0.92 秒,对手为 2.15 秒;每输入 token 的价格更低;并且可通过十五家 API 提供商调用,而小米仅有一家。更新、分数更高的那个模型,反而是实际调用起来更难的那个——这种倒挂正是本文对比的重点。
都是开放权重,都是多模态,相隔十四周
这两个模型在设计意图上是近亲。二者都是来自中国实验室的稀疏专家混合模型,都具备 1M token 的上下文窗口,都能原生接受图像和视频,而非通过外挂式适配器,并且都公开权重。它们的发布相隔十四周,而它们之间的指数差距,就是开放权重前沿在这段时间里走过的距离。
• 总参数量 — Xiaomi MiMo-V2.6-Pro 1.02T;MiniMax M3 约 427B,两者均为稀疏 MoE
• 每 token 激活 — Xiaomi MiMo-V2.6-Pro 42B;MiniMax M3 约 23–25B
• 上下文 — 每个 1M tokens,且 MiniMax M3 保证最低 512K
• 输入模态——两者均支持文本、图像和视频;Xiaomi 额外增加音频输入
• 权重 — Xiaomi MiMo-V2.6-Pro 采用 MIT 许可证;MiniMax M3 依据 MiniMax 社区许可证发布,该许可证并非宽松型,商业使用需另行签订协议
• 发布 — Xiaomi MiMo-V2.6-Pro 2026年9月21–22日;MiniMax M3 2026年5月31日
• 可及性——在 Artificial Analysis 上,Xiaomi MiMo-V2.6-Pro 计有一个 API 提供商;MiniMax M3 则有十五个
最后那一行才是要始终盯住的。表上其余的一切都偏向较新的模型。那一行却不然,而正是这一行决定了某个模型能否进入生产路径。
该指数衡量什么,以及由谁衡量
Artificial Analysis 自行在 v4.3.2 上运行了这两个模型——这是一个涵盖推理、知识、数学和编程的十项评测综合指标,包括 AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience 和 AA-LCR v1.1。46 和 29 都不是厂商自报数字,这一点在这里很关键,因为两家实验室也都发布了自己的基准测试数据,而那些属于厂商自报数字,两类数字绝不可混为一谈。
46分的成绩让小米 MiMo-V2.6-Pro 在该综合指标上位居开放权重领域之首。但它并未使其登上该指数榜首:Claude Fable 5.1 和 GPT-6 Astra 均为53分,Claude Opus 5 为51分。MiniMax M3 的29分使其在114个被测模型中位列第十六,远高于其规模类别的中位数,但距离六月时被拿来比较的前沿水平仍有很大差距。
MiniMax M3 手握小米没有的实锤
这是对比中最常被跳过的一部分,也是买家最应该重点权衡的一部分。MiniMax M3 以官方成绩登上公开的 DeepSWE v1.1 排行榜:20.4% Pass@1 和 48.7% Pass@4,于 2026 年 6 月 8 日发布,此前一次 MiniMax 推理升级修复了异常 token 生成并改进了长上下文缓存行为。该成绩附带了一份效率核算,而这份核算并不好看:中位数为 311 个 agent 步骤、约 91,000 个输出 token,以及每个任务约 5.04 美元。它能通过长时程工程任务,但代价高昂。
小米为其新模型给出的主打基准测试数字是在 DeepSWE v1.1 上的 72.57,高于 58.4 的基线,测量方式是使用 mini-swe-agent、取三次平均、在小米自家测试框架上运行。这不是一个排行榜条目,也未曾作为排行榜条目提交。把 72.57 放在 MiniMax 的 20.4 旁边,就此读出一个 52 分的胜出,是在两种不同测量之间做算术:排行榜发布的是特定配置下的 Pass@1,并附带置信区间和每任务平均成本,第三方可以复现;而厂商给出的数字则没有附带这些。72.57 很可能属实。它只是不是同一类东西。
MiniMax 也公布了自己的一套发布数据,而同样的告诫适用于其中每一项:SWE-Bench Pro 为 59.0,BrowseComp 为 83.5,SVG-Bench 为 63.7,Terminal-Bench 2.1 为 66.0,这些均是在 MiniMax 自己的基础设施上、用其自己的脚手架运行的。要把它们视为关于该模型的宣称,而不是对它的测量。
速度、延迟,以及决定账单的两个数字
吞吐量差距与质量差距方向相反,而且差距之大足以产生影响。MiniMax M3 每秒生成 168.9 个输出 token,而小米 MiMo-V2.6-Pro 为 134.3 个;其 0.92 秒的首 token 时间大约比小米的 2.15 秒快两倍半。对于交互式产品,首 token 延迟是用户能感知到的数字;对于批处理流水线,吞吐量则是决定总运行时长的数字。
在成本上,两者的差距比标称价格所显示的要小,而谁更划算取决于你的流量构成。MiniMax M3 的标价是每百万输入 token 0.30 美元、每百万输出 token 1.20 美元;小米 MiMo-V2.6-Pro 的标价则是 0.43 美元和 0.87 美元。论输入,M3 更便宜;论输出,小米更便宜。在应用缓存折扣之后——M3 为 80%,小米为 99%——按 7:2:1 的缓存命中/输入/输出配比计算,两者的综合价格分别落在每百万 0.22 美元和 0.18 美元。Artificial Analysis 还记录了小米 MiMo-V2.6-Pro 每项 Intelligence Index 任务 0.13 美元的成本,该指标以相同方式对榜单上所有模型进行测算,是这两者之间可获得的、最具可比性的单一成本数据。

十五条路由对一条,以及故障转移有何价值
如果端点宕机,十七个点的指数优势也帮不了你。在撰写本文时,Artificial Analysis 只统计到一家为 Xiaomi MiMo-V2.6-Pro 提供服务的 API 供应商,而这个数字反映的是此次发布的情况,而非模型本身:三天前才发布的检查点还没来得及扩散开来。问世四个月的 MiniMax M3,则有十五家在提供服务。
这种差异正是路由器存在的意义,也是这两个模型在商业上分道扬镳之处。MiniMax M3 在 OrcaRouter 上的标识是 minimax/minimax-m3:一个与 OpenAI 兼容的端点,提供商标价原样透传,0% 加价,所以上面提到的 $0.30 和 $1.20 是 MiniMax 自己的定价,而不是我们的;MiniMax 一旦调价,我们这边当天就会生效。它的十五个上游提供商,才让自动故障转移链真正有意义——在某个提供商上卡住的请求,会在响应开始之前重试到另一个提供商上,这和一个只有一处可去的模型所提供的保障截然不同。小米 MiMo-V2.6-Pro 不在 OrcaRouter 上;任何小米模型都不在,如今要用它,只能通过小米自家的平台以及将其收录的第三方目录。
如果你想让两者共处于同一个应用之中,务实的形态是用一个 key 承载你已经确定下来的那些模型,让新来者与它们做对比评估,而不是凭一个三天前出炉的分数就把它采纳。这是一个路由决策,而它有用的地方在于:备用通道在真正救你的那一天到来之前,不产生任何成本。

该选哪一个
如果你本周就需要在生产环境中使用一个开放权重、多模态、百万 token 的模型,答案是 MiniMax M3,而且优势毫无悬念——十五家提供商、亚秒级首 token、一条足够宽松的商用路径(前提是你已阅读社区许可证),以及一个你可以查看的官方长时程基准测试条目。效率警告是真实存在的:预算要按每任务 91,000 个输出 token 来算,而不只是看每 token 费率。
如果你正在为下个月启动的工作挑选模型,小米 MiMo-V2.6-Pro 是能力更强的模型,实测优势明显,混合费率更低,并且采用 MIT 许可证,彻底免去了许可方面的讨论。它目前还没有第二个可以运行的地方。值得关注的是提供商数量:当它不再只有一家提供商时,这 17 个百分点的差距就不再只是一项研究结果,而会成为一个部署决策。
在那之前,坦率的总结是:更好的模型是你无法从它做故障转移的那个,而更弱的模型是你今晚就能放到客户面前的那个。

这篇文章中的数字来自哪里
两个模型的指数得分、吞吐量、延迟、缓存折扣和提供商数量均为 Artificial Analysis 在 Intelligence Index v4.3.2 上的测量结果,读取日期为 2026 年 9 月 22 日;MiniMax M3 的 29 分与小米 MiMo-V2.6-Pro 的 46 分基于同一版本的综合指数。MiniMax M3 的 DeepSWE v1.1 数据来自 2026 年 6 月 8 日的公开排行榜条目。DeepSWE 从 58.4 到 72.57 的提升、Pro 运行在三十步内约 262 万美元的强化学习支出,以及 MiniMax M3 的 SWE-Bench Pro、BrowseComp、SVG-Bench 和 Terminal-Bench 数据,均由厂商在各自实验室的自有测试框架上报告,尚未经过独立复现。每 token 费率均为厂商自身的标价。
