一张生成的标题卡,对比 Xiaomi MiMo-V2.6-Pro 与 GLM-5.2。左侧卡片显示 Intelligence Index v4.3.2:46,每 token 激活 42B 参数,每 1M 混合价 $0.18,GA - 当前版本;右侧卡片显示 Intelligence Index v4.3.2:34,每 token 激活约 40B 参数,每 1M 混合价 $0.90,Deprecated - GLM-5.3 已发布。页脚写着:两项得分均基于 Artificial Analysis Intelligence Index v4.3.2。两者的权重均采用 MIT 许可。OrcaRouter 标志合成在右下角。
Guides & Insights

MiMo-V2.6-Pro 对比 GLM-5.2:两个开放权重 MoE,以及那个你绝不能忽视的基准测试

作者

Magnus Corvin

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

这种对比最偷懒的做法,就是把 Xiaomi MiMo-V2.6-Pro 的 72.57 和 GLM-5.2 的 46.2 摆在一起,称之为领先 26 分,然后直接发布。它错的原因与哪个模型更好毫无关系:这两个数字根本不是同一种测量。小米的 72.57 是在自家测试框架上用 mini-swe-agent 跑出的三次平均,从未提交到任何公开榜单;而 46.2 则是来自一个完全不同测试框架的 Pass@1 数值。对 Xiaomi MiMo-V2.6-Pro 和 GLM-5.2 进行诚实对比,应该是另一种方式,用两者真正都跑过的同一把尺子来衡量——而在那把尺子上,差距确实存在,但它是十二分,而不是二十六分。

在 2026 年 9 月 22 日读取的 Artificial Analysis Intelligence Index v4.3.2 上,Xiaomi MiMo-V2.6-Pro 得分为 46。GLM-5.2 得分为 34。两者都是来自中国实验室的开放权重混合专家模型,均运行 1M token 上下文窗口,而且两者定价都足够便宜,因此它们之间的选择关乎能力和服务,而非预算。相似之处到此为止,因为 GLM-5.2 已被其自家厂商取代,而这篇对比所在的页面带有弃用通知。

每个模型是什么,以及它处于什么状态

GLM-5.2 是 Z.ai 的旗舰模型,于 2026 年 6 月 16 日发布。它是一款混合专家(MoE)Transformer,总参数量约为 7530 亿,每个 token 激活约 400 亿参数;据报道,它完全基于华为昇腾加速器而非英伟达硬件训练。它以 MIT 许可证开放权重,并提供 FP8 和 INT4 量化版本,支持 100 万 token 上下文,最多可输出 131,072 个 token;在 Z.ai 自家 API 上的定价为每百万输入 token 1.40 美元、每百万输出 token 4.40 美元,缓存输入为 0.26 美元,混合费率为 0.90 美元。Artificial Analysis 测得它的输出速度为每秒 72.6 个 token、首 token 延迟 5.98 秒,运行完整索引的成本为 1,559.05 美元。

小米 MiMo-V2.6-Pro 于2026年9月22日正式全面可用,其强化学习检查点仓库在前一天发布。这是一个稀疏混合专家模型,总参数量达1.02万亿,每token激活420亿——总参数量大于GLM-5.2,激活量则几乎相同——具备100万token上下文窗口,原生支持文本、图像、视频和音频多模态,并采用MIT许可的权重。小米保持了上一代的定价,而没有上调价格,因此其标价为每百万token 0.43美元和0.87美元,缓存折扣达99%,混合价格为0.18美元。

• 权重 — 两者均采用 MIT 许可证且可下载;这是二者真正持平的唯一类别

• 激活参数——MiMo-V2.6-Pro 每 token 42B;GLM-5.2 约 40B。两者几乎相同,这使得分数差距是训练结果,而非规模结果

• 总参数量——MiMo-V2.6-Pro 1.02T;GLM-5.2 约 753B

• 指数得分 — MiMo-V2.6-Pro 46;GLM-5.2 34,两者均基于 Artificial Analysis v4.3.2

• 标价 — MiMo-V2.6-Pro 每 1M $0.43 / $0.87;GLM-5.2 $1.40 / $4.40,混合价 $0.18,而其为 $0.90

• 运行该指数的成本 — MiMo-V2.6-Pro 206.66 美元;GLM-5.2 1,559.05 美元

• 速度 — MiMo-V2.6-Pro 每秒输出 134.3 个 token;GLM-5.2 72.6

• 首个令牌时间 — MiMo-V2.6-Pro 2.15 秒;GLM-5.2 5.98 秒

• 状态 — MiMo-V2.6-Pro 为当前版本并已正式发布(GA);GLM-5.2 在 Artificial Analysis 上已被弃用,该平台现在仅以默认的 10k 输入工作负载对其进行基准测试

A two-column scoreboard titled MiMo-V2.6-Pro vs GLM-5.2, subtitled Twelve index points in fourteen weeks, at the same active parameter count. The left column, Xiaomi MiMo-V2.6-Pro, reads Intelligence Index v4.3.2 46; active parameters 42B per token; blended rate per 1M $0.18; cost to run the index $206.66; speed 134.3 tokens per second; status GA, current. The right column, GLM-5.2, reads Intelligence Index v4.3.2 34; active parameters ~40B per token; blended rate per 1M $0.90; cost to run the index $1,559.05; speed 72.6 tokens per second; status deprecated, superseded by GLM-5.3. A footer notes GLM-5.2 is marked deprecated on Artificial Analysis, which now benchmarks it only at the default 10k input workload. The OrcaRouter logo is composited in the bottom-right corner.

弃用通知才是头条

Z.ai 此后已发布 GLM-5.3,而 Artificial Analysis 的 GLM-5.2 页面也直接说明了这一点,将该模型标记为已弃用,并将后续基准测试工作限制在单一的默认工作负载上。这改变了本页面的用途。如果你今天要选择一款新模型,你真正关心的对决是 MiMo-V2.6-Pro 对 GLM-5.3,而不是 GLM-5.2——并且在同一个 v4.3.2 指数上,GLM-5.3 在最大努力下得分为 45,而 MiMo-V2.6-Pro 为 46。一分之差。这是一场真正的较量,也是一篇完全不同的文章。

GLM-5.2 的对比仍然值得一做,原因很具体:它能以最低的成本说明,开放权重的前沿在 2026 年 6 月到 9 月之间推进得有多快。大约十四周里涨了十二个指数点,而激活参数量基本没有变化。无论这一提升来自什么,它都不是规模。

GLM-5.2 曾经擅长什么,以及它是否依然如此

GLM-5.2 的发布材料主打编程和长时间运行的智能体工作,而这些数字作为对该模型的描述依然站得住脚:SWE-bench Pro 为 62.1,对比 GLM-5.1 的 58.4;Terminal-Bench 2.1 为 81.0,对比 63.5;FrontierSWE 为 74.4,对比 30.5。在知识与数学方面,它报告 GPQA-Diamond 为 91.2、AIME 2026 为 99.2,以及 Humanity's Last Exam 为 40.5。当时,它在一项长时程智能体编程基准上领先所有模型,并在一个公开的网页开发排行榜上排名第二。这些都是厂商在自家测试框架上报告的数字,而其中每一个都适用那句常见的提醒。

小米自己公布的 MiMo-V2.6-Pro 数据与它们并不可比,而这件事值得把原因说清楚,而不是含糊带过。小米报告称,在其强化学习训练过程中,该模型在 DeepSWE v1.1 上从 58.4 提升到 72.57,评估使用 mini-swe-agent、取三次平均,并采用自家的评分器;该次运行被记录为 30 步,在不到六天内完成约 750,000 条轨迹,公布的 Pro 模型花费约为 262 万美元。这些都不是排行榜上的条目。排行榜条目是在明确条件下对某一特定配置作出的、第三方可以复现的声明,而小米的并不是。另一个追踪榜单将 GLM-5.2 在 DeepSWE 上列为 46.2——这是 Pass@1,同一任务族上的不同指标——而把 72.57 与 46.2 并列以得出 26 分的差距,是在两个不同尺度上做算术。这不应该做,而这正是围绕这一对模型流传的最常见错误。

Screenshot of the Artificial Analysis model page for Xiaomi MiMo-V2.6-Pro, captured 22 September 2026. The header reads 46 Artificial Analysis Intelligence Index, ranked first of 114 in its class; 134.3 output tokens per second, ranked eleventh of 114; $0.435 input and $0.87 output per 1M tokens with a 99% cache discount; $0.13 cost per Intelligence Index task, ranked twelfth of 114; and 140M output tokens from the Intelligence Index. Technical specifications list reasoning Yes, input modality text, image, speech and video, output modality text, a 1M-token context window, 1.0T total parameters, 42B active parameters, an MIT licence and Hugging Face model weights, under a breadcrumb reading Xiaomi, Open weights model, Released September 2026. A comparison summary notes it cost $206.66 to evaluate MiMo-V2.6-Pro on the Intelligence Index.

在它们之间做选择,以及使其变得廉价的路由

如果两者都是在同一许可证下的开放权重,那么决定性因素就是你能运行什么、以及你能在哪里调用它。GLM-5.2 已在 OrcaRouter 上,标识为 z-ai/glm-5.2——一个 OpenAI 兼容端点,供应商标价原样传递、0% 加价,因此 Z.ai 一调价,我们这边当天就同步生效。小米 MiMo-V2.6-Pro 不在 OrcaRouter 上;小米旗下没有任何模型在,要调用它,只能通过小米自家的平台,或某个收录了它的第三方目录。我们宁愿把这一点讲清楚,也不想让模型页面给出相反的暗示。

有用的结果是,你可以用一个密钥继续使用现有模型,并在此基础上评估新来者,而无需再签一份合同。如果 MiMo-V2.6-Pro 在你的提示上胜出,你以很低的成本就学到了这一点。如果它没有胜出——12 个点的指数差距,并没有每 token 价格差距那么大,因此结果确实取决于你的工作负载——那你除了这次测试之外什么也没损失。把两者放在同一个端点之后,并启用自动故障转移,也回应了对一款本周才发布的模型的实际质疑:单一服务路径就是单点故障,而一条可以回退的通道,才让新模型能够安全地置于真实流量之前。

Screenshot of the OrcaRouter model page for GLM 5.2, captured 22 September 2026. The page lists the model id z-ai/glm-5.2, by Z.ai, dated 2026-06-16, marked FEATURED, with Tools, JSON and Reasoning badges, a 1M-token context window, a maximum output of 128K tokens, text-only input and output, $1.40 per 1M input tokens and $4.40 per 1M output tokens, 17.3M tokens of traffic over seven days, and a code sample calling the model through the OpenAI-compatible base URL api.orcarouter.ai/v1.

简短的回答

如果你今天正在使用 GLM-5.2,而且它运行良好,那么升级问题就不是 MiMo-V2.6-Pro——而是同一血统的 GLM-5.3,它与小米模型仅差一分,且没有迁移成本。如果你是从零开始选择路线,并且想要三者中实测得分最高的开放权重,那么 MiMo-V2.6-Pro 的 46 就是那个数字,而它每秒 134.3 个 token 和每项索引任务 0.13 美元,正是它并非险胜的原因。如果你想要三者中最安全的,GLM-5.2 是错误答案,原因与它在六月有多好毫无关系:它是三者中唯一一个其自家厂商已经停止开发的。

OrcaRouter 将200 多个模型整合到一个兼容 OpenAI 的端点之后,按提供商标价提供,0% 加价,因此供应商一旦调价,当天即可生效。

本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新