MiMo-V2.6-Pro 与 Qwen3.8-Max 对比的标题卡,展示两张相对的规格卡:小米 MiMo-V2.6-Pro 在 Intelligence Index v4.3.2 上为 46,每 token 激活参数 42B,134.3 tokens/秒,混合价格为每 1M $0.18;对比 Qwen3.8-Max 指数为 45,每 token 激活 95B,39.2 tokens/秒,价格为 $1.18。
Guides & Insights

MiMo-V2.6-Pro 对比 Qwen3.8-Max:一个指数点之差,六倍价格之别

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Qwen3.8-Max 是一个拥有 2.4 万亿参数的模型,每个 token 激活其中 950 亿个参数,且仅由单一供应商运行。小米 MiMo-V2.6-Pro 是一个 1.02 万亿参数的模型,每个 token 激活 420 亿个参数,在同一独立指数上的得分还高出一分,而调用成本大约只有前者的六分之一。这些事实摆在一起显得颇为别扭,而如何看待它们,正是二者之间取舍的全部关键。简而言之:在 Artificial Analysis Intelligence Index v4.3.2 上,小米 MiMo-V2.6-Pro 得 46 分,Qwen3.8-Max 得 45 分——在噪声范围内属于平手——而价目表上,前者每百万 token 为 0.43 美元和 0.87 美元,后者则为 2.00 美元和 6.00 美元。

每个模型到底是什么

Qwen3.8-Max 是阿里巴巴的旗舰模型,自 2026 年 8 月 3 日起正式开放使用,在发布时是 Qwen 系列推出的最大模型。它是一个稀疏混合专家模型,基于 Qwen 3.5 架构构建,总参数量达 2.4 万亿,每个 token 约激活 950 亿参数,上下文窗口为 100 万 token,输出最高可达 131,000 个 token,并支持文本、图像和视频的多模态输入。阿里巴巴将国际价格下调至每百万输入 token 2.00 美元、每百万输出 token 6.00 美元,缓存输入为 0.25 美元,并宣传这一价格约为 Claude Opus 5 输入价格的 40%。随后于 2026 年 9 月 2 日发布了点位更新版本 Qwen3.8-Max-0902,Artificial Analysis 目前对其基准测试得分为 45。

小米 MiMo-V2.6-Pro 于 2026 年 9 月 22 日正式发布,也就是在撰写本对比的三天前,而其强化学习检查点仓库则在一天前出现。它是一个稀疏混合专家模型,总参数量为 1.02 万亿,每个 token 激活 42 亿参数,并具有相同的 100 万 token 上下文窗口、跨文本、图像、视频和音频的原生多模态能力,以及以 MIT 许可证发布的权重。小米维持了上一代的定价,而不是将新检查点的价格上调,因此其标价为 $0.43 和 $0.87,并享有 99% 的缓存折扣,混合价格为 $0.18。

• 每个 token 的激活计算量 — Qwen3.8-Max 95B;Xiaomi MiMo-V2.6-Pro 42B,不到一半

• 总参数量 — Qwen3.8-Max 2.4T;Xiaomi MiMo-V2.6-Pro 1.02T

• 指数得分 — Xiaomi MiMo-V2.6-Pro 46;Qwen3.8-Max 45,两者均基于 Artificial Analysis v4.3.2

• 输出速度 — Xiaomi MiMo-V2.6-Pro 134.3 tokens/秒;Qwen3.8-Max 39.2,而同层级中位数为 72.5

• 首个 token 时间 — Xiaomi MiMo-V2.6-Pro 2.15 秒;Qwen3.8-Max 2.93

• 目录价 — Xiaomi MiMo-V2.6-Pro 每 100 万 $0.43 / $0.87;Qwen3.8-Max $2.00 / $6.00

• 混合费率 — Xiaomi MiMo-V2.6-Pro 每 100 万 $0.18,按缓存命中/输入/输出 7:2:1 计;Qwen3.8-Max $1.18

• 权重 — Xiaomi MiMo-V2.6-Pro 采用 MIT 许可,可下载;Qwen3.8-Max 以专有端点形式提供服务,同时发布了仅支持文本的开放权重版本,舍弃了 1M 上下文和视觉输入

• 可达性 — 在 Artificial Analysis 上各计为一个 API 提供商

比分是平局。速度则不然。

在十项评估综合得分上相差一分,并不是任何人应当据此采取行动的差异,更有用的信号是它背后发生了什么。每 token 激活参数不到一半的模型得分略高,生成输出的速度快了 3.5 倍——每秒 134.3 个 token,而另一者为 39.2,同类推理模型的中位数是 72.5。Qwen3.8-Max 是该页面上测得的前沿级模型中最慢的,这是每 token 激活 950 亿参数的设计后果,而不是服务事故。

延迟给出的结论与参数量所暗示的恰恰相反。Qwen3.8-Max 生成首个 token 需要 2.93 秒,而小米为 2.15 秒,这一差距远小于吞吐量差距——Qwen3.8-Max 慢在开始生成之后,而不是启动慢。对于答案简短的聊天界面,这种差异几乎不会显现。对于需要生成数万个输出 token 的智能体循环,吞吐量就是整个墙钟时间,而 3.4 倍的差距会在运行的每一轮中不断累积。

A two-column comparison scoreboard for Xiaomi MiMo-V2.6-Pro and Qwen3.8-Max covering Intelligence Index v4.3.2 (46 vs 45), active parameters (42B vs 95B per token), output speed (134.3 vs 39.2 tokens/second), time to first token (2.15s vs 2.93s), blended rate ($0.18 vs $1.18 per 1M) and weight availability (MIT, full multimodal vs a text-only release without the 1M context).

供应商表格在何处不一致,以及为什么这并不矛盾

阿里巴巴为 Qwen3.8-Max 发布了一份覆盖面很广的表格,其表现确实强劲:Terminal-Bench 2.1 达 86.6,SWE-bench Pro 达 67.7,PaperBench 达 93.0,GPQA Diamond 达 92.6,IFBench 达 82.8,OSWorld-Verified 达 86.1,Humanity's Last Exam 达 43.6。这些是厂商在阿里巴巴自家测试框架上运行得出的数字,其中部分还基于阿里巴巴自家的基准测试,因此它们属于宣称而非实测——但这些是针对广泛使用的基准测试的宣称,这使得它们在不同实验室之间比定制测试框架的结果更具可比性。

Xiaomi 的主打数字是 DeepSWE v1.1 上的 72.57,较 58.4 的基线有所提升;该结果是在 Xiaomi 自己的评分器上,用 mini-swe-agent 按三次取平均测得的,来自一次 Xiaomi 记录为三十步、约 750,000 条轨迹的强化学习运行,公布的花费约为 262 万美元。它尚未提交到公开的 DeepSWE 排行榜,也没有任何第三方复现过。把 72.57 与 Qwen 在 SWE-bench Pro 上的 67.7 放在一起,并宣称 Xiaomi 领先五分,等于是跨两个不同的基准、两个不同的测试框架和两套不同的评分惯例来解读。只有一把尺子,是两个模型都被其制造商以外的人用来测试过的,而它给出的是 46 比 45。

Qwen3.8-Max 两个更有分量的数字根本不是评分。阿里巴巴宣布,权重将与 Qwen3.8-27B 一同开源,而最终落地的检查点是纯文本的,并不具备已提供服务的 Max 端点所拥有的完整 100 万 token 上下文或视觉输入。因此,“Qwen3.8-Max 是开放权重”和“Qwen3.8-Max 是多模态 100 万上下文端点”都是关于不同产物的真实陈述,而基于前者制定、却期待后者的部署方案一经接触现实就无法成立。与此同时,0902 小版本发布在没有更改版本号的情况下,将模型推上了一个公共 Web 开发竞技场的榜首——这提醒我们,你在 8 月做基准测试的模型,未必就是 9 月为你的请求提供服务的那个模型。

开放权重是否意味着你可以自行托管其中任意一个?

For Xiaomi MiMo-V2.6-Pro,原则上可以:MIT 许可证,无需商业协议。但实际上,一个 1.02T 参数、42B 激活的检查点需要多节点服务集群,这与调用 API 是不同量级的投入。发布权重让自托管变得合法,而非便宜。

对于 Qwen3.8-Max 而言,答案比名声所暗示的要窄。开放版本仅支持文本,且不含完整的上下文窗口,因此自行托管所得到的模型,其规模明显小于 45 所测的那一个。如果你想要的是经过基准测试的配置,那么被提供的端点才是产品,而该端点是专有的。

调用任意一个,以及决定它的算术

Artificial Analysis 只在单一 API 提供商处对这两个模型进行统计,这对两款旗舰模型而言并不常见,因此故障转移就成了一个实际问题,而非可有可无的加分项。Qwen3.8-Max 在 OrcaRouter 上以 qwen/qwen3.8-max一个按阿里巴巴自家标价、0% 加价提供的、与 OpenAI 兼容的端点的形式提供,因此上文的 $2.00 和 $6.00 会原样传递,阿里巴巴一侧的价格变动当天就会在我们这边生效。我们自己的实测显示,该端点的 p50 约为 3.3 秒,这才是应当据以规划的数字,而非理论上的最佳情况;而故障回退链意味着,停滞的请求会在响应开始之前重试到另一条上游。Xiaomi MiMo-V2.6-Pro 不在 OrcaRouter 上;小米的任何模型都不在上面,如今要接入它,路径是小米自家的平台以及将其收录的第三方目录。

成本算术才是这场对比真正分出高下的地方,而它并不是那些头条费率所暗示的算术。在 7:2:1 的缓存命中/输入/输出配比下,综合费率分别为每百万 $0.18 和 $1.18——相差 6.6 倍,比输入 4.6 倍和输出 6.9 倍的差距更大,因为小米 99% 的缓存折扣比阿里巴巴的 88% 更深。Artificial Analysis 还记录到,小米 MiMo-V2.6-Pro 在每项 Intelligence Index 任务上的成本为 $0.13,并且对榜单上每个模型都采用完全相同的测量方式。用相同工作负载跑这两个模型,更便宜的那个反而是得分更高的那个,这是很少能写出来的事,也是这场比较并非走过场的原因。

The OrcaRouter model page for qwen/qwen3.8-max, showing the model's vendor, capability tags, context window and the per-million-token input and output rates passed through from Alibaba's list price.

谁该换,谁不该换

如果你今天正在使用 Qwen3.8-Max,而且它运转良好,那就没有必须迁移的紧迫理由。指标上的差距只是一个点,视觉与长上下文表现在你的工作负载中已经得到验证,而阿里巴巴仍在持续发展这一产品线——0902 更新就说明了这一点。迁移的理由在于吞吐量和综合成本,而只有当你的流量以输出为主或属于长周期场景时,这一理由才足够充分:智能体、代码生成,以及任何写入远多于读取的场景。

如果你是从零开始,基于已发布的证据,这个排序很难被驳倒。Xiaomi 模型更快,在每一个维度上都更便宜,采用 MIT 许可,并且在唯一一个独立运行、覆盖两者的综合评测中略微领先。制衡因素真实而具体:三天的生产历史、单一服务路由,以及没有可供查看的公开基准测试条目。这种组合说明,应该把它放在现有方案旁边的一条通道中评估,而不是取代现有方案——这正是路由配置的用途,也是为什么有用的做法是把候选方案和现有方案放在同一个密钥之下,而不是从记分板上选出一个赢家。

The Artificial Analysis model page showing the Intelligence Index v4.3.2 scores, output speed, latency and per-task cost that both models in this comparison are measured on.

什么会改变这个答案

有三件事。为 Xiaomi MiMo-V2.6-Pro 增加第二和第三个供应商,将消除针对它的唯一结构性异议,并把价格差距变成一个需要实际做出的决定,而不是一个诱人的选项。对 DeepSWE 配置进行一次独立运行,要么证实 72.57,要么让它作废,而无论哪种结果,都比这个数字本身更有价值。在 v4.3.2 上提供逐项评测细分,则会显示十个评测中每个模型分别赢下哪些——综合分终究是综合分,一个在智能体编程上领先的模型和一个在检索密集型问答上领先的模型,可能得到相同的指数分数,却彼此不适合对方的工作。