主视觉卡片,标题为“MiMo-V2.6-Pro vs MiMo-V2.6-Flash”,副标题为“3 倍价差,以及它解释不了的原因”,包含两个面板:左侧面板标题为“MiMo-V2.6-Pro”,内容为“$0.435 / $0.87 每 1M”和“42B 激活参数”;右侧面板标题为“MiMo-V2.6-Flash”,内容为“$0.14 / $0.28 每 1M”和“15B 激活参数”;底部页脚为“两者均为 MIT 许可 · 均为 1M 上下文 · 索引仅针对 Pro 发布”。
Guides & Insights

MiMo-V2.6-Pro 与 MiMo-V2.6-Flash:两项基准测试无法解释的 3 倍价差

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

在小米自己的评测表上,MiMo-V2.6-Flash 击败了 MiMo-V2.6-Pro。这一行是 CyberGym,差距为 95.1 对 94.0。它是十五行中的一行,而这也正是要仔细阅读这份对比其余部分、而不是想当然认为旗舰总是答案的原因——因为 MiMo-V2.6-Flash 的成本大约是 MiMo-V2.6-Pro 的三分之一,而在大多数行上,两者相差只有几分。

两个模型都于 2026 年 9 月 21 日以 Hugging Face 仓库的形式发布,采用 MIT 许可证,相隔十八秒,是各自独立的训练运行,而不是同一架梯子上的不同层级。Xiaomi MiMo-V2.6-Pro 是万亿参数档位。MiMo-V2.6-Flash 是效率档位。本页要回答的问题是,二者之中哪一个适合你的生产路径,而诚实的答案取决于一个在两次发布中都不存在的数字。

每一个是什么

• 参数 — Xiaomi MiMo-V2.6-Pro 总参数量 1.02T,每个 token 激活 42B;对比 Xiaomi MiMo-V2.6-Flash,总参数量约 309B,激活 15B
• 架构 — 两者均为稀疏专家混合模型,原生支持全模态输入;Flash 的文档记载为 48 层,其中 39 层滑动窗口注意力、9 层全注意力,隐藏维度 4096,256 个路由专家、激活 8 个且无共享专家,另配 681M 视觉 Transformer、308M 音频分词器和 127M 音频 patch 编码器
• 上下文 — 两者均为 1M token,且最多支持 128,000 个输出 token
• 许可 — 两者均为 MIT,权重均无需申请即可获取
• 价格 — Pro 为每百万 token 输入 $0.435、输出 $0.87,Flash 则为 $0.14 和 $0.28:输入和输出两端均相差 3.1 倍
• 缓存命中输入 — Pro 为每百万 $0.0036,Flash 为 $0.0028
• 训练支出 — 小米报告称,Pro 的 RL 运行约为 $2.62M,Flash 约为 $854K,两者均在不到六天内完成,历经 30 个强化学习步骤和约 750,000 条轨迹
• 独立指数得分 — Xiaomi MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index v4.3.2 上为 46;MiMo-V2.6-Flash 暂无公布得分

要抓住的是最后那一行。除 Pro 分数外,它上面的所有内容均为小米方面提供的数据。

价格翻三倍,却几乎买不到什么

小米的表 3 将两者并列展示在该系列训练所用的各套测试框架上,而在长时程智能体工作中,双方的差距很小:

• DeepSWE v1.1 — Pro 71.9,Flash 67.9
• MiMo Code Bench — Pro 63.2,Flash 61.2
• AutomationBench v1.0.6 — Pro 53.1,Flash 52.3
• Toolathlon-Verified — Pro 76.9,Flash 73.6
• Terminal Bench 2.1 — Pro 89.9,Flash 87.6
• OSWorld-Verified — Pro 82.0,Flash 80.8
• JobBench — Pro 62.0,Flash 61.2
• MiMo Visual Coding — Pro 72.3,Flash 71.5
• CyberGym — Pro 94.0,Flash 95.1
• MiMo Cyber Bench — Pro 80.2,Flash 77.2

顺着那一列往下看,旗舰机型的优势大多在一到四分之间,只有一行彻底落败。在一种工作流中,如果 67.9 和 71.9 之间的差距就是任务完成与任务失败的差别,那三倍的价格也算便宜。而在另一种工作流中,如果它只是两个都可接受的答案之间的差别,那就不算便宜。像这样带小数位的厂商数据表容易营造出虚假的精确感——小米之外没人跑过这些测试,而在内部评分的测试框架上,两分的差距完全落在换一个评分器或换一套重试策略就能左右的范围内。

Two-column scoreboard headed 'MiMo-V2.6-Pro vs MiMo-V2.6-Flash — the scoreboard'. The left column, MiMo-V2.6-Pro, reads Active params 42B, Price $0.435 / $0.87, DeepSWE v1.1 71.9, CyberGym 94.0, ExploitGym 17.8, Independent index 46. The right column, MiMo-V2.6-Flash, reads Active params 15B, Price $0.14 / $0.28, DeepSWE v1.1 67.9, CyberGym 95.1, ExploitGym 6.0, Independent index none published. A footer reads 'All benchmark figures are Xiaomi's own runs; only the Pro index score is independent.'

在哪里大量购买

有一组行,其中的差距不再只是舍入误差层面的争议。它们每一项都是安全相关工作:

• ExploitGym — Pro 17.8,Flash 6.0
• ExploitBench — Pro 47.9,Flash 25.3
• SEC Bench Pro — Pro 66.3,Flash 47.5
• Agents' Last Exam — Pro 31.6,Flash 27.6
• Terminal Bench 4.0 — Pro 34.9,Flash 28.8

在 ExploitGym 上,旗舰模型的价格是更便宜模型的三倍,这与它们之间的价格倍数相同,而在 SEC Bench Pro 上则是 1.4 倍。这种模式正是你会在一个拥有 420 亿激活参数的模型对比一个拥有 150 亿激活参数的模型时所预料的:一项需要长链条推理且没有部分得分的任务,正是额外容量会显现出来的那类任务,而 CyberGym 的结果相反,则是一个例外,它证明的是两次训练学到的是不同的东西,而不是同一东西在不同规模下的表现。

所以这条分界线对应的是真实的工作负载边界,而非营销上的划分。成功标准宽松、吞吐量高的智能体工作——检索、分类、常规编辑、靠重试就能救回来的调用——属于 Flash 的地盘。而那些答错代价高昂、答一半毫无价值的工作——漏洞利用开发、安全审查、带多步状态的终端会话——才是 Pro 档位配得上其溢价的地方。

不存在的数字

MiMo-V2.6-Flash 没有 Artificial Analysis 模型页面。它的同系列产品却有。这种不对称是这一页上最重要的一点,因为它意味着整个 MiMo-V2.6 系列中唯一一个经过独立测量的数字,就是 Xiaomi MiMo-V2.6-Pro 旁边的那个 46。上文中的每一个 Flash 数字——包括它获胜的那一行 CyberGym——都来自 Xiaomi 的测试框架、Xiaomi 的评分器和 Xiaomi 的离线运行。

有合理理由认为这是暂时的:截至撰写本文时,该模型才问世一天,而第三方评估需要时间。也有合理理由认为这是结构性的,因为 Flash 是走量层级,而走量层级吸引的基准测试关注较少。无论如何,如今的实际后果是,你无法像比较 Pro 那样有把握地将 Flash 与自身家族之外的任何产品进行比较。如果你基于性价比在 Flash 和非小米模型之间做选择,你是在拿厂商的数据与别人的实测数据作比较。

两份模型卡都带有相同的第二条注意事项。两个仓库都没有被任何推理服务商部署——Hugging Face 在每个页面上都明确说明了这一点,而 Artificial Analysis 统计到 Pro 只有一个 API 服务商。我们并不托管其中任何一个检查点,因此两者都无法经由我们路由。通往两者的途径是小米自家的平台,以及收录它们的第三方目录。

Screenshot of the Hugging Face model page for XiaomiMiMo/MiMo-V2.6-Flash-RL, showing the MIT licence tag and multimodal tags including 8-bit precision and fp8, a Safetensors panel reporting a model size of 159B parameters, an Inference Providers panel stating 'This model isn't deployed by any Inference Provider', a model tree listing one finetune and six quantizations, and a collection block headed MiMo-V2.6 holding three items.

你付出的是硬件成本,而不是代币。

按 token 计费只是 checkpoint 开销的一半,而两者在磁盘上的差距远比在价目表上更为悬殊。MiMo-V2.6-Flash 发布了分布在 65 个分片中的 172.9 GB FP8 权重。小米 MiMo-V2.6-Pro 的参数规模约为其三倍,这使得它在任何量化之前的原始下载量达到半 TB 级别——而它自己的仓库报告 Safetensors 模型规模为 524B 参数,这一数字既无法与 1.02T 的总参数量相符,也无法与 42B 的激活参数量相符。

这种差距改变了决策的性质。172.9 GB 的 Flash 是一个小团队可以在租用算力上自行托管、并把它当作商品化资源的模型。而大约三倍于此的 Pro 则是一个集群级决策——围绕发布的报道估计,这两次训练分别动用了约 4,000 和 8,000 块 H200 等效 GPU。如果你关注开放权重的原因,是想拥有停止按 token 付费的选项,那么这两个检查点以截然不同的承诺规模提供了这一选项。

在它们之间做选择

在上述种种前提之下依然成立的原则是:按工作负载类别来选,而不是按基准测试的平均分来选。凡是你乐意重试的任务,就用 Flash;凡是重试也救不回来的任务,就用 Pro。然后去做实测,因为在真正在乎的那些基准测试上,这两个模型都没有独立评分。

将两个检查点并排衡量,正是路由器能做到而按模型签订的合同做不到的事。把廉价档位用于你大部分流量,只把棘手情况升级到昂贵档位与这一页是同一个决策,只是以配置而非重写来表达——而这种组合正是路由层存在的意义。它对价格本身也很重要:我们以 0% 加价率透传提供商标价,因此如果 Xiaomi 下调任一检查点的费率,我们这边的数字当天就会变,而不是等到下一次合同续约。这适用于我们提供的模型。具体到 MiMo-V2.6 这一对,目前你仍然是在直接从 Xiaomi 购买。

什么能解决这个问题

有两件事会把这件事从主观判断变成一道算术题。为 MiMo-V2.6-Flash 建一个 Artificial Analysis 页面,会把两个检查点放在同一条每任务成本轴上——这条轴目前把 Pro 标为每项 Intelligence Index 任务 $0.133——比较本身就会得出结论。对安全集群——ExploitGym、ExploitBench、SEC Bench Pro——进行第三方复现,将确认那些行上的 3 倍差距是模型的特性,还是评分器的特性。

在那之前,站得住脚的立场是:对大多数团队在大多数时候而言,Xiaomi MiMo-V2.6-Flash 是更划算的选择;而对于失败代价高昂的那一小类工作,Xiaomi MiMo-V2.6-Pro 才是更值得买的。Flash 胜出的那一行并不能推翻这一点——但它有益地提醒我们,旗舰机型的溢价针对的是一种工作负载,而不是一个模型。

Screenshot of the Artificial Analysis model page for MiMo-V2.6-Pro, showing the Xiaomi attribution and 'Released September 2026', an Intelligence card reading 46 ranked #1 of 114, a Speed card reading 125.2 output tokens per second, a Cost card reading $0.435 in and $0.87 out per million tokens with a 99% cache discount and $0.13 cost per Intelligence Index task, and a Verbosity card reading 140M output tokens, with a technical specifications panel listing 1M context window, 1.0T total parameters, 42B active, MIT licence and weights on Hugging Face.